OpenAI 发布 GeneBench-Pro:专为评估 AI 生物学计算能力的新基准测试

2个月前更新 laddes
9 0 0

主要用来评估 AI 模型在生物学计算任务中的真实研究能力,重点考察模型面对杂乱数据时的分析判断能力、方法选择能力,以及其研究结论是否足以支撑后续决策。具体而言,GeneBench-Pro 基准测试覆盖基因组学定量生物学转化医学等多个方向,共设置 129 道题目,分布在 10 个大领域和 21 个子领域,涉及统计遗传学、群体遗传学、功能基因组学、蛋白质组学等内容。每道题都会为模型提供一份接近真实科研场景的数据集,以及简要的实验背景说明和一个与后续决策直接相关的目标问题。

OpenAI 发布 GeneBench-Pro:专为评估 AI 生物学计算能力的新基准测试的封面图

相关快讯

Sakana AI 发布网络安全模型 Fugu Cyber,基准测试超越 GPT-5.5-Cyber

Sakana AI 发布了面向现代网络防御的 Fugu Cyber 模型,采用单一 API 封装的多智能体架构,可动态编排专业智能体处理复杂多步骤任务。该模型在 CyberGym 和 CTI-REALM 等高难度安全基准上分别取得 86.9% 和 72.1% 的成功率,表现优于 OpenAI GPT-5.5-Cyber 和 Anthropic Claude Mythos-Preview】【。

打不过Fable 5?马斯克转而猛夸Grok 4.5“性价比”

SpaceX发布最新AI模型Grok 4.5,这是收购Cursor后两家公司首次联合训练的成果。该模型从软件工程扩展到金融、法律等知识工作领域,并主打低成本高速度:输入每百万token 2美元、输出6美元。基准测试显示,其单任务成本比排行榜前列模型低近90%。

首个具身智能行业标准正式发布,开启新篇章

中国信息通信研究院与40余家单位联合发布了具身智能领域首个行业标准,标志着该领域评测进入有标可依的新阶段。该标准于3月26日正式发布,聚焦于人工智能的关键基础技术和具身智能的基准测试方法,明确了具身智能系统的框架和能力要求。该标准将于2026年6月1日正式实施。

首个具身智能行业标准正式发布,开启新篇章

中国信息通信研究院与40余家单位共同发布了具身智能领域首个行业标准,标志着该领域评测进入“有标可依”的新阶段。该标准建立了统一的基准测试框架,重点关注人工智能的关键基础技术和具身智能的测试方法,明确了具身智能系统的框架和能力要求。该标准将于2026年6月1日正式实施。

Hugging Face据悉寻求出售,估值或超130亿美元

据报道,AI初创公司Hugging Face正在寻求出售,并已与银行合作评估潜在买家意向。公司当前估值目标至少为130亿美元,远高于2023年融资时的45亿美元。当时,Salesforce、Alphabet、谷歌和英伟达等科技巨头参与投资。

人形机器人“手”“脑”并进,赛场“淬炼”推动应用落地

8月22日至26日,第二届世界人形机器人运动会在北京举行。赛场上,人形机器人接连刷新跳高、短跑等多项对标人类的 […]

暂无评论

暂无评论...