字节 Seed 最近发布了一个 Agent 评测项目 EdgeBench。乍看之下,它依然像一个常见的 benchmark,但它实际上抛出了一个其他榜单很少追问的问题。
现在大多数 benchmark 的逻辑,都是给模型出一道题:做对就得分,做错就零分。这种模式越来越像一场标准化考试,清晰、直接,却也越来越接近“只看结果、不看过程”的单点测量。
但真实世界里,人类使用 AI 的方式根本不是这样。你不会给 Claude Code 出一道题,然后站在原地等它交卷。你会把一个项目、一整个代码库,或者一批数据交给它,让它在里面连续折腾几个小时:不断探索、试错、读取反馈、修正判断,再重新尝试。
真正值得关注的,不是它在一次性题目里能不能答对,而是它在现实任务环境中浸泡一段时间后,能力会不会比刚进入时更强。遗憾的是,当前大多数 benchmark 还很难测出这种“长期适应”和“持续进化”的能力。
相关快讯
字节跳动昆明新公司成立,注册资本7亿元
天眼查显示,昆明贝叶数擎科技有限公司近日成立,法定代表人为邱京昊,注册资本7亿元,注册地址位于磨憨-磨丁合作区口岸围网区数字经济产业园。公司经营软件开发、系统集成、信息咨询及计算机软硬件零售等业务,由北京字跳网络技术有限公司100%持股。
全球开源AI格局生变:中国开源模型加速崛起
Hugging Face最新观察报告显示,全球开源AI生态加速扩张,中国模型已成为重要力量。2026年以来,多数月份中国企业发布的最大开源模型参数规模显著领先美国,月度上限达7540亿至2.78万亿,而美国多低于1300亿。与此同时,中国大模型在开放授权上也更积极,超八成参数超过200亿的模型采用宽松协议。Qwen已成为重要基础模型,相关衍生模型超过15万个。
腾讯启动顶尖AI产品人才专项招聘 ━━━━━
腾讯启动“AI产品经理培训生”招聘专项,面向2026届、2027届毕业生开放混元大模型、WorkBuddy及游戏、社交、金融、云等AI产品与业务场景。项目不限学历和专业,重视候选人的AI实力、产品架构设计、技术敏感度、产品审美及从0到1落地能力,并将个人作品和项目成果作为重要参考,重点考察思考、实践、业务判断与协作能力。
小红书开源 dots3-note:IMO 42 分满分同系列模型来了
小红书 dots 实验室宣布开源 dots3-note preview,这是 dots3 系列首个开源版本。该模型承接此前 dots-note-3.0 在国际奥数竞赛中拿下官方认证满分 42 分的成绩,当前开源版本重点面向更贴近现实、评测更困难的长程任务,进一步延续了社区对其能力开放的关注。
腾讯豪掷514亿加码算力采购,马化腾:大幅增加投入
腾讯Q2自由现金流为-138亿元,若剔除算力采购预付款则为376亿元,推算算力预付金额约514亿元。腾讯新增算力将优先用于自研大模型训练和AI应用拓展,同时兼顾内部模型开发与对外出租需求。本季度AI是主线,Hy3正式发布并开源,智能体和代码能力较preview提升20%至30%。财报显示,腾讯AI产品线带来约105亿元经营亏损。
Google Gemma 4全球下载量突破3亿次
Google Gemma 4 模型在 Google I/O 上海传出下载量已突破 3 亿。该系列于今年 4 月发布,面向高级推理与智能体(Agentic)工作流场景设计,显示出较强的市场关注度和应用热度。