Workflow Gym:让Agent落地更近一步,告别仿真测试鸿沟

2天前更新 routerbase
3 0 0

各家发布会的 PPT 频频飘红,仿佛 AI 很快就要接管整台电脑。但当测试者把赛道从“Chrome + Office”搬到 FreeCAD、QGIS、剪映、KiCad、Blender 这些真正用于生产的专业软件后,结果立刻变得相当真实:56 款专业软件、338 个真实工作流、平均超过 100 步的操作链条,摆在面前的是一套远比演示场景更硬核的考题。

在这套考题里,就连最强的 Gemini 3.1 Pro 和 Kimi K2.6,pass@3 成功率也只有约 41%,单次平均通过率更是刚过 30%。这场评测叫 Workflow Gym,由字节 Seed 评测团队推出。

Workflow Gym:让Agent落地更近一步,告别仿真测试鸿沟的封面图

相关快讯

飞书 Agent 产品升级,正式支持自主工作

飞书于7月23日升级 Agent 产品飞书aily,新增主动工作、团队共享智能体和多智能体协同能力。新版可在授权范围内基于消息、文档、日历、会议、任务和多维表格等信息主动跟进任务,并与团队成员或其他智能体分工协作,任务发起、执行到结果交付均可在飞书内完成,定位也从个人AI助手升级为参与实际工作的“AI同事”。

Flova定义的Agent视频范式,正在成为新标杆

作者最近常用 Flova 制作 AI 小视频,并观察到许多 AI 视频产品的界面正趋于同质化:从 Agent 定位、交互方式到功能模块和操作流程,都在向相似方向演进。这种现象类似 ChatGPT 出现后,许多对话类 AI 产品纷纷模仿其对话框布局。

豆包首款无限进步模型 Seed-Evolving 实测:真的告别版本号了?

火山引擎方舟上线了新模型 Doubao-Seed-Evolving,模型 ID 固定不变,但能力会高频持续升级。作者对这种“悄悄变强”的更新方式印象深刻,也特别提到豆包上下文窗口终于提升到 1M Tokens,更适合 Agent 场景使用。

Agent 创业公司的黄金时代,可能正在结束

文中提到,AI 产品竞争已进入拼技术、拼功能的阶段,模型与 Agent 持续提升应用想象力,但产品的“惊艳期”越来越短。2025 年 3 月发布的 Manus 以 Agent 执行任务、直接交付结果迅速出圈,随后又加入长期记忆引擎和多智能体协同等能力,上线 8 个月 ARR 便突破 1 亿美元,成为 AI 领域增长最快的初创产品之一。

openJiuwen首发多模态Skill范式Skill-Omni,让Skill“有图可依”

Skill 让 Agent 复用任务经验,但传统 Skill 多为纯文本,难以承载修图、按钮操作等“看了才懂”的视觉知识。为解决这一短板,openJiuwen 社区发布 Skill-Omni,将网页和视频中的视觉经验工程化沉淀为可复用的多模态 Skill,让 Agent 从“读得懂”升级为“看得见”。

3.8万小时、天价Token背后:字节如何发现Agent的 Scaling Law

字节 Seed 发布的 EdgeBench 评测显示,5 个前沿模型累计跑了约 3.8 万小时,核心结论是找到了 Agent 的 scaling law。论文指出:134 个任务的平均学习曲线可被 log-sigmoid 高精度拟合,说明 Agent 学习存在稳定的数学规律,并据此总结出公式、路径、本质和速度四个发现。

暂无评论

暂无评论...