美团LongCat发布VitaBench2.0开源版本

2个月前更新 haozi9365
17 0 0

自去年10月推出VitaBench 1.0以来,美团LongCat团队现再发布VitaBench 2.0。这一新版本是首个针对长期动态用户建模的智能体评测基准,旨在系统性评估大语言模型在真实生活场景中,面对长期用户互动时的个性化和主动性能力。

美团LongCat发布VitaBench2.0开源版本的封面图

相关快讯

苹果牵手阿里训练中国专属大模型:告别纯“借力”

路透称,苹果已为中国市场训练一款大语言模型,改变了此前主要依赖第三方模型的做法。知情人士表示,这款中国专属AI模型由苹果与阿里巴巴合作开发,并在阿里支持下完成训练。此事此前未被公开报道,显示苹果正为在华销售的iPhone等设备引入生成式AI功能,进一步强化本土化策略。

英伟达据悉推出万亿参数开源AI模型Nemotron 4,挑战顶级开源模型

英伟达正开发新一代开源模型 Nemotron 4,参数规模预计至少 1 万亿,意在挑战全球领先的开源大模型。此举不仅有助于扩大开放模型生态、推动 AI 应用落地,也可能进一步带动市场对其 GPU 算力的需求。英伟达此前已推出 Nemotron 系列开源模型,其中包括 3400 亿参数版本,主要用于训练数据生成、模型开发和企业 AI 应用。

梁汝波回应大模型与海外SOTA差距:坚持自研,接受短期落后,持续优化长期竞争力

梁汝波在字节跳动2026年中全员会上表示,公司AI业务上半年整体表现稳中有进:豆包在C端应用保持竞争力,视频生成模型Seedance维持SOTA。但在大语言模型方面,海外SOTA已拉开差距,字节仍将坚持自研,夯实基础能力,接受短期落后,着眼长期优化。这一判断也与张一鸣此前的表态一致。

字节跳动CEO:大语言模型坚持自研,短期落后也要接受

字节跳动2026年中全员会上表示,大语言模型将坚持自研,夯实基本功,接受短期落后,聚焦长期优化,避免动作变形。梁汝波否认因外部压力而自研,称核心原因是延迟满足、打牢技术基础以支持AGI。张一鸣此前也强调不使用模型蒸馏加速研发,宁可短期性能落后。

字节跳动梁汝波:大语言模型坚持自研,短期落后也要接受

8月6日,梁汝波在字节2026年中全员会上表示,大语言模型与海外领先模型差距拉大,但公司仍将坚持自研、夯实基本功,接受短期落后,聚焦长期能力建设和AGI目标。谭待称,ToB场景只有SOTA模型才能率先释放高价值,Seedance 2.0已推动视频生成从“玩具”走向严肃商业生产。

腾讯混元 Hy ASR 3.0 Preview 发布:通用识别、方言覆盖、场景鲁棒性全面升级

腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview,融合 Hy3 大语言模型的理解能力,提升通用识别、上下文感知、场景鲁棒性和方言覆盖。新模型采用 MoE 架构,增强语言理解、上下文建模与语义推理,实现从逐字转写到理解语境、兼容场景的一键直出。

暂无评论

暂无评论...