1、Vidu S2:实时数字人,实时改视频
生数科技上线实时视频模型Vidu S2,包含实时数字人S2-Avatar与实时改视频S2-Editing,Avatar凭一张图生成交互数字人,输出提升至720p、保持25—42 FPS;S2-Editing支持风格迁移、虚拟试穿、人物替换与背景替换,官方称在多项评测达到SOTA,并开放在线Demo和API。
2、国内第一个为团队而生的Agent,果然还是在飞书里面来了。
飞书与豆包工作联合发布面向团队的Agent产品“豆包工作伙伴”,可拉入企业群聊,拥有独立人设、名称与组织身份,能参加会议、读取文档代码、接入GitHub与多维表格并主动推进工作。形态类似Anthropic的Claude Tag,目前处于邀请共创测试阶段。
3、Meta新研究:字节模型蒸馏后,天花板破了
Meta FAIR与华盛顿大学提出字节级蒸馏,将Llama 3-8B教师的Token概率分布转换为逐字节学习目标,并提出Marginalize-It和End-Of-Token方法。学生模型约12.8亿参数,End-Of-Token下游平均准确率上限达52.4%,高于传统Token蒸馏4个百分点,但训练计算量增加约30.94%。
4、3B模型成功率94.5%!Token级奖励打开长链路智能体训练新思路
中科大与阿里巴巴提出ADRS,将训练期特权技能转化为token级信用,并接入原生reward-to-advantage-to-policy路径,缓解多轮智能体强化学习的时间信用分配难题。基于Qwen2.5-3B/7B与Qwen3-1.7B评估,3B模型ALFWorld成功率94.5%,较最强基线提升10.1个百分点,TVA门控额外提升2.3个百分点。
5、Claude独立破译370年前密文!仅44分钟,密码学家破防了
独立研究员让Anthropic的Claude Fable 5.1破解17世纪英国学者Sir Thomas Urquhart于1653年留下的“双行密码”。该密文由64个数字组成,长期无人攻克,Claude在人类零干预下耗时44分钟、消耗17.6万Token完成破译,随后又解开同一作者《The Jewel》中285个数字的“八行密码”。
6、OpenAI押注RSI,国产AI火速交卷!Flash叫板万亿大模型
OpenAI将研究重心转向递归自我改进,披露一名人类员工一天工作量相当于AI Agent的3.1天,并计划2028年3月造出自动化AI研究员。国内云知声推出U2-Flash,采用稀疏MoE架构,总参数约266B、推理仅激活约10B,SWE-Bench Pro得61.6分,TerminalBench 3.0得24.3分,超过GLM5.3-Flash、DeepSeek-V4-Pro等。
7、在多项高难度Benchmark超越GPT-6 Astra,RSIAgent让开源模型自主探索新环境
Aether AI提出RSIAgent框架,通过自主探索、验证与记忆演化的递归闭环,让Kimi-K3、GLM-5.3等开源模型在不更新参数的情况下持续提升Agent能力。在OSWorld 2.0上Partial Score从71.97%升至78.98%,Agents’ Last Exam达到84.82%,超过GPT-6 Astra的72.60%和82.26%,也领先Claude Opus 5等闭源模型。
8、突发!Opus 5.2深夜上线,RSI真来了?
Anthropic的Claude Opus 5.2在Claude Code中开启灰度测试,跳过5.1版本,开发者通过请求日志确认模型slug已指向Opus 5.2,实测响应更快、输出更简洁,能自主循环迭代代码。内部报告显示,未发布的Model 2在CoBench v2上取得62.8%,高出Mythos 5达12.5分,已承担公司大部分代码编写;RSI模型性能再高22分。
9、英伟达,开始限制Claude使用了
据The Information 9月14日报道,英伟达、Palantir和Booz Allen Hamilton正限制部分Anthropic模型的使用。Palantir要求不可撤销的零数据留存承诺;英伟达涉及专有信息时改用自研Nemotron;Booz Allen禁止在专有数据网络安全项目中使用Anthropic商业模型。背景是Anthropic对Claude Fable 5、Mythos 5等前沿模型默认保留30天使用数据用于安全监测。
10、Claude Mods开始上线,社区用插件「魔改」Claude Code
Anthropic的Claude Code负责人Boris Cherny宣布Claude Mods开始上线,社区已基于该机制做出运行在Claude Code界面内的俄罗斯方块Mod。Claude Mods源于Function Hooks提案,本质是使用Function Hooks的插件,开发者可用TypeScript函数拦截和修改工具调用、扩展UI组件,甚至让Claude自行生成Mod,但测试中也暴露超时静默失败、拦截被绕过等安全隐患。
11、万字详解GPT-6 Astra,Sebastian Raschka带你读懂循环Transformer与隐藏的思维链
OpenAI新旗舰模型GPT-6 Astra发布后引发循环深度/循环Transformer争议,The Information称其可能隐藏推理过程。OpenAI首席科学家Jakub Pachocki澄清,前沿模型计算图深度与GPT-4差距仍不超两倍。Sebastian Raschka撰文梳理该架构,认为循环Transformer并非思维链难监控主因,更可能是强模型犯错少、回溯少。Astra在ARC-AGI-3得分99.9%。
12、「人类造的最后一个AI」还有多远?一张图看懂OpenAI、Anthropic等大厂的RSI进度
Theseus Labs联合清华大学、字节跳动、面壁智能等发布RSI路线图报告,提出RSI五级框架与能力余量闭合指数,基于2023至2026年393组观测数据覆盖10大能力领域。前沿数学HCI达86.4、研究生级科学85.8,但工具调用Agent仅39.9、软件工程52.6。报告梳理OpenAI、Anthropic、Google DeepMind、Meta、腾讯混元、字节Seed等72家团队实践,指出大厂多处于L1–L2阶段。
13、从李飞飞到朱军,世界模型为什么都开始走向机器人|甲子光年
世界模型正从生成走向机器人行动。李飞飞创办的World Labs发布Atlas,将文本、图像、视频和3D纳入同一模型;朱军与生数科技提出通用世界模型GWM,划分L1至L5五级路线,并发布Motus2。Motus2以约13万小时人类第一视角数据预训练,加入100多小时机器人轨迹和人机对齐数据后,五项真机任务平均成功率从51%升至84%。
14、端侧AI从「能跑」到「会进化」,元空智能跑进惠普预装
元空智能发布端侧模型Boxer、办公Agent元空AI Work和科研Agent元空AI Science,提出“生产力=端侧AI=模型×Agent×设备”。Boxer聚焦20B—100B中尺寸区间,Boxer-35B-A3B-v0-0819在WorkArena评测得73.1分,领先第二名10.3分;在40 TOPS算力、不到8GB内存下保留87.3%任务效果。该端侧模型已获惠普商务电脑预装。
15、7名博士生仅用3个月从零训练7B大模型:代码+数据+训练日志全公开
北京中关村学院7名博士生用3个月从零训练出7B大模型ZGCM-1,并开源权重、中间checkpoint、训练代码、数据配方和日志。团队组建数百个Agent处理数据、实验与评测,实践AI4AI研发范式,并评级11类研发任务的AI自主性。ZGCM-1在14项推理评测的同规模模型中领先,部分数学推理和搜索任务可与Qwen3-235B-A22B、GLM-5.1等更大模型比较。
上一篇
【紧急加更】谷歌Bard中文版火爆上架,畅享中文对话,一键登录,告别ChatGPT封号困扰!
下一篇
09月14日AI资讯 | Anthropic冲刺IPO;智谱押注GLM-6.0;iOS 27接入Claude;腾讯T-Mem发布;追觅IFA秀具身智能
- 作者:AI学长小林
- 链接:https://ai.linbintalk.com//article/3dc629a6-152d-8192-b13b-e982c55de6f6
- 声明:本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。

