Lazy loaded image
AI日报
09月16日AI资讯 | GPT-6 Sol曝光;Gemini 3.8 Live上线;紫东太初9B开源;飞书豆包工作合体;Vidu S2发布
字数 3236阅读时长 9 分钟
2026-9-16
2026-9-16

1、突发,GPT-6 Sol曝光了!

GPT-6 Sol正在OpenAI内部测试,已在API中被发现,预计本月正式发布。多名开发者发现手中的5.6 Sol已被自动路由至GPT-6-Sol。实测显示,该模型在输出质量、编程与前端生成、视觉与游戏创作上全面超越GPT-6 Astra,且成本更低。其定位略低于Astra,主打极致性价比。OpenAI核心研究员Noam Brown同期披露,递归自我改进已成公司首要战略目标,预训练与强化学习产生乘数效应。

2、刚刚,Gemini 3.8 Live上线!

Google DeepMind发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款实时语音对话模型,称其为迄今最先进的语音模型。Extended Thinking在Artificial Analysis语音质量榜以82.6分登顶;τ-Voice得分68.6%,略高于GPT-Live-1 Astra的67.9%;τ-Voice-banking为35.1%,对手32.0%;Big Bench Audio达97.7%。两者支持97种语言对话中自动切换、后台并行调用工具及近实时视觉输入。

3、刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一

紫东太初开源ZDTaichu5.0-9B通用多模态大模型,面向物理世界与具身智能。其在九大国际空间基准中获8项同参数通用组别全球第一,MindCube-tiny得78.27分,分别领先Qwen3.5-9B和STEP3-VL-10B 20.67和15.46个百分点。通用能力保持:AI2D 91.48、WeMath 75.9、OCRBench 85.5,IFEval 93.7、AIME2026 89.2、LiveCodeBench v6 73.4,并在ViewSpatial等基准超过Gemini 3 Pro逾7%。

4、刚刚,最强Agent工作平台亮相!飞书、豆包工作合体

9月15日,飞书在2026未来无限大会暨豆包工作开工大会上发布飞书8.0与原生企业级Agent豆包工作,飞书CEO谢欣称其目标是成为Agent最好的工作平台。飞书将消息、文档、表格、审批等能力开放给Agent,支持其入群、参会与协作,并强调权限隔离。数据显示,飞书CLI在GitHub获1.7万星,上半年ARR增速为去年同期2.5倍,中小企业客户增长70%。

5、实时编辑、实时互动视频双旗舰,Vidu S2发布即体验

生数科技发布实时交互与实时编辑视频生成模型Vidu S2,包含S2-Avatar、S2-Editing和S2-Avatar[Offline]三类核心能力。S2-Avatar支持720p、25至42 FPS的实时数字人互动,可处理舞蹈等大幅度动作;S2-Editing能持续接收摄像头或源视频流,在保留原姿态、动作与镜头轨迹的同时实时改变画风、人物或背景。发布当天开放网页体验与API,并公开技术论文。

6、刚刚,中国语音AI连拿多项全球第一!

9月15日,阶跃星辰发布StepAudio 3系列五款音频模型,包括TTS、Gen、Realtime、ASR和Music,覆盖语音生成、识别、实时交互与音乐创作全链路。据Artificial Analysis榜单,StepAudio 3 Realtime以98.9%综合得分位列对话动态全球第一,以99.7%准确率位列语音推理全球第一;StepAudio 3 ASR非流式语音识别WER仅1.7%,并列全球第一。

7、OpenAI总裁:AGI时代来了!GPT-6已能自主干活24小时

OpenAI总裁Greg Brockman在a16z访谈中宣布AGI时代已至,依据是GPT-6 Astra能自主连续工作24小时,其在OSWorld 2.0中得分72.6%,高于GPT-5.6 Sol的65.7%。他称AGI更像一段光谱,并透露曾用约一万个并发智能体求解纳维-斯托克斯方程。OpenAI已暂停25%生产工程师原项目,转为用模型排查安全漏洞,并承诺投入10亿美元加固关键基础设施。

8、GPT-6刷到99.9%,ARC AGI考卷被迫重做!下一关考「发明」

GPT-6 Astra在ARC-AGI-3半私有测试集上达99.9%,令该基准接近饱和,ARC原定出题计划被迫调整。同一模型在标准框架下仅得62.7%,接入OpenAI Provider Adapter后升至99.9%;Claude Opus换用更优harness后由30%升至95.5%,英伟达AVO在公开演示集达100%。ARC Prize创始人François Chollet公布新蓝图:ARC-AGI-4明年Q1发布,聚焦长尺度持续学习与课程学习;ARC-AGI-5围绕「发明」展开。

9、换题还是第一!DM0.5横扫RoboColiseum四榜

原力灵机DM0.5在智元机器人发起的具身模型评测RoboColiseum中,于指令跟随、空间理解、扰动适应和通用操作四个榜单全部位列第一,成为该评测中唯一全榜登顶的模型。此前它已在LIBERO、RoboTwin 2.0、VLA-Arena、RoboChallenge Table30 V2和RoboDojo等六套公开评测中排名第一,其中LIBERO综合成功率99.0%。DM0.5已全面开源,并进入仓储与3C制造场景。

10、清华团队再探 On-Policy Distillation:数据撑死,算法饿死

清华团队联合多所高校发布On-Policy Distillation研究第二篇,将数学训练集从DAPO-Math-17K的17000道题缩减至1道。模型训练300步仍持续提升,数学三基准均分从59.1升至68.5,接近全量数据的69.8,恢复超70%收益,在Qwen、Llama、OLMo上同样有效。研究提出数据撑死、算法饿死:单题rollout状态覆盖率达71.5%,16道语义分散题达98.9%并打平全量。

11、别让Agent瞎想乱搜还闯祸:哪些能力该内化进模型,哪些必须交给Harness,这篇讲透

北京航空航天大学、南方科技大学、复旦大学、爱丁堡大学及百度等8家机构的19位研究者联合完成Theory of Agent综述,基于约600项近期研究,以“内化”与“外化”为统一视角,讨论LLM Agent的能力应放在模型参数还是外部Harness。综述围绕学习、对齐、演化与评测,提出稳定知识宜内化进模型,实时事实、精确计算与可验证执行宜外化至Harness。

12、OpenAI“Lily计划”曝光 你的聊天记录可能正在被人工审核

外媒报道,OpenAI正推进代号“Lily计划”的内部项目,数百名外包人员阅读真实ChatGPT对话并评分,以训练模型避免拟人化和过度讨好。ChatGPT全球用户超9亿,多数用户或不知对话可能被人工审核。OpenAI称已脱敏且不显示用户名,但敏感信息仍可能遗漏;“为所有人改进模型”选项在免费版、Plus及Pro默认开启。Anthropic也证实人工审核用于优化Claude。

13、黄仁勋再谈AI危险论:很多预测都是编的,中国会成为全球开源重要力量

9月14日,英伟达CEO黄仁勋在All-In Summit 2026称,安全与创新不矛盾,放射科医生被取代、90%代码由AI生成等预测未发生;递归自我改进是上下文、强化学习、合成数据、LoRA等已有技术组合。开源与闭源模型都不可缺少,近6个月约4000亿美元风投进入AI原生公司,80%使用开源模型。他称中国或成全球开源生态重要贡献者,并回答AGI现在已经达到了。

14、梁文锋CFO到位!投过智谱MiniMax

路透社援引知情人士消息称,DeepSeek计划聘请高瓴创投合伙人严文韬出任首任CFO。严文韬1991年生,曾投资字节跳动、小红书、极兔,以及智谱、MiniMax。DeepSeek曾于2025年2月挂出CFO岗位,今年7月重启招聘。另据路透社9月9日报道,DeepSeek已聘请中信证券筹备科创板IPO,最早今年年底递交申报材料,力争2027年挂牌;其二轮融资寻求估值约5000亿元。

15、云知声发布U2-Flash,要争“大模型主力位”|甲子光年

9月15日,云知声发布U2-Flash,沿用U2基座,通过后训练提升Coding、Agent等复杂任务能力。评测显示,其DeepSWE v1.1得64.6分,较U2的32分接近翻倍;SWE-Bench Pro由50.1升至61.6,TerminalBench 3.0由2.7升至24.3。云知声称,完成同一任务的迭代步数减少约20%至30%,Agent任务周期缩短约35%,Token消耗减少约20%至30%。

16、逼近Claude!中国黑马27B模型与OpenAI同榜

中国团队万衍(Vera Praxis)的27B网络安全模型Feyospace-v1,在CyberGym漏洞复现评测中取得63.0%成功率,逼近Claude Sonnet 4.6的65.2%,与OpenAI、Anthropic、DeepSeek同榜。该评测含1507个真实漏洞任务;同一后训练使27B基座提升8.73个百分点,ExploitBench成功率从12.96%升至19.05%。团队不到十人,采用Kreator方法将专家判断转为训练信号。

17、被英伟达点名的杭州团队,补上了AI for Science的「最后一公里」

杭州AI蛋白质设计公司力文所发布Lévin™ Harness,面向科研社区开放。该产品以Agent为核心,整合数据、模型、插件、算力与工作流,用户以自然语言提出目标,Agent可调用AlphaFold、ProteinMPNN、Pallatom等工具完成结构预测与序列设计,并兼容DeepSeek、Kimi、GLM、Qwen等通用模型。内置三维分子可视化、插件系统和可复用Workflow,支持本地或远程GPU。

18、一张GPU跑10万原子!分子之心用AI把化学反应“拍”成了电影

分子之心推出反应性机器学习力场QuantaMind,可模拟化学键断裂与成键过程。在发表于《Science Advances》的研究中,它完整模拟了含17,792个原子的PET水解酶体系连续6纳秒的催化循环,涵盖质子转移、断键成键全过程,与量子力学验证吻合度超0.99。最新测试显示,该模型已扩展至十万原子级体系、数百纳秒模拟,单张GPU单步计算仅约0.25秒。

19、从炒虾到通用“大脑”,Mobile ALOHA作者带来新模型

Reward AI联合创始人、斯坦福博士符梓鹏发布通用机器人策略OM-1及Omnibody技术栈。该模型直接从人类自然操作数据学习,不使用遥操作和机器人本体经验,通过Omnibody Hand、One Data Interface和Control Any Body实现跨本体控制,可部署于工业机械臂、人形机器人等。官方称,新任务仅需不到30分钟人类演示数据即可学会;电磁追踪将平均过冲误差从24.9毫米降至9.5毫米,降幅60%。

20、本地该怎么做RSI?我们与StartLux CTO聊了聊

StartLux联合创始人兼CTO郭权玮介绍本地模型StartLux-V1.0-27B-Preview与“本地×RSI”路线。该模型在中国信通院MCP测试中得分39.25,排名第二,超过284B的DeepSeek-V4-Flash-0731,与1.6万亿参数DeepSeek-V4-Pro差距约1个百分点。其以Qwen3.6-27B为基座,后训练提升5.34个百分点,约70%实验执行由AI完成。安全上主张探索自由与自我修改权限分离。
上一篇
【紧急加更】谷歌Bard中文版火爆上架,畅享中文对话,一键登录,告别ChatGPT封号困扰!
下一篇
09月15日AI资讯 | Vidu S2发布;飞书豆包团队Agent亮相;Meta字节级蒸馏;Claude破译密文;OpenAI押注RSI;Opus 5.2上线