1、GLM-5.3-FlashX 上线:200 tokens/s
智谱上线 GLM-5.3-FlashX,推理速度最高 200 tokens/s,较 GLM-5.3-Flash 提速 5 倍、提价 2.5 倍,API 同步开放。该模型依托 10 万张国产芯片的推理算力,由 GLM-5.3 驱动 Agent 构建推理 Infra,从模型适配到上线不到两周,端到端吞吐达初始基线 3 倍。
2、华为全联接大会2026解析:一颗芯片、一台计算机、一座数据中心|甲子光年
华为全联接大会2026集中展示算力系统三项进展:昇腾960芯片、昇腾960超节点和3D数据中心。昇腾960超节点基于灵衢UnifiedBus和NPO光引擎Hi-ONE,将4096张卡组成逻辑“一台计算机”,实现8EFLOPS FP8、16EFLOPS FP4算力;全球首个3D数据中心在安徽芜湖点亮。
3、刚刚,Claude Code大重构!内部3万Agent管理技术免费开放
Anthropic发布重构版Claude Code Projects,原生支持多Agent并行:Coordinator协调器拆解任务,云端派生多个独立Git分支的Claude Code实例同步编码、测试并自动提交PR,并通过共享记忆对齐上下文。内部报告显示,研发平台常态化并发运行3万个AI Agent,单月触发决策超10亿次,26%的研发任务已达AL4级。
4、Claude狂写80%代码,差点干崩Anthropic!CI半年暴涨25倍
Anthropic披露全公司80%的代码由Claude编写,工程师人均季度交付代码量达2021至2025年平均水平的8倍。Claude偏好提交细小密集的PR,并在夜间和周末持续运行,导致代码库测试规模激增10倍,CI任务量半年内暴涨25倍;团队三次打补丁后转向无状态分布式架构。
5、AGI最难一战,竟在医院!中国AI登上Science,医生不怕失业还催着上线
阿里达摩院联合浙大一院等研发的通用腹部影像AI模型DAMO RADAR登上Science,覆盖18种解剖结构、146种疾病,模型、代码和框架全部开源。内部近3.9万例队列平均AUC为0.913,8家外部医院超2.4万例验证AUC为0.895,2.7万例急诊数据AUC为0.904;人机对比中准确率超过26名放射科医生中的23名。
6、刚刚,Gemini 4 Pro偷跑上线!碾压Astra和Fable
谷歌下一代旗舰模型Gemini 4 Pro以“gemini-3.8-flash”之名在LMArena匿名偷跑,实测与泄露基准显示其在编码、智能体、推理等任务上全面超越GPT-6 Astra与Claude Fable 5.1。该模型输入上限1000万Token、输出25.6万Token,定价为每百万Token输入2.25美元、输出11.25美元。
7、豆包大模型再更新,发力多模态编程,一手实测来了
字节发布新版豆包2.1 Pro(0915),已在火山方舟全量上线并接入豆包工作。模型基于Seed-Evolving,重点提升多模态编程、Agent专业任务交付、3D与专业图文理解及Token效率。官方称在Luanti约38.7万行代码、1000个真实Issue修复中,多子Agent连续运行近36小时,83%任务达可合并标准;图像和视频推理Token消耗较上代减少30%以上。
8、那个教 ChatGPT 说话的人,做了一个「哑巴」模型
前OpenAI研究员、ChatGPT共同发明者Diogo Almeida创办的TypeSafe AI完成4000万美元融资,发布非文本生成模型Jev。该模型只输出锁定Schema的结构化决策,端到端延迟70至500毫秒,比前沿大模型快40至200倍;输入成本每百万token 0.042美元,输出免费。内部测试四个企业工作流准确率67.8%,接近GPT-5.6 Terra的67.9%。
9、Mythos,终于部分解禁!
Anthropic正式上线生命科学验证计划(LSVP)测试版,首次向经认证科研人员开放此前严格受限的Mythos模型。计划分标准使用和高风险使用授权;标准覆盖日常生命科研,含Mythos 5.1、Opus 5和Sonnet 5,高风险使用移除全部安全限制,仅面向Opus 5和Sonnet 5,按单个项目授权,每六个月续期。安全机制以离线流量监控、用途绑定和30天数据保留替代实时拦截。
10、OpenAI被曝雪藏数百个证明!你死磕3年的题,答案可能早在服务器上
据Scott Aaronson博文及纽约大学数学家Scott Armstrong透露,OpenAI自7月国际数学家大会起至少压着数百个数学证明未公开。OpenAI内部动用约1万个智能体并发运行约88小时,解出纳维-斯托克斯方程,消耗约1300亿输出token,Aaronson估算算力成本约1500万美元。陶哲轩等25位菲尔兹奖得主联名批评AI公司把数学难题当跑分工具。
11、大模型Scaling撞上成本墙:三星提出TrOPD新方法,把前沿智能塞进数亿终端
三星大模型团队联合牛津大学、北京大学提出信任域在策略蒸馏方法TrOPD,针对On-Policy Distillation中教师与学生能力差距过大导致监督信号失真、训练不稳定的瓶颈,仅在教师可信的信任域内使用反向KL监督,对离群token改用前向KL,并引入离策略引导。在Qwen3-SFT-1.7B上,TrOPD于数学、代码、指令遵循、STEM四类基准分别较原始OPD提升3.34、4.00、5.11、6.18分。
12、流式推理优化,让机器人决策延迟低至0.68秒
面壁智能联合华中科技大学等高校及研究机构提出机器人模型SimpleMemVLA,不设专用记忆模块,将带时间戳的视觉历史直接作为上下文,在四项记忆基准上取得总体SOTA。RoboMemArena长程任务中126秒历史窗口下全阶段成功率达63.6%,较此前最强模型提升17.4个百分点;流式推理将60秒历史决策延迟从1.02秒降至0.68秒,低于0.96秒实时预算。
13、腾讯、阿里、字节,为什么都在给Agent“造世界”?|甲子光年
腾讯、阿里、字节等大厂正密集布局Agent训练环境。腾讯首席AI科学家姚顺雨强调,没有好环境Agent就难以完成各类任务。今年4至9月,腾讯混元至少4组团队发布6篇相关论文;其从47678个公开终端环境中筛选后仅留下127个合格环境,淘汰率达99.7%。阿里通义联合浙大、北大发表Environment Scaling论文,字节Seed与中国人民大学推出Agent-World,含超2000个环境、1.9万个工具。
14、从 Token-Maxxing,到 Token-Minimizing
近期模型厂商密集推出Flash级模型,如DeepSeek V4.1-Flash、GLM-5.3-Flash、Gemini 3.8 Flash,价格低至头部模型的1/10乃至1/40,速度普遍达100 token/s以上。行业思路从追求烧Token的Token-Maxxing,转向核算人力与Token总成本的Token-Minimizing。外滩大会上,百灵团队介绍金融增强模型Ling-3.0-flash-Fin,并联合中金推出FinFIRST评测基准。
15、谷歌DeepMind成立AGI研究所!诺奖得主亲自挂帅
谷歌DeepMind宣布成立DeepMind研究院(DMI),由Demis Hassabis、Shane Legg与James Manyika共同掌舵,专注研究AGI及超级智能对经济、社会和科学的颠覆性影响。DMI开张首日发布三篇文章,覆盖AGI经济政策、推理透明度等议题,其中一篇提出11种应对AGI经济冲击的政策工具。
16、央企做了个通用Agent,直接杀进IDC实测前三!
IDC发布国内首份《中国企业级通用Agent产品技术评估》,以近百道非公开任务实测端到端办公能力。央企中国电信旗下TeleAgent进入前三,常规任务得分3.49分、复杂任务3.36分,任务表现获满分5分,成本效率为测评最高。TeleAgent于7月推出V1.0,用户规模已接近120万,上下文窗口突破400K。
17、开源模型夯爆了!ZDTaichu5.0-9B,10B以内空间具身智能卷出通用类第一
紫东太初开源通用多模态大模型ZDTaichu5.0-9B,参数9B。该模型在9项国际空间理解基准中拿下8项同参数通用组别第一,MindCube-tiny得分78.27,高于Qwen3.5-9B的57.6与STEP3-VL-10B的62.8;加入Gemini 3 Pro、Grok 4等闭源模型后仍在5项基准取得最高分。其采用自适应循环推理,并开源覆盖预训练、监督微调、退火和GRPO强化学习的数据生产管线。
18、EMNLP 2026主会|北大×易鑫AI Lab:大模型明明「知道」,为什么还会答错?
北京大学与易鑫AI Lab合作论文被EMNLP 2026主会接收。研究提出大模型“读出瓶颈”现象:隐藏状态已编码正确答案,却在输出层词表投影与序列分数累加中被系统性偏置掩盖。在Qwen3.5-9B上,线性探针准确率达0.830,原生序列打分仅0.333;仅引入2个全局标量偏移、用25个无标签样本校准,即可将ProofWriter准确率从33.3%升至67.8%。
19、1300张卡叫板10万卡!前OpenAI副总裁出手,硬核难题击败GPT-6 Astra
前OpenAI研究副总裁Liam Fedus创立的Periodic Labs发布首个模型Periodic Neon,参数约1T,仅用1300张H200训练,在自建X射线衍射分析基准FrontierXRD的134道难题上成功率达55.3%,超过GPT-6 Astra的约40%至50%区间及Claude Fable 5.1的约40%,单题成本约4美元。团队目标是构建能持续产出新数据的科研闭环,突破互联网文本耗尽后的Scaling瓶颈。
20、TPAMI26 | 全面升级PolaFormer++:极性感知计算流 +通道级尖峰,实现线性注意力的新天花板
哈工大(深圳)与鹏城实验室等合作的扩展版线性注意力模型PolaFormer++被IEEE TPAMI正式接收。该工作继ICLR 2025的PolaFormer后,首次给出特征映射“降熵尖锐性”理论判据,并提出极性感知通道级尖锐(PaCS)特征映射,以缓解负值丢失和注意力熵过高问题。模型覆盖7M–114M参数,200K长序列下较Flash Attention最高提速5.25×。
上一篇
【紧急加更】谷歌Bard中文版火爆上架,畅享中文对话,一键登录,告别ChatGPT封号困扰!
下一篇
09月17日AI资讯 | 华为昇腾960提前发布;OpenAI反超Anthropic;Claude统一办公;豆包手机开卖;谷歌RSI突破
- 作者:AI学长小林
- 链接:https://ai.linbintalk.com//article/3df629a6-152d-81fc-bc61-ccd1de8729a3
- 声明:本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。

