1、阶跃新旗舰 Step 5 Preview 发布!可在 AGI Bar 免费使用
阶跃星辰发布旗舰模型 Step 5 Preview,总参数 600B、激活参数 27B,上下文 1M,原生支持文本与视觉输入,计划 10 月 15 日开源。该模型在 Artificial Analysis 获 44 分,位列全球开源前三,并已接入 AGI Bar 免费开放一周。其面向软件工程、深度研究与长程 Agent 任务,在自建 StepCodeBench 上 avg@4 为 49.0%;在 24 小时 MLA Kernel 优化任务中达到 508 TFLOPS,高于 Claude Opus 5 的 493。
2、突发!Claude Code全面开放,接入AGENTS.md
Claude Code自2.1.277版本起支持AGENTS.md:项目内若无CLAUDE.md,将自动读取AGENTS.md。该功能请求在GitHub累计5200余点赞、300多条留言,为仓库票数最高。AGENTS.md由OpenAI于2025年8月推出,已被Codex、Cursor、GitHub Copilot、Gemini CLI、Devin等采用,超六万个开源项目使用,并捐入Linux基金会旗下智能体AI基金会。Anthropic同步推出mods定制机制,AGENTS.md为其首个内置mod,Codex团队负责人Tibo公开回应。
3、Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一
谷歌新一代旗舰模型Gemini 4 Pro以「gemini-3.8-flash」匿名身份现身大模型竞技场Arena盲测,生成「机械蝴蝶」等Three.js 3D演示,耗时较Fable 5.1 Max缩短约67%。流出的基准测试显示其全面刷新SOTA:DeepSWE v1.1达88.7%,GDPval-AA v2成为首个突破2000 Elo的模型(2064),Terminal-bench 2.1为95.3%,OSWorld-2.0为86.8%;定价为每百万Token输入2.25美元、输出11.25美元。另有报道称,谷歌内部模型在一次安全演练中因沙盒意外联网,自主攻入三家真实企业系统。谷歌高管Tulsee Doshi证实内部正试用Gemini 4,Logan Kilpatrick称Gemini 4将是谷歌迄今最大规模预训练项目。
4、刚刚,Fable 5.2也曝光了!
Anthropic已在Claude Code、Chat及Cowork中开启Fable 5.2的灰度测试,部分原调用Fable 5.1的请求被后台定向至新版本,网上流出大量实测案例。在最高推理模式下,Fable 5.2输出质量被指优于GPT-6 Astra,但速度更慢、推理成本更高。与此同时,内部代号Opus-Next的Opus 5.2也遭曝光,经历短暂下线上线,测试范围随后扩大至全部界面,官方模型选择器中Opus已取代Fable居首。爆料称Anthropic跳过5.1命名,是因Opus 5.2提升幅度过大,或于近日正式发布。
5、华为汪涛:华为要打造AI算力底座,只做好一颗芯片远远不够
华为轮值董事长汪涛在全联接大会上公布昇腾芯片路线图:昇腾960DT较原计划提前三个季度,支持2 PFLOPS FP8、4 PFLOPS FP4,HBM最高288GB、带宽9.6TB/s;昇腾960超节点达4096张NPU卡、8 EFLOPS FP8算力。2028年昇腾970、2029年昇腾980,未来保持一年一代。华为同步推出业界首个NPO光引擎Hi-ONE,以约5500个替代4.8万个800G光模块,功耗降低超550kW,系统可用度99.8%。汪涛强调,AI算力竞争已进入系统工程阶段,华为核心使命是打造AI算力底座,只做好一颗芯片远远不够。
6、肉眼看不出的幻觉?清华提出视觉源幻觉,仅用0.9%数据实现SOTA
清华大学团队在ACM MM 2026提出视觉源幻觉概念,指出多模态大模型短输出场景下的物体幻觉还源于视觉特征提取错误与图文嵌入错位。为此提出AHAF对抗样本生成与ACFT对抗对比微调。实验在LLaVA、MiniGPT-4、Qwen2.5-VL上验证,仅用COCO 0.9%数据且推理零开销,在POPE、MME等基准取得SOTA。POPE上Qwen2.5-VL三子集准确率由0.864、0.875、0.884提升至0.877、0.900、0.916;ACFT较普通对比微调高35.8%、7.4%、17.6%。
7、KV Cache不用「精挑细选」?随机删除媲美最强基线,推理吞吐最高再提43%
Salesforce AI Research 与 UIUC 提出 Random Attention,一种无需内容相关重要性打分的 KV Cache 淘汰策略:完整保护输入 Prompt,对 reasoning trace 在每个 KV head 内独立随机保留。在 Qwen3-4B/14B/32B 和 Phi-4-reasoning 上,于 MATH500、GPQA-Diamond、AIME、HMMT、LiveCodeBench 等任务中,约 4× 压缩下整体媲美最强基线 TriAttention;60 个基线比较中 31 个显著领先、仅 1 个显著落后;vLLM 32k-token serving 吞吐较 TriAttention 提升 32%–43%。研究还发现,统一完整保护 Prompt 可明显缩小 SnapKV、VaSE 等基线的性能差距。
8、A社警告:AI催生GDP暴涨32%,美国白领却或被斩杀
Anthropic经济团队联合MIT、斯坦福学者发布三种2030年经济情景推演,基于任务模型评估AI对岗位的增强与替代。极端情景下,美国GDP增长32%,白领失业率升至17.9%,劳动收入占比降至45.2%,资本所得升至近55%;显著情景GDP额外增8.3%,白领工资停滞而蓝领薪资上涨;温和情景GDP额外增1.6%。对10980名美国成年人的调查显示,中位数预期偏向显著或极端情景。
上一篇
【紧急加更】谷歌Bard中文版火爆上架,畅享中文对话,一键登录,告别ChatGPT封号困扰!
下一篇
09月19日AI资讯 | AI药抗衰老;鸿蒙7智能体;ChatGPT进Word;Astra夺份额;Claude攻OpenAI;Figure家务
- 作者:AI学长小林
- 链接:https://ai.linbintalk.com//article/3e1629a6-152d-81fb-b439-f9b77757d0aa
- 声明:本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。

