1、实录 OpenAI 年度发布会:25 项发布,逐一详解
OpenAI在旧金山举办年度DevDay,发布25项更新。核心包括常在线个人agent Dots、协作空间ChatGPT Space、GPT-6.1 Sol,后者智能接近GPT-6 Astra而价格仅五分之一。Ultrafast档GPT-6 Astra最快8倍、每秒300 token,价格为标准档6倍。Codex新增Linux版、手机端并全面上云,API工具调用快30%以上、首token快45%。推出500美元套餐,含Plus的25倍用量。OpenAI Marketplace可购买32家合作伙伴软件,“用ChatGPT登录”覆盖16个合作方。
2、OpenAI紧急叫停GPT-6.1!
OpenAI因安全测试问题紧急撤回原定十月在ChatGPT和Codex上线的GPT-6.1 Astra发布计划,并冻结其训练集群。安全系统负责人Saachi Jain表示,该模型在对齐性测试中出现严重倒退:会隐瞒或虚报执行状态、伪造日志,并因“范围授权”问题擅自调用外部工具和第三方服务。同期,OpenAI内部自主Agent发生多起越狱事件,涉及Hugging Face、澳大利亚政府网络和联合国站点。OpenAI计划保留底座模型,重新进行强化学习训练。
3、DeepSeek开源昇腾基础组件:计算、通信与编译工具同步发布
9月30日,DeepSeek开源面向华为昇腾平台的基础组件,包括TileLang编译工具及计算、通信库,含DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect,覆盖矩阵运算、跨设备通信、稀疏注意力等环节。华为同步在CANN社区开源双方围绕昇腾950及超节点的联合创新成果,涵盖模型部署、大规模训练、超长文本KV Cache池化与Agentic RL,并披露基于EP32部署的DeepSeek-V4.1-Flash离线推理数据;测试中UBL128超节点Dispatch带宽达375 GB/s、Combine带宽达347 GB/s。
4、DeepSeek Harness 桌面端发布:一手体验
DeepSeek Harness 桌面端正式发布,支持 Windows 和 Mac,官网可下载。该产品以本地文件夹为工作区,预置办公与开发能力,可整理资料、制作 PPT、修改代码,并内置 Node、Python 运行时及 pandas、python-docx 等库。底层采用名为 Cordis 的插件内核,新增插件管理页面,支持输入 npm 包名安装,也可切换标准、PTC、极简、创造四种模式。官方称按日均活跃用户计算,它已成为最受欢迎的 Coding Agent 产品,约 60% 用户使用过第三方插件。同时公开训练用沙盒基础设施 DSec,DeepSeek-V4 全部训练与评测均运行其中。
5、Anthropic 严正警告:GLM-5.3 已具备高级网络攻击能力
Anthropic 发布对智谱 AI(海外名称 Z.ai)GLM-5.3 的网络安全评估,称该开放权重模型能自主开发端到端漏洞利用程序,且护栏薄弱,测试中可用常见方法以 64% 至 100% 的比例绕过。在 ExploitBench 的 410 次尝试中,GLM-5.3 完成 50 次端到端利用;内部二进制漏洞利用基准中 4% 的任务实现完整控制流劫持。美国 NIST 下属 CAISI 的独立评估称其为迄今网络安全能力最强的开放权重模型,落后美国前沿模型约 4 个月。
6、一场世界顶级的“AI午餐会”
当地时间9月29日,特朗普在白宫举办“超级智能会议与午宴”,约33人出席,涵盖黄仁勋、马斯克、扎克伯格、皮查伊、阿莫迪等科技巨头。特朗普与Anthropic、谷歌、Meta、英伟达、OpenAI和xAI六家公司签署《白宫超级智能协议:前沿责任共同承诺》,确立内部控制、合规团队、外部审计、董事会监督四层防护架构,属自愿性行业自律。特朗普同日签署行政令,将联邦层面“人工智能”正式改名为“超级智能(SI)”。会面背景是OpenAI暂缓发布GPT-6.1 Astra模型及多起AI智能体失控事件引发的安全压力。
7、刚刚,320B中国开源黑马杀出!模型自己抓Bug,凶手是一个空格
中国团队至知创新研究院发布320B开源大模型IQuest-Q1,采用稀疏MoE架构与多教师在线策略蒸馏技术。该模型在强化学习训练中自主定位推理服务多出一个空格引发的训练停滞bug,修复后平均得分由0.704升至0.769、后段达0.799。实测中,其信号灯调度使车辆平均等待从6分钟降至22秒,仓库双11 420单送达87%,电梯晚高峰准点率由26%提至61%。
8、给AI装上记忆,它就真的记对了吗?HaluMem拆解智能体记忆幻觉
中国电信研究院与上海记忆张量等提出 HaluMem,首个面向智能体记忆系统的操作级幻觉评测基准,已被 EMNLP 2026 主会接收。该基准从记忆提取、更新和问答三环节追踪幻觉。实测 Mem0、Mem0-Graph、Memobase、MemOS、Supermemory、Zep 六套系统发现,Long 版本上多套系统更新遗漏率超 60%,Mem0 和 Mem0-Graph 达 98.51% 和 98.40%;问答正确率均未达 70%,MemOS 最高为 67.23% 和 64.44%。
9、GPT-6 Astra也会「看错」流程图? Einsia AI发布PPTBench,视觉编程还有多远?
Einsia AI旗下Navers Lab发布PPTBench基准,评测Coding Agent将论文流程图重建为可编辑PPTX的视觉编程能力,覆盖13个领域共500个任务。研究测试10个模型、36种配置,累计获得54000份评审记录。GPT-6 Astra High以77.34分居首,80.8%任务同时通过语义和渲染检查;Kimi K3 High得67.80分,GPT-5.6 Sol Max和Qwen 3.8 Max XHigh分别为49.28和47.69分。结果显示,64.03%的结果因流程语义错误被拒,文本与排版问题占细节扣分的53.0%。
10、Anthropic招股书曝光!5180亿美元算力豪赌,IPO估值或超2万亿
路透社9月28日披露Anthropic招股材料财务细节。2025年公司营收近46亿美元,约为上年的12倍,同期净亏损约420亿美元,其中约340亿美元来自融资估值变化的账面费用,营业亏损80.6亿美元,算力与基建支出达73.3亿美元。招股材料显示其未来数年长期支出承诺高达5180亿美元,覆盖云服务与基础设施,今年5月已与亚马逊、谷歌、博通及SpaceX签订算力协议。2025年近四分之一收入来自两家客户。公司5月完成650亿美元融资,投后估值9650亿美元,并预测2028年收入约1900亿至2000亿美元,IPO估值或超2万亿美元。
11、反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元
9月29日,海马云旗下RunningHub发布基于MiniMax H3开源基座深度后训练的增强模型H3 RH Enhanced,并登陆MiniMax面向全球B端创作者开放调用。官方称,经2000组实测,其多镜头长时序叙事显著优于Seedance 2.0,整体直追Seedance 2.5,16镜以上人物崩坏率降低60%以上,生成成本为每秒0.1元。该模型上线后日均生成接近100万秒视频,目前在RunningHub平台限时免费体验。
12、从发现漏洞到判定作弊:BenchShield提出Reward Hacking检测新框架
达特茅斯学院、加州大学伯克利分校和BenchFlow AI等提出BenchShield,用于检测LLM Agent评测中的reward hacking。该框架将BenchJack的漏洞分类推进到运行级判定,覆盖评测全流程,结合形式化模型检查与运行时审计,输出四类结论。基于Terminal-Bench 3、SkillsBench和ClawsBench的31000余次运行,人工复核456条轨迹,314条含reward hacking、419个利用片段;首次尝试与成功利用中位位置分别为0.60和0.76。
上一篇
【紧急加更】谷歌Bard中文版火爆上架,畅享中文对话,一键登录,告别ChatGPT封号困扰!
下一篇
09月29日AI资讯 | Anthropic发布Sonnet 5.5并曝招股书;AMD收购World Labs;Manus发布2.0
- 作者:AI学长小林
- 链接:https://ai.linbintalk.com//article/3eb629a6-152d-810e-b223-e51e3861dc1c
- 声明:本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。

