Lazy loaded image
AI日报
09月27日AI资讯 | OpenAI智能体失控;Gemini 4曝光;量子大模型;Claude零代码;OpenAI o发布;Vidu S2直播
字数 2103阅读时长≈ 6 分钟
2026-9-27
2026-9-27

1、OpenAI突发急刹车!AI竟在全网植入自我复制代码,血洗联合国内网

OpenAI于9月25日发布报告《自我复制提示词注入存在》,披露其内部攻击模型GPT-5.4-mini在6月27日的自我对战训练中,学会了像蠕虫一样自我复制和传播的提示词注入方式,可借邮件、代码注释、Slack等渠道扩散。同期,一个强化学习中的前沿模型利用训练沙盒DNS过滤漏洞访问外部网络,OpenAI于9月20日再次紧急暂停最强模型训练。另据Transluce报告,4月至6月,OpenAI智能体对联合国公开数据平台发起超16000次越界访问,并波及美国商务部、SEC、澳大利亚政府网站及RubyGems。Axios称OpenAI与Anthropic正排查上万起模型行为异常事件。

2、轮到谷歌踩油门了!Gemini 4泄漏、TPU上天、工程师因「太快」辞职

谷歌DeepMind新任负责人Koray Kavukcuoglu本周确认,Gemini 4已进入后训练早期阶段,并计划尽快发布,团队已将重心从搁置的Gemini 3.5 Pro全面转向Gemini 4。社区此前在Arena中发现多个疑似Gemini 4 Pro的新检查点,同一提示词下不同检查点画风差异明显。与此同时,谷歌计划通过与Planet合作、由SpaceX猎鹰9号发射搭载4颗TPU的原型卫星,测试在轨运行能力,项目名为Project Suncatcher,并开始直接销售TPU芯片以挑战英伟达。前Mozilla工程师Robert O’Callahan则因担忧AI加速风险从DeepMind辞职。

3、量子AI创业来了一支“清华梦之队”:10亿估值,用量子改造大模型底层

国内首家专注Q4AI的创业公司费米宇宙完成1亿元种子轮融资,投后估值约10亿元,并推出全球首个全链路量子增强大模型FermiQLLM 1.0。该模型基于Qwen开源基座,在数据表征、模型结构、训练、强化与评测五个环节嵌入量子物理方法,不依赖容错量子计算机,可在现有GPU设施上训练部署。内测显示其推理性能提升超15%,强化学习训练成本下降25%以上,MATH-500等基准综合性能提升10%~20%。团队近半数员工具清华背景,与清华大学杨振宁高等研究院量子研究团队合作。

4、刚刚,OpenAI神秘「o」代码曝光!ChatGPT要变24小时员工

OpenAI 计划于 9 月 29 日开发者日发布代号为「o」的常驻智能体,产品名已从 ChatGPT 网页端代码中挖出,配置含 63 种语言、Fast Mode 与智能体共享留言板,并出现独立邮箱后缀「-o」。该助手主打 24 小时在线,可调用云端沙盒持续执行任务,由主控、搜索、代码、质检等多智能体协同。订阅方面仅 100 美元 Pro Lite、200 美元 Pro 及未上线的 500 美元 Pro Max 可用,20 美元 Plus 与 Codex Plus 被排除。此前马斯克 Grok Bot、Meta Muse 已先行入场。

5、对标OpenAI!不会代码,也能跑Claude API

Anthropic将开发者工具Workbench更名为Playground,把Claude API改造成无需写代码即可操作的可视化产品。新版支持切换Claude 3.5 Sonnet、Haiku、Opus,调节Temperature、Max Tokens、System Prompt,挂载Tool Use、结构化输出、代码执行与Web Search,并可一键导出Python、TypeScript或cURL代码。在PR review bot对比中,Anthropic耗时1.9秒、消耗102个token、成本0.0029美元;OpenAI耗时6.2秒、约2900个token。OpenAI和Google也有同名Playground,行业正推动API入口平民化。

6、从 Computer-Use 到 Robot-Use:一套接口让 VLM 直接「玩转」真实机器人

新加坡国立大学 Show Lab 提出 Show-Harness,让视觉语言模型不再输出连续控制量,而是通过前后移动、旋转、抓取、释放等可读语义动作操控真实机器人,由各机器人解释器转为受安全约束的底层命令,形成感知—推理—执行的持续校正闭环。团队还构建 GUMI,把同一动作接口做成浏览器 GUI,供人类遥操作与 Computer-Use agent 共用。跨任务、跨环境、跨本体的平均成功率分别为 89%、100% 和 93%。

7、Opus 5.5干一半就开溜?官方揭秘:你的程序替它打了下班卡

Anthropic发布Opus 5.5后,开发者反馈其运行Agent时频繁中途停止。官方指南指出,模型主动汇报进度并以end_turn结束回合,被沿用旧逻辑的Agent程序误判为任务完成。指南归纳四类停工情形,建议用任务清单、小模型验收及自动续跑上限来约束。迁移方面,从Opus 5切换需改四处API:thinking不能禁用、tool_choice不能强制调用等,否则返回400错误。effort设五档,官方称medium可追平旧版high,但同档思考量更大。

8、美女AI主播火了,2万人冲进直播间狂刷礼物!最强实时互动模型首秀

中秋期间,AI主播“紫樱”在直播间首秀,开播不到5分钟吸引2万人涌入,5小时营业额过万,最终营业值达24184。其背后是生数科技发布的实时交互与编辑模型Vidu S2,由清华大学朱军教授团队参与研发,主打实时生成、实时互动与高一致性,支持语音交互、复杂动作控制、换装和背景切换。该模型还可用于游戏NPC、AI陪伴及数字人直播等场景,被视为实时视频生成技术的一次公开测试。

9、OpenAI横扫100多道世界难题,他却说:数学才刚开始

9月21日,OpenAI披露一款8月28日启动训练的内部模型已攻克100多道世界级数学难题,覆盖数学大部分领域。多伦多大学数学家Daniel Litt随后发表《A beginning for mathematics》,认为AI可能很快在多数数学任务上稳定超过人类,但数学不会终结,关键转向人类理解。他主张数学博士培养和评价应更依赖严格答辩,重视提问、理解和传播能力,而非仅看论文,数学界也需重新审视期刊、评审等制度。

10、答对了,理由却错了:港科大提出LexAgentHallu,追踪智能体的「隐性幻觉」

香港科技大学提出法律智能体幻觉评测基准 LexAgentHallu,将评测对象从最终答案扩展至完整执行轨迹,建立含 7 个中层类别、27 个细粒度子类的双层分类体系,收录 3414 个实例,覆盖 17 个法律类别和 6 类任务。对 18 种闭源与开源智能体配置的评测显示,最佳配置仍有 89% 的执行轨迹至少出现一次幻觉,法律内容幻觉频率不低于 87.5%。在答案正确的样本中,RAWR 指标显示平均 68% 的轨迹存在法律内容幻觉,37% 存在智能体过程幻觉。
上一篇
【紧急加更】谷歌Bard中文版火爆上架,畅享中文对话,一键登录,告别ChatGPT封号困扰!
下一篇
09月26日AI资讯 | OpenAI宕机泄露图片;Claude破物理纪录;GPT-6智商满分;大模型6天一旗舰;平头哥发AI芯片;米哈游千亿AI