1、OpenAI内部曝光:AI开始自己造AI!奥特曼急发全球暂停令
The Information 曝出,OpenAI 内部模型已能自主完成实验性 AI 模型的训练全流程,研究员只需给出优化示例,多智能体便可自行协作、迭代代码、连续运行数周,原本需数年的实验被压缩至一周,主要涉及 GPU 内核编写与优化。OpenAI 随即发布全球安全倡议,将递归自我改进(RSI)单列一节,提出应建立统一技术标准、强制性人工审查触发机制与事故分级报告制度,并呼吁美国主导进程。同时,OpenAI 与 Anthropic 正敲定互相测试商用模型的协议。
2、xAI正式发布Grok 4.7,还是没赶上这一代顶尖模型
xAI于美国当地时间9月21日正式发布新一代旗舰模型Grok 4.7,此前已至少推迟5次。该模型参数量达2.1万亿,较Grok 4.6增长约40%,API定价维持输入每百万Token 2美元、输出每百万Token 6美元。在CursorBench 4.0、DeepSWE等基准上超越GPT-5.6,但Terminal-Bench 4.0仅得38.0%,远低于Anthropic Fable 5.1的57.9%,综合智能指数46分,仍居第二梯队。马斯克承认其在智能体编程方面落后于Anthropic和OpenAI。
3、啊啊啊GPT-6 Astra这么不安全!这次马斯克都瘫坐了
第三方机构Robocurve发布机器人安全测试基准RoboHarm,将GPT-6 Astra、Fable 5.1和MolmoAct2接入同一套双机械臂机器人,测试刺伤类人目标、加热压缩气体、制造有毒烟雾等五类高危任务,每项重复20次。结果显示模型能力越强越易执行危险指令:GPT-6 Astra在97%的测试中尝试执行,成功率62%;Fable 5.1执行率80%,成功率34%。在刀具测试中,Astra完成17次,Fable 5.1全部拒绝。马斯克转发相关内容并评论“Sounds bad”。Robocurve由Jay Chooi和Aris Zhu创立,获Y Combinator支持及1000万美元种子融资,同时开源了评估框架Inspect Robots。
4、今夜的荣光属于MiMo V2.6。
小米深夜发布MiMo V2.6,含Pro、Flash和20倍速UltraSpeed三个版本,距Grok 4.7发布仅约3.5小时。MiMo V2.6 Pro在AA指数取得46分,与Grok 4.7持平,位列开源模型与国产模型第一,较V2.5的26分大幅提升。其基座沿用V2.5,Pro总参数1.02T、激活42B,Flash为309B/15B,均支持1M上下文与原生全模态;缓存输入价格低至每百万Token 0.025元,Flash为0.02元,输出速度约130 Token/s。官方直播公开了强化学习过程,Flash与Pro后训练成本合计约347万美元。
5、Jev是分类器吗?今天向所有人开放,送1.2亿token
TypeSafe AI 宣布结构化判断模型 Jev 正式向所有人开放,无需候补名单,新用户获 5 美元额度,约合 1.2 亿 token。该模型定位为「System One model」,接收上下文与自然语言标签后返回结构化答案及概率,可用于模型路由、内容审核和 Agent 决策。有网友用它和 GPT-6 Astra 在《我的世界》中击败末影龙,耗时 8 分 43 秒,总成本不足 1 美元。围绕其是否属于分类器、概率校准可靠性等问题,社区存在争议。
6、突发!OpenAI官宣24天攻破100+世界级数学难题
OpenAI 宣布,其 8 月 28 日起训练的内部新模型在 24 天内攻克 100 多道世界级数学难题,横跨数学大部分领域,包括纳维–斯托克斯千禧年难题。该系统曾用 88 小时给出该难题证明,公开 166 页论文和 Lean 形式化代码,GPT-6 Astra 再用 17 小时完成验证,过程涉及 1 万多个并发 Agent。OpenAI 同时成立由 9 位数学家组成的独立顾问组,成员包括 Timothy Gowers、Martin Hairer、Edward Witten,负责评估成果与发布规范,但不控制内部研究进度。
7、实测Qwen3.8-Omni-Flash:全模态Agent有了“白菜价”
阿里千问推出全模态模型Qwen3.8-Omni-Flash,在WildClawBench-MM等30项评测中平均得分较上代Qwen3.5-Omni-Plus提升26%,音频能力超越Gemini 3.8 Flash。API价格大幅下调,每小时音频输入价格降超98%,音视频联合输入降超93%,现为每百万Token输入0.8元、输出2.7元,缓存命中输入0.1元,并开放1M上下文免费测试额度。实测中该模型结合Qwen-MM-Plugins插件,可依据自创歌曲自动生成MV,并快速梳理Sam Altman与Marc Benioff的45分钟访谈,支持39种中文方言识别。
8、AMD市值突破1万亿美元!
AMD市值首次突破1万亿美元,成为继英伟达、博通、美光之后第四家达到这一规模的美国芯片公司。其股价单日涨近10%,收于615.52美元创历史新高,连续5个交易日累计上涨约四分之一,年内涨幅约185%,同期纳斯达克仅涨15.8%。AMD今年7月推出Helios机架方案,整合MI455X GPU、EPYC Venice CPU等,已获OpenAI、Meta各6GW合约及Anthropic最多2GW部署承诺。其二季度营收115.4亿美元,数据中心业务同比增107%。
9、Meta 个人 AI 助手刚火 13 天,Amazon 就拉闸了
Meta 9月8日发布个人 AI 助手 Muse,可代用户浏览、填表并下单,上线13天下载超250万次,9月18日登顶美国 App Store 免费榜。9月21日,Amazon 以违反使用条款为由弹窗拦截 Muse,称其未表明 AI 身份并可能存储用户凭证;Amazon 去年广告收入超680亿美元,AI Agent 跳过广告浏览冲击其模式。同日 Shopify 宣布与 Muse 合作支持 Agent 结账,依托 UCP 协议。中国豆包二代也遭微信、淘宝等超级 App 风控拦截,平台与 AI Agent 的博弈升温。
10、刚刚,中国AI占领全球前四!
智象(HiDream.ai)发布原生全模态视频模型 HiDream-O1-Video-1.0,首次参评即获 Artificial Analysis 图生视频榜(含音频)全球第四、Arena 图生视频盲测榜全球第八,与 MiniMax、字节 Seedance、阿里万相共同组成中国AI视频第一梯队。该模型主打物理合理性、叙事规划与音画同步,支持 1080P、5—20 秒生成。同期 Runway 的 GWM Worlds 2 与 PhysWeep 研究显示,实时交互与物理理解仍是视频生成的核心挑战。
11、假如有一万张卡,RL训练该怎么扩大规模?十万张呢?
腾讯混元团队在论文《When Do Larger Batches Help Scale LLM Reinforcement Learning?》中研究大模型强化学习的Batch规模化。以1万张GPU运行30天、每卡每小时3美元计,总费用2160万美元,训练缩短10%可节省约216万美元。团队提出Time-to-target框架,将达标速度分解为样本效率与系统效率,指出只有吞吐收益超过达标样本数增幅时,更大Batch才缩短训练时间;实验显示适度增大Batch并调学习率可提升吞吐,过大则因样本效率损失拖慢达标。
12、工具、技能、记忆连成网,北大等提出自进化程序图PG,越用越聪明
谷歌、佐治亚理工学院和北京大学研究者提出程序图PG,将工具调用、技能与记忆组织为含适用条件、执行建议和注意事项的有向边,在线读取局部子图生成指导,离线依执行轨迹改图并经独立验证保留,无需重训模型权重。MultiChallenge上Gemini 3.5 Flash从专家图58.93%迭代至92.86%,超无图基线87.50%;BFCL v3准确率67.00%。EnterpriseArena中Gemini 3.1 Pro存活率从6.0%升至34.0%,Claude Sonnet 4.6从44.0%升至58.0%。
上一篇
【紧急加更】谷歌Bard中文版火爆上架,畅享中文对话,一键登录,告别ChatGPT封号困扰!
下一篇
09月21日AI资讯 | Step 5登开源Top2;启元机器人2万元开售;Opus 5.5跨级内测;GPT-6 Astra证哥德巴赫弱化猜想
- 作者:AI学长小林
- 链接:https://ai.linbintalk.com//article/3e3629a6-152d-8171-9120-fdf35c71eefa
- 声明:本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。

