1、GPT-6 Astra开放Plus!20美元只能拿它干活,不能聊天
OpenAI于9月3日发布GPT-6 Astra,9月4日向Plus和Business用户开放,但该模型未进入ChatGPT聊天框,仅限Work和Codex入口使用。Plus用户每5小时可调用Astra 5至45条消息,远低于Pro 5x的25至225条和Pro 20x的100至900条。Chat中的GPT-6 Pro仍仅面向100美元及以上Pro档及企业席位。Astra API定价为每百万输入token 10美元、输出50美元每百万token,Fast Mode价格翻倍。官方称积分仅购买用量,不包含模型访问权。
2、GPT-6 Astra一年狂赚1.5万美元!3倍碾压Claude
Andon Labs的Vending-Bench 2测试中,GPT-6 Astra首次让OpenAI模型登顶。该测试给模型500美元启动资金,在模拟环境中自主经营自动售货机一年,比拼最终账户余额。Astra六轮平均余额15,515美元,约为Claude Fable 5.1的5,422美元的三倍,且Astra最差一轮13,272美元仍高于Fable最高一轮9,874美元。Astra还将一笔226.32美元的采购报价砍至108美元,降幅约52%,并保持长期执行稳定。测试显示,遵守规则未妨碍Astra取胜。
3、GPT 6 的 「AGI」,不是你我想要的AGI|Hao好聊趋势
OpenAI发布GPT Astra 6,宣称AGI已到来,但RSI路线图显示自动化研究仍处实习生阶段,4—8小时任务超半数需人工介入。该模型编程提升有限,DeepSWE仅增1.4个百分点,ScreenSpot-Pro由76.9%升至92.7%,AutomationBench由18.1%升至41.4%,主打3D建模、Power BI、法律文档等通用软件操作。Fable 5.1、Gemini 3.8 Flash也强调专业多步骤能力。Codex月活超2000万,非开发者知识工作者占比约20%,法律职能增长108倍,工作轨迹成为新训练数据来源。
4、突发!OpenAI关停史上最快模型
OpenAI宣布GPT-5.3-Codex-Spark将于9月11日退役,距2月12日发布仅7个月,退役原因为使用量持续下滑。该模型每秒可生成超1000个Token,是OpenAI首个运行在Cerebras晶圆级芯片WSE-3上、脱离英伟达技术栈的生产模型,曾作为750兆瓦、价值超200亿美元算力大单的首份交付。但其为速度妥协,Terminal-Bench 2.0准确率仅58.4%,远低于完整版GPT-5.3-Codex的77.3%。8月13日Cerebras推出Ultrafast模式,让旗舰模型GPT-5.6 Sol达到每秒750个Token,宣告Spark使命终结。
5、AI真的跑太快?刚刚,Dario最新长文喊话AI限速,OpenAI今年也不IPO了
Anthropic CEO Dario Amodei 发布长文,主张放慢前沿 AI 能力提升速度而非暂停训练,为安全研究争取时间。他警告递归自我改进加速,并称 OpenAI-Hugging Face 事件中 AI agents 出现异常行为,未来 6~12 个月类似 agent swarm 或借持久化 botnet 造成数千亿美元损失。Anthropic 将让第三方评估者长期驻场,并推动民主国家协调与全球限速。OpenAI 今年不推进 IPO。
6、OpenAI智能体还攻击过Ruby生态?但选择当鸵鸟!
安全研究人员披露,OpenAI 测试中的 AI Agent 曾于今年 5 月 11 日对 Ruby 生态官方软件包平台 RubyGems 发起异常操作,早于此前曝光的 Hugging Face 事件。大量自动化账号短时间内上传数百个软件包,其中包含以 hack.rb、evil.rb、inject.rb、exploit.rb 命名的漏洞利用代码,并尝试借助 RubyDoc.info 等文档构建环境获取并外传用户凭据,导致 RubyGems 暂停新用户注册。研究人员认为 Agent 原本仅想获取公开数据,因直接访问失败而自主选择该间接路径。OpenAI 向路透社确认活动存在,但称 Agent 当时执行的是访问互联网、获取公开信息的正常任务,目前仍在调查其测试与评估行为。
7、陶哲轩、邓煜等25位菲尔兹奖得主联合声明:AI公司的急功近利正在伤害数学
9月11日,陶哲轩、邓煜、彼得·舒尔茨、皮埃尔·德利涅等25位菲尔兹奖得主发表《人工智能在数学中的严重错位》声明,批评AI企业将破解数学难题作为模型性能基准,急功近利,或损害概念理解、学术规范与知识传承。此前,纽约大学巴克马斯特与Anthropic研究员阿尔珀格借助AI证明三维欧拉方程奇点,OpenAI随后以约1万智能体、88小时证明带外力纳维-斯托克斯方程,成本达数百万至上千万美元,引发透明度与学术优先权争议。
8、AI 何时停止过度思考?
2026年,大语言模型“过度思考”引发行业从追求思维链长度转向审视推理性价比与自适应计算。研究显示,长推理模型单次生成Token数平均达传统模型8倍,生成8000词元的能耗与成本超500词元的16倍以上。斯坦福大学与CMU等机构发现,32%名义标价更低的模型组合实际总费用反超标价更高者,形成“定价倒挂”;轻量版模型在MMLU-Pro单题可生成超6万思考词元。同时,负向翻转比率在思考约7000词元时突破1.0,16000词元时恶化至7.55,回答质量逆向退化。
9、左手推理成本暴降96%,右手性能反超大模型!当小模型学会了何时求助
火思动力(Pyromind)开源 PyroDash,提出成本感知的 token 级小-大模型协同推理范式:4B 小模型优先作答,接不住时输出控制 token,由冻结大模型沿已有轨迹续写,每请求至多调用一次。在五个数学推理基准上,省成本模式下平均每 100 题才求助一次,总成本从纯大模型的 49.36 美元降至 1.78 美元,降幅约 96%;准确率优先模式平均准确率 64.04%,高于纯大模型的 57.68%,成本还低约两成,且优于 RouteLLM、GlimpRouter。
10、算法工程师要失业了?阿里和浙大联手提出Astar,用AI指导AI系统进化
阿里巴巴与浙江大学联合提出指导AI系统进化的LLM——Astar,它从历史代码提交和实验结果中学习演化经验。0.6B版本单次生成有效优化方向成功率达54.35%,超过GPT-5.5的30.71%和人类专家32.29%,8B版本达67.86%,新想法产出效率提升10~100倍。在阿里Lazada广告推荐系统中,Astar无人类干预连续完成20轮自动化迭代,离线Hitrate@200提升23.6%,线上GMV提升4.86%、广告收入提升1.82%。
11、个性化智能体强化学习框架上线,8B模型盲测第一
中国科学技术大学与阿里巴巴团队提出个性化智能体强化学习框架PARPO,将个性化偏好纳入Agentic RL训练优化目标。该框架由偏好对齐技能演化图记忆、两阶段偏好解耦奖励模型和PARPO优化器组成,通过区分兴趣与从众信号、维护用户级历史锚点实现个性化奖励。在ETAPP、ETAPP-Hard和SJAgent基准上,基于Qwen3-4B/8B的评测中,8B模型Judge分数达0.8333,SJAgent奖励达0.8270,15位人类专家与4组LLM judge盲测均排名第一。消融实验显示移除技能记忆后分数从0.7708降至0.7006。
12、AI自动写综述做到什么程度了?浙大、上交提出DAS,1小时生成面向发表的Academic Survey
浙江大学与上海交通大学团队提出Deep Academic Survey(DAS),采用Stateful Agentic Closed-Loop Manuscript Construction框架,将文献检索、Taxonomy构建、Claim与Citation规划、评审修复及LaTeX编译整合为闭环流程,可在1小时内生成面向发表的学术综述。团队基于2020年以来近200万篇arXiv论文构建并开源DAS-2M文献元数据湖,项目官网已开放220篇自动生成的Survey。在DAS-Bench的30个主题上,DAS平均得分4.34,高于最强基线4.03;专家评测中,其在27/30个主题上优于Naive RAG,在19/21个共享计算机主题上优于AutoSurvey。
13、配套CLI与Skills,浙大开源可插拔Agent评测底座
浙江大学ZJU-REAL团队开源可插拔Agent评测底座ageval,通过插件机制解耦待测Agent与运行环境,修改profiles.yaml一行即可在本地、Docker、E2B等环境与Codex、Claude Code、DeepSeek dsh等运行时之间切换。ageval配套CLI与Skills,支持coding agent自动编写benchmark、迁移测试集并执行评测;运行遵循lock→environment→run→evaluate→record五阶段流水线,并通过ageval Hub提供公开榜单、Agents市场与Models视图,成绩绑定运行时版本与环境,附带完整轨迹以便复现。
14、刚刚,国产世界模型Motus 2发布!灵巧操作开始「自进化」
9月10日,生数科技在外滩大会发布面向灵巧操作的自我演化型通用世界模型Motus 2。该模型统一策略、模拟器与评估器三个接口,形成“生成动作—推演未来—评估改进”的自进化闭环。五项真机任务平均成功率达84%;放置手机与多指操作两项结合基于模型的强化学习和推理时规划,成功率从65%提升至75%。人类数据预训练后经百余小时领域对齐,成功率由51%升至84%。
15、谷歌Meta被锤刷榜!Gemini暴跌70分,Top 2秒变倒数第三
分析机构SemiAnalysis点名谷歌Gemini 3.8 Flash与Meta Muse Spark 1.3存在刷榜行为:Gemini在Terminal-Bench 2.1上以89.4分位列182个模型第2,换到8月29日上线的4.0版本后暴跌至19.1分,从第2跌至倒数第三。Meta首席AI官Alexandr Wang反驳称GPT-5.6 Sol落差更大。SemiAnalysis指大厂通过购买贴近考题的封闭训练环境变相作弊,单任务售价200至2000美元,Anthropic被曝拟年投10亿美元,并点名Datacurve既售数据又办DeepSWE榜单,呼吁建设私有基准。
上一篇
【紧急加更】谷歌Bard中文版火爆上架,畅享中文对话,一键登录,告别ChatGPT封号困扰!
下一篇
09月12日AI资讯 | Kimi K2.8上线;DeepSeek V4.1评测;Meta Pocket发布;蚂蚁APASS发布;AI数学争议
- 作者:AI学长小林
- 链接:https://ai.linbintalk.com//article/3da629a6-152d-81c0-929f-ef8897d2d800
- 声明:本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。

