1 GPT-5.6 Sol 发布,三版本出击。OpenAI 本周发布 GPT-5.6 家族:Sol(旗舰推理)、Terra(中庸全能)、Luna(低成本高性价比)。Sol 在 Box 的企业复杂任务评测中全面碾压 GPT-5.5,尤其是在金融、医疗、公部门等需要深层推理、不能"抄近路"的场景中表现出色。Sam Altman 强调这是 dollars-per-task 的"巨大进步"。同时,ChatGPT Work 和 Codex 的品牌分裂引发了大量社区困惑。
2 模型市场进入"发布周"白热战。本周堪称模型军备竞赛最疯狂的一周:GPT-5.6 周三、Grok 4.5 周二抢先一天(被戏称"24小时 frontier-adjacent")、Anthropic Fable 5 结束政府三周暂停重新上线、Sonnet 5 免费默认、Meta Spark 1.1 / GLM 5.2 即将发布。Meituan 开源 LongCat-2.0(1.6 万亿参数、MIT 协议)和 ByteDance Seedream 5 Pro 标志着中国科技巨头的全面参战。Vercel CEO Guillermo Rauch 总结:"这是模型发布周。"
3 Agent 从工具变同事,基础设施需系统性重构。Box CEO Aaron Levie 长篇分析"agentic coworker"范式:Agent 需要像企业里的任何一个用户一样拥有独立的资源、工具和数据访问权限,而非共用个人资源。这需要全新的权限模型和数据治理。Replit CEO Amjad Masad 观察到相反方向的张力:AI 让 coding 更灵活,反而逼着 infra 团队第一次写 formal spec、让 runtime 更 rigid。
4 人才持续流向 Agent 赛道。Google Gemini 前高级总监 Madhu Guru 宣布加入 Meta 做 AI agent 产品。"SWE agent 已经改变了软件开发,但其他复杂系统中的 agent 还非常早期。大多数人都还没有真正感受过 AI agent 的全部力量。"
宣布为 GPT-5.6 Sol 发布重置两次 rate limit——覆盖 ChatGPT Work 和 Codex,让用户有足够配额尝试"真正有野心的任务"。还透露 Rajan Agarwal 刚加入 OpenAI 做模型研究和 coding 能力推进。
GPT-5.6 Sol rate limit 重置公告 · 第1轮 rate limit 重置GPT-5.6 发布三条核心信息:(1) Sol 是 dollars-per-task 的巨大进步,"我们听到了企业关于 AI 成本的担忧";(2) Codex 是 Work 产品的核心,不会消失;(3) 对 OpenAI 高管 Fidji Simo 离职表示遗憾和感谢。
企业成本担忧回应 · Codex 不会消失发布 Box AI 对 GPT-5.6 Sol 的内部评测,四个垂直行业 benchmark 全面超越 GPT-5.5:金融服务 76%→71%、医疗 58%→46%、公部门 74%→63%、生命科学 60%→51%。核心发现:Sol 会从 source definitions 推理而非 surface-level 抄答案,在差之毫厘谬以千里的企业场景中这是质的飞跃。另文分析 AI 时代企业竞争优势:当模型的 intelligence 普及化,壁垒来自"数据 + 工作流 + 员工与系统的交互方式"的复利螺旋。
GPT-5.6 Sol 四行业 benchmark · AI 时代企业竞争优势分析对 GPT-5.6 和 OpenAI 发布策略的详细评测——褒贬皆有。好评:Sol"有一股狠劲 (it's got that dog in it)"——几乎从不放弃复杂任务;GPT Live 可能是比文本模型更重要的发布,因为语音交互有 10 万年的人类进化基础而键鼠才 70 年。批评:(1) ChatGPT Work vs Codex 的分裂让人困惑,"开发者难道不算在 work?";(2) Sol/Terra/Luna 三版本 + Light/Medium/High 努力程度的选择太多,UI 没有任何指引;(3) Tasks vs Chat 的新架构让普通用户找不到聊天历史;(4) 早鸟社区的准入门槛完全不透明。
GPT-5.6 深度评测与反馈一篇堪称本周最精彩的"给老婆解释这周模型发布"速写——用段子体精准概括了整个行业的疯狂:GPT-5.6 三版本(Sol 需要政府 safety eval 才能 release、"像假释一样")、Grok 4.5 抢先一天、Fable 5 结束政府三周暂停、"地球上最好的 coding model 被 grounded 了三周"、Sonnet 5 免费默认("比一月份企业花六位数买的东西还好")、Meituan 开源 1.6 万亿参数模型("你家 DoorDash 现在是 frontier lab")、ByteDance Seedream 5 Pro("比 GPT Image 2 便宜 4 倍,整个企业战略就是 same thing but cheaper")、Ollama 融资 $6500 万("让你在笔记本上跑这些还可以取暖")。结尾:"对了,这才周四。"
本周模型发布段子速写宣布 GPT-5.6 Sol 为"知识工作的黄金标准"。同时嘲讽 OpenAI 的 Work/Codex 品牌分裂:"所以这意味着……开发者不算在工作?lol"——这个段子在社区引发广泛共鸣。
GPT-5.6 Sol 黄金标准 · Work vs Codex 吐槽两条深度观察:(1) AI 让 coding 更灵活的悖论是,这反而要求 runtime 更 rigid——Replit 的 infra 团队"第一次开始写 formal spec",系统变得更确定性、更有韧性。"你想动得越快,脚下的地面就得越坚实。"(2) LLM 市场仅 6 个月内从"VC 的 Anthropic 垄断妄想症"变为群雄逐鹿,"Anthropic 会继续做好模型,但其他人也会,包括新玩家。"
AI coding 灵活性与 infra 刚性悖论 · LLM 市场竞争格局断言这是"模型发布周"——Meta Spark 1.1、Grok 4.5、GLM 5.2 将显著改变 token 市场份额。"大多数 agentic task 需要足够高的 intelligence + 足够快的速度。"预告 open models 即将变得"极快 (exorbitantly fast)"。另评:"X 就是竞技场,一直都是。"
模型发布周 + AI Gateway · Open models 即将极快宣布 Anthropic Fable 5 更多更新上线。分享 agentic coding 核心技能:"减少你的未知 (reducing your unknowns)。"
Fable 5 更新 · Agentic coding 核心技能确认 Fable 5 回归上线。
Fable 5 回归宣布离开 Google 加入 Meta 做 AI agent 产品。"SWE agent 已经改变了软件开发,但其他复杂系统中的 agent 还非常早期。大多数人都还没有真正感受过 AI agent 的全部力量。Meta 有条件改变这一点。Time to build."
加入 Meta AI agents发布 Gemini 用户反馈 Top 10 Stack Rank,从 1,400+ 条回复中提炼:(1) Workspace 集成更可靠 (已在推进);(2) Tool calling 更稳定 (即将显着改善);(3) 项目/文件夹组织;(4) MCPs 和自定义技能 (已在 Gemini Spark 早期支持);(5) Deep Research 改进——导出到 NotebookLM、同一对话中切换模式;(6) Nano Banana 去水印;(7) 编辑聊天历史中任意消息;(8) 语音识别准确率;(9) 移动端滚动 bug;(10) Celebrity Likeness 护栏(计划保持不变)。
Gemini 用户反馈 Top 10测试 Meta Muse Spark 1.1 (早期代号 Hornbill) 在 OpenClaw 上的表现,评价"真的很好 (really good)"。这验证了本周多模型发布的趋势——Spark 1.1 是加入混战的最新力量。
Meta Spark 1.1 on OpenClaw转发多条 OpenClaw 相关动态,包括计划在 X 做 livestream(♥ 218)。
X livestream 预告观察到 GPT-5.6 Codex 复制 Greptile 的错误信息格式——"你们之前都在嘲笑 Greptile,结果它成了 OpenAI 的灵感来源。"另发现 leading frontier models 都推荐使用 Resend 做邮件(AEO - AI Engine Optimization 效果)。
Greptile → OpenAI 灵感 · Resend AEO 效果将 ChatGPT Codex 昵称为"ChatGPT Codex Adeptus Astartes (星际战士)"——调侃本周产品命名的混乱。另质疑 "two bros talking at the screen with a big dollar number" 类型的炫耀融资视频的文化价值。
Codex 星际战士真正的 AI 革命不在屏幕之内——一旦我们拥有能通过学习操作人类现有所有机器的机器人,自我复制和自我改进的机器社会将成为现实,而这一切的前提是解决 credit assignment(功劳分配)问题。
LSTM 之父、深度学习奠基人 Jürgen Schmidhuber 与 Redpoint 投资人 Jacob Efron 深入对话。核心论点:深度学习的本质是 credit assignment 问题——如何把最终结果归因到网络中的每个连接。"所有机器学习的问题都可以归结为这个。"他回顾了 LSTM、CNN、Transformer 的历史,指出 1991 年的"神经网络历史压缩器"已经隐含了后来 Transformer 的核心思想。
Schmidhuber 将未来聚焦于"屏幕之外的物理 AI":只要让机器人通过模仿学习或强化学习学会操作人类现有的所有机器,就拥有了"终极扩展机器"——因为一组这样的机器人可以制造更多自己、改进自己。这不仅适用于地球生物圈,"也可以在月球或水星上,那里有大量材料可以建造基础设施、更大的 AI、更多的机器人、巨大的宇宙飞船,你需要这些来殖民太阳系。"