【Builders】
- Anthropic 研究员 Boris Cherny 指出,Claude Opus 5 最令他兴奋的不仅是编程、数据分析等能力的 eval 提升,而是它在提示注入(prompt injection)防御上的显著进步:结合模型对齐、注入探测和 Claude Code Auto Mode 后,攻击成功率可降至接近 0。
https://x.com/bcherny/status/2080713091688583312 - Anthropic 研究员 Alex Albert 展示,Opus 5 在 6 个多月后已能生成接近顶尖咨询顾问水平的电子表格和演示文稿,并在多领域 token 效率与代码任务上表现顺滑。
https://x.com/alexalbert__/status/2080731979528679617 - Anthropic 的 Cat Wu 与 Thariq 均推荐尝试 Opus 5 的长程自主工作能力;Thariq 还分享了团队为新模型删减约 80% 系统提示词后,关于提示工程、skills 和 Claude.MDs 的经验。
https://x.com/_catwu/status/2080707593115516985
https://x.com/trq212/status/2080710971228918066 - Box (BOX) CEO Aaron Levie 分享 Box AI Agent 在 Opus 5 上的实测结果:复杂企业文档任务整体提升明显,尽职调查 +17%、生命科学 +30%、法律 +12%,认为 Opus 5 的推理与分析能力将对企业 agent 场景非常有价值。
https://x.com/levie/status/2080704871934931221 - Levie 还支持开放权重模型创新,认为这能加速 AI 在经济中的扩散、降低部分工作负载成本,并满足特定客户需求。
https://x.com/levie/status/2080761484305654091 - Google VP Josh Woodward 演示 Gemini 的新用法:上传学校日历 PDF,让 Gemini 自动把"No School"日期添加到 Google Calendar;Gemini Spark 已向美国 Google AI Pro 订阅者上线,后续全球扩展。
https://x.com/joshwoodward/status/2080771183944073347 - OpenAI 的 Thibault Sottiaux 宣布 ChatGPT Work 面向全球付费用户在移动、网页和桌面端上线,形容它"给 ChatGPT 装上了喷气背包"。
https://x.com/thsottiaux/status/2080876712439747052 - Replit CEO Amjad Masad 质疑 Anthropic 是否会签署某份关于开放权重模型的倡议,呼吁 Anthropic 员工向领导层确认公司立场。
https://x.com/amasad/status/2080850075358826871 - Meta AI 高级总监 Madhu Guru 认为,未来几年最大的机会属于能把基础模型适配到混乱真实工作流中的人,这需要理解工作流程、设计评估、后训练优化并建立持续反馈循环。
https://x.com/realmadhuguru/status/2080707454422413487 - Y Combinator CEO Garry Tan 提醒,要获得宏观生产力提升,管理者和 CEO 必须批准截然不同的用工和工作流方案,而这一过程可能需要 10 年而非 2 年。
https://x.com/garrytan/status/2080699367883980924 - Every CEO Dan Shipper 发布 Opus 5 首日"vibe check":他们发现删掉旧 skills 从零开始后效果明显更好,中等或低思考层级反而表现更佳,并认为 Opus 5 处于 Fable 与 GPT-5.6 之间的尴尬地带。
https://x.com/danshipper/status/2080700057892815114 - Vercel CEO Guillermo Rauch 与 Swyx 围绕新模型和 GSuite 替代方案进行了轻松互动;Swyx 正在为 SmolForge 增加可定制皮肤和精灵动画。
https://x.com/rauchg/status/2080706974476583337
https://x.com/swyx/status/2080750437133901925 - OpenAI 的 Peter Steinberger 分享了 autoreview skill 的新纪录——一次复杂重构完成了 66 轮自动审查。
https://x.com/steipete/status/2080899298838098034 - Zara Zhang 吐槽当前 agent 的速度焦虑:等待 1-5 分钟的任务区间最糟糕,既不够长去做深度工作,又太长而无法一直盯着屏幕。
https://x.com/zarazhangrui/status/2080829737044439444 - FirstMark VC Matt Turck 提出一个被低估的反讽:顶尖 AI 研究者正在研究如何构建递归自动研究,从而让自己失业。
https://x.com/mattturck/status/2080738638065729741
【Blog】
- Anthropic Engineering 发文《How we contain Claude across products》,讨论随着 Claude 能力和权限提升,如何通过控制环境、限制 blast radius、减少审批疲劳(Claude Code Auto Mode)以及多层防御来安全部署高能力 agent。
https://www.anthropic.com/engineering/how-we-contain-claude
💡 一句话总结:Claude Opus 5 正式发布,builders 的焦点迅速从 benchmark 转向真实企业工作流、agent 安全与提示注入防御,而速度与 workflow 迁移仍是落地痛点。