跳转至

Twitter AI 编程 - 2026-07-29

1. 人们在讨论什么

1.1 成本、配额和供应商切换取代了单纯的演示热议 🡕

Twitter 上最强的一波 AI 编程讨论,已经不再围绕更花哨的演示,而是智能体运行成本是否在下降、配额修复是否真的恢复了可用余量,以及大型团队究竟信任哪家供应商到愿意据此标准化。四个高信号条目支撑了这一主题:OpenAI 关于 Codex 自我优化的说法、Disney 据称从 Copilot 转向 Codex、Microsoft 更广泛的 Copilot 增长更新,以及一条围绕 Sol 使用上限且回复很多的讨论串。

@OpenAIDevs 表示(881 个点赞、53 条回复、44,085 次浏览、73 次收藏),GPT-5.6 Sol 被用于 Codex 内部,以优化 Codex 自身的基础设施和性能。被引用的 OpenAI 帖子补上了主推文里缺失的具体数字:生产环境 GPU kernel 的改进让服务成本降低了 20%,推测解码让 token 生成效率提高了 15%+。回复随即把这个基础设施层面的胜利转成了用户价值问题:这些收益究竟会体现为更低延迟、更少配额消耗,还是只是更好的后端吞吐。

@wallstengine 报道称(60 个点赞、6 条回复、17,167 次浏览),Disney 计划 8 月在美国停用 GitHub Copilot,转而采用 OpenAI Codex,保留 Claude Enterprise 和 Cursor,并移除 Amazon Kiro 与 Q。Business Insider 进一步补充了操作者层面的细节:8 名 Disney 技术员工表示他们很少或从不使用 Copilot;一名产品经理称它的输出“复杂得没必要”;还有一名工程师说,他大约 80% 的编程 AI 使用都来自终端里的 Claude。这条帖子下的回复不赞成从单一泄露过度解读,但仍把它视为一个有意义的证据:企业团队正在主动重新测试供应商选择,而不是锁死在单一栈上。

@wallstengine 还补充(60 个点赞、13,654 次浏览),Satya Nadella 表示,Copilot 收入环比加速超过 60%,覆盖大多数员工的企业级部署增长近 75%,GitHub 用户达到 2.25 亿,GitHub Copilot 达到 5,000 万。这反而让 Disney 的故事更值得关注,而不是更不重要:即便 Microsoft 整体的 Copilot 采用率还在上升,仍有一家大型买方据称在切换离开。

OpenAI 的 Tibo Thsottiaux 表示 ChatGPT Work 和 Codex 限额已重置、GPT-5.6 Sol 预计可多撑约 18% 的截图

讨论要点: @TimJayas (27 个点赞、11 条回复、1,786 次浏览)同日的 Codex 重置解读为使用量提升了 18%,但回复里的怀疑多过庆祝。有人认为这次改动只是拿回了之前失去容量中的一小部分;另一位则讥讽说“好耶,我们被限制得更严了”;还有人追问现在真正的每周上限到底是多少。最明显的模式不是对某一家模型供应商盲目忠诚,而是对不透明配额算法的不信任。

与前日对比: 7 月 28 日围绕 Copilot 的讨论主要由模型可用性驱动——尤其是 Grok 4.5 登陆 Copilot。到了 7 月 29 日,Copilot 和 Codex 依然处于中心,但重心已经转向成本、限制和企业采购。

1.2 Google 的智能体栈继续从演示应用向外扩展 🡒

Google 和 Antigravity 依然高度显眼,但重点已经从单纯的 UI 花活转向真实工作流和产品组合广度。三个延续性的条目支撑了这个主题:一条关于 Antigravity research-evals 的讨论串、Google 的 Farm Brain 部署故事,以及一篇被大量收藏的 Google 免费 AI 工具栈盘点。

@antigravity 展示了(376 个点赞、14 条回复、18,155 次浏览、125 次收藏)Antigravity 被用于 research-eval 分析:系统用自然语言分析表格、提出假设,并拉起并行子智能体来隔离失败模式。这比昨天的 canvas-to-UI 演示更偏落地:它的价值主张是用可重复的分析工作流,替代手写评估脚本和手动解析表格。最有分量的一条回复来自付费用户:他要求支持移动端任务交接和 BYOK 模型,因为原生 Opus 选项还停留在 4.6。

@Google 展示了(353 个点赞、51 条回复、121,037 次浏览、94 次收藏)Michigan 农民 Paul Windemuller 的“Farm Brain”:这是一个在 Antigravity 内、基于 Gemini 3.6 Flash 搭建的本地多智能体系统,用来自动化每日农场绩效跟踪。这让当天的 Google 叙事更难被轻易看成只面向程序员的营销:回复集中在两点,一是对于一个拥有 260 头奶牛的农场来说,这套每天早晨都能跑一次且足够便宜的循环在经济上是否成立;二是基于历史数据训练的模型在市场突然走坏时还能否保持韧性。

@AIHighlight 列出了(133 个点赞、11 条回复、9,158 次浏览、111 次收藏)14 个 Google AI 工具,覆盖设计、编码、文档、后端和内容任务,包括 Pomelli、Stitch、Opal、Gemini CLI、Code Wiki、Jules 和 Antigravity。这条帖子之所以能打中用户,是因为它把 Google 的供给包装成一整套免费栈,而不是单一聊天机器人;Pomelli 的 Google Labs 页面 至少证实了其中一个主打产品确实真实存在且已上线。

精选《List of Free Google AI Tools》页面的截图,说明该列表只收录 Google 产品或拥有有意义免费层且限制条件已写明的开源发布

讨论要点: 反对声音是务实的,不是意识形态式的。Antigravity 用户要求手机到笔记本的任务接力和更新模型的访问权;而阅读免费工具栈盘点的人则在问,Pomelli 这类工具到底好不好用,以及“免费”是否只是把真正的限制藏到了别处。

与前日对比: 7 月 28 日,Antigravity 演示和 Farm Brain 就已经在流传。到了 7 月 29 日,这个故事被扩展到了研究运营和“免费工具栈”分发,而同样的访问权限与模型选择抱怨依旧存在。

1.3 远程控制和智能体原生工作区正从临时方案走向产品 🡕

另一个清晰的模式是,人们已经不再把远程控制和多智能体协作当成支线任务,而是在把它们做成一等产品。两个帖子支撑了这个主题:一篇很长的 Buzz 讲解帖,以及 Theo 发布的 T3 Connect。

@rileybrown 详细介绍了(146 个点赞、12 条回复、12,645 次浏览、232 次收藏)Buzz:这是一个免费、类似 Slack 的工作区,智能体在里面是“平等成员”,而不是附加组件,Codex 和 Claude Code 订阅可以接入共享频道。这条帖子塞满了具体工作流细节——接入 OpenCode 和 Cursor、移动应用、共享算力、自动化,以及“管理频道”的用例——而收藏数说明,读者是在把它当操作手册保存,不只是对一个点子点头。

@theo 发布了(319 个点赞、31 条回复、29,820 次浏览、103 次收藏)T3 Connect:这是一个极简的开源隧道层,让人无需先折腾 Tailscale,就能远程控制 T3 Code 实例。主帖承诺的流程只有四步——安装你的编程运行框架、运行 npx t3 connect、登录,然后从网页、桌面端或即将推出的移动应用控制那台电脑——而第一条回复则指向 app.t3.codes 用于与账户绑定的控制。

讨论要点: 最有价值的回复并不是叫好。在 Buzz 的讲解帖下,有用户问产品要怎么避免两个智能体同时编辑同一批文件;也有人提醒,大多数智能体演示一旦需要跨步骤的真实上下文或记忆就会崩掉。在 Theo 的讨论串下,反复出现的反应则更简单:“终于不用再先去折腾 Tailscale 这条支线了”,紧接着就是催问承诺中的移动应用。

与前日对比: 7 月 27 日和 7 月 28 日就已经出现了很多多会话、多智能体演示。到了 7 月 29 日,讨论又向下沉了一层,落到了控制平面本身:共享频道、远程隧道和跨设备交接。

1.4 Skills、定制化和可观测性成了运行框架层 🡕

当天还出现了异常具体的证据,表明新的差异化层已经明显落在模型外围:可复用技能、评审时上下文、支出遥测,以及打包好的 Copilot 配置。社区案例和 GitHub 官方产品界面都指向同一个方向。

@RoundtableSpace 放大传播了(17 个点赞、11 条回复、14,115 次浏览)Matt Pocock 的 mattpocock/skills 仓库,把它描述成一整套 AI 编程工作流,包含 26 个可用于生产环境的技能。这张图之所以重要,是因为它展示了实际结构:工程类技能,如 to-specimplementcode-reviewdiagnosing-bugswayfinder,再加上 productivity 和 misc 两层,全部都可以通过 npx skills@latest add mattpocock/skills 安装。GitHub 的 repo API 目前显示 mattpocock/skills 已被加星 194,783 次,而 README 也明确把这套包定位为一组小而可组合的技能,而不是庞大的流程框架。

mattpocock/skills 的截图,展示 26 个可复用的智能体 skills,覆盖 engineering、productivity 和 misc 类别,并附带安装命令 npx skills@latest add mattpocock/skills

@GHchangelog 报道称(5 个点赞、440 次浏览),Copilot 代码审查现已正式支持智能体技能和 MCP 服务器。链接中的 GitHub changelog 表示,仓库可以添加 .github/skills/.../SKILL.md 上下文,MCP 调用在评审中是只读的,现有 cloud-agent MCP 配置会自动沿用,而评审评论现在也会注明何时使用了技能或 MCP 上下文。

@tpschmidt_ 展示了(1 个点赞、3 条回复、541 次浏览、4 次收藏)AWS CloudWatch 的 Coding Agent Insights,它利用来自 Claude Code、Codex 和 Copilot 的 OpenTelemetry 跟踪支出并预测 token 消耗。@DanKornas 另外还强调了(4 个点赞、2 条回复、912 次浏览)一个社区构建的《Awesome GitHub Copilot Customizations》目录,它把 Copilot 配置拆成自定义指令、可复用提示词和自定义聊天模式。

一张图示,展示 Claude Code、Codex 和 Copilot 将 OpenTelemetry 指标发送到 CloudWatch,以生成 token 支出告警和预测

讨论要点: 技能本身并不能解决可移植性问题。Matt Pocock 讨论串下的一条回复说,类似的技能集在 Flutter 代码库里表面上运行“很干净”,但因为内置了 Next.js 假设,实际上会悄悄产出错误结果——这比泛泛的反炒作说法更有力,因为它直接点出了失败模式。

与前日对比: 本周更早时候,“skills” 主要还是以技能市场、技巧和围绕缓存的建议出现。到了 7 月 29 日,这个概念已经落到了更持久的产物上:一个巨大的公开 skills 仓库、GitHub 第一方的评审支持、支出遥测,以及可复用的 Copilot 配置包。


2. 令人困扰的问题

不透明的计量逻辑与配额不信任

严重程度:高。最一致的挫败感,并不是模型在抽象层面上有多贵,而是开发者在把 token 烧掉之前,仍然不知道一次真实会话到底会花多少钱。@forgebitz 一句话概括了这一点(72 个点赞、19 条回复、2,057 次浏览):“一旦开始按 API 计费,你对 vibe coding 的看法真的会变。” 回复立刻补上了生活化例子:一位用户报出了 599 欧元的 Gemini 账单,另一位说按 API 计费是唯一能“看清楚”的方式,还有一位描述了如何通过 Codex 插件把提示词手动路由到不同模型。

@TimJayas 庆祝了(27 个点赞、11 条回复、1,786 次浏览)OpenAI 所说的 Sol 使用时长大约延长了 18%,但回复把这张截图更多看成一次修复信任的尝试,而不是一次胜利。有人说这个修复仍然让 Sol 不可能连续用满 5 小时,另一位认为用户只是拿回了他们已经失去的一小部分,还有第三个人追问隐藏的每周上限到底是多少。另一条传播较低、但异常具体的帖子来自 @notjazii,他声称(6 个点赞、4 条回复、202 次浏览),同一个 K3 模型用于一个中位任务时,在 Kimi Code 里大约用了 61k token,在 Hermes 里是 67k,而在 Claude Code 里则达到 340k。这虽然只是一张截图,却呼应了当天更广泛的担忧:运行框架层的开销可能会压过模型本身的成本。

人们现在靠模型路由器、更便宜的模型和遥测插件来应对,而不是信任默认计量器。这值得围绕它构建产品,因为这种痛点既是运营性的、会反复出现,又直接连着采购行为:就在开发者争论配额的同一天,Disney 被报道称正用 Codex 替换 Copilot。

悄悄出错的输出与无声的工作流失败

严重程度:高。实践者不断把信任边界划在同一个位置:AI 很有用,但前提仍是有人积极参与审查。@NateSilver538 写道(229 个点赞、21 条回复、33,994 次浏览),只要流程里有人真正懂那个领域,AI 工具就非常有帮助;但如果没有人类专家,很可能会产出“bug 多得离谱的模型”。他的回复没有停留在泛泛恐惧上,而是补充了具体失败模式——有人说 Claude 忘了最基本的上下文,还把图表文字搞乱;另一个人则描述了在模拟工作流里出现的荒唐数学结果。

同样的抱怨也出现在技能层。@RoundtableSpace 分享 Matt Pocock 技能套装的帖子下,一条回复说,类似配置在 Flutter 代码库里表面上运行正常,但因为这些技能默认假设了 Next.js 风格的项目结构,结果会悄悄生成错误输出。@onderceylan 明说 自己之所以做 SHIP,是因为“编程智能体越来越快”,而“软件质量正在失控”,他认为评审、测试和成本闸门都没有跟上生成速度。

今天的权宜方案不是投入更多信任,而是加更多运行框架:可复用规格、评审技能、QA 闸门、安全扫描和人工审批。这值得围绕它构建产品,因为这些失败往往是无声的;命令行能跑过,但仍然没有满足真正需求。

远程连续性仍然脆弱到足以催生新工具

严重程度:中。远程控制类产品下的回复表明,在智能体式编程里,“随处工作”依然很脆弱。@theo 发布 了 T3 Connect(319 个点赞、31 条回复、29,820 次浏览、103 次收藏),专门就是为了消除 Tailscale 和公网 IP 的配置负担,而最热情的反应只是松了一口气:这条支线任务也许终于能消失了。与此同时,讨论串里的下一个问题就是“我怎样才能拿到那个移动应用?”——这说明远程访问仍不完整。

@antigravity 展示 research-eval 分析的帖子下,一条付费用户回复从另一个方向提出了同样缺失的功能:让用户可以从手机把任务发给运行在宿主笔记本上的智能体,并通过 BYOK 带入更新的模型。@ryanvogel 描述了(2 个点赞、1 条回复、927 次浏览、5 次收藏)一种基于 Coast 和 Hark 的权宜方案:从屏幕录像里重建他做过什么,再生成一个晨间总结站点;它之所以有用,恰恰是因为会话连续性仍然太容易丢失。

这值得围绕它构建产品,因为人们已经在自己拼装局部修复方案——隧道、本地记忆工具、晨间总结、手机交接请求——而不是从主流编程产品里直接获得端到端连续性。


3. 人们期望的功能

可预测的智能体预算与运行框架层成本控制

这是当天最清晰的现实需求。@forgebitz 认为(72 个点赞、19 条回复、2,057 次浏览),API 定价会彻底改变你看待“vibe coding”的方式;而 @TimJayas 分享了(27 个点赞、11 条回复、1,786 次浏览)一张 OpenAI 试图安抚用户、说明 Sol 现在大约能多撑 18% 的截图。这两条帖子读起来都不像满意,更像是在呼唤一个控制平面:在开始之前就告诉他们一项任务大概会花多少钱,以及何时是运行框架在浪费 token。

局部答案已经存在。@tpschmidt_ 展示了(1 个点赞、3 条回复、541 次浏览、4 次收藏)CloudWatch 支出跟踪,而 @forgebitz 那条帖子(72 个点赞、19 条回复、2,057 次浏览)下的一条回复则描述了一个手动路由插件,会按情况挑选模型。机会:直接。尚未被满足的需求,是一层位于供应商和运行框架之上的预算与路由层,而不是又一个孤立的定价仪表盘。

移动端交接、远程控制,以及能跨设备延续的记忆

这同样是一个直接需求,而且用户表达得很直白。在 @antigravity 展示 research-eval 分析的帖子下,一位付费用户要求有一个移动应用,可以把任务发给运行在宿主笔记本上的智能体,并明确把这个缺口拿来和 Cursor、Claude 作比较。@theo 展示 了 T3 Connect 已经通过网页远程控制解决了一部分问题,但第一个追问仍然是:那个移动应用要怎么拿到?

@ryanvogel 展示了(2 个点赞、1 条回复、927 次浏览、5 次收藏)同一需求的另一面:用 Coast 记住屏幕录像里发生过什么,再生成一份晨间回顾。机会:直接。人们要的不是一个远程终端而已;他们要的是能贯通手机、笔记本和昨天工作的连续性。

能理解本地技术栈的可复用团队技能

当天对技能包的热情,天然带着一个警告。@RoundtableSpace 放大传播了(17 个点赞、11 条回复、14,115 次浏览)Matt Pocock 的 26-skill 仓库,而 @GHchangelog 确认(5 个点赞、440 次浏览)GitHub 现在已经把评审时技能和 MCP 上下文作为第一方功能支持起来。但 Matt Pocock 帖子下最有用的一条回复指出,类似技能会因为默认假设了 Next.js 项目,而在 Flutter 代码库里悄悄失灵。

@DanKornas 从 Copilot 这一侧总结了(4 个点赞、2 条回复、912 次浏览)同一个问题:团队想要的是可复用指令、提示词、聊天模式、hooks 和工作流,而不是每次都从零重建配置。机会:竞争型。局部解决方案已经存在,但缺口是一层可移植的技能 / 配置层:它在开始行动之前,会先检查自己的假设是否真的和仓库匹配。


4. 使用中的工具与方法

工具 类别 评价 优势 局限
GPT-5.6 Sol / Codex LLM + 编程智能体 (+/-) OpenAI 称 Sol 降低了 Codex 的服务成本并提升了 token 生成效率;企业买家正在认真测试它;Codex Security 把这套栈延伸到了仓库扫描 用户依然不信任配额算法、隐藏的每周上限,以及运行框架层的 token 消耗
GitHub Copilot 智能体平台 (+/-) 5,000 万用户、企业规模优势明显、stacked PR / app 势头强、第一方评审期 skills 与 MCP 支持 一例被报道的企业转投、输出过于复杂的抱怨、定制化入口碎片化
Antigravity 智能体工作区 (+/-) 支持 research-eval 分析、有真实世界的 Farm Brain 部署案例、还能接入 Google 更广的免费工具栈 用户想要移动端交接、BYOK、更新模型访问,以及在更难任务上更强的信任
Buzz 多智能体工作区 (+) 智能体原生频道、共享算力、可与现有 Codex 和 Claude Code 订阅配合 关于文件冲突处理和长期上下文持久性的疑问仍未解决
T3 Connect / T3 Code 远程控制运行框架 (+) 一条命令即可远程控制、无需 Tailscale 前置、已为关联实例提供 web 入口 移动端仍在路上;Theo 说如果隧道账单上涨,免费状态可能改变
mattpocock/skills 技能包 / 运行框架层 (+/-) 26 个可组合的技能、仓库采用度极高、可通过 npx skills@latest add 或插件流程安装 当仓库的技术栈假设不匹配时,可能会悄悄失配
Copilot custom instructions / prompts / chat modes 智能体配置 (+) 可复用指导、任务特定提示词、角色特定工作流、更好的仓库一致性 仍分散在不同界面;第三方资产需要先审查才能信任
AWS CloudWatch Coding Agent Insights 可观测性 (+) 按智能体和模型跟踪支出、告警、预测 token 消耗,并可与交付指标关联 需要能产生 OpenTelemetry 的智能体或网关支持
Codex Security CLI 安全工具 (+) 批量仓库扫描、结果验证、建议修复、导出 / CI 路径、5k+ GitHub stars 公开的 0.1.x 包、API 可能变化、需要 Node 22+ 和 Python 3.10+
Coast 本地记忆 (+) 对看过内容的完全本地记忆、隐私优先定位、实用的回忆工作流 今天的证据来自单一工作流案例,不是广泛用户基础
SHIP 工程编排 (+) 将 Linear 工单贯穿规划、编码、评审、运维、测试与成本 / 时间汇报 封闭测试中;仍在寻找设计合作伙伴

总体来看,满意度的分化与其说取决于底层模型品牌,不如说取决于一个工具是在增加还是减少运行框架开销。@wallstengine 报道称(60 个点赞、6 条回复、17,167 次浏览),Disney 将用 Codex 替换 Copilot,同时保留 Claude Enterprise 和 Cursor;这是这份数据里最清晰的迁移信号:团队并不是在选择一个永久赢家,而是在保留可选性,并替换掉他们觉得最弱的那一层。@wallstengine报道了 Copilot 达到 5,000 万用户的规模,因此这个市场正在同时发生两件事:一边向大型平台集中,一边又在平台内部测试替代方案。

当天的权宜方案也很说明问题。@theo 围绕 远程访问摩擦构建了产品,而不是等它自己消失;@tpschmidt_ 围绕 支出不透明构建了产品;@onderceylan 围绕 评审 / 测试治理构建了产品。就连这波技能包热潮也仍处在竞争期,而不是定局:@RoundtableSpace 放大传播了(17 个点赞、11 条回复、14,115 次浏览)一个规模巨大的公开 skills 仓库,而 @GHchangelog 确认(5 个点赞、440 次浏览)GitHub 正把技能和 MCP 拉进第一方代码审查。


5. 人们在构建什么

项目 构建者 功能 解决的问题 技术栈 阶段 链接
Buzz @hot_town 智能体原生工作区,智能体作为一级参与者驻留在频道中 在不逼团队放弃 Codex 或 Claude Code 订阅的前提下协调多智能体工作 Buzz、Codex、Claude Code、OpenCode、Cursor、OpenRouter/Muse、iOS 应用 测试版 讲解帖, 视频
T3 Connect @theo 适用于任意联网设备上 T3 Code 实例的远程控制隧道 消除远程编码会话中 Tailscale / 公网 IP 的配置摩擦 T3 Code、app.t3.codes、由 Cloudflare 支持的隧道层 测试版 发布推文, 应用
mattpocock/skills Matt Pocock 为编程智能体提供 26 个可复用的工程与生产力 skills 让智能体拥有可重复的规划、评审、调试和交接工作流,而不是一次性提示词 Shell / Markdown skills、Claude Code 插件、skills.sh 安装器 已发布 仓库, skills.sh
Codex Security CLI OpenAI 扫描仓库、验证发现并提出修复建议的 CLI 和 TypeScript SDK 把安全审查和可接入 CI 的扫描带入智能体式编程工作流 TypeScript、Node 22+、Python 3.10+、Codex runtime 测试版 仓库, 文档
SHIP @onderceylan 将 Linear 工单推进到规划、编码、评审、运维和测试阶段的智能体式工程平台 在编程智能体加快交付的同时恢复质量闸门和成本可见性 Linear、GitHub PRs、自主 CI / 测试 / 评审闸门、多提供商模型支持 测试版 发布推文
Coast recap workflow @ryanvogel 通过屏幕录像使用 Coast CLI,再用 Hark 生成晨间总结站点 帮助开发者找回跨会话、跨天自己做过什么 Coast、opencode、Hark、本地屏幕录像 Alpha 版 推文, Coast

@rileybrown 展示了(146 个点赞、12 条回复、12,645 次浏览、232 次收藏)Buzz 不只是一个玩具协作层,而是一个严肃的多智能体操作界面:智能体频道、共享算力、模型混用,以及管理者视角工作流。最好的那条回复同时也是最难的问题——产品要怎么阻止两个智能体同时改动同一批文件——而这正是真正共享工作区必须解决的系统性问题。

@theo 展示了(319 个点赞、31 条回复、29,820 次浏览、103 次收藏),T3 Connect 不是一个停留在想法阶段的概念,而是一条现在就可用的远程控制路径,对最多 3 台设备免费开放。回复把它的价值说得很清楚:大家对隧道架构本身兴趣没那么大,更在意的是自己也许终于可以跳过那套 Tailscale 配置循环。

@RoundtableSpace 分享了(17 个点赞、11 条回复、14,115 次浏览)Matt Pocock 的 skills 仓库;它当前的 GitHub 元数据 显示已被加星 194,783 次,而 README 把它描述成重流程框架之外的一种轻量替代方案。@onderceylan 则从另一个方向发布了(7 个点赞、1 条回复、457 次浏览)SHIP:它强调的不是更多提示词技巧,而是一层编排系统,让工单在 SDLC 中流转时,规划、评审、测试、运维和支出都保持可见。

Codex Security 批量扫描流程的截图,展示 gh auth login、npx codex-security bulk-scan,以及写入结果前的仓库选择步骤

安全和记忆是另外两个值得注意的构建方向。Cointelegraph 报道称(42 个点赞、25 条回复、22,007 次浏览),Codex Security CLI 已作为开源扫描工具发布,而公开的 README 说,它被设计用来发现、验证和修复漏洞。@ryanvogel 展示了(2 个点赞、1 条回复、927 次浏览、5 次收藏)一个更小但很说明问题的模式:开发者已经在现有智能体周围搭建自己的记忆基础设施,而不是等核心产品自己记住足够多的东西。

反复出现的构建模式已经很清楚:围绕现有运行框架的远程控制封装、具备仓库感知能力的 skills 包、多提供商智能体之上的治理层,以及能跨会话持久存在的回忆系统。共同的触发点不是“我们需要一个新模型”,而是“我们需要外围系统没那么脆弱”。


6. 新动态与亮点

Skills 和 MCP 进入第一方 Copilot 代码审查

@GHchangelog 报道称(5 个点赞、440 次浏览),Copilot 代码审查现已正式支持仓库 skills 和 MCP 服务器。链接中的 GitHub changelog 让这次发布值得关注的原因,不只是“上下文更多”而已:评审现在可以使用 .github/skills/.../SKILL.md,MCP 调用是只读的,现有 cloud-agent MCP 配置会自动沿用,而生成的评论现在也会披露是否使用了 skills 或 MCP 上下文。

Codex Security 把安全扫描纳入编程智能体栈

Cointelegraph 报道称(42 个点赞、25 条回复、22,007 次浏览),Codex Security CLI 已经发布,而公开的 Codex Security 文档 说,它被设计用来发现、确认并修复漏洞、为审查存储发现结果,并为 CI 导出结果。它在这一天显得格外突出,是因为叙事方式变了:安全工作被呈现成编程智能体的标准配套,而不是一个分离的专家工作流。

Farm Brain 是一个少见但仍然重要的非软件部署案例

@Google 展示了(353 个点赞、51 条回复、121,037 次浏览、94 次收藏)一个用于奶牛场绩效跟踪的本地多智能体系统,它在 Antigravity 内部由 Gemini 3.6 Flash 构建。它之所以重要,是因为它把常见的“智能体式工作流”语言翻译成了软件之外一个具体的日常运营循环,而回复也立刻把它识别成成本和可靠性的故事,而不只是一个新奇演示。


7. 机会在哪里

[+++] 智能体式编程的成本控制平面 —— 证据几乎无处不在:@forgebitz (72 个点赞、19 条回复、2,057 次浏览),API 定价会改变整个 vibe coding 的计算方式;@TimJayas 向一个持怀疑态度的受众传播了(27 个点赞、11 条回复、1,786 次浏览)OpenAI 那张“使用时长延长 18%”的截图;@tpschmidt_ 展示了(1 个点赞、3 条回复、541 次浏览、4 次收藏)CloudWatch 的支出遥测;而 @wallstengine 报道称(60 个点赞、6 条回复、17,167 次浏览),Disney 正在切换到 Codex。最强的机会,是一层与供应商无关的系统:它能在会话开始前预测成本、路由工作,并暴露浪费发生在哪里。

[+++] 模型之上的评审与治理运行框架 —— Nate Silver 对输出容易出错的警告、Matt Pocock skills 讨论串下 Flutter / Next.js 的错配案例、SHIP 的质量闸门主张,以及 Codex Security 的扫描加修复工作流,都指向同一个缺口。市场正在奖励那些围绕现有模型增加评审、验证、安全和可审计性的系统,而不是试图取代这些模型。

[++] 远程、移动端与记忆连续性 —— Buzz、T3 Connect、Antigravity 上对移动交接的请求,以及 Coast 的本地记忆回顾工作流,都指向一个现实空洞:从“这个智能体成功跑通过一次”到“这个智能体成了我日常的一部分”之间,仍有很长一段没被补上。一个可靠的跨设备控制平面,如果还能带着能跨睡眠、出行和标签页关闭的记忆,就有明确需求,而今天只有局部解法。

[+] 具备技术栈感知能力的可移植 skills 包 —— 可复用 skills 和 Copilot 定制化显然已经有采用度,但这份数据里最尖锐的一条回复说,同样的 skills 只要框架假设错了,就会悄悄失败。这让兼容性检查、仓库内省和假设验证,成为一个正在浮现但已经真实存在的产品界面。


8. 要点总结

  1. 成本已经变成用户可感知的功能,而不只是后端管线。 @OpenAIDevs 表示(881 个点赞、53 条回复、44,085 次浏览、73 次收藏),Codex 变得更便宜也更高效,但回复仍在追问:用户是否真能在配额或延迟上感受到这些节省。
  2. 即使在大规模阶段,企业 AI 编程栈仍然高度流动。 Business Insider 报道了 Disney 从 Copilot 转向 Codex,而 @wallstengine 报道称(60 个点赞、13,654 次浏览),Copilot 仍已达到 5,000 万用户。
  3. Google 的智能体叙事正从炫目的演示扩展到工作流和运营故事。 @antigravity 展示了(376 个点赞、14 条回复、18,155 次浏览、125 次收藏)一个 research-eval 工作流,而 @Google 展示了(353 个点赞、51 条回复、121,037 次浏览、94 次收藏)Farm Brain 这一日常运营闭环。
  4. 真正的产品战场正在转向运行框架层。 @theo 发布了(319 个点赞、31 条回复、29,820 次浏览、103 次收藏)T3 Code 的远程控制能力,而 @RoundtableSpace 分享了(17 个点赞、11 条回复、14,115 次浏览)一个包含 26 个智能体工作流的可复用 skills 仓库。
  5. 人工评审仍然是最难突破的信任边界。 @NateSilver538 写道(229 个点赞、21 条回复、33,994 次浏览、23 次收藏),AI 工具在有领域专家参与时确实有帮助,但否则就会产出“bug 多得离谱的模型”。