跳转至

Twitter AI 编程 - 2026-07-30

1. 人们在讨论什么

1.1 企业级运行框架、审查闭环和可分支工作流开始变得具体 🡕

Twitter 上最强的一波 AI 编程讨论,已经不是新的模型基准,或某个炫目的单次演示,而是:一旦智能体工作必须经得起企业治理、代码审查和真实分支结构,它的可持续操作模型究竟长什么样。5 条保留下来的内容共同支撑了这个主题:Satya Nadella 受治理的 ROIC 应用演示、GitHub 的新规模指标、GitHub 对 stacked sessions 现代化改造的案例、Copilot code review 对 skills/MCP 的 GA 支持,以及 Rubber Duck 的跨模型家族审查闭环。

@satyanadella 展示了(610 个赞、95 条回复、65,497 次浏览、316 次收藏)一个详细的 ROIC Intelligence 应用:基于 Morgan Stanley PDF,用一条提示词加 /drill-me 技能、Copilot autopilot 和 /rubber-duck 测试构建而成。真正特别的地方并不是“CEO 做了个应用”,而是这套技术栈纪律:他明确说应用留在 Copilot 里、代码在 GitHub Enterprise 里、数据流水线、数据湖和语义模型在 Fabric 里,而且全都处于 IT、安全和 FinOps 控制之下。架构图进一步把这个主张说实了:权威数据源流经 Fabric 编排和 OneLake,进入 Direct Lake 语义模型,再进入 React + TypeScript 应用层。

Satya Nadella 的 ROIC Intelligence 应用架构图,展示权威文档流经 Fabric 编排、OneLake bronze/silver/gold 分层、Direct Lake 语义模型,以及 React + TypeScript 应用运行时

@kdaigle 补充了(59 个赞、7 条回复、7,393 次浏览)这套企业叙事背后的规模背景:GitHub 上有 2.25 亿开发者、5,000 万 Copilot 用户,而且每 3 个 pull request 里就有 1 个涉及智能体。她的另一条 tweet(35 个赞、1 条回复、5,084 次浏览、11 次收藏)则指向 Cassidy Williams 关于 stacked sessions and pull requests 的文章:一次失败的旧 React 15 应用单次现代化尝试,最终变成了一串 stacked sessions 和 stacked PRs。这很重要,因为它把智能体式编程定义成分支编排和审查卫生,而不只是更快的提示词循环。

@GHchangelog 报道称(20 个赞、4 条回复、2,392 次浏览、5 次收藏),Copilot code review 现在已正式普遍支持 agent skills 和 MCP servers。链接的 GitHub changelog 写得很清楚:审查可以使用 .github/skills/.../SKILL.md,MCP 调用保持只读,现有 cloud-agent 的 MCP 配置也会自动沿用。与此同时,@burkeholland 又把注意力拉回到(30 个赞、3 条回复、3,145 次浏览、11 次收藏)Rubber Duck,也就是 GitHub 为 Copilot CLI 做的跨模型家族二次审视闭环。

讨论要点: Satya 帖子下的回复强化了与原帖相同的主题:企业价值来自可治理、可复用的制品,而不是一次性输出。Cassidy 的文章则补上了另一半画面:即便智能体已经很强,单次现代化改造依然会失败,最后仍得重启为 stacked branch 流程。真正的信任边界不是“模型会不会写代码”,而是“这份工作能不能经得住治理和审查”。

与前日对比: 7 月 29 日已经把讨论推向技能、可观测性和远程工作空间;7 月 30 日则又往操作模型里深入了一层:受治理的数据栈、感知分支的会话链、审查时的仓库上下文,以及显式的 second-opinion 闭环。

1.2 Google 的免费 AI 栈仍在持续传播,但真正有分量的内容是 Antigravity 的评估工作流 🡒

Google 仍然是这批数据里最显眼的存在之一,但最高价值的证据,并不是又一条泛泛的“15 个免费工具”转发,而是:Antigravity 被当作真实 research-eval 表面来使用,同时各种免费工具清单在把 Google 的编码和设计工具打包成一个大礼包向外分发。这个主题由 2 条保留下来的内容支撑。

@antigravity 展示了(558 个赞、20 条回复、27,768 次浏览、180 次收藏)Antigravity 被用于 research-eval 分析:用自然语言读表、做定量分析、生成假设,并拉起并行子智能体隔离失败模式。这比 canvas 演示或快速 UI 转换更偏操作层。最有价值的回复并不是庆祝,而是能力上的施压:有人说 Claude 在接入 Google Drive、Figma 和报告生成方面仍然更强;有人要求更深入的讲解视频;还有人称 DeepMind 的基准测试工作支持这种子智能体模式。

@AIHighlight 列出了(135 个赞、13 条回复、10,868 次浏览、118 次收藏)14 个 Google AI 工具,覆盖 Pomelli、Stitch、Opal、Antigravity、Jules、Gemini CLI、Code Wiki、Gemini Code Assist 和 Firebase Studio。附图的重要性在于,它比一般的工具拼贴图更有纪律:明确说只收录那些由 Google 或开源提供、免费层足够有用、仍在积极维护,并清楚注明限制或门槛的产品。去看 Pomelli by Google Labs 后,至少能确认清单里一个主打产品确实真实存在且公开可用。

“List of Free Google AI Tools”页面截图,说明只收录那些免费层有意义、积极维护、并注明限制条件的 Google 或开源工具

讨论要点: 质疑始终很具体。对 Antigravity 持怀疑态度的人,并不是在反对智能体这个想法,而是在要求连接器、更强的证据,以及更精确的产品解释。这种信号比模糊炒作健康得多,因为它说明读者是在评估工作流深度,而不是只对着 logo 鼓掌。

与前日对比: 7 月 28 日和 7 月 29 日本就充满了 Antigravity 演示和 Google “免费工具栈”分发叙事。到 7 月 30 日,主题仍然延续,但真正最有分量的 Google 条目变成了 research-eval 工作流,而不是又一个纯演示短片。

1.3 Codex 正从编程助手扩展成多模态工作表面 🡕

OpenAI 的 AI 编程叙事,已经从昨天关于配额和供应商切换的讨论,转向更广阔的产品表面:更丰富的视觉编辑、浏览器和 computer-use 工作流、更便宜的价格分层,以及那些和运行框架设置绑定、而不是只和底层模型绑定的基准收益。4 条保留下来的内容支撑了这个主题。

@OpenAIDevs 表示(359 个赞、28 条回复、31,425 次浏览、117 次收藏),Codex 中的 ImageGen 现在有了 lightbox 和 canvas。被引用的 OpenAI 演示把实际工作流讲得更清楚:你可以指向一个角色、擦除想去掉的部分,再用评论说明标题或其他修改应该落在哪里。回复立刻划出了 UI 和能力之间真正的分界线:有人喜欢可编辑性,但也有人追问底层图像质量什么时候能提升,还有人希望支持“手绘 + 提示词”的组合编辑。

@Codex_Changelog 报道称(98 个赞、4 条回复、5,193 次浏览),应用版本 26.727 加入了地址栏历史记录、Google 搜索兜底、历史查找,以及 Chrome 扩展的标签页和高亮支持。链接的 Codex changelog 比推文本身信息更多:Codex 现在包括内置浏览器、computer use、无需项目文件夹即可开始的聊天、thread automations、应用内 PR 审查,以及对 PDF、电子表格等文件的 artifact viewer。这已经是从“编程智能体”转向“恰好会写代码的通用工作表面”的明确信号。

@gabrielchua 写道(17 个赞、6 条回复、712 次浏览),两个 API 设置——保留推理和服务端压缩——让 GPT-5.6 Sol 在 ARC-AGI-3 上的成绩大约提升了 3 倍,同时输出 token 降低到约 1/6。这个说法里最重要的是图,而不是文字:图上显示,相比官方运行框架,强化后的运行框架以低得多的 token 用量拿到了高得多的分数;配套幻灯片也明确建议使用 Responses API、保留推理和压缩。

一张 GPT-5.6 Sol 在 ARC-AGI-3 上的对比图,显示在开启保留推理和压缩后,分数显著更高且输出 token 用量远低于官方运行框架

@LuminaXspace 总结了(19 个赞、1,064 次浏览)OpenAI 的价格调整:Luna 便宜了 80%,Terra 便宜了 20%,Sol 新增 fast mode,而 Codex/ChatGPT Work 的使用额度也能拉得更远。正因如此,@schaerpfcom 当天的追问就格外有启发性(11 个赞、5 条回复、2,628 次浏览):如果 Sol 不能拉起更便宜的 Luna 或 Terra 子智能体,而是强迫所有 child 都继承父模型和 effort,那么这套新定价就无法真正发挥价值。

讨论要点: 围绕这个子智能体抱怨的公开 GitHub issue 明确写道,当前运行时把路由控制藏了起来,也阻断了用户想要的 Sol-to-Terra/Luna 工作流。所以即便在 OpenAI 一边降价、一边扩展应用能力的这一天,最可执行的用户诉求仍然不是模型原始 IQ,而是编排能力。

与前日对比: 7 月 29 日的焦点是 Codex 的成本、配额和企业供应商选择;到 7 月 30 日,成本仍在视野里,但重心已明显转向工作流广度、多模态编辑和运行框架配置。

1.4 构建者持续在打包跨工具能力层,而不是押注某个单一模型 🡕

另一个清晰模式是:构建者并没有等着供应商替他们敲定整套栈,而是在模型之上持续交付可移植层:廉价模型桥接器、可安装的智能体 roster、互联网访问层,以及基于循环的技能系统。5 条保留下来的内容支撑了这个主题。

@ridark_eth 把它描述成(46 个赞、22 条回复、725 次浏览、28 次收藏)一个“harness swap”故事:由 Codex 充当控制器,DeepSeek 充当廉价后端模型,本地的文件感知智能体负责保留上下文和执行代码。无论读者是否买账他的变现叙事,这里面的技术结论都很直接:人们正在主动把栈拆解成编排层、上下文层和模型成本层。

@rightnowai_co 表示(5 个赞、172 次浏览),他们做了一个 localhost bridge,可以在 Claude Code、Codex、Cline、Aider 和 OpenCode 这些工具预期的 API 之间做翻译,同时还把 Kimi-Linear-48B 量化到了 28.8 GB,从而能在单张 32 GB GPU 上运行。这是对碎片化的直接回应:保留你喜欢的智能体外壳,替换成你负担得起的后端。

@tom_doerr 分享了(20 个赞、2,293 次浏览、20 次收藏)Autoresearch。它的 README 描述了 14 个命令,横跨 Claude Code、OpenCode 和 Codex,并声称把一个臃肿的大技能拆成更薄的命令文件后,token 消耗下降了 95%。@charliejhills 展示了(18 个赞、8 条回复、1,311 次浏览)The Agency,如今还配上了桌面应用,可以把专门化智能体安装进 Claude Code、Cursor、Codex、Gemini CLI 等工具。@undefinedKi 介绍了(8 个赞、129 次浏览、4 次收藏)Agent Reach,这是一个能力层;它的 README 明确提到 Twitter API 每月大约要 215 美元,并把社交/网页访问打包成一条命令即可安装。

讨论要点: 最好的警告,恰恰来自这类智能体打包故事内部。Charlie Hills 说 OpenCode 大约只会加载 119 个智能体,其余的会被悄悄忽略;另一个回复则说,即便有“现实检查员”这种角色,它也仍然必须能访问真实制品,而不能只看摘要。换句话说:可移植性确实在提升,但验证能力和运行时限制,仍决定这些打包层到底有没有用。

与前日对比: 7 月 29 日已经出现了公开技能仓库和定制能力;7 月 30 日则把它扩展成完整的安装器、联网能力层,以及把模型选择当作可替换零件的本地模型桥接器。


2. 令人困扰的问题

运行框架/模型不匹配,而且常常是静悄悄地出问题

严重程度:高。当天最尖锐的困扰不是“AI 不会写代码”,而是整套栈看起来像是正常运作,但运行框架与模型的假设其实早已偏离。@0xJeyx 认为(34 个赞、4,817 次浏览、36 次收藏),纯 vibe coding 会把人拖进“猜一猜再试一试”的循环——“我们可以试上一百种不同方式”,每次仍可能得到不同实现——并明确把 spec-driven development 当成解药。@radshaan 则把这个抱怨说得更具体(184 次浏览):Kimi K3 对保留的 thinking history 很敏感,切换会话或使用不兼容的运行框架,都可能让输出质量变得不稳定。

一张截图,说明 Kimi K3 对保留的 thinking history 很敏感,建议只搭配经过验证兼容的运行框架使用,并警告切换进行中的会话会让质量不稳定

同样的信任问题,也出现在产品层。@OpenAIDevs 展示(359 个赞、28 条回复、31,425 次浏览、117 次收藏)Codex 新的 lightbox 和 canvas 后,回复立刻追问:这次发布提升的是图像质量,还是只是编辑表面?人们愿意使用更聪明的工具,但他们想知道,栈里到底是哪一层真的变好了。

这个方向值得投入,因为失败往往很隐蔽。模型照样会回答、智能体照样能完成任务,但整个工作流仍可能以一种更晚才暴露的问题方式悄悄跑偏。

降价只停留在父智能体层面

严重程度:高。OpenAI 再次把定价变成了面向用户的故事,但回复表明:如果编排层不能智能地分发工作,更低的标价其实解决不了太多问题。@LuminaXspace 总结(19 个赞、1,064 次浏览)官方改动时说,Luna 便宜了 80%,Terra 便宜了 20%,而 Codex/ChatGPT Work 的额度也拉得更远。然而 @schaerpfcom 立刻就提出(11 个赞、5 条回复、2,628 次浏览),希望 Sol 能拉起更便宜的 Luna 或 Terra 子智能体,否则每个 child agent 都会继承昂贵的父配置。

链接的 GitHub issue 把这个抱怨写得异常具体:当前运行时据称隐藏了路由控制、强迫模型继承,并阻断了用户想要的 Sol-to-Terra/Luna 工作流。另一个成本边界也出现在 @alexcooldev 的提问中(19 个赞、9 条回复、1,106 次浏览):与其花成千上万 token 去重造现有 SaaS,尤其当代码库和维护需求还在不断增长,是否不如每月直接付 20 美元买现成产品?

人们当前的应对方式,是把重负载工作卡在订阅限额附近执行、切换后端,或要求更便宜的子智能体,而不是只要求更便宜的父会话。这值得投入,因为它已经不再是单纯定价问题,而是路由和工作负载塑形问题。

跨智能体集成仍然依赖桥接器和能力层

严重程度:中。独立构建者不断在交付胶水代码,因为核心工具仍然各自假设不同的 API、鉴权路径和平台访问规则。@rightnowai_co 表示(5 个赞、172 次浏览),他们做了一个 localhost bridge,好让 Claude Code、Codex、Cline、Aider 和 OpenCode 都能指向同一个本地 Kimi 后端,而不用各自重写。@undefinedKi 介绍了(8 个赞、129 次浏览、4 次收藏)Agent Reach;它的 README 明确写道,Twitter API 访问每月大约 215 美元,Reddit 常会对匿名服务器 IP 返回 403,而且多个平台都需要 cookie 或浏览器会话绕行方案。

同一模式也解释了为什么 @charliejhills 会强调(18 个赞、8 条回复、1,311 次浏览)The Agency 支持一键安装到 Claude Code、Cursor、Codex 和 Gemini CLI。新产品并不只是“更多智能体”,而是在试图让一个破碎的智能体生态,看起来像一个统一环境。

这个方向值得投入,因为多个互不相关的团队已经从不同角度在解决同一个问题:API 翻译、互联网访问和多工具安装。通常这就意味着平台缺口是真实存在的。


3. 人们期望的功能

Codex 内部支持异构子智能体

今天最明确的显式请求,是让父智能体可以选择更便宜或更合适的子模型,而不是强制继承。@schaerpfcom 在 OpenAI 降价后提出,希望 Sol 可以拉起 Terra 或 Luna 子智能体;而链接的 issue 则把它扩展成一组具体的产品诉求:可配置的 child model 选择、更严格的 child-agent 权限,以及目前仍被隐藏的路由控制入口。这是一个现实需求,而不是情绪表达,因为当天官方降价的实际价值,取决于运行时能否真正利用这些更便宜的模型。机会判断:直接。

模型切换时可验证的兼容性契约

第二个需求,是在团队把某个工作流押到开放模型上之前,先对它在特定运行框架中的行为有足够信心。@radshaan 发出的 Kimi K3 截图写得很明确:这个模型依赖保留的 thinking history,应该只搭配经过验证兼容的运行框架使用;而 @rightnowai_co 做 localhost bridge 的原因,恰恰是因为 Claude Code、Codex、Cline、Aider 和 OpenCode 预期的 API 全都不同。@ridark_eth 把模型切换当成正常工程工作来谈,但当天的证据说明,这件事仍然脆弱到人们希望得到明确保证,而不是只靠江湖经验。桥接器和自定义 wrapper 提供了部分答案,但还没有标准化的信任契约。机会判断:直接。

一键可移植的能力打包层

人们还希望,那些可复用能力能随着他们在不同工具之间移动,而不是每换一家供应商就重新拼装一遍。@charliejhills 强调了多种编程工具之间的一键智能体安装;@undefinedKi 推广了通过 Agent Reach 一条命令接入社交/网页访问;@tom_doerr 则提到了 ClaudeSkills,它是一套经过测试的端到端工作流,覆盖 PRD、决策简报、deck 和文章。这是个现实需求,而且已经能看到竞争压力:多个开源项目都在局部解决它,但每个项目覆盖的都只是问题的一部分。机会判断:竞争型。


4. 使用中的工具与方法

工具 类别 评价 优势 局限
GitHub Copilot app and code review 智能体平台 (+) 装机量大,支持 stacked sessions/PRs、审查阶段技能与 MCP 上下文,贴合企业治理需求 仍然依赖分支纪律和显式审查结构
Rubber Duck 审查方法 (+) 用第二个模型家族做批判式复核,能提升复杂多文件审查质量,并内置在 Copilot CLI 中 增加了编排步骤,而且只有团队愿意停下来做审查时才有帮助
Codex app 编程工作空间 (+/-) 内置浏览器、computer use、历史查找、自动化、PR 审查、artifact 查看和图像编辑 canvas 用户仍在追问表面升级是否真的改善底层质量;子智能体路由仍受限
保留推理 + 压缩 智能体运行时方法 (+) 在共享的 GPT-5.6 Sol ARC 案例中,显著提升长任务表现并降低 token 消耗 需要特定 API/运行时支持,如果运行框架把开关藏起来就很容易错过
Antigravity 智能体工作空间 (+/-) 支持自然语言评估分析、定量推理、并行子智能体,在 Google 栈中曝光度很高 回复仍在要求连接器、更好的讲解,以及更硬的证据
Google's free AI tool stack 工具套件 (+) 在编码、设计、文档和后端工作流上提供广泛的免费分发 免费层仍有各种限制,而且清单热度可能跑在真实日常使用之前
DeepSeek and local Kimi backends LLM 后端 (+/-) 执行便宜、本地可控、可挂在现有智能体外壳后面,量化版 Kimi 可跑在单张 32 GB GPU 上 API 不匹配、兼容性假设,以及对运行框架敏感的质量表现
Autoresearch 循环框架 (+) 14 个跨智能体命令、目标导向改进循环,并声称 token 降低 95% 需要刻意配置和持续度量,不是一次提示词就能搞定
ClaudeSkills 技能包 (+) 对研究、PRD、deck 和文章提供经过测试的端到端工作流 范围更窄,覆盖面也不如巨型通用智能体包
The Agency 智能体包与安装器 (+/-) 大量按角色划分的智能体,再加上主流编程工具的一键安装 智能体过多会带来过载;部分运行时还会悄悄跳过其中一部分
Agent Reach 能力层 (+) 一条命令提供网页和社交访问,研究价值强,而且对受阻平台提供了明确配置路径 某些目标仍需要 cookies、OpenCLI 或额外本地配置

整体满意度更取决于运行框架的完整性,而不是底层模型品牌。人们在谈受治理制品、stacked review 流程和 second-opinion 检查时,对 Copilot 的评价是正面的;在谈更宽的工作表面和更便宜档位时,对 Codex 的评价也是正面的,但一旦遇到隐藏的路由限制,情绪就会转为混合;Antigravity 则先吸引注意力,随后立刻被追问连接器和证据。

表格里的绕行方案也非常一致:从一次性提示词转向规格和循环、把昂贵后端换成便宜后端、加一个第二审查模型,以及安装能力层以获取数据访问或角色库。当前的竞争格局已经呈现三足形态:GitHub 在治理和审查场景最强,OpenAI 正在推动工作表面广度和运行时效率,而开源构建者则在跨工具可移植性上跑得最快。


5. 人们在构建什么

项目 构建者 功能 解决的问题 技术栈 阶段 链接
ROIC Intelligence app @satyanadella 把公开财务研究变成一个受治理、可交互的 ROIC 分析应用,带历史、查找、场景分析和 what-if 工具 说明由智能体产出的结果也可以成为可复用的企业资产,而不是一次性聊天 Copilot Code、/drill-me、autopilot、/rubber-duck、GitHub Enterprise、Fabric、OneLake、Direct Lake semantic model、React、TypeScript Alpha tweet
Autoresearch uditgoenka 通过一组命令,在 Claude Code、OpenCode 和 Codex 之间运行目标导向的改进循环 降低 token 浪费,把编程智能体变成迭代式改进系统 跨智能体命令框架、可复用技能文件、Claude Code、OpenCode、Codex 已发布 repo, tweet
ClaudeSkills staruhub 提供 13 个经过测试的技能,用于决策简报、PRD、deck、文章及相关交付物 用可重复工作流制品和验证机制,替代临时拼接提示词 技能文件、安装脚本、面向验证的工作流打包方式 已发布 repo, tweet
The Agency msitarzewski 打包大量按角色划分的智能体,并配套一个适用于主流编程工具的桌面安装器 让团队无需从零定义每个智能体,也能获得可移植的专长角色 智能体定义、角色化工作流、桌面安装器、Claude Code、Cursor、Codex、Gemini CLI 已发布 repo, tweet
Agent Reach Panniantong 一条命令为智能体接入社交、网页、视频和研究访问能力 绕过 API 费用、匿名请求被拦和配置蔓延,服务于市场研究 CLI 能力层、GitHub/YouTube/web 读取器、X 和 Reddit 鉴权路径、搜索连接器 已发布 repo, tweet
Local Kimi bridge @rightnowai_co 把多种编程智能体 API 翻译到一个运行在单张 GPU 上的本地 Kimi 后端 让团队保留偏好的智能体外壳,同时切换到更便宜的本地模型 Kimi-Linear-48B、量化、自定义解码 kernel、localhost API 翻译 Alpha tweet

Satya Nadella 的例子,是这组构建里企业气质最强的一项。真正有意思的地方不在于新奇本身,而在于这个应用被呈现为一个可复用、受治理的系统:数据在 Fabric,代码在 GitHub Enterprise,应用逻辑在 Copilot,审查则交给专门的 /rubber-duck 流程。这比一次性演示更接近内部产品开发。

Autoresearch、ClaudeSkills 和 The Agency 指向同一个方向:构建者正在把“过程”产品化。Autoresearch 把跨智能体迭代变成命令网格;ClaudeSkills 把端到端交付物当成需要测试的软件;The Agency 则定义了数十种专门角色,再通过桌面安装器把它们投放到多个工具中。

Autoresearch 截图,展示跨智能体工作流的命令网格,例如 plan、review、fix、document 和 ship 循环

ClaudeSkills 截图,展示仓库 README、验证徽章,以及 PRD、deck 和研究任务的示例工作流输出

The Agency 截图,展示多团队智能体仓库及其用于向多个编程工具安装智能体的配套应用

Agent Reach 和本地 Kimi bridge,则把同一种构建冲动应用在基础设施而不是提示词上。Agent Reach 打包了那些通常会被 API、鉴权或浏览器状态挡住的数据源访问能力,而 Kimi bridge 则打包了在互不兼容的本地智能体 API 之间实现模型可移植性的能力。共同触发它们的,不是“我们需要更聪明的模型”,而是“我们需要在任何地方都拥有同一种能力”。

Agent Reach 截图,展示 X、Reddit、Instagram、Facebook、YouTube 等来源在不同配置模式下的支持矩阵

反复出现的构建模式非常清晰。人们在做安装器、桥接器、能力层和技能包,因为真正的痛点是可移植性、可审查性和数据访问。多个团队在同一天独立做出了“模型之上一层”的产品,这强烈说明这个缺口是结构性的,而不是小众需求。


6. 新动态与亮点

Codex 7 月 30 日的应用更新,把它推成了更广义的工作空间

这份 Codex 2026-07-30 app changelog@Codex_Changelog 通过这条 tweet 带出来,之所以值得注意,是因为它已经不再局限于代码生成,而是扩展到了浏览器使用、computer use、无需项目的聊天、自动化、应用内 PR 审查和 artifact 预览。再结合 @OpenAIDevs 展示的新 ImageGen lightbox 和 canvas,产品正在被呈现为一种通用工作表面,而不是单纯的终端智能体。

Copilot code review 把 skills 和 MCP 带入 GA

@GHchangelog 报道称,Copilot code review 现在已普遍支持 agent skills 和 MCP。链接的 GitHub changelog 之所以重要,是因为它通过 .github/skills/.../SKILL.md 和审查评论里的只读 MCP 上下文,把仓库特定的工作流知识操作化,而不是让这些知识继续困在本地提示词或人工记忆里。

运行框架设置本身也开始成为基准新闻

@gabrielchua 展示了,保留推理加服务端压缩,会同时改变 GPT-5.6 Sol 在 ARC-AGI-3 上的表现和 token 经济性。这件事值得注意,因为它让竞争叙事的一部分,从“哪个模型家族更强”转向“运行时如何配置”:运行框架不再只是一个隐藏实现细节,而开始成为基准故事的一部分。


7. 机会在哪里

[+++] 跨模型档位的定价感知编排 —— 证据从多个方向同时出现:OpenAI 降低了 Luna 和 Terra 的价格,@schaerpfcom 要求让 Sol 把工作路由给这些更便宜的子模型,@ridark_eth 描述了手工“harness swap”,而 @rightnowai_co 做了一个桥接器,让现有智能体外壳能指向不同后端。这个方向很强,因为用户已经在手工拼装对应的绕行方案。

[+++] 面向可复用智能体工作的企业治理 —— Satya Nadella 受治理的 Fabric + GitHub 构建、GitHub 每 3 个 PR 就有 1 个涉及智能体的规模说法、stacked sessions 和 stacked PRs、Copilot code-review skills,以及 Rubber Duck,都指向同一个机会:团队需要的是能产出可审查、可复用资产的智能体工作流,而不是一次性答案。这个方向很强,因为第一方供应商和一线使用者都在向同一组控制点收敛。

[++] 可移植的能力与工作流打包层 —— The Agency、ClaudeSkills、Autoresearch 和 Agent Reach,都在模型之上打包可复用层:角色、技能、命令循环和外部数据访问。这个机会属于中等而非完全空白,因为已经能看到明显的开源竞争,但这些方案仍按能力和运行时被切得很碎。

[+] 面向开放模型运行框架的兼容性验证 —— Kimi K3 对保留 thinking 的警告、spec-driven development 对输出不一致的抱怨,以及 localhost API bridge 的需求,都说明一个更小但正在增长的机会:为“智能体 + 模型”组合提供标准化兼容性测试。这个方向还在浮现,因为痛点真实存在,但市场信号目前仍主要集中在更技术型用户身上。


8. 要点总结

  1. 企业采用智能体,越来越被表述为一种受治理的系统设计问题,而不只是更快的提示词。 Satya Nadella 的 ROIC 演示和 GitHub 的规模数据,都把耐久制品、治理和审查流放在了比模型新奇性更核心的位置。(source)
  2. Google 仍然靠广度和免费分发吸引注意力,但用户正在用工作流深度来衡量 Antigravity。 免费工具清单扩大了覆盖面,而 Antigravity 的评估讨论串则引来了关于连接器、证据和真实分析能力的追问。(source)
  3. Codex 正在扩展到浏览器、视觉和长时任务工作,而不是停留在狭义编程智能体。 7 月 30 日的应用更新日志和 ImageGen canvas 更新,都显著拓宽了产品表面。(source)
  4. 更便宜的模型,只有在编排层真正会用它们时才有意义。 OpenAI 对 Luna 和 Terra 的降价,立刻引发了对异构子智能体的要求;与此同时,构建者们还在持续交付手工桥接器和后端切换层。(source)
  5. 开源构建者正在模型之上的可移植层上跑得最快。 Autoresearch、ClaudeSkills、The Agency、Agent Reach,以及本地 Kimi bridge,都把技能、安装、访问和路由本身当成产品表面。(source)