跳转至

Twitter AI 编程 - 2026-09-01

1. 人们在讨论什么

1.1 Google 把 Antigravity 推成了当天最受关注的编程技术栈(🡕)

Google 的编程技术栈当天至少在五条高信号内容中占据主导:一种新的 /boost 模式、更大范围的 Gemini 3.7 Flash 展示、关于达到研究级结果的公开说法、直接建议使用 /teamwork-preview,以及用户讨论把近期 Bug 重新界定为容量问题,而不是采用不足问题。

@antigravity 介绍了(886 个赞、60 条回复、45,399 次浏览、317 次收藏)将 /boost 定位为面向复杂软件任务的深度推理模式。公开的 /boost 文档称,它采用三阶段多智能体流水线,包含隔离 worktree、专用子智能体和独立回归检查;该帖回复又进一步将适用场景收窄到棘手 Bug 修复、算法优化、非简单重构和根因排查。这让它与其说是一次通用模型升级,不如说是 Antigravity 运行框架内部新增的一档付费工作流。(文档

@Google 展示了(692 个赞、73 条回复、151,041 次浏览、175 次收藏)展示了团队如何在 Google AI Studio、Antigravity 和 Gemini App Spark 中使用 Gemini 3.7 Flash,并点名列出实时网站生成器、3D 物理模拟器、摄像头工具和个性化海滩实地指南等具体成果。在回复中,Google 又把内容拆成了 Google Sheets 视频生成器、单次生成的 Kerr 黑洞模拟器等单独案例,使这条帖子更像一组产品盘点,而不只是一段宣传短片。

@ai_for_success 重点介绍了(249 个赞、22 条回复、11,020 次浏览、43 次收藏)提出了一个更技术化的 Google 说法:Antigravity 搭配 Gemini 3.7 Flash,解决了 FOCS、JMLR 等场景中的七个开放问题,包括 Knuth 循环猜想的 40 多页 Lean 验证证明,以及一个可启动 xv6 并进入 shell 的周期精确乱序 RISC-V 模拟器。这张截图很关键,因为它补充了推文一句话带过的大量细节。

Google 文章截图,展示 Antigravity 与 Gemini 3.7 Flash 解决了七个开放性的数学和工程问题,其中包括经 Lean 验证的证明和一个 RISC-V xv6 模拟器

@ksprashu 表示(29 个赞、5 条回复、1,966 次浏览、19 次收藏)建议付费 Google AI 用户“先放下手头一切”,开始使用 /teamwork-preview;与此同时,@thtbee_ 认为(137 个赞、20 条回复、12,597 次浏览、11 次收藏)则认为近期 Bug 之所以浮现,是因为 Gemini 3.7 Flash“需求爆棚、容量吃紧”,并援引 Google 的 Evan Otero 的说法称,这是增长最快的模型,容量也在扩充中。

讨论洞察: 值得注意的变化,并不是所有人突然都认定 Antigravity 最强,而是公开讨论的焦点已从“根本没人用它”转向“需求是否已经跑赢容量”,以及 Google 能否继续足够快地交付。

与前一天对比: 在过去一周里,Antigravity 先是以终端和 git 改进出现,随后是 Xcode 访问能力,再到由 Teamwork 驱动的研究成果。今天又把这条轨迹继续往前推进:一方面新增了具名的深度推理模式 /boost,另一方面也流传出更多、更具体的公开证据,说明这套技术栈到底擅长什么。

1.2 智能体信任讨论从抽象安全转向具体的安全与验证工作(🡕)

四条独立帖子传递出同一个信息:编程智能体如今已经被信任到足以接触真实工作,因此社区正把注意力集中在欺诈控制、恶意工具攻击、恶意仓库,以及能证明输出可安全交付的验证闭环上。

@thdxr 警告称(194 个赞、15 条回复、9,979 次浏览、24 次收藏)提醒 Hermes 和 OpenCode Go 用户更新智能体并设置自定义 user agent,因为“正在发生多得离谱的欺诈”。回复没有弱化这一点,反而把问题讲得更具体:一位用户称自己在使用 Hermes 时遭遇临时封禁;另一位说,在这套栈里,身份“不是可有可无的”;还有一位认为,仅靠 user agent 远远不够,还需要智能体 ID、任务 ID 和审批回执。

@rohanpaul_ai 总结了(1 个赞、2 条回复、758 次浏览、2 次收藏)提到了新论文《ContextLeak:通过恶意工具窃取 LLM 智能体上下文》,而公开的 arXiv 摘要也证实了其机制:研究者利用强化学习设计恶意工具名称和描述,诱导智能体既选择该工具,又把运行时上下文泄露进工具参数。推文里给出的数字也很具体:面对用户提示攻击时选择率为 92%,面对对话历史攻击时为 89%;在 Claude Code 的测试中,如果训练只针对一个开源代理,100 次里也有 22 次会选中该工具。(论文

ContextLeak 的论文摘要,描述了恶意工具描述如何从 LLM 智能体中窃取运行时上下文

@Ax_Sharma 指出了(4 个赞、2 条回复、101 次浏览、1 次收藏)介绍了 GitSpawn,而 Manifold Security 的公开文章称,漏洞出在后台收集 git 上下文的环节:只要打开不受信任的仓库,某些智能体就可能在工作区信任提示出现之前,先在主机上执行代码。Manifold 记录了 7 个智能体中的 8 项问题,并表示发文时其中 4 项仍未修复。(研究

GitSpawn 信息图,展示不安全的 git 上下文收集如何让不受信任的仓库在多个 AI 编程智能体中执行代码

@ryanvogel 展示了(13 个赞、5 条回复、1,383 次浏览、14 次收藏)展示了这类信任叙事的另一面:OpenCode mobile 的一套远程工作流,会让一台无头 EC2 Mac 通过 serve-sim 运行 iOS、macOS 和 iPadOS 测试,再在 TestFlight 之前用截图验证作为放行条件。这张截图异常具体:PR #9 已准备好审查,附有竖屏和横屏截图,且 65 项测试全部通过。

OpenCode 智能体日志,显示在审查前已有 65 项测试通过,并将纵向和横向截图附加到 PR #9

讨论洞察: 回复区并没有要求更好的提示词,而是在要求审计轨迹、明确的智能体身份,以及像截图验证这样能让远程运行结果对人可读、可判定的通过条件。

与前一天对比: 前一天关于可靠性的讨论更多围绕重置、宕机和重试风暴。今天的重点则更贴近主机本身:信任建立前到底运行了什么、哪些内容会泄露给工具,以及人在相信智能体确实完成任务之前需要看到什么证据。

1.3 可复用规则和技能成了应对 AI 编程“糊弄产出”的首选答案(🡕)

关于“反糊弄”的讨论,重点并不在换模型,而在把更好的判断力编码进技能、工作流和审核门槛里。至少五条独立内容都汇聚到了同一种设计直觉上。

@LimestoneHQ 表示(6 个赞、3 条回复、4,399 次浏览、2 次收藏)指出,大多数团队停留在工具采用层面,始终无法达到生产速度,因此围绕 V.U.E. 搭了一套“Velocity Framework”:每一行 AI 生成代码都必须满足 Verified、Understood、Explainable。配图还补充了剩余的操作模型:AI 重度参与的工作集中在样板代码、测试、重构、CRUD 和文档,而安全、支付和架构仍全部由人工审核。

Velocity Framework 图示,将 V.U.E. 定义为 Verified、Understood、Explainable,并将高度依赖 AI 的工作与仅由人类作出的决策区分开来

@diamai_ 披露了(23 个赞、9 条回复、466 次浏览、11 次收藏)介绍了 i-have-adhd——一套适用于 Claude Code、Codex、Cursor、Gemini CLI 和 GitHub Copilot 的规则集,要求智能体先说下一步动作、步骤编号、压制跑题,并以一个明确的下一步收尾。公开的 GitHub 元数据显示,该仓库已有 26,440 颗星;当天最好的回复也很好地重述了它的价值:收益不只是更短,而是更低的决策负担。(仓库

@Sejan71 将其定位为(1 个赞、5 条回复、148 次浏览)介绍了 Taste Skill,试图解决 AI 生成网站“满屏都是 AI 味”的问题,承诺在 Claude Code、Codex、Cursor 和 Gemini CLI 中改善布局、排版、间距、动效,以及更符合具体项目的视觉风格。链接的 GitHub 仓库目前显示 83,354 颗星,并把自己描述为一个面向 AI 智能体的反糊弄前端框架。(仓库

@DanKornas 收集了(3 个赞、2 条回复、940 次浏览、8 次收藏)介绍了更广泛的 Awesome Agent Skills 生态——一个拥有 33,575 颗星、收录 1000 多项技能的索引,涵盖官方团队和社区开发者;与此同时,Dan Kornas 在 OwnYourCode 上的另一条帖子(7 个赞、3 条回复、393 次浏览、5 次收藏)推广了一套围绕 spec-driven development 和完工前可解释性构建的 Claude Code 六道闸工作流。(Awesome Agent SkillsOwnYourCode 仓库

讨论洞察: 今天这一簇内容里最有力的回复,来自 i-have-adhd 对“更好的输出规则可能胜过更聪明的模型”的论证,因为真正的收益是降低决策负担。这与 V.U.E. 和 OwnYourCode 两条线索高度一致:它们都把 AI 编程失败看成判断问题,而不只是打字问题。

与前一天对比: 技能和工作流定制此前已在背景中存在,但今天的表述更聚焦:不再是“这里又有一个工具”,而是“你的智能体缺的,是这套审核门槛、输出契约或视觉标准”。

1.4 成本控制成了产品功能,而不再只是顺带抱怨(🡒)

前一天最响亮的配额抱怨并未消失,但讨论重心已转向那些能降低成本、平滑限制、或干脆绕开托管定价的工具与习惯。

@daanisharif 解释了(8 个赞、3 条回复、361 次浏览、1 次收藏)讨论了“智能体 token 税”:编程智能体会反复重发先前上下文、工具历史以及已经读过的文件,因此团队不断为模型已经做过的工作再次付费。同一帖子还引用了 SOMA 的说法:在 GitHub Copilot + DeepSeek V4 Pro 的组合下,上下文可减少约 10%;但也特别补充了关键限定——这种节省依赖具体工作流,并非普适。

@Im_IrushiK 发布了(27 个赞、9 条回复、2,852 次浏览)发布了一张预算图,认为 Codex 的使用预算变得更紧、更难预测,而 Claude Code Pro 在公开额度追踪中看起来更稳定。真正让这条内容有用的,是图表本身,而不只是推文文字。

额度趋势图,对比了 Claude Code Pro 和 Codex Plus 直到 2026 年的变化,强调了 Codex 的波动性以及当前更低的每周价值

@starmexxx 制作了(26 个赞、9 条回复、1,267 次浏览、21 次收藏)围绕 textgen 提出了当天最有力的“本地优先”定价论点:这是一款拥有 47,595 颗星的本地 LLM 桌面应用,提供兼容 OpenAI 和 Anthropic 的 API、工具调用以及 100% 私有执行,被定位成每月 200 美元托管订阅的替代品。回复区关注的重点不在基准测试,而在一个更实际的判断:本地 AI 正在成为完整技术栈,而不再只是“终端里的一个模型”。(仓库

讨论洞察: 应对手段都很具体:上下文压缩、理解会话相关的定价机制、公开预算追踪,以及使用本地 API,让现有工具无需重写工作流就能指向更便宜的后端。

与前一天对比: 2026-08-31 的梗是“限额重置”本身;到了 2026-09-01,更有意思的是人们正在这些限制之上搭建的应对层。


2. 什么让人感到挫败

智能体栈中的不安全后台行为

当天最严重的挫败点不是模型质量,而是信任边界。@thdxr 描述了(194 个赞、15 条回复、9,979 次浏览、24 次收藏)提到 Hermes 和 OpenCode Go 周围“发生了多得离谱的欺诈”,而回复进一步把问题具体化为控制缺口:临时封禁、缺失的身份信号,以及对智能体 ID、任务 ID 和审批回执的需求。由 @rohanpaul_ai 显示 总结的公开 ContextLeak 论文(1 个赞、2 条回复、758 次浏览、2 次收藏)则展示了另一条滥用途径:恶意工具描述诱导智能体把提示词和运行时上下文泄露到工具参数中。GitSpawn 把同样的挫败感推到了主机层:@Ax_Sharma 指出了(4 个赞、2 条回复、101 次浏览)指出了这一问题,而 Manifold Security 记录的是一类 Bug:打开不受信任仓库,可能会在信任提示出现前就触发代码执行。严重程度:高。这个方向值得投入,因为用户如今要的已经不是更好的措辞,而是明确身份、净化处理,以及能证明后台动作安全的证据。

团队仍不信任原始 AI 输出可以直接成为生产代码或最终 UI

当天几条最强的工作流帖子之所以存在,正是因为人们并不相信“已经交付”就等于“可以放心保留”。@LimestoneHQ 表示(6 个赞、3 条回复、4,399 次浏览)指出,团队可以买 Copilot 席位、提高产出,却并不会同步提升生产速度,随后又用 V.U.E. 审核规则来填补这一落差。@DanKornas 推广了(7 个赞、3 条回复、393 次浏览、5 次收藏)把 OwnYourCode 作为对“你自己都解释不清的代码”的直接回应;@Sejan71 将其描述为(1 个赞、5 条回复、148 次浏览)则把 Taste Skill 当作修复 AI 生成界面千篇一律问题的方案。就连 @ryanvogel 达到(13 个赞、5 条回复、1,383 次浏览、14 次收藏)也从另一角度得出了同样结论:让远程测试工作流真正可信的,是截图验证。严重程度:中高。常见补救办法是增加关卡、截图、更严格的输出格式,以及更窄的 AI 自主范围。

使用限额如今更多被体验为上下文管理问题

配额之痛仍在,但讨论已经更技术化。@daanisharif 描述了(8 个赞、3 条回复、361 次浏览)指出,智能体会不断为已经处理过的上下文重复付费,把长时任务变成 token 税,甚至导致数小时锁定。@Im_IrushiK 认为(27 个赞、9 条回复、2,852 次浏览)显示,在公开追踪中,Codex 的预算表现比 Claude Code Pro 更紧、更难预测;而 @codeglitch 指出(2 个赞、2 条回复、390 次浏览)则指出,Anthropic 最常被重复传播的定价标题其实是缓存读取折扣,而不是整体容量增加。严重程度:中等。这个方向值得做,因为人们正在寻找压缩层、预算仪表盘、会话习惯建议和本地后端,而不是等供应商自己把定价讲清楚。


3. 人们希望存在什么

可验证、且始终由人类掌控的智能体工作流

人们并不是想要更少 AI,而是想要 AI 在人类失去理解之前停下来。@LimestoneHQ 希望(6 个赞、3 条回复、4,399 次浏览)要求每一行生成内容都必须是 Verified、Understood、Explainable;@DanKornas 推广了(7 个赞、3 条回复、393 次浏览、5 次收藏)则提出了一套核心前提就是“AI guides, you build”的工作流。@ryanvogel 补充说(13 个赞、5 条回复、1,383 次浏览、14 次收藏)给出了同一需求的操作化版本:只有截图和通过的测试能证明结果时,这次运行才值得信任。这是一个现实且紧迫的需求。机会:直接。

能跨工具迁移、且不会把私有工作发送到托管层的技能

多条帖子汇聚到了同一个愿望:一旦团队摸索出好的输出契约或工作流,就不该被锁死在某一家供应商界面里。@DanKornas 重点介绍了(3 个赞、2 条回复、940 次浏览、8 次收藏)介绍了一个覆盖 Claude Code、Codex、Cursor、Gemini CLI、GitHub Copilot 等工具、收录 1000 多项智能体技能的索引;而他的 OpenSkills 帖子(推文)则通过 MCP 在本地运行技能,把这个想法又往前推进了一步。@diamai_ 展示了(23 个赞、9 条回复、466 次浏览、11 次收藏)体现了对可移植输出规则的需求;@Sejan71 展示了(1 个赞、5 条回复、148 次浏览)则体现了对可移植 UI 审美约束的同类需求。这既实际,也具有战略意义。机会:竞争性。

在不改动整套工作流的前提下降低上下文拖累

最强的预算相关帖子,本质上都是对“隐形基础设施”的功能请求。@daanisharif 希望(8 个赞、3 条回复、361 次浏览)想要的是降低重复上下文税,而不是换一款新 IDE;SOMA 的卖点正是“同一个智能体、同一个模型、同一个工作流——但要支付的 token 更少”。@starmexxx 希望(26 个赞、9 条回复、1,267 次浏览、21 次收藏)希望 Claude Code、Cursor、Codex 等现有工具能直接指向本地、兼容 OpenAI 的后端,而不是再买一个新的托管订阅;@codeglitch 认为(2 个赞、2 条回复、390 次浏览)则指出,只有当用户通过维持同一会话,真的能吃到缓存读取折扣时,定价改动才有意义。这是一个明确存在试错意愿的现实基础设施需求。机会:竞争性。

更好地让 AI 生成界面显得有设计意图,而不是模板化

Taste Skill 的核心论点是,AI 生成的网站会共享同样的布局、间距和动效模式;回复区也普遍认同,智能体需要更强的设计标准。这既有实用层面,也有情绪层面:开发者希望产出不要一眼看上去就是机器做的。由于领先方案已经在开源社区取得了较大采用,这与其说是一个尚未被满足的空白需求,不如说是对现有智能体提出了更好默认值和更强审美层的要求。机会:从理想到竞争。


4. 正在使用的工具和方法

工具 类别 情绪 优势 局限
Antigravity /boost 智能体运行框架 (+) 三阶段推理流水线、隔离 worktree、回归检查,面向棘手 Bug 和重构 付费方案功能;明确会消耗更多 token;容量问题仍在讨论中
Antigravity /teamwork-preview 长时运行的智能体工作流 (+/-) 用户称其在付费方案里“值得先放下一切去用”;围绕子智能体和长任务设计 今天的证据仍主要来自用户背书,而非广泛采用指标
Gemini 3.7 Flash 模型 (+/-) 在 AI Studio、Antigravity、Spark 中有广泛公开展示,并宣称在研究和系统任务上表现强劲 近期 Bug 被公开归因于需求压力;部分用户仍希望有更高一档的模型
Claude Code 编程智能体 (+/-) 技能生态丰富,具备可解释性工作流和远程操作扩展 限额敏感性、欺诈控制和安全研究仍是活跃关注点
GitHub Copilot 编程助手 / 平台 (+/-) 可用于现代化工作流、技能集合,以及 SOMA 这类第三方压缩层 多条帖子认为,仅仅购买席位并不能带来生产速度
SOMA 上下文压缩中间件 (+/-) 声称在不改变智能体工作流的前提下降低上下文开销;可与 Copilot 和 DeepSeek V4 Pro 集成 节省幅度的说法仍偏早期、依赖具体模型,且今天的证据没有独立基准验证
textgen 本地 LLM 运行器 (+) 兼容 OpenAI/Anthropic 的 API、工具调用、私有本地执行,并兼容现有智能体前端 需要本地部署和硬件;今天最强的证据来自开发者自我推广,而非中立对比
i-have-adhd / Taste Skill 输出与前端技能层 (+) 降低决策负担、提升可执行性,并试图消除 AI 生成 UI 的模板化模式 如果机械套用,强规则可能会过度限制边缘场景
OpenSkills / Awesome Agent Skills 技能基础设施 (+) 通过 MCP 本地执行,并提供跨 1000 多项可复用技能和众多智能体的广泛发现能力 生态已经大到“策展”本身都成了必要基础设施
Claude Fable 5.1 / Mythos 5.1 模型 (+/-) 公开基准卡显示其在编程、科学研究、知识工作和商业工作流上都有提升 定价讨论很快转向缓存读取习惯和受限可用性,而不是简单的容量增长

@ripper0x 传播了(3 个赞、3 条回复、39 次浏览)介绍了 Anthropic 的 Fable 5.1 基准卡;@codeglitch 提供了(2 个赞、2 条回复、390 次浏览)则给出了更实用的后续解读:宣传中的折扣针对的是缓存读取,因此只有用户停留在同一会话里、让系统复用先前上下文时,才能真正受益。

Claude Fable 5.1 与 Fable 5、Opus 5 和 GPT-5.6 Sol 的基准测试表,涵盖编程、研究、知识工作和业务流程

信息图解释了 Anthropic 的降价实际上是缓存读取折扣,奖励用户留在同一会话中,而不是重新开启新的会话

今天满意度最高的,是那些无需强迫用户整套迁移工具、却能重塑工作流的层:输出规则(i-have-adhd)、可解释性关卡(OwnYourCode、V.U.E.)、上下文压缩(SOMA),以及保留现有智能体客户端的本地后端(textgen)。最常见的变通模式是“保留界面,替换经济模型”:让 Claude Code、Cursor 或 Codex 指向本地 API,在上下文抵达模型前先做压缩,或者在同一会话里停留足够久,以吃到缓存读取折扣。因此,竞争正在从模型本身上移到工作流界面和中间件:Antigravity 与 Copilot 正在加入引导式任务模式,而开源开发者则在竞相提供可移植技能、本地执行和更好的默认层。


5. 人们在构建什么

项目 构建者 功能 解决的问题 技术栈 阶段 链接
My-Brain-Is-Full-Crew @KanikaBK 带出 多智能体 Obsidian crew,支持笔记采集、搜索、收件箱分拣、链接分析、邮件/日历同步和转录 个人知识系统通常忽视记忆、收件箱混乱、饮食和心理负担之间的交叠 Shell、Obsidian、8+ 个智能体、14 项技能、Claude Code、Gemini CLI、OpenCode、Codex 已发布 推文仓库
Taste Skill @Sejan71 / Leonxlnx 反糊弄前端技能,改善智能体生成 UI 的布局、排版、间距、动效和风格 AI 生成网站常常彼此雷同,而且一眼看出机器痕迹 JavaScript、技能文件、tasteskill.dev 已发布 推文仓库
i-have-adhd @diamai_ / ayghri 输出契约技能,强制回答以行动优先、使用编号并减少跑题 编程智能体经常把下一步埋在冗长、难以执行的文字里 Python、SKILL.md 规则、兼容多智能体 已发布 推文仓库
Awesome Agent Skills @DanKornas / VoltAgent 收录官方团队和社区开发者 1000 多项可复用技能的精选索引 技能发现分散在不同供应商和仓库中 GitHub 目录、Markdown 元数据、跨工具安装路径 已发布 推文仓库
OpenSkills @DanKornas / instavm 本地 MCP 服务器,可在 macOS 上通过兼容 AI 工具运行 Claude 技能 团队希望复用技能,而不把私有文件上传到托管工作流 Python、MCP、macOS 沙盒、本地 LLM 支持 已发布 推文仓库
OwnYourCode @DanKornas / Daniel Podolsky 以可解释性优先的 Claude Code 工作流,采用 spec-driven development 和六道质量闸门 开发者希望获得 AI 帮助,同时不放弃对代码库的理解 Shell、Claude Code 工作流、spec-driven development 已发布 推文仓库
textgen @starmexxx / oobabooga 本地 LLM 桌面应用,支持兼容 OpenAI/Anthropic 的 API、工具调用和隐私优先执行 让现有智能体客户端使用本地后端,而非付费托管订阅 Python、llama.cpp、exllamav3、transformers、TensorRT-LLM、MCP 兼容 API 已发布 推文仓库
SOMA @daanisharif / @SomaSubnet 面向编程智能体会话的上下文压缩层,最初用于 GitHub Copilot + DeepSeek V4 Pro 长时运行的智能体不断为重发旧上下文重复付费 压缩中间件、GitHub Copilot 集成、DeepSeek V4 Pro Beta 分析推文产品
ApexAgents-SkyRL-Recipe @charlie_ruan / Mercor 基于 APEX-Agents 数据训练知识工作智能体的公开方案与代码库 面向长时程专业智能体的开放 RL 方案仍然稀缺 Python、SkyRL、Harbor、APEX-Agents 已发布 推文仓库博客

最强的构建模式并不是“再来一个聊天机器人”,而是面向编程智能体的元基础设施:改变输出行为的技能、帮助用户发现这些技能的目录、替换现有工具底层经济模型的本地运行时,以及试图在不要求开发者重学界面的前提下,让长时会话更便宜的压缩层。

@KanikaBK 分享了(9 个赞、3 条回复、537 次浏览、4 次收藏)介绍了 My-Brain-Is-Full-Crew:这是一个由博士研究者搭建的 Obsidian 系统,包含 8 个智能体和 14 项技能,用同一套代码库协调知识、营养和心理健康工作流。下载下来的截图很关键,因为它展示了真实仓库结构:多个智能体、技能目录、编排辅助工具和文档,而不只是概念图。

My-Brain-Is-Full-Crew 的项目结构截图,展示了多个智能体、专门技能、编排辅助工具以及面向 Obsidian 的文档

@DanKornas 推广了(456 次浏览、2 次收藏)把 OpenSkills 展示为同一趋势的隐私优先版本:技能保留在本地,通过 MCP 运行,并避免把文档、表格、演示文稿和图片放进托管工作流层。README 截图把预期用例和执行模型写得很具体。

OpenSkills README 截图,展示了本地文件处理、沙箱执行以及用于本地运行 Claude skills 的 MCP 兼容性

@DanKornas 还重点介绍了(7 个赞、3 条回复、393 次浏览、5 次收藏)介绍了 OwnYourCode,它把同样的反糊弄取向转成了开发者训练工作流:先写规范,让 AI 充当导师,而第一道质量闸门就是开发者必须能解释代码。这与“更快自动补全”的产品定位明显不同。

OwnYourCode README 截图,展示了 AI 导师式开发、基于用户画像的教学模式,以及以可解释性为导向的工作流设计

另一个重要分野在于经济模型。textgen 和 SOMA 都保留了熟悉的工具界面,同时改变其底层成本结构:前者换成兼容本地 API 的后端,后者则在上下文抵达模型前做压缩。Mercor 的 SkyRL 方案则还要更底层一层,分享的是训练方案本身,而不是另一个面向用户的壳。


6. 新内容与值得关注的动向

GitHub Copilot 被展示为引导式现代化智能体,而不只是编辑器助手

@VisualStudio 分享了(32 个赞、5,187 次浏览、14 次收藏)介绍了一套由 GitHub Copilot 驱动的 .NET Framework 到 .NET 10 现代化流程;链接的开发博客对工作流结构写得异常具体:Guided mode 会在检查点暂停,生成可提交到源代码控制的 Markdown 制品,并在 Visual Studio 内带着示例 BookCatalog 应用完成升级。这是一次值得注意的产品表述变化,因为它卖的不是“Copilot 能重构代码”,而是可审计性和分阶段复核。(开发博客

GitHub Copilot .NET 现代化改造指南中的现代化 Book Catalog 应用截图

Mercor 发布了面向前沿知识工作智能体的公开 RL 训练方案

@charlie_ruan 报道了(32 个赞、4 条回复、832 次浏览、12 次收藏)介绍了 Mercor Research 与 SkyRL 的合作成果:在 APEX-Agents 上将 Qwen3.5-397B-A17B 的 Pass@1 从 16% 提升到 27%。链接的博客给出了更完整也更强的说法:从 16.11% 提升到 27.29%,并公开了方案仓库、模型权重和评测轨迹,同时明确声称其中部分收益迁移到了 OpenCode 和 Terminal-Bench 2.1。(博客仓库

Codex mobile 正在成为真正的远程智能体控制界面

@CodexReleases 总结了(42 个赞、5,058 次浏览、4 次收藏)介绍了 ChatGPT for iOS 的一次更新:支持跨 Windows 和 Linux 主机的附件、为运行中任务和未读更新提供优先视图,并支持排队提示词——它们会同步到所连接主机,并在应用留在后台时发出。这一点很重要,因为它让移动端从“通知伴侣”更进一步,开始接近编程智能体会话的“轻量远程操作控制台”。

ChatGPT for iOS 1.2026.237 的 Codex 移动端更新日志卡片,重点展示了 2026 年 9 月 1 日的更新


7. 机会在哪里

[+++] 面向智能体的信任、验证与安全上下文处理 —— 这是最强的机会,因为无论从失败侧还是解决方案侧,都有充分支撑。GitSpawn 展示了不受信任仓库带来的主机级执行风险,ContextLeak 表明恶意工具描述可以外泄运行时上下文,而 Hermes/OpenCode Go 那条帖子则暴露了欺诈和智能体身份缺失带来的真实运营痛点。建设性的一面同样清晰:截图验证、V.U.E. 和 OwnYourCode 都指向同一个产品方向——更强证据、更紧边界,以及明确的人类检查点。

[++] 能经受供应商切换的可移植技能层 —— Taste Skill、i-have-adhd、Awesome Agent Skills 和 OpenSkills 之所以存在,就是因为人们希望把行为模式从 Claude Code 带到 Codex、Gemini CLI、GitHub Copilot,而不必全部重写。这是一个切实机会,因为生态已经大到发现、策展和本地执行都开始成为独立产品。

[++] 保留界面、改变经济模型的成本控制基础设施 —— SOMA、textgen、公开预算图表和缓存读取科普,都反映了同一需求:开发者想保留熟悉的智能体前端,同时降低重复上下文成本,或切换到更便宜的后端。这是中等偏强机会,因为相关需求反复出现在抱怨、变通方案和已发布产品中,而不是只停留在某家供应商的定价页上。

[+] 现有开发界面中的引导式专家工作流 —— Antigravity 的 /boost/teamwork-preview,以及 GitHub Copilot 的现代化智能体,都显示出市场对特定模式体验的兴趣:围绕困难任务包上规划、审计和验证。这一方向仍处于萌芽阶段而非已被证明,因为今天的证据更多体现为产品动作强劲,但除早期用户和厂商帖子之外,独立用户证词还不算多。


8. 要点

  1. Google 用一天时间把 Antigravity 推成了工作流栈,而不只是模型端点。 /boost/teamwork-preview、Gemini 3.7 Flash 展示以及那张开放问题截图,都指向同一个方向:在这一运行框架里承载更结构化、时间跨度更长的编程工作。(来源
  2. 信任如今是智能体采用的主要瓶颈。 Hermes/OpenCode Go 中的欺诈报告、ContextLeak 中的恶意工具外泄,以及 GitSpawn 中信任建立前的仓库执行,都说明后台行为正受到比原始生成质量更严格的审视。(来源
  3. 验证正在成为产品功能,而不只是最佳实践。 V.U.E.、OwnYourCode 的闸门,以及 Ryan Vogel 的截图验证移动测试流程,都在描述这样一类系统:人可以检查证据,而不是靠信念接受一次智能体运行的结果。(来源
  4. 可复用技能正在成为应对糊弄产出的首选方案。 i-have-adhd、Taste Skill、Awesome Agent Skills 和 OpenSkills 分别从不同角度处理同一个问题:更好的输出契约、更好的设计默认值、更容易的发现,以及本地/私有执行。(来源
  5. 关于成本控制的讨论已经上移到了技术栈更高层。 今天真正有意思的产品,不只是新模型,还有围绕模型搭起来的各层:上下文压缩、兼容本地 API 的运行时、预算追踪,以及对缓存读取与新会话差异的定价认知。(来源
  6. 一些最值得注意的构建活力,其实发生在用户界面之下。 Mercor 发布了面向知识工作智能体的公开 RL 方案,而 GitHub Copilot 和 Codex 也都展示了围绕核心模型搭建的、更具结构化的操作界面。(来源