Twitter AI Coding - 2026-08-13¶
1. 人们在讨论什么¶
1.1 工作历史记忆,正从仓库事实扩展到完整的活动时间线 (🡕)¶
8 月 13 日,记忆讨论出现了实质性转向。8 月 12 日主要还在谈仓库级记忆、召回层,以及指令文件蔓延;8 月 13 日则把这个想法扩展成更广义的活动日志,可以重建一个人在不同 app 和网站上的工作轨迹。这一簇讨论,由重磅发布的 Computer History 支撑,Hindsight 等记忆层帖子则构成补充。
@OpenAIDevs 宣布了(1,044 个赞、62 条回复、53,989 次浏览、306 次收藏),Codex 和 ChatGPT 现在可以把 Computer History 当作最近工作的上下文。公开的 Computer History 文档 表示,这项功能默认关闭,需要 macOS 桌面应用加上 Memories,会把交互事件而不是截图整理成时间线摘要,并且在发现重复工作流时还能建议技能或自动化。

@Vectorizeio 把(9 个赞、422 次浏览、5 次收藏)Hindsight 定位成一个可跨智能体表面使用的记忆插件,而公开的 文档 说明,它结合了语义、关键词、图谱和时序检索,并存储心智模型、观察和事实,而不是扁平的向量缓存。这让当天关于记忆的争论,不再是“智能体该不该记住”,而更像是在讨论:什么样的检索方式和控制表面,才是可以接受的。
讨论要点: 最积极的反应给了连续性和工作流复用,但警惕情绪也立刻出现:有条回复把 Computer History 说成 ChatGPT 在审视你昨天的工作,而文档本身也反复强调需主动开启、可排除范围,以及不会采集截图或音频。
与前日对比: 8 月 12 日的记忆讨论,主要还是围绕仓库范围和陈旧指令文件。8 月 13 日则把范围扩展到了完整工作历史、本地记忆文件,以及从重复行为里自动生成技能。
1.2 Antigravity 成了自定义智能体、插件和 Gemini 3.7 Flash 的封装层 (🡕)¶
Antigravity 成了当天最主导的词汇之一,而 Gemini 3.7 Flash 既是一场模型发布,也是一场分发事件。把它们串起来的线索,是封装:基于文件的智能体、插件清单、新模型可用性,以及构建在 shell 之上的具体项目。相比 8 月 12 日把 custom agents 当作一项功能,8 月 13 日更像是在展示 Antigravity 正变成模型和扩展的分发表面。
@antigravity 宣布了(686 个赞、40 条回复、54,516 次浏览、186 次收藏)Custom Agents,而公开的 custom agents 博文 说,这些文件位于 .agents/agents/ 或 ~/.gemini/config/agents/ 下,并且既能对称地作为主智能体运行,也能作为被委派的子智能体运行。附图之所以重要,是因为它展示了一个下拉选择界面,让这些角色成为可选项,而不是藏在配置里的东西。

@antigravity 宣布了(646 个赞、48 条回复、18,625 次浏览)Antigravity 中上线 Gemini 3.7 Flash,而 Google 公开的 模型发布文章 表示,3.7 Flash 相比 3.6 Flash,在 DeepSWE v1.1(65.3% 对 49.0%)、FrontierCode 1.1 Main(43.6% 对 34.4%)、WebDev Arena(1588 对 1538)以及 AutomationBench(30.4% 对 17.0%)上都有提升。这让 Antigravity 拿到了一个更便宜的主力模型,而且公开证据明确强调了它在编程和智能体工作流上的增益。

@JackWoth98 介绍了(188 个赞、17 条回复、11,965 次浏览、106 次收藏)一个打包进 Antigravity 的 Gemini API 插件,而 Google Cloud 公开的 插件文档 把 plugin.json 定义为技能、智能体、MCP 配置、hooks 和规则所需的清单文件。@googledevs 分享了(153 个赞、10 条回复、17,117 次浏览、66 次收藏)Gemma Translator 仓库,它用 LiteRT-LM 和 Moonshine 在 Raspberry Pi 5 上本地运行 Gemma 4,说明 Antigravity 已经不只是拿来做演示提示词,而是在用于交付具体的离线设备。
讨论要点: 回复对更便宜的 flash 模型和可复用的智能体文件总体积极,但最尖锐的摩擦点,还是可发现性和策略门槛:有条关于 custom agents 的回复说,更新前压根看不到下拉菜单;而关于 Copilot 的回复则指出,企业管理员必须先开启 Gemini 3.7 Flash,这个模型才会变成可选项。
与前日对比: 8 月 12 日把 custom agents 作为新的专门化表面引入。8 月 13 日则展示了这个表面开始不断叠加模型逐步发布、插件清单,以及真实硬件项目。
1.3 智能体外围的运行层,正在变得更可视化、可评审,也跨越更多表面 (🡕)¶
当天最有意思的构建者帖子,并不是“又一个更强模型”的主张,而是围绕现有智能体加上的新控制表面:可视化编辑器、图控制平面、规范优先的命令栈、基于 ACP 的 IDE 切换、可回放会话,以及可复现评估。这延续了 8 月 12 日的运行层趋势,但 8 月 13 日的设计更明确,也更有主张。
@charliejhills 认为(23 个赞、12 条回复、2,555 次浏览),GitHub 的 Spec Kit 修正了“倒着写代码”的问题:它强制把需求、澄清、规划、任务和编码排进一个结构化顺序里。@Alan_Earn 分享了(24 个赞、10 条回复、370 次浏览、6 次收藏)Airship,其公开 README 说,它会把一个设计画布放在正在运行的开发服务器前面,让用户点击某个元素、描述想改什么,再由 Claude Code、Codex 或 OpenCode 在本地写出 diff。

@WebStormIDE 介绍了(16 个赞、2 条回复、1,150 次浏览)WebStorm 里基于 ACP 的智能体选择,而公开的 JetBrains 文章 说,ACP 能让团队在不放弃本地索引、也不用额外订阅 JetBrains AI 的情况下切换不同提供商。@airealitynoslop 则指出(3 个赞、1 条回复、35 次浏览、3 次收藏),DeepSeek Harness 把模型、工具、技能、会话、沙箱、存储、循环、调度和 UI 都当作构建在 Cordis 之上的插件,这让模块化比一般的“工具 / 插件”划分还要更深一层。
@codeglitch 用一张图提炼了(4 个赞、3 条回复、162 次浏览)这层系统背后的评审准则:一个智能体不该包揽每一步,证据应该从分诊流向复现、编码和评审。类似的“可评审性”也出现在 @s7rthaks 构建(1 个赞、1 条回复、64 次浏览)一款可复现基准测试 CLI 的帖子里:它会在一个容器里运行求解器,再在一个全新的容器里评估补丁。

讨论要点: 最强的实践者细节,不在于原始能力,而在于协作成本。有条关于具名 Claude Code 会话的回复说,这种模式能用,但 token 税太高,因为智能体会不断把彼此唤醒、来回聊天;这也进一步强化了大家转向显式图、协议和评审阶段。
与前日对比: 8 月 12 日展示的是围绕采集、分析和安全浮现出来的运行层。8 月 13 日则把它推进到了更具体的 UX:画布、协议、图、质量闸门,以及带证据的评估闭环。
2. 令人困扰的问题¶
既有用、又不让人觉得被冒犯的记忆¶
这是一个高严重度的困扰,因为最强的正面信号和最强的怀疑,指向的是同一项功能。@OpenAIDevs 宣布了(1,044 个赞、62 条回复、53,989 次浏览、306 次收藏)Computer History,把它当作一种让 ChatGPT 和 Codex 接上最近工作的方式;但公开的 文档 用来解释排除项、删除、本地存储、提示注入风险,以及对敏感 app 的同意要求的篇幅,几乎和介绍便利性的篇幅一样长。有条回复甚至直接用玩笑说出了这种不适:ChatGPT 像是在审视你昨天和上周做过的工作。
同一困扰的技术版本,则出现在 @Vectorizeio 把(9 个赞、422 次浏览、5 次收藏)Hindsight 定位为记忆层的方式上,因为正如公开 文档 所描述的,简单的向量召回并不足以回答那些需要时间推理或整合观察的问题。人们当前的应对方式,是自己加上明确的 memory bank、排除规则和保留策略,而不是相信默认聊天窗口。这非常值得直接构建,因为需求很明确;但产品必须把范围、来源和删除路径做得一目了然。
一次性智能体,仍然需要评审架构和可重复评估¶
即便这些构建者帖子本身的互动量不高,这依然是一个高严重度困扰。@codeglitch 把(4 个赞、3 条回复、162 次浏览)核心抱怨浓缩成了一条规则:一个智能体不该包揽每一步。@s7rthaks 专门做了(1 个赞、1 条回复、64 次浏览)一个 benchmark CLI,就是为了别再信任退出码或求解器输出:它会先隔离求解,再做一轮全新的评估;与此同时,@PatrickToulme 把(11 个赞、10 条回复、1,657 次浏览)AgentSage 描述成一种可回放的会话轨迹系统,在任何数据离开机器之前,先做脱敏和密钥扫描。
协作成本也直接出现在讨论里。@adocomplete 展示了(8 个赞、2 条回复、334 次浏览、4 次收藏)可以彼此私信的具名 Claude Code 会话,但有条回复说,这套东西会很贵,因为智能体会把上下文浪费在互相聊天和唤醒彼此上。今天的权宜方案,是在智能体外围再套上闸门、分工角色,或可回放工具。这非常值得直接构建,因为真正的失败模式不是智能体什么都做不了,而是团队没法信任、也没法低成本核查它到底做了什么。
模型可得性改善的速度,快过了部署经济性¶
这个困扰介于中到高严重度之间,因为能力曲线在快速上行,但访问条件仍受策略和硬件限制。@github 宣布了(91 个赞、16 条回复、24,044 次浏览)Copilot 中上线 Gemini 3.7 Flash;但公开的 更新日志 明确说明,企业和 business 管理员必须先启用预览策略,用户才能选这个模型。即便对符合资格的套餐,Copilot 各个表面的 rollout 也是渐进的。
在本地这一端,@burkeholland 报告称(67 个赞、13 条回复、8,567 次浏览、19 次收藏),Qwen3-Coder 30B 通过 Ollama 在 GitHub Copilot app 里运行时,速度大约能到每秒 85 个 token;但回复马上就把焦点拉回了现实:96GB VRAM 的要求,以及硬件价格。Antigravity 和 Copilot 帖子里对 flash 级模型的兴趣,部分原因就在于重试和工具调用的价格,而不只是质量本身。这非常值得拿来做竞争性构建,因为人们需要有人帮他们在托管、本地和策略受限的模型选择之间做路由,而不是逼每个人都去当基础设施专家。
3. 人们期望的功能¶
能把重复工作变成可复用制品的记忆¶
人们要的,不只是一个会记住的智能体;他们要的是一个能把重复工作转成可复用、可评审产物的智能体。公开的 Computer History 文档 说,重复工作流会触发技能或自动化建议;@OpenAIDevs 也把(1,044 个赞、62 条回复、53,989 次浏览、306 次收藏)这个功能框定成“从上次停下的地方接着做”,以及“理解工作模式”。@Vectorizeio 则用 一个跨智能体记忆层来支撑这一点,而公开的 文档 也明确把 retain、recall 和 reflect 建模成系统能力。这不是愿景,而是非常实际的需求。机会:直接。
能扛住工具切换的封装¶
Custom agents、插件清单、协议适配器和模型 rollout,其实都指向了同一个请求:行为定义一次,就能在外围工具变化时保持可移植。@antigravity 展示了(686 个赞、40 条回复、54,516 次浏览、186 次收藏)基于文件的 custom agents,Google Cloud 公开的 插件文档 把 plugin.json 暴露为封装根节点,而 @WebStormIDE 则把(16 个赞、2 条回复、1,150 次浏览)ACP 定位成一种能把 GitHub Copilot、Claude Code 或任何兼容智能体带进同一个 IDE、又不必额外订阅的方式。这个需求既实际、也很有竞争性,因为开发者显然希望自己能在 shell、IDE 和 provider 之间来回切换,而不用重写整层运行面。机会:竞争型。
能把规划、执行、验证和评审拆开的编排¶
多条帖子,即便用词不同,也都收敛到了同一个理想模式。@charliejhills 把(23 个赞、12 条回复、2,555 次浏览)Spec Kit 描述成一种强迫“先需求、再规划、再任务”的方法。@tom_doerr 分享了(4 个赞、1,023 次浏览)Pilot Shell,其公开仓库把 Claude Code 和 Codex 变成带质量闸门的 /prd、/spec、/build 和 /fix 工作流。@ctrlnodeai 构建了(3,488 次浏览)一个图控制平面,而 @codeglitch 则认为(4 个赞、3 条回复、162 次浏览),步骤之间应该交接证据,而不是让同一个智能体全包。这是一个紧迫、直接的需求,因为用户已经在自己动手缝合编排层了。机会:直接。
4. 使用中的工具与方法¶
| 工具 | 类别 | 评价 | 优势 | 局限 |
|---|---|---|---|---|
| Computer History | 记忆 / 工作历史捕获 | (+/-) | 把最近的 app 和网站活动变成可用上下文;还能从重复工作中建议技能或自动化 | 仅限 macOS 桌面端、需主动开启、受管理员策略影响,并带来隐私与提示注入顾虑 |
| Antigravity Custom Agents | 智能体外壳 / 封装 | (+/-) | 基于文件的智能体、主智能体 / 子智能体对称、配置可在团队内共享 | 更新与发现有摩擦,而且又多了一层定制化需要维护 |
| Gemini 3.7 Flash | 模型 | (+) | 编程 / Web 开发基准优于 3.6 Flash,重试和工具循环更便宜,逐步发布势头强 | 可用性是渐进式的,且部分基准仍是更强但更贵的模型领先 |
| GitHub Copilot app + Ollama | 智能体平台 / 本地模型表面 | (+/-) | 让团队在熟悉的 shell 里同时尝试托管模型和本地模型 | 本地实验可能需要昂贵硬件,模型访问也仍受策略开关影响 |
| Hindsight | 记忆系统 | (+) | retain / recall / reflect API、时序加图谱检索、结构化记忆类型 | 团队需要额外运维并信任这一层基础设施 |
| WebStorm ACP | IDE 协议 / BYOK | (+) | 不离开有索引的 IDE 就能切换智能体,也不需要额外 JetBrains AI 订阅 | 需要兼容 ACP 的智能体,以及一定的配置纪律 |
| Spec Kit | 规划工作流 | (+) | 强制在编码前先做需求、澄清、规划和任务;可广泛接入多类智能体 | 增加前置流程;对“提示词一打就开干”的用法吸引力较低 |
| Airship | 可视化编辑器 / UI 工作流 | (+) | 直接把设计画布放到开发服务器前面,且修改留在本地 | 早期产品仍要处理不同智能体能力差异和安全模式取舍 |
| Pilot Shell | 工作流层 | (+) | 增加 spec / build / fix 通道、TDD、质量 hooks、记忆共享和本地控制台 | 这是一层有强主张的运行面,自带安装和约定成本 |
| DeepSeek Harness | 智能体运行框架 | (+/-) | 从模型、工具、会话、存储到 UI 都采用“万物皆插件”的架构 | 仍是开发者预览,并已明确会有破坏兼容性的变更 |
| CTRL NODE | 智能体图控制平面 | (+/-) | 图画布、混合提供商、仅出站 Bridge、实时任务活动 | 仍是早期产品,还在寻找工作流契合度和操作者反馈 |
| OpenCode | 开源智能体外壳 | (+) | 支持多提供商,正在持续压缩上下文,并有使用统计和移动客户端生态 | 仍在公开调试 compaction、路由和提供商行为 |
满意度沿着一条清晰的线分化。人们最喜欢那些能保住上下文、减少重复提示,或让现有智能体更容易操控的层:工作历史记忆、更便宜的 flash 模型、spec-first 工作流、可视化编辑器,以及协议适配器。而一旦这些层又引入新的隐私边界、管理开关、GPU 成本,或“这层控制平面值不值得自己运营”的问题,情绪就会转为混合。
迁移方向也已经可见。与其押注一个万能聊天表面,越来越多人是在多智能体外围再加封装和控制:IDE 里的 ACP、Antigravity 里的插件清单、CTRL NODE 里的图编排、Spec Kit 和 Pilot Shell 里的 spec-first 流程,以及围绕 OpenCode 的本地 / 移动扩展。竞争越来越像是谁能占住模型外围的运行层,而不只是模型本身。
5. 人们在构建什么¶
| 项目 | 构建者 | 功能 | 解决的问题 | 技术栈 | 阶段 | 链接 |
|---|---|---|---|---|---|---|
| Gemma Translator | Google Creative Lab via @googledevs | 面向双向对话的便携离线语音翻译器 | 翻译工作流受制于云端依赖和网络连接 | Gemma 4、LiteRT-LM、Moonshine、Raspberry Pi 5、React 前端、Python API | Alpha | 仓库 · 帖子 |
| CTRL NODE | @ctrlnodeai | 带本地 Bridge 的 AI 智能体图控制平面 | 团队想做分叉式、多 provider 的智能体工作流,但又不想把本地工作区暴露到公网 | 图画布、出站 Bridge、WebSocket 控制平面、支持 Claude/Copilot/Gemini/Codex/OpenRouter/Ollama | Alpha | 仓库 · 帖子 |
| Airship | 0xnyn via @Alan_Earn | 位于实时开发服务器前方的可视化编辑器,并把修改交给编程智能体 | 在纯文本智能体工作流里,UI 编辑和设计到代码的交接依然别扭 | Node CLI、实时浏览器画面、Claude Code、Codex、OpenCode | Beta | 仓库 · 帖子 |
| Spec Kit | GitHub via @charliejhills | 面向编程智能体的规范优先工作流套件 | 智能体往往在需求和约束还不明确时就开始写代码 | Python CLI、斜杠命令、多智能体集成、Markdown spec | 已发布 | 仓库 · 帖子 |
| Pilot Shell | Max Ritter via @tom_doerr | 围绕 Claude Code 和 Codex 增加 PRD、spec、build 和 fix 通道的工作流层 | 原始智能体运行会跳过测试、丢失上下文,而且需要质量闸门 | Claude Code、Codex、hooks、记忆共享、本地控制台 | 已发布 | 仓库 · 帖子 |
| DeepSeek Harness | DeepSeek AI via @airealitynoslop | 以插件为先的运行框架,让模型、工具、会话、存储和 UI 都可替换 | 构建者想要一个可替换的运行时,而不是固定死的 shell / provider 栈 | Cordis、Node.js、Web UI、插件运行时 | Alpha | 仓库 · 帖子 |
| Hindsight | @Vectorizeio | 带 retain / recall / reflect 行为的跨智能体记忆库 | 智能体会忘记会话历史,也不擅长做带时间感的检索 | 语义搜索、BM25、图谱检索、时序检索、结构化记忆类型 | Beta | 文档 · 帖子 |
| AgentSage | @PatrickToulme | 可回放的编程智能体会话,以及并排对比的 arena | 已经跑完的智能体运行很难被检查、比较或安全地公开 | CLI 捕获、会话回放、脱敏、密钥扫描、多智能体 arena | Alpha | 帖子 |
| OpenCode iOS Client | grapeot via @ivanfenenko | 面向 OpenCode 服务器的原生 iPhone / iPad / Vision Pro 客户端 | 开发者想在离开桌面时也能监控会话、diff 和工具调用 | Swift、iOS/iPadOS/visionOS、SSH tunnel、OpenCode server | Beta | 仓库 · 帖子 |
| Reproducible coding-agent benchmark CLI | @s7rthaks | 在固定仓库状态上运行求解器,再在全新容器里评估补丁 | 团队需要可审计的智能体评估,而不是只信退出码 | Docker、固定 commit、隔离的求解器 / 评估器生命周期 | Alpha | 帖子 |
最强的重复构建模式,并不是“再套一层智能体壳”,而是围绕信任搭脚手架。@charliejhills 分享了(23 个赞、12 条回复、2,555 次浏览)Spec Kit,目的是在写代码之前强制先把需求和任务拆清;@tom_doerr 分享了(4 个赞、1,023 次浏览)Pilot Shell,目的是在 Claude Code 和 Codex 外围加上 PRD/spec/build/fix 通道、TDD 和质量 hooks。@s7rthaks 则补上了(1 个赞、1 条回复、64 次浏览)同一套思路的评估端:不要信求解器输出,而要看全新容器给出的裁决。

第二种构建模式,是围绕同一批底层智能体做出新的操作表面。@Alan_Earn 展示了(24 个赞、10 条回复、370 次浏览、6 次收藏)放在开发服务器前方的 Airship 设计画布,@ctrlnodeai 构建了(3,488 次浏览)带本地 Bridge 的图控制平面,而 @ivanfenenko 分享了(2 个赞、19 次浏览)OpenCode 移动客户端的公开 TestFlight + 仓库路径。@PatrickToulme 则把(11 个赞、10 条回复、1,657 次浏览)AgentSage 定位成智能体会话的可回放视图,而不是另一个单纯让你发 prompt 的地方。


第三种模式,是借模块化基础设施获得可移植性。@googledevs 展示了(153 个赞、10 条回复、17,117 次浏览、66 次收藏)一个基于 Pi 的 Gemma Translator 离线设备,而 @airealitynoslop 强调了(3 个赞、1 条回复、35 次浏览、3 次收藏)DeepSeek Harness,以及 @Vectorizeio 强调了(9 个赞、422 次浏览、5 次收藏)Hindsight——它们都明确把记忆 / 运行时层做成了可替换件。反复触发这些构建的原因,不是原始生成质量不够,而是大家需要能扛住工具更替的封装、观测、路由和验证方式。
6. 新动态与亮点¶
封装约定开始从文档细节,变成可见的产品表面¶
@GoogleCloudTech 发了一条(7 个赞、1 条回复、601 次浏览)极简的 plugin.json 示例,把它作为任何兼容智能体工作区的入口,而公开的 Antigravity 插件文档 说,这个 manifest 可以锚定技能、智能体、MCP 配置、hooks 和规则。这件事之所以值得注意,是因为封装细节通常都藏在文档里;但到了 8 月 13 日,它们已经被拿出来当成一种“前门式”的工作流概念来宣传。

以插件为先的运行框架,正在把模块化推进到工具层之下¶
@airealitynoslop 强调了(3 个赞、1 条回复、35 次浏览、3 次收藏)DeepSeek Harness,它是一个开发者预览运行时,在那里,模型本身和工具、会话、沙箱、存储、循环、调度以及 UI 处在同一类可替换插槽里。公开的 仓库 和 DeepSeek 页面 都把它描述成构建在 Cordis 之上的“万物皆插件”架构。因此,这一天的亮点不只是插件更多了,而是运行框架把智能体核心行为本身也当成可配置基础设施。

今天最强的证明性工件,是一条通过的 GUI 测试轨迹¶
@awakecoding 展示了(8 个赞、3 条回复、467 次浏览)GitHub Copilot 如何通过 ironrdp-agent 打开 Paint、自主测试 IronRDP 的笔输入、画一个笑脸,并用截图确认结果。附带轨迹之所以值得注意,是因为它把规划、执行和验证放进了同一个可见工件里,而不是抽象声称“智能体可以测试软件”。

7. 机会在哪里¶
[+++] 保护隐私的工作历史与记忆治理 —— Computer History 和 Hindsight 都显示出跨会话连续性的强需求,但 OpenAI 文档和回复模式也清楚表明:来源排除、删除控制、可追溯性,以及同意边界,本身就是产品的一部分,而不是可选的政策文案。
[+++] 带显式裁决的可评审编排 —— Spec Kit、Pilot Shell、基准测试 CLI、codeglitch 的评审幻灯片,以及 AgentSage,都在指向同一个缺口:团队需要的是把规划、求解、检查和发布拆成不同阶段,并给每一步挂上证据的流程。
[++] 跨智能体封装与协议工具链 —— Antigravity custom agents、plugin.json、WebStorm ACP 和 DeepSeek Harness,都把可移植性当成了头等需求。这里有空间去做能在 shell、IDE 和提供商之间翻译、验证或管理同一套智能体包的工具。
[++] 围绕编程智能体的可视化、图化和移动控制表面 —— Airship、CTRL NODE 和 OpenCode iOS Client 表明,终端已经不再是智能体式编程工作的唯一严肃界面。这个机会属中等,因为价值已经可见,但产品仍然早期且分散。
[+] 本地优先的边缘构建与离线智能体体验 —— Gemma Translator,以及 Copilot 里的本地模型实验,都说明人们仍然想要能在自己硬件上工作的智能体和模型。这个方向还在浮现,因为案例已经具体,但成本和硬件门槛仍然限制了受众。
8. 要点总结¶
- 记忆已经从仓库上下文,扩展成工作历史捕获。 OpenAI 的 Computer History 发布,把最近的 app 和网站活动变成了智能体可用上下文,甚至还能生成技能建议;Hindsight 则从基础设施侧说明了同样的需求。(source)
- Antigravity 的角色,已经从 custom-agent 功能扩展成封装层。 到了 8 月 13 日,它承载的不只是 custom agents,而是 Gemini 插件、Gemini 3.7 Flash,以及一台离线 Gemma 硬件设备。(source)
- 围绕编程智能体的运行层,正在变得更显式,也更产品化。 Spec Kit、Airship、WebStorm ACP、CTRL NODE、Pilot Shell 和 DeepSeek Harness,都把注意力放在工作如何被结构化、路由和评审,而不是只盯着原始生成。(source)
- 验证和证据,正在成为差异化因素。 benchmark CLI、codeglitch 的评审幻灯片、AgentSage 的回放,以及 IronRDP 的 GUI 测试轨迹,都在尝试让智能体输出变得可检查,而不是只是“看起来像对的”。(source)
- 模型选择,如今已经与分发经济性绑在一起。 Gemini 3.7 Flash 的势头,来自基准提升加上广泛 rollout 和更便宜的工具循环;与此同时,本地模型实验仍然会撞上 VRAM 成本和策略门槛。(source)