跳转至

Twitter AI 编程动态 - 2026-09-15

1. 人们在讨论什么

1.1 Antigravity 正从 Google 的单一界面,转向支持多模型、多扩展的运行时(🡕)

Antigravity 仍是讨论中心,但话题范围已经扩大。antigravity 提及量今天为 37,接近昨日峰值 38;gemini 则升至 31,远高于上周均值 17.9。变化并非来自一次明确的新模型发布,而是一批帖子开始将 Antigravity 视为 Google 混用模型、开放 API、吸引外部开发者的运行时。

@wallstengine 报道称(244 个赞、10 条回复、32,058 次浏览)称,Google 现在允许工程师通过 Antigravity 在公司内部使用 Claude 进行编码工作,但受配额限制;相关链接 Business Insider 文章 则表示,Gemini 仍是主模型,第三方模型用于覆盖专门化场景。@thtbee_ 通读文档并做了总结(34 个赞、6 条回复、3,367 次浏览)将 Antigravity 描述为一个持久化的 Ubuntu 24.04 沙箱,提供代码、文件和网页工具、自定义函数、远程 MCP 支持,以及可恢复的多轮任务;这与 Google 公开的 Antigravity agent 文档 一致。@itsPaulAi 分享了(70 个赞、5 条回复、103 次收藏、6,096 次浏览)介绍 Google 的开源项目 ARTEMIS 仓库,称其可让 Antigravity、Codex 和 Claude Code 驱动真实 Android 设备;该仓库还给出了更具体的范围:6,001 个 star、原生 MCP 集成、日志/截图采集,以及据称超过 99% 的 AndroidWorld 基准成绩。@yashjitpal 构建了(67 个赞、4 条回复、66 次收藏、4,345 次浏览)介绍了 BetterGravity——一个外部 Antigravity 改造层,支持插件、主题、应用内浏览器,以及通过公开的 仓库 实现自带密钥(BYOK)。

@Its_lakshya_ai 发布了(64 个赞、5 条回复、4,655 次浏览)分享了一张显示 models/antigravity-preview-09-2026 的 api-watch 截图。围绕 Gemini 4 的猜测尚未得到证实,应视为传闻;但这张截图本身很重要,因为它让 Antigravity 的 slug 公开可辨,足以支撑文档讨论、逆向工程和生态建设工作。

api-watch 截图,显示 models/antigravity-preview-09-2026 被列为一个新出现的模型条目

讨论洞察: 有价值的回复更偏务实,而非站队。有人在 Google/Claude 那条帖子下回复称,在 Antigravity 中使用 Opus 是一种生产力上的对冲,而不是平台迁移;ARTEMIS 相关回复则澄清,注重隐私的端侧 VLM 仍在路线图中,尚未发布。

与前一日对比: 9 月 14 日,Antigravity 被确立为一个执行载体;到 9 月 15 日,这个叙事进一步延伸,显示 Google 正把这一载体扩展到竞品模型和第三方扩展。

1.2 可靠性、配额和上下文管理,仍是惊艳演示与日常使用之间的落差(🡕)

关于配额和可靠性的抱怨明显升级。quota 提及量升至 31,高于 9 月 14 日的 21,约为上周均值 15.3 的两倍。最强烈的抱怨已不再是笼统的价格焦虑,而是关于容量故障、强制压缩,以及支持渠道无法解释实际情况的具体报告。

@MmuzTW 表示(154 个赞、27 条回复、13,063 次浏览)表示,因反复出现“模型达到容量上限”和“过载”错误、风险控制不透明,以及客服后续跟进悄无声息,他们准备取消 Pro 20x 订阅。@rodydavis 承认了(131 个赞、20 条回复、4,921 次浏览)提到 Antigravity 中 Gemini 3.8 Flash 的一起实时故障,并称问题修复后会重置速率限制。@Soso_fun_yt 发布了(61 个赞、11 条回复、6,783 次浏览)详细批评了 Antigravity 在 harness 层面的上下文策略,认为 256k 的活跃上下文上限和 140k 的压缩阈值浪费了 Gemini 更大的原生窗口,并会在会话中途触发有损的“遗忘循环”。就连变通方案也成了讨论焦点:@MrTacticalX 分享了(5 个赞、34 次浏览)称,Claude Code 的 /low-priority 通道能在五小时限制后继续推进工作,只是速度更慢。

编码代理会话中反复出现“Context automatically compacted”条目,且每次都因“Selected model is at capacity”而失败

讨论洞察: 回复中充满了应对办法,而不是否认问题。人们比较不同套餐,建议把 DeepSeek 作为备用方案,为更严格的上下文限制辩护,认为这是稳定性上的取舍,或分享 /low-priority 这类备用容量路径。这说明问题已经进入成熟阶段:用户已经开始建立应对策略,因为他们并不期待产品界面会完整、如实地呈现实际情况。

与前一日对比: 9 月 14 日,讨论重点是指令和路由开销;到 9 月 15 日,这些问题转化为对容量错误、强制压缩,以及真实工作场景中支持不透明的更强烈愤怒。

1.3 Copilot 正向上延伸到工作跟踪、实时干预和 PR 审查(🡕)

Copilot 的讨论重点不再是模型本身的质量,而是提示框之上的编排界面。copilot 提及量从 9 月 14 日的 23 升至 28;值得注意的更新,集中在如何让任务、提问和审查都留在同一个工作界面中。

@github 宣布了(48 个赞、4 条回复、27,153 次浏览)介绍了 Copilot 应用中的新“我的工作”面板;链接 GitHub 博客文章 补充了具体功能:为进行中/审查中/已完成工作提供内置视图,根据应用中实际操作过的仓库自动限定 repo 范围,以及支持自定义的 GitHub 风格筛选器。@burkeholland 展示了(46 个赞、6 条回复、2,413 次浏览)表示,/ask 可以在 Copilot 代理仍在工作时向其提问;直接回复则澄清,该功能适用于所有模型。@pierceboggan 推出了(29 个赞、3 条回复、3,171 次浏览)介绍了 Copilot 应用中的 Jira 画布,但回复很快指出了可发现性问题和 Jira 数据故障。@VisualStudio 推广了(10 个赞、3,482 次浏览)介绍了无需离开 IDE 即可进行 PR 审查;相关链接 Visual Studio 文章 称,开发者可以审查 diff、添加行内评论、批准/合并,然后通过 #pullrequest 将 PR 上下文带入 Copilot。

讨论洞察: 回复并没有否定这些功能,而是在要求更清晰的入口:更容易发现画布、更便捷地针对选中文本提问、更轻量的应用性能,以及更少的隐藏步骤。

与前一日对比: 9 月 14 日强调路由和供应商选择;到 9 月 15 日,竞争界面上移了一层,开始围绕哪些任务正在进行、能否中断、能否审查,以及哪些环节在等待人工处理展开。

1.4 新的竞争层是控制权:路由旋钮、压缩技巧和更安全的执行边界(🡕)

当天几项最像产品更新的内容,都位于模型本身之上。它们关注谁能控制支出、有多少上下文会送入模型,以及代理处理不可信输入时还剩下哪些边界。

@markfenner 解释了(10 个赞、3 条回复、473 次浏览)称,Copilot Auto 现在可以偏向 Efficiency、Balance 或 Intelligence;相关链接 GitHub 更新日志 确认,这三个选项底层使用的是同一模型池,计费则依据实际选中的模型。@AileLabs 主打(22 个赞、3 条回复、2,123 次浏览)介绍 AILE,将其描述为面向高级模型的低价访问市场;回复很快质疑推理配置是否一致,以及访问权限是否可能被撤销。@0xBoomz 声称(2 个赞、1 条回复、173 次浏览)称,SOMA 的压缩器现在可以将 Copilot 加 DeepSeek V4 Pro 的会话压缩约 15%,高于上线时约 10% 的水平。

Copilot 自动模型选择器,提供 Efficiency、Balance 和 Intelligence 选项

对比图:未压缩的 1000 万 token Copilot 会话,与启用 SOMA 后压缩为 850 万 token 的会话

同样的“控制层”视角也主导了安全讨论。@_orcaman 发布了(33 个赞、10 条回复、1,333 次浏览)介绍了一篇公开的 Accomplish 文章,描述 Codex 的两种沙箱逃逸方式;@gossy_84 总结了(2 条回复、77 次浏览)则讨论了 RoguePilot 通过 GitHub issue 和 PR 实现被动提示注入的路径。@DataScienceDojo 使用了(2 个赞、3 条回复、490 次浏览)借 Docker 网络研讨会讨论串指出,“跳过权限”不是安全模型;代理需要更坚固的运行时边界。

讨论洞察: 积极情绪集中在明确可控的杠杆上:可见的路由选择、可见的 token 节省,以及可见的沙箱机制。消极情绪则集中在不透明的配额,以及仍假定用户会信任隐藏代理行为的工作流上。

与前一日对比: 9 月 14 日已经显示路由正在成为产品界面;到 9 月 15 日,这一概念进一步扩展到压缩中间件、二级访问市场和具体的沙箱设计。


2. 什么让人感到沮丧

不透明的配额和静默压缩,让高级套餐显得不可信

最强烈的挫败感并不是高级编程代理需要付费,而是用户在工作开始后不再信任限制机制。@MmuzTW 描述了(154 个赞、27 条回复、13,063 次浏览)描述了一个体验变差、受容量限制、且无法通过官方渠道解释清楚的 Pro 20x 账户。@Soso_fun_yt 新增了(61 个赞、11 条回复、6,783 次浏览)从技术角度提出了同一问题:模型可能宣传很大的上下文窗口,但 harness 仍能通过激进的压缩策略抹去这一优势。@rodydavis 确认了(131 个赞、20 条回复、4,921 次浏览)提到 Antigravity 中 Gemini 3.8 Flash 的一起实时故障,使这种痛点显得具有系统性,而非个别案例。

私信线程截图,显示一次带有线程 ID 的反馈上传,以及之后一次未获回复的跟进

严重程度为高,因为问题关乎运行层面的信任,而不只是价格。用户觉得自己即使付费获得访问权限,也可能在运行中途被困住,却得不到关于原因的诚实解释。值得构建程度:高。

有用的工作流界面仍然摩擦过大

第二个挫败点是,许多正确的功能确实已经上线,但仍需要用户反复摸索,或依赖过多周边机制。@pierceboggan 展示了(29 个赞、3 条回复、3,171 次浏览)介绍 Copilot 中的 Jira 画布,但回复立即提到无效的 Jira 数据,以及让代理先把该界面打开本身就很别扭。@burkeholland 展示了(46 个赞、6 条回复、2,413 次浏览)表示,/ask 可以有效打断运行,但回复仍希望支持针对选中文本提问,并抱怨应用过于臃肿。@VisualStudio 将其描述为(10 个赞、3,482 次浏览)将 PR 审查与 Copilot 交接整合为一个流程,方向明确,但仍绑定于特定宿主界面。@paolino 认为(7 个赞、363 次浏览)则直接提出反例:简单的 issue 分诊不应要求 2,000 行 agentic YAML 和昂贵模型;一个小型 Ruby action 配合 GPT-5.6-Luna 就能完成。

严重程度为中高,因为需求显然真实存在,但当前方案往往显得过度复杂,或难以发现。值得构建程度:高。

提示注入和沙箱逃逸已从理论变成具体图示与补丁级修复

安全讨论异常具体。@_orcaman 分享了(33 个赞、10 条回复、1,333 次浏览)列出了两种有名称的 Codex 逃逸技术——Overpatch 和 Heapjack,以及修复版本门槛。@gossy_84 展示了(2 条回复、77 次浏览)说明,被动提示注入如何藏在 GitHub issue 的 HTML 注释中,最终仍可能导致 token 外泄。@DataScienceDojo 认为(2 个赞、3 条回复、490 次浏览)指出,“跳过权限”实际上只是加速手段;如果底层没有更强的沙箱,它会扩大影响范围。

示意图显示:GitHub issue 中隐藏的 HTML 注释指令导致 Copilot 读取内部文件并外泄一个 token

安全幻灯片警告称,“skip permissions”会移除审批提示,并扩大对真实文件、凭证和网络的访问范围

安全幻灯片将 Docker 沙箱描述为一个 microVM,拥有自己的 Linux 内核和管理程序边界

严重程度为高,因为这些案例已经具体到可以直接采取行动:明确的利用机制、明确的补丁版本,以及明确的边界主张。值得构建程度:高。

3. 人们希望存在什么

覆盖套餐、模型和溢出路径的透明预算与路由控制

用户显然希望拥有 Copilot 刚刚推出的那种路由旋钮,同时还要配套真实的配额状态和官方认可的溢出通道。@MmuzTW 希望(154 个赞、27 条回复、13,063 次浏览)希望高级套餐不会静默降级;@markfenner 强调了(10 个赞、3 条回复、473 次浏览)体现了明确路由偏好的价值;@MrTacticalX 分享了(5 个赞、34 次浏览)展示了 Claude Code 中的备用容量方案;@AileLabs 主打(22 个赞、3 条回复、2,123 次浏览)则提供了绕开高级模型价格的市场路径。这一需求务实且紧迫。机会:直接。

能展示压缩策略,并允许用户自行权衡取舍的长上下文代理

数据反复表明,开发者想要的不只是更大的理论上下文窗口。他们想知道 harness 何时会压缩、会丢弃什么,以及能否用速度换取连续性。@Soso_fun_yt 制作了(61 个赞、11 条回复、6,783 次浏览)通过 256k 与 1M 的对比明确提出了这一需求;@thtbee_ 展示了(34 个赞、6 条回复、3,367 次浏览)则表明,Antigravity 已经暴露出足够多的运行时结构,可以更诚实地呈现这些信息。@0xBoomz 提供了(2 个赞、1 条回复、173 次浏览)提供了压缩层方案,但更强烈的未满足需求,是让 harness 本身原生具备透明度。机会:直接。

易于中断、检查并可跨任务延续的工作区

Copilot 应用的更新指向一个真实需求:用户希望看到正在进行的工作,在运行中提问,附加 PR 或 issue 上下文,并在之后重新进入同一任务,而无需从头开始。@github 推出了(48 个赞、4 条回复、27,153 次浏览)对应“我的工作”;@burkeholland 演示了(46 个赞、6 条回复、2,413 次浏览)对应 /ask@VisualStudio 展示了(10 个赞、3,482 次浏览)则是 PR 审查与 #pullrequest 交接。在这一技术栈之外,@xunio98 认为(2 条回复、31 次浏览)指出,agentic 编程需要的是运行时,而不是另一个聊天面板,并将 herdr 视为持久化层。这一需求务实且已有部分解决方案,因此机会是竞争性的,而非假设性的。机会:竞争。

默认安全的执行边界,而不是基于信任的“跳过权限”

人们不想永远手动管理审批,但也不希望安全性取决于精心设计提示词。@gossy_84 展示了(2 条回复、77 次浏览)展示了被动提示注入所需的用户可见行为有多么少;@_orcaman 展示了(33 个赞、10 条回复、1,333 次浏览)表明,即使是成熟的编程代理界面,也可能出现真实的逃逸问题;@DataScienceDojo 认为(2 个赞、3 条回复、490 次浏览)则要求更坚固的容器加 microVM 边界。这是一项务实且紧迫的需求。机会:直接。

衡量工具调用耐久性,而不仅是显存占用的本地模型与 harness 匹配

本地模型的话题仍然很容易被过度简化。@akshay_pachaar 展示了(18 个赞、8 条回复、3,799 次浏览)介绍 Magnitude,称其可以分析硬件,并为主流 harness 推荐本地模型;公开的 Magnitude 仓库 则将这一方向转化为具体产品。但回复透露了更深层的需求:人们希望了解长时间运行的工具调用、上下文行为和 harness 稳定性,而不仅是模型能否装入内存。因此,这是一个务实但竞争更激烈的细分方向。机会:竞争。

4. 正在使用的工具与方法

工具 类别 情绪 优势 局限
Google Antigravity 编程代理 / 运行时 (+/-) 持久化的 Ubuntu 沙箱、代码/文件/网页工具、自定义函数、远程 MCP,以及不断扩大的扩展界面(文档@thtbee_@yashjitpal 高负载故障、发布摩擦、140k 压缩问题,以及不透明的配额行为(@rodydavis@Soso_fun_yt@MmuzTW
ARTEMIS 移动自动化 / MCP 桥接 (+) 控制真实 Android 设备、日志和截图采集、与主流编程代理的原生 MCP 集成,以及据称超过 99% 的 AndroidWorld 成绩(仓库@itsPaulAi 目前聚焦 Android;注重隐私的端侧 VLM 仍被描述为路线图功能,尚未发布(@itsPaulAi
GitHub Copilot app 代理工作区 / 任务界面 (+/-) “我的工作”视图、运行期间的 /ask、Jira 画布、自动模型选择,以及通过 #pullrequest 进行 PR 审查交接(GitHub 博客@github@burkeholland@markfennerVisual Studio 博客 可发现性问题、应用臃肿、无效的 Jira 数据,以及计费仍取决于 Auto 实际选中的模型(@pierceboggan@burkehollandCopilot 更新日志
Codex 编程代理 (+/-) 仍然足够强,能够支撑生态移植、官方迁移指南和跨工具自动化技术栈(@LukeParkerDevOpenAI 更新日志仓库 GPT-5.5 退役迫使用户迁移;具体的沙箱逃逸已被公开披露并修复(@CodexReleases@_orcaman
Claude Code 编程代理 (+/-) 仍是多工具比较中的参照点,并提供备用容量 /low-priority 作为后备方案(@MrTacticalX@wallstengine 五小时和每周限制仍然构成约束,且备用通道明确更慢(@MrTacticalX
Magnitude 本地推理 / harness 桥接 (+) 分析硬件、推荐模型,并通过一次设置流程将本地模型接入多个 harness(仓库@akshay_pachaar 长时间运行的工具调用和上下文耐久性仍有待验证,而不仅是硬件适配性(@akshay_pachaar
herdr 运行时 / 多路复用器 (+) 通过状态显示、重连、CLI/socket API 和插件,让代理跨终端和机器持续运行(仓库@xunio98 它改善的是持久化和编排,而不是模型质量,因此依赖底层代理(仓库
AILE 访问市场 (+/-) 通过二级市场提供高级模型的按 token 访问和闲置密钥借用(网站@AileLabs 回复质疑低价是否仍意味着相同的推理配置和稳定的访问权(@AileLabs
SOMA Compressor 压缩中间件 (+/-) 据自身报告,可将 Copilot 加 DeepSeek V4 Pro 的会话从 10M token 降至 8.5M token(@0xBoomz 证据带有厂商宣传性质,数据集中没有其他独立验证(@0xBoomz
Docker microVM sandboxing 安全方法 (+) 将代理安全定义为坚固的运行时边界,包括隔离内核、虚拟机监控器隔离、网络策略和密钥隔离(@DataScienceDojo 目前以教育性指导形式出现,而非主流编程代理产品的默认配置(@DataScienceDojo

总体而言,当工具明确呈现自身取舍时,情绪最好:路由偏好、持久状态、可见工作队列,或清晰的沙箱边界。常见的变通模式,是在模型周围增加另一层,而不是直接更换模型:压缩、更便宜的访问、运行时、本地设置工具,或更小型的工作流封装。

5. 人们正在构建什么

项目 构建者 功能 解决的问题 技术栈 阶段 链接
ARTEMIS Google 将自然语言提示转换为 Android 自动化,用于测试和运维工作流,并通过 MCP 接入编程代理 将编程代理连接到真实设备的移动工作流,而不是止步于代码生成 Python、MCP、ADB、scrcpy、FFmpeg、多模态模型支持 已发布 仓库
BetterGravity @yashjitpal 面向 Antigravity 的开放社区改造平台,支持插件、主题、应用内浏览器/计算机使用和 BYOK 为封闭的默认工作区增加定制、实验和绕过配额的路径 JavaScript、CSS 主题、Antigravity bundle hooks、Discord RPC 已发布 仓库
Magnitude Magnitude(由 @akshay_pachaar 分享) 分析本地硬件、推荐可运行模型,并将它们连接到主流代理 harness 消除代理工作流中配置本地模型的猜测成本 TypeScript CLI、本地推理引擎、模型目录、harness 连接器 已发布 仓库文档
dotnet-opencode @LukeParkerDev / Hona 使用 C# 和 .NET 11 对 OpenCode V2 进行 1:1 移植 为 .NET 团队提供现代代理工作流的原生重实现,而不是封装层 C#、.NET 11、Razor、Blazor、OpenTUI、ASP.NET Core、SQLite、MCP SDK Alpha 仓库
herdr herdrdev(由 @xunio98 分享) 通过状态显示和重连,让编程代理跨终端和机器持续运行的运行时 解决聊天面板忽略的持久化/编排问题 Rust、CLI/socket API、插件、多机器会话状态 已发布 仓库网站
Copilot Triage @paolino 使用缓存的 Copilot 回复进行 issue 分诊的小型 Ruby GitHub Action 用于替代复杂的 agentic 工作流 YAML,处理一种狭窄但常见的自动化任务 Ruby、GitHub Actions、缓存回复、GPT-5.6-Luna 已发布 市场

最明显的构建者模式,是围绕现有代理做扩展和控制,而不是开发新的基础模型。@itsPaulAi 浮现(70 个赞、5 条回复、103 次收藏、6,096 次浏览)介绍了面向既有编程代理的移动自动化桥接;@yashjitpal 转向了(67 个赞、4 条回复、66 次收藏、4,345 次浏览)将 Antigravity 变成改造平台;@akshay_pachaar 将其描述为(18 个赞、8 条回复、3,799 次浏览)将本地推理视为硬件匹配问题;@LukeParkerDev 移植了(42 个赞、4 条回复、1,635 次浏览)将 OpenCode 带入 .NET 生态;@xunio98 认为(2 条回复、31 次浏览)则指出,agentic 编程更需要 herdr 这样的运行时,而不是另一个聊天标签页。

dotnet-opencode 的 .NET 技术栈清单,显示 ASP.NET Core、Razor 和 Blazor 运行于 OpenTUI、SQLite 以及 MCP SDK 之上

即便“越小越好”的阵营,也符合这一模式。@paolino 使用了(7 个赞、363 次浏览)以 Copilot Triage 为例,主张狭窄的自动化任务应保持简单、便宜且易于理解。这仍然是一次控制层押注,只是它通过做减法,而不是增加编排来实现。

6. 新动态与值得关注的内容

GPT-5.5 现在已确定在 Codex 中的退役日期

@CodexReleases 标出了(56 个赞、6 条回复、5,768 次浏览)称,GPT-5.5 将于 10 月 14 日从 ChatGPT、ChatGPT Work 和 Codex 中退役。相关官方 OpenAI 更新日志条目 明确说明了实际影响:对于使用 ChatGPT 登录的 Codex,团队需要在该日期前,将工作区默认设置、自定义代理、计划任务和脚本从 gpt-5.5 迁移到 gpt-5.6-sol

ARTEMIS 可能是目前最清晰的编程代理连接真实设备执行的桥梁之一

@itsPaulAi 浮现(70 个赞、5 条回复、103 次收藏、6,096 次浏览)将 ARTEMIS 介绍为 Google 的开源项目,但真正重要的是仓库本身,而不是宣传声量:6,001 个 star、原生 MCP 集成、日志和截图采集,以及对真实 Android 设备的明确聚焦。这使它不只是又一个代理演示,而是当天最有力的案例之一,展示了代理工具如何离开编辑器,以结构化方式触达外部系统。

Codex 安全讨论已从笼统警告升级为具体漏洞名称和精确补丁版本

@_orcaman 记录了(33 个赞、10 条回复、1,333 次浏览)介绍了 Overpatch 和 Heapjack,以及 Codex CLI 和 Codex Desktop 的修复版本。再结合 @gossy_84 制作(2 条回复、77 次浏览)让 RoguePilot 变得直观可感,以及 @DataScienceDojo 教授(2 个赞、3 条回复、490 次浏览)提出的 microVM 式隔离,结果是一个更广泛的公共转变:安全性已经成为主流编程代理产品评估的一部分。

7. 机会在哪里

** [+++] Truthful quota, routing, and overflow management** — @MmuzTW 报道称(154 个赞、27 条回复、13,063 次浏览)显示了用户对高级套餐限制的不信任;@markfenner 展示了(10 个赞、3 条回复、473 次浏览)显示了用户对明确路由取舍的需求;@AileLabs 暗示(22 个赞、3 条回复、2,123 次浏览)则表明,只要供应商无法满足需求,价格套利层就会出现。

** [+++] Long-context governance and compaction visibility** — @Soso_fun_yt 制作了(61 个赞、11 条回复、6,783 次浏览)让压缩问题变得可量化;@thtbee_ 展示了(34 个赞、6 条回复、3,367 次浏览)说明运行时已经足够明确,可以暴露更多相关状态;@0xBoomz 指出(2 个赞、1 条回复、173 次浏览)则将第三方压缩定位为权宜之计,而非最终答案。

** [+++] Safe execution boundaries for untrusted issues, PRs, and tools** — @gossy_84 展示了(2 条回复、77 次浏览)展示了被动提示注入;@_orcaman 发布了(33 个赞、10 条回复、1,333 次浏览)展示了真实的逃逸路径;@DataScienceDojo 认为(2 个赞、3 条回复、490 次浏览)则表达了对更坚固运行时边界的需求。市场显然已经准备好接受更安全的默认配置。

** [++] Work orchestration that unifies live steering, task tracking, and review** — @github 推出了(48 个赞、4 条回复、27,153 次浏览)对应“我的工作”;@burkeholland 演示了(46 个赞、6 条回复、2,413 次浏览)对应执行期间的实时提问;@VisualStudio 扩展了(10 个赞、3,482 次浏览)则将 PR 审查纳入同一 AI 工作流。跨界面的更清晰方案仍有空间。

** [++] Local-model fit, backend routing, and cheaper fallback lanes** — @akshay_pachaar 将其描述为(18 个赞、8 条回复、3,799 次浏览)将本地设置视为硬件加 harness 问题;@MrTacticalX 分享了(5 个赞、34 次浏览)提供了 Claude Code 的备用容量方案;@AileLabs 主打(22 个赞、3 条回复、2,123 次浏览)则展示了高级访问权限的二级市场。只要工具能帮助开发者更干净地绕开成本和可用性限制,他们显然愿意这样做。

8. 要点

  1. ** Antigravity 越来越被当作运行时,而不是一个神秘的模型名称来评估。** @wallstengine 报道称(244 个赞、10 条回复、32,058 次浏览)关注其中的模型选择,@thtbee_ 梳理了(34 个赞、6 条回复、3,367 次浏览)关注其沙箱/API 行为,@yashjitpal 扩展了(67 个赞、4 条回复、66 次收藏、4,345 次浏览)则关注如何从外部对其进行扩展。
  2. ** 可靠性问题如今是惊艳能力与可信赖的日常使用之间最突出的障碍。** @MmuzTW 描述了(154 个赞、27 条回复、13,063 次浏览)体现了不透明的高级套餐故障,@rodydavis 确认了(131 个赞、20 条回复、4,921 次浏览)体现了 Antigravity 的实时问题,@Soso_fun_yt 解释了(61 个赞、11 条回复、6,783 次浏览)则揭示了引发挫败的上下文策略机制。
  3. ** Copilot 的竞争动作越来越集中在提示框之上的工作流界面。** @github 上线了(48 个赞、4 条回复、27,153 次浏览)对应“我的工作”;@burkeholland 新增了(46 个赞、6 条回复、2,413 次浏览)对应活跃运行期间的 /ask@VisualStudio 展示了(10 个赞、3,482 次浏览)则是 PR 审查与 Copilot 交接。
  4. ** 构建者正集中于封装层、运行时、移植和桥接,而不是新的基础模型。** @itsPaulAi 浮现(70 个赞、5 条回复、103 次收藏、6,096 次浏览)对应 ARTEMIS;@akshay_pachaar 将其定位为(18 个赞、8 条回复、3,799 次浏览)对应 Magnitude;@LukeParkerDev 移植了(42 个赞、4 条回复、1,635 次浏览)对应将 OpenCode 带入 .NET;@xunio98 指出(2 条回复、31 次浏览)则将 herdr 视为这些代理赖以运行的运行时层。
  5. ** 安全性已经成为主流编程代理产品评估的一部分。** @_orcaman 命名为(33 个赞、10 条回复、1,333 次浏览)展示了真实的 Codex 逃逸;@gossy_84 制作了(2 条回复、77 次浏览)让被动提示注入变得易于理解;@DataScienceDojo 认为(2 个赞、3 条回复、490 次浏览)则提出了对 microVM 式隔离模型的需求。