跳转至

Twitter AI Coding - 2026-08-15

1. 人们在讨论什么

1.1 Antigravity 和 Gemini 3.7 Flash 的讨论,继续从展示型演示转向具体工程任务 (🡒)

Antigravity 仍主导着这个话题,但叙事框架更窄、也更偏操作层。最火的帖子不再是泛泛的“什么都能造”,而是生成原生认证界面、编排跨云数据管道、把一款教育游戏从头到尾交付出来这类具体任务。至少有 4 条内容扎实的帖子支撑起这组讨论,而回复又不断把话题拉回回归问题、企业适配性,以及运行框架质量。

@antigravity 展示了(466 个赞、33 条回复、20,991 次浏览、56 次收藏)Gemini 3.7 Flash 在 SwiftUI、React Native、Jetpack Compose 和 Flutter 之间生成原生认证界面。真正有意思的不只是跨框架输出;回复马上就追问,怎样才能避免新功能把原来能用的功能弄坏,以及到底还要配置多少运行框架,这也让一场炫目的演示迅速变成了可靠性讨论。

@antigravity 介绍了(304 个赞、12 条回复、14,552 次浏览、64 次收藏)第二条工作流:Gemini 3.7 Flash 会跨 BigQuery、PostgreSQL 和 Cloud Storage 推理,跑自我修复式的构建与调试循环,并使用原生 PDF 解析。那条讨论串里也出现了更贴近一线实践的细节:一条回复说,自我修复必须有置信度阈值,否则只会更快地自动执行错误修复;另一条则直接要企业版。

@Google 指向了(76 个赞、1 条回复、20,104 次浏览、20 次收藏)一个用 Google AI Studio 和 Antigravity 搭建教育游戏的案例。链接里的 AI_Andrew 讨论串 补上了关键证据:Antigravity 不只是生成代码,它还会去构建、测试、录制演示 GIF 和截图,并把结果推送到 GitHub。

@antigravity 转推了(115 个赞、9 条回复、13,267 次浏览、13 次收藏)一条关于文档和搜索的更新日志。回复让这条更新比普通 changelog 更有用:Antigravity 表示,CLI 现在支持 Gemini API key,也支持自定义 base URL;另一条回复则反馈,企业账号依然看不到 Gemini 3.7 Flash。

讨论要点: 正面信号仍然绑定在具体产出上,但怀疑也始终绑在运行框架上。回复讨论得更多的是回归问题、置信度阈值、企业级封装和账号可用性,而不是基准排名谁高谁低。

与前日对比: 2026-08-14 的信息流更强调网站优化、更广泛的上线,以及跨多个产品入口的炫目演示。到了 2026-08-15,最强的证据则转向更窄、更像生产任务的东西:认证流程、数据管道、文档,以及 CLI 里的 key 配置。

1.2 成本上限和长会话性能,已经成了模型特性,不再只是附注 (🡕)

第二组讨论关注的是:当新鲜感过去之后,一条编程工作流还能不能保持便宜且流畅。人们比较工具时,看的不只是“最强模型”地位,还会看每周重置规则、单任务成本,以及超大会话的使用体验。4 条不同的内容都在推向同一个结论:价格和会话开销,如今已是产品本身的一部分,而不是事后才提一嘴的东西。

@DanDr1s 报告(126 个赞、31 条回复、11,439 次浏览、14 次收藏)说,OpenAI 正在提供付费的 Codex 用量重置:部分每月 200 美元的 Pro 用户会看到 80 美元的完整每周重置,部分 Plus 用户则会看到 8 美元的小额方案。回复最在意的是一个最伤人的细节:兑换重置后,下次每周重置日期似乎会被往后推,所以用户读到的就不是一次善意补量,而是一条定价政策。

@DanDr1s 分享了(78 个赞、7 条回复、2,778 次浏览、10 次收藏)一项基准测试:一段 741 轮、231 MB 的 ChatGPT 和 Codex 对话,加载时间快了 94%,会话渲染器的堆内存增长少了 87.8%,请求数少了 98.2%,加载的对话记录项少了 99.6%。这条主张之所以重要,是因为它正好打中了重度用户已经切身体会到的失败模式:旧的智能体聊天会慢慢变成卡顿的历史档案。

@analogalok 认为(3 个赞、1 条回复、62 次浏览)“单任务成本归零的时代”已经到了,并附上一张图:OpenCode 加 Gemini 3.7 Flash 几乎等于每任务 0.00 美元,DeepSeek 是 0.07 美元,而一些前沿栈还在 6 到 12 美元左右。互动不高,但这张图很有价值,因为它把成本差距直接摊开来看,而不再只是抽象地讨论。

@Av1dlive 声称(11 个赞、8 条回复、434 次浏览、5 次收藏),自己已经把每月 200 美元的 ChatGPT 使用习惯,换成了每月 10 美元的 OpenCode Go,加上一条免费的 DeepSeek Harness 工作流。回复也强调,带证据的图示和可编辑的流程图,比为更贵的默认栈买单更有用。

讨论要点: 回复真正问的不是哪个模型最聪明,而是限制是否公平、长对话还能不能继续好用,以及更便宜的栈是不是已经足够支撑日常工作。

与前日对比: 2026-08-14 已经能看到价格焦虑,但今天它变得更具体了:有结账截图、有确切的重置金额、有会话规模级别的性能数字,也有明确的“我已经换栈了”成本对比。

1.3 工作流脚手架,仍是新杠杆出现的地方 (🡕)

第三个主题把技能、编排、沙箱隔离和可观测性,视为真正有进展的地方。最强的帖子并不是在承诺又一个万能编程助手,而是在把那些脆弱的操作性工作封装进可复用的循环、插件和隔离环境里。贯穿其中的共同模式很简单:要围绕模型定义工作流,而不只是雕琢其中的提示词。

@github 展示了(60 个赞、8 条回复、20,273 次浏览、25 次收藏),GitHub Copilot CLI 和一个社区 Namecheap 技能如何在大约 14 分钟里,把一个 repo 从零带到带自定义域名和 HTTPS 的 GitHub Pages 在线站点。链接里的 GitHub 博客文章 补全了公开机制:启用 Namecheap API 访问、安装技能、让它把停放记录替换成 GitHub Pages 的 DNS 记录、添加 CNAME,并验证结果。

@eptwts (23 个赞、10 条回复、793 次浏览、16 次收藏),在用 vibe coding 做复杂系统时,一个最大的突破口,是让智能体维护一张后端流程的可视化地图,并在代码变化时同步更新。回复又把需求说得更直白:有人说这种技能其实已经有了,也有人说,这张地图会把系统里那些“谁都不记得自己搭过的房间”暴露出来。

@DanKornas 介绍了(7 个赞、2 条回复、770 次浏览)Autoresearch,把它定位成面向 Claude Code、OpenCode 和 OpenAI Codex 的自主迭代技能。公开的 repo 介绍了一套目标—指标—循环工作流:机械验证、回归时回滚、有边界的迭代次数,以及一套 14 条命令的工具箱,而不是漫无边际地反复试错。

@neil_xbt 认为(35 个赞、5 条回复、363 次浏览)OpenSandbox 比又一次模型发布更重要。公开的 OpenSandbox README 也给出了具体的基础设施证据:SDK、CLI、MCP 支持、Docker 和 Kubernetes 运行时、Credential Vault,以及包括 gVisor、Kata Containers 和 Firecracker 在内的强隔离选项。

讨论要点: 连互动不高的小帖子也收敛到同一条规则:人们不想让模型每次都从零即兴发挥。他们要的是打包好的技能、看得见的地图、隔离的运行时,以及能证明自己确实改进了结果的循环。

与前日对比: 2026-08-14 的运行层讨论,重点还在安全默认值、规范和事件模型。到了 2026-08-15,同一层开始变得更容易安装:技能、沙箱、编排循环,以及任务专用自动化。


2. 令人困扰的问题

智能体主导构建中的回归问题与不透明的自我修复

这是当天最火演示下最清晰的高严重度挫败点。在 @antigravity认证界面演示(466 个赞、33 条回复、20,991 次浏览、56 次收藏)的回复里,有用户说,新功能一加,原本能用的功能就会坏掉,并追问到底什么提示词才能避免这种循环。在 @antigravity跨云管道演示(304 个赞、12 条回复、14,552 次浏览、64 次收藏)的回复里,另一位用户则提醒,自我修复必须有置信度阈值,否则只会更快地自动执行错误修复。

人们的应对方式不是“再多信模型一点”,而是给它外面再搭一层脚手架。@eptwts 建议(23 个赞、10 条回复、793 次浏览、16 次收藏)强制智能体维护一张持续更新的后端流程图,这样人就不会对快速变化的生成代码失去把握。这个方向很值得直接做成产品,因为真正的痛点不是把原型跑起来,而是连续改了很多轮之后,项目还能不能保持连贯。

定价和配额政策仍像在跟用户对着干

这也是一个高严重度痛点,因为抱怨都很具体、真金白银,而且来得很快。@DanDr1s 报告(126 个赞、31 条回复、11,439 次浏览、14 次收藏)说,部分 Pro 用户要花 80 美元、部分 Plus 用户要花 8 美元来重置 Codex,而回复集中火力盯住的一点,是“兑换重置后,下次每周重置日期会往后推”这件事。

显示 80 美元 Codex 用量上限重置收费的结账页

在信息流更靠下的位置,人们已经开始直接换栈,而不是等官方把价格讲明白。@analogalok 认为(3 个赞、1 条回复、62 次浏览),当 OpenCode 加 Gemini 3.7 Flash 或 DeepSeek 都能把任务成本压到接近 0 时,做生产的开发者就不该再为前沿模型价格买单;而 @Av1dlive (11 个赞、8 条回复、434 次浏览、5 次收藏),一套 10 美元的 OpenCode 配置,加上免费的 DeepSeek Harness,已经替代了他每月 200 美元的 ChatGPT 习惯。这个方向值得做的前提是,产品要能在积分烧掉前帮助人预测花费,而不是事后才告诉他们发生了什么。

持久化智能体解决了一个痛点,也带来了另一个

持久化确实吸引了注意力,但回复也说明了为什么它仍然只是一个中等严重度的操作层问题。@RoundtableSpace (24 个赞、5 条回复、14,286 次浏览)Grok Bots 描述成一种持久化云电脑,文件和应用都能跨会话保留下来,但回复马上就追问:应用需要更新时怎么办?还有人开玩笑说,当 OAuth 过期,或者弹窗出现在错误的位置时,保存下来的状态就会变成一栋闹鬼的房子。

同一个问题更正式的一版,出现在 @FlowAltDelete 梳理(12 个赞、498 次浏览、5 次收藏)的两种 Microsoft Copilot 运行框架里。图里写得很明确:运行框架在创建时就选定,之后不能迁移。这样一来,有状态工作流确实更有结构,但前期选择也会被锁死。这个方向值得用竞争性产品去做:团队想要持久化,也需要升级路径、重置路径和可见的状态修复。


3. 人们期望的功能

一张能跟上快速变化 AI 生成代码的动态系统地图

最清晰的实际需求,不是更大的模型窗口,而是一张会随着智能体持续修改而保持最新状态的地图。@eptwts (23 个赞、10 条回复、793 次浏览、16 次收藏),复杂 vibe-coded 系统里最有用的突破口,就是一张能自动更新的后端流程可视化图,否则很容易就弄不清智能体到底改了什么。回复没有否定这个判断,反而进一步支持了它:有人说这种打包好的技能已经存在,也有人说,这些地图会暴露出“谁都不记得自己搭过的房间”。

这不是愿景式诉求,而是实际需求。当前的权宜方案,要么是手工画图,要么是事后再叠一层技能。机会:直接。

在会话变贵之前先给出成本预测

人们已经公开在问,能不能在真正押注某条工作流前,先把成本算个大概。@DanDr1s 报告(126 个赞、31 条回复、11,439 次浏览、14 次收藏)说,Codex 现在提供付费重置,但它会怎样影响下一次每周额度又让人一头雾水;与此同时,@analogalok 认为(3 个赞、1 条回复、62 次浏览),单任务成本的分化已经大到,足以让高价默认栈在很多生产任务里显得浪费。@Av1dlive 补上了(11 个赞、8 条回复、434 次浏览、5 次收藏)一个直接的购买行为信号:把每月 200 美元的习惯,换成 10 美元加免费的组合栈。

人们要的不是另一张定价页,而是一种在长时间运行开始前,就能把工作负载形态、可能的 token 消耗、重置规则和模型路由串起来的规划器。机会:直接到竞争激烈。

把工具和说明打包在一起的可移植工作流包

多条帖子都指向同一个操作层愿望:装一个包,就把工具和使用指引一起带进你已经在用的客户端。@github 展示了(60 个赞、8 条回复、20,273 次浏览、25 次收藏)Namecheap 技能如何在 GitHub Copilot CLI 里处理 DNS 工作;而 @cosmicjs 宣布(1 个赞、87 次浏览),Cosmic 的 MCP server 和 Agent Skills 现在可以作为一个 Agent Plugin,一次安装到 Cursor、VS Code、GitHub Copilot 和 Kiro 里。链接里的 Cosmic 文章 把好处说得很明白:一个包同时交付 MCP server,以及教智能体如何使用它的技能。

这是一个既实际、也充满竞争的需求,因为开发者已经在不同客户端之间切换了。他们不想每次都把同一套配置重新拼一遍。机会:竞争激烈。

围绕快速模型的企业级接入与封装

数据里最直白的“希望能有”式表达,不是在 Antigravity 的主帖里,而是在它的回复区。跨云管道演示下面有条回复说,Antigravity “如果有企业版会更好”;更新日志讨论串下面另一条回复则说,即便个人账号已经能用,企业账号依然访问不到 Gemini 3.7 Flash。同一批回复还希望看到 ACP 式或应用级入口,而不是再在分离的 CLI 和 IDE 体验之间来回折腾。

这既实际也紧迫:模型本身也许已经够快了,但可用性、账号权益一致性,以及可部署封装仍然参差不齐。机会:直接到竞争激烈。


4. 使用中的工具与方法

工具 类别 评价 优势 局限
Gemini 3.7 Flash LLM / 编程模型 (+/-) 认证界面生成、跨云管道和端到端游戏构建都跑得动,价格也足够低,适合高频循环使用 仍会被拿去和更强的 Pro 级模型比较;一旦自我修复承诺跑在护栏前面,信任就会下滑
Antigravity 智能体外壳 (+/-) 跨框架输出、管道编排、文档 / 搜索更新,以及 CLI 里的 Gemini API key 支持都很吸睛 用户仍会报告回归问题、额外的运行框架配置、企业账号上线缺口,以及企业级封装需求
GitHub Copilot CLI / App 智能体外壳 (+) 能把 DNS 设置、PR / test 循环和在线站点收尾这类脆弱杂务,变成有引导的工作流 往往依赖额外技能或已连接服务,因此外围封装和模型本身同样重要
Codex / ChatGPT Work 编程助手 (+/-) 公开可见的工作重点,是让超大会话更快、更轻 付费重置和每周上限政策变化,直接引发了反弹
OpenCode CLI 智能体 (+) 日常使用的经济性很有吸引力,多智能体并发成本低,也容易搭配低成本模型 功能完整度和运行框架成熟度,在回复里仍常被质疑
OpenSandbox 沙箱基础设施 (+) 隔离环境、Credential Vault、CLI / SDK / MCP 接口,以及面向编程 CLI 的直接集成都很扎实 今天没有浮现强烈局限;更可能的代价在部署复杂度,而不是能力缺失
Latitude 可观测性 (+) 一行接入追踪、问题分组、语义搜索、回放式验证,以及智能体调度 需要先配置 API key / project,也要求团队愿意先做埋点,之后才有回报
Autoresearch 技能 / 迭代引擎 (+) 目标—指标—循环工作流、机械验证、回滚、受限迭代,以及跨智能体支持 只有在成功可以被清晰度量时才真正有效;有些 hook 护栏仍是 Claude Code 专属
Cosmic Agent Plugin 插件封装 (+) 一次安装就能在 Cursor、VS Code、GitHub Copilot 和 Kiro 里同时获得 MCP 工具和技能 GitHub Copilot 支持还在稳定中,而且这个包还没覆盖 ChatGPT / Codex

条形图,对比 OpenCode、DeepSeek、Claude、GPT-5.6 等编程模型组合的单任务成本

示意图,对比 Microsoft Copilot Studio 的标准运行框架与一个结果导向的 GitHub Copilot 运行框架

整体满意度更偏向那些能减少成本、配置或验证摩擦的工具。只要某个产品能让智能体工作更便宜、更容易安装、更可观测,或者更有结构,用户就会给出正面反馈;一旦同样的工具把定价政策藏起来、把原本能用的代码弄坏,或者让太多状态保持隐形,情绪就会转向负面。

最清晰的权宜方案,是把工作路由到更便宜的模型栈、加上验证循环,并把说明和工具一起打包,而不是靠记忆硬撑。迁移路径也很明确:从昂贵的前沿模型默认栈,转向 OpenCode 加 DeepSeek 或 Gemini 这类组合;从手工修改配置,转向技能、插件和编排器。

竞争态势越来越拼封装,而不是模型身份本身。Gemini 3.7 Flash 之所以反复出现,是因为 Antigravity 把它包进了具体演示里;GitHub Copilot 之所以反复出现,是因为它交付了真实的操作性工作流;而 OpenSandbox、Latitude 和 Autoresearch 这类基础设施项目受到关注,则是因为它们能让你选定的任何模型表现得更好。


5. 人们在构建什么

项目 构建者 功能 解决的问题 技术栈 阶段 链接
OpenSandbox opensandbox-group 面向 AI 应用和编程智能体的通用沙箱平台 智能体需要隔离执行、凭据处理和运行时控制,同时又不想替换现有 CLI 多语言 SDK、CLI、MCP、Docker、Kubernetes、gVisor、Kata Containers、Firecracker、Credential Vault 已发布 repo
Autoresearch uditgoenka 围绕可度量目标循环迭代、并能回退坏改动的自主技能 只有“改进一下”这类模糊提示,却没有证据或回滚 Claude Code / OpenCode / Codex 技能、git、验证循环、hooks 已发布 repo
Latitude latitude-dev 面向 AI 智能体的可观测性与修复平台 团队在没有追踪可见性或失败分组的情况下上线智能体 遥测 SDK、会话、工具调用可观测性、MCP、CLI、智能体调度 已发布 repo
Anthropic Cybersecurity Skills mukul975 面向编程智能体的结构化安全技能库 通用智能体缺少资深分析师级别的安全工作流 agentskills.io、817 个技能、29 个领域、6 个框架映射、多智能体兼容性 已发布 repo
AgentBar dannypostma 用于监控实时编程智能体会话的 macOS 菜单栏工具 很难看出哪个本地智能体会话需要关注 Swift / macOS app、本地会话轮询、Claude Code / Grok / Codex hooks 已发布 repo
SP Permissions Explorer Aimery Thomas 用于交互式访问审查和受控写入的 SharePoint Copilot app 纯文本 Copilot 回答不适合做权限管理 SPFx 1.24、React 17、SharePoint REST、Microsoft 365 Copilot、Heft Beta repo
Cosmic Agent Plugin Cosmic JS 跨编辑器分发 MCP 工具与技能的便携包 每个客户端都要重复配置 MCP 和技能 Agent Plugins spec、MCP、打包技能、带凭据与注册流程的 server 模式 已发布 repo, blog

@neil_xbt 重点提到(35 个赞、5 条回复、363 次浏览)OpenSandbox,把它当成基础设施,而不是又一个助手外壳。公开仓库也证明了它为什么重要:它并不要求团队放弃 Claude Code、Cursor、Codex 或 Gemini CLI,而是给这些工具底下补上隔离运行时、CLI 和 MCP 入口、安全凭据注入,以及更强的隔离边界。

OpenSandbox 信息图,展示其上线拿到 13k star,以及支持编程智能体、GUI 智能体、评估、代码执行和安全运行时

@DanKornas 介绍了(7 个赞、2 条回复、770 次浏览)Autoresearch,把它当成处理重复改进工作的技能,而不是一次性提示词。公开仓库给出的核心区别在流程上:先定义目标、测量基线、做一处改动、机械验证,如果指标变差就回滚。这让它更像智能体工作的工作流引擎,而不只是提示词库。

Autoresearch README 截图,展示目标—指标—循环工作流,以及 plan、debug、fix、secure、ship 和回归检查命令矩阵

@gideonxqt (13 个赞、4 条回复、93 次浏览、9 次收藏)Latitude 形容成“开源版 Sentry,不过是给 AI 智能体用的”,而公开的 Latitude README 也用追踪、问题分组、语义搜索、智能体调度和回放式验证支撑了这个说法。@MAXdeg0 带出了(42 个赞、23 条回复、1,398 次浏览、18 次收藏)另一层完全不同的东西:Anthropic Cybersecurity Skills,一个大型的结构化技能库。它给智能体的是领域化流程,而不是把安全工作完全交给它临场即兴发挥。

较小的工具也指向同一个方向。@joelmoss 贴出了(1 个赞、43 次浏览)AgentBar 这个本地会话感知工具,@schneika 指向了(3 个赞、31 次浏览、3 次收藏)SP Permissions Explorer 这个带护栏的 Copilot 管理界面,而 @cosmicjs 则把(1 个赞、87 次浏览)MCP 和技能打包成了一次插件安装。反复出现的构建模式已经很清楚:人们并不是在争先发布新的基础模型,而是在构建聚焦的运行层,让现有智能体变得更安全、更可观测、更可移植,或更贴近具体任务。


6. 新动态与亮点

OpenAI 同时把长 Codex 会话背后的价格和优化工作摆到了台前

两条不同的推文,把同一套底层系统一下子照亮了。@DanDr1s 报告(126 个赞、31 条回复、11,439 次浏览、14 次收藏)了付费 Codex 用量重置,以及它对下一次每周额度造成的令人困惑的影响;同一个账号又分享了(78 个赞、7 条回复、2,778 次浏览、10 次收藏)一项基准测试,目标是让一段 741 轮、231 MB 的 ChatGPT 和 Codex 对话显著变轻。两者合在一起,让会话经济性从两个方向都变得可读:重度用户大概要花多少钱,以及为了让超大会话继续可用,基础设施团队到底投入了多少优化工作。

基准测试截图,展示一段 741 轮 ChatGPT 和 Codex 对话里,更快的加载时间以及更低的内存 / 请求数量

社区技能已经开始接管真实的运维杂务

最值得注意的封装信号,是公开技能已经在处理开发者平时最怕碰的工作,而不只是帮忙写提示词。@github 展示了(60 个赞、8 条回复、20,273 次浏览、25 次收藏)一个社区 Namecheap 技能,如何给 GitHub Pages 接上自定义域名 DNS;而 @cosmicjs 宣布(1 个赞、87 次浏览)了一个插件包,能在多个客户端里同时交付 MCP 工具,以及使用这些工具所需的技能。这很重要,因为它让技能从可复用的提示词片段,变成了可安装的运维能力层。


7. 机会在哪里

[+++] 防回归的智能体脚手架 —— 当天最强的证据,一边是大家对具体智能体产出的热情,另一边则是对第 6 次、第 10 次改动后会发生什么的焦虑。Antigravity 的回复里有人说,新改动会把原本能用的功能弄坏;跨云管道讨论串要求给自我修复加上置信度阈值;eptwts 则主张要有动态系统地图。OpenSandbox、Latitude 和 Autoresearch 指向的是同一个切口:产品要能让长时间运行的智能体工作可观测、可验证,并在跑偏时容易恢复。

[++] 花费与配额编排 —— 付费 Codex 重置、单任务成本图,以及明确从 ChatGPT 切到 OpenCode 加 DeepSeek 或 Gemini 的案例,都说明人们已经开始按经济性路由工作。这里有价值的产品,会在执行前估算大致花费,自动选择更便宜但够用的路径,并在工作流即将跨入高成本区间或踩中重置规则陷阱时发出警告。

[+] 可移植的运维技能包 —— GitHub 的 Namecheap 工作流、Cosmic 的插件包、SP Permissions Explorer 和 AgentBar 都说明,市场愿意为窄而深的包买单:它们能把重复性杂务变成可安装的智能体能力。正在浮现的机会,不是再做一个通用助手,而是做体积小、可移植、能把工具、说明和护栏一起带上的工作流产品。


8. 要点总结

  1. 具体工程任务,比抽象的 AI 编程炒作更能打动人。 当天互动最高的是 Antigravity 关于原生认证界面和跨云管道的演示,不是泛泛的“智能体未来”宣言。(认证界面)
  2. 如今左右产品观感的,不只是原始能力,还有会话经济性。 围绕 Codex 重置的定价摩擦,以及对超大会话性能的公开优化,都成了重要信号,因为重度用户会把成本和可用性放在一起评估。(付费重置)
  3. 构建者最强的精力,正在投向智能体外围的运行层。 OpenSandbox、Latitude、Autoresearch 和 Anthropic Cybersecurity Skills 都是在现有模型外壳之下补上隔离、可观测性、验证或领域知识,而不是替代它们。(OpenSandbox)
  4. 可安装的技能和插件,开始接手那些脆弱的操作性工作。 GitHub Pages 的 Namecheap 技能,以及 Cosmic 的 Agent Plugin,都说明把工具和说明一起打包,正在变成一个独立的产品类别。(GitHub Copilot CLI + Namecheap)