Twitter AI 编程 - 2026-07-14¶
1. 人们在讨论什么¶
1.1 智能体工作开始具备实时交接和运行中检查 (🡒)¶
最具体的发布,都围绕如何监督已经在运行的工作,而不是再开一个聊天窗口。GitHub 把远程 Copilot CLI 会话接进了 Mobile 通知,还在 Copilot app 里加上了针对当前改动的安全审查。Antigravity 的团队命令依然很显眼,但回复区也在质疑这次宣布到底有多新。
@github 宣布 了 GitHub Mobile 对远程 Copilot CLI 会话的实时通知(66 点赞、4 回复、30,371 浏览量):包括进度、需要输入时的提示,以及返回会话日志的入口。配图展示了预期中的介入点:手机上会弹出一个远程 “Fix authentication bug” 任务的通知,并明确标记为 “Needs input”。

@GHchangelog 发布 了 Copilot app 里处于公开预览阶段的 /security-review(12 点赞、1 回复、2,079 浏览量)。GitHub 表示,这个命令会针对当前变更审查高置信度问题,并给出严重程度与置信度,覆盖注入、XSS、不安全数据处理、路径遍历和弱加密等类别,同时补充现有的代码与密钥扫描。
@testingcatalog 重点提到 了 Antigravity 的 /teamwork-preview(274 点赞、13 回复、23,844 浏览量);被引用的官方帖子把它描述为并行规划、构建和验证。截图确认这已经是一个一等团队命令,但有人在回复里说自己几个月前就用过,所以现有证据支持的是它现在变得更显眼,而不是一个可以确信的全新能力。

讨论要点: 有价值的张力不在于大家反不反对智能体,而在于人们能在哪些地方观察并介入。Antigravity 的回复质疑的是发布表述,而 GitHub 的 Mobile UI 则把 “needs input” 明确做成了一个控制状态。
与前日对比: 前一天对智能体团队运作的关注仍在延续,但证据已经转向更面向用户的监督界面:手机通知,以及编辑器内的安全检查。
1.2 团队正在把模型编排成不同角色,而不是只选一个赢家 (🡕)¶
实践者把模型选型描述成一个任务路由问题。一条一手经验说,更小的模型适合基础和中等难度工作;另一条则在自定义扩展里,把规划、开发和审查分给不同智能体。
@burkeholland 表示,自己在 GitHub Copilot 里用 GPT-5.6 Luna 做了不少实事,包括 UI 工作(57 点赞、10 回复、3,715 浏览量),而他原本以为自己早就不需要更小的模型了。配图里的 Copilot 界面展示了一个改主题任务:先做计划和文件搜索,再列出变更文件数量,最后给出渲染预览。作者后来也把这种好评收窄到了基础和中等难度任务。一条回复补充说,更高的推理强度会抹掉它在速度和成本上的优势;另一条则强调,累计下来的对话记录和项目上下文同样会影响选择。

@davis7 描述了 一个自定义 Pi 扩展(23 点赞、4 回复、554 浏览量):其中一个 Claude Code 子智能体负责研究 API 设计,一个 Codex 子智能体负责开发,另一个 Claude Code 子智能体再负责从简洁性和正确性角度做审查。作者称 dynamic-workflows 这一层还不够打磨,可能还需要桌面应用;这也把一个已经能工作的个人流程,和一个真正成熟的产品区分开了。
讨论要点: Luna 这条讨论支持的结论,比“小模型正在取代前沿模型”要窄得多:人们确实会为了日常工作用它,但最终选择仍由上下文连续性、推理设置和价格共同决定。
与前日对比: 昨天的重点是并行编排,而今天新增的最强细节,是不同模型支持的智能体之间开始出现明确的角色分工。
1.3 产品收敛正在制造导航与连续性问题 (🡕)¶
当天还暴露出了一个产品设计代价:把聊天、编程和自主工作折叠进同一个界面,不是没有成本。这不是抽象的品牌抱怨;回复里点名了移动端和桌面端行为不同,也点名了项目或历史记录无法在模式间顺畅移动。
@emollick 对比了 Claude 的 Home / Code 和 Chat / Cowork 选择,与 OpenAI 的 ChatGPT Work / Codex 分拆(99 点赞、18 回复、7,321 浏览量),并指出网站本身又是另一套。回复里,@simonw 说,移动端的 Chat 和 Work 差异是实质性的,而桌面端 Codex 和 Work 的差别更偏表面;另一条回复则说,在一种模式里创建的 Projects 不会出现在另一种模式里。也有一位 Claude Cowork web-beta 用户给出反例,说它的网页和桌面 UI 是一致的。
@signulll 认为,把 Codex / “ChatGPT Work” 折进 ChatGPT,是一个聪明的分发动作(80 点赞、14 回复、8,020 浏览量)。回复则分成两派:有人为合并辩护,认为这一步有必要;也有人说,这样会丢失聊天历史,让只想聊天的体验变差。
讨论要点: 分发和易用性正在朝相反方向拉扯。回复区支持的,是从聊天顺畅交接到工作;但并不支持用会遮住历史或资产的模式边界来换取这种分发。
2. 令人困扰的问题¶
工作模式碎片化,以及连续性丢失¶
严重程度:中。用户主要抱怨的,并不是聊天和智能体工作共存在一起,而是他们无法预测某个能力以及它的历史到底该归在哪个界面。@emollick 记录 了不同产品和界面里相互冲突的 Home、Code、Chat、Cowork、Work 和 Codex 标签(99 点赞、18 回复、7,321 浏览量);回复则描述了移动端存在实质性差异,以及项目会被模式切开。@signulll 把 Codex / ChatGPT 的整合界定成一次分发动作(80 点赞、14 回复、8,020 浏览量),但也有回复说这样会丢失聊天历史,让纯聊天用法更糟。讨论里能看到的应对方式,是尽量留在那个还能保住任务上下文的界面里;目前没有证据表明,已经存在一个完整的跨模式解决方案。这个方向值得做,因为它影响的是任务发现和连续性,而不只是偏好。
强大的浏览器上下文,也带来了明确的信任边界¶
严重程度:高。@PablitoPool 分享了 一个 OpenCode 桥接器(689 浏览量、3 收藏),它可以访问真实 Chrome 配置文件中的标签页、会话、历史记录、书签、截图、页面文本以及 Chrome DevTools Protocol。它的 README 采用本地原生消息宿主和可轮换的 bearer token,但也明确警告:因为它访问的是真实配置文件而不是隔离浏览器,所以只能在可信的本地工作流里使用。眼下真正的空缺,是围绕已登录浏览器上下文,提供安全、可检查的委派。这个方向值得做,因为在当前设计里,便利和暴露是绑在一起的。
在模型路由不断变化时,用量限制仍然很难推断¶
严重程度:中。@burkeholland 的 Luna 帖子(57 点赞、10 回复、3,715 浏览量)下,有一条回复说,自己在另一个模型下把重置次数耗尽后,后来又拿到了 3 次额外重置;另一个回复者则认为,更高的推理强度会让 Luna 变慢,而且也不会便宜太多。@jumperz 表示(12 点赞、5 回复、695 浏览量),自从 GPT-5.6 发布以来,Codex 限额已经被反复重置;但这仍只是单个用户的观察,而不是经过验证的产品政策。讨论里可见的权宜方案,是手动盯着重置次数,并切换模型或推理设置。这个方向值得做,目标是做出透明的、跨模型的预算和重置可见性。
3. 人们期望的功能¶
一条从聊天延伸到自主工作的连续工作空间¶
这些讨论串里没有出现正式的功能请求,但它们共同展示了一个很实际的需求:先从对话开始,把任务交给系统去做,监督执行过程,再回到原处,而且不能丢历史和资产。@emollick 暴露 了 Chat、Work、Codex、Home、Code 和 Cowork 之间让人困惑的重叠(99 点赞、18 回复、7,321 浏览量),而一条回复则说 Projects 会被不同模式拆开。@github 增加了 针对远程 Copilot CLI 会话的移动端介入(66 点赞、4 回复、30,371 浏览量),这只是那个生命周期里的一个环节。对需要跑长任务的用户来说,这个需求既务实又紧迫;眼下已经有一些局部答案,但还没有一个横跨所有界面的统一连续性模型。机会:直接。
带作用域权限的可复用智能体能力¶
供给侧最强的回应,是可复用的技能、插件和桥接器,但它们的权限边界仍然各自为政。@koruneko32767 提到 了 Microsoft 的 Power Platform skills marketplace(215 浏览量、2 收藏),它的插件覆盖多种开发界面,也记录了更安全的允许列表做法以及更宽松的自动批准。@PablitoPool 分享 的浏览器桥接器(689 浏览量、3 收藏)能保留会话上下文,但也明确警告只能在本地可信环境中使用。这里真正缺的,是那些在运行前就能说明自己会接触哪些文件、服务和浏览器状态的可移植能力。机会:竞争激烈。
清晰的预算与推理模式控制¶
Luna 那组讨论说明,更便宜、更小的模型确实可能有价值,但这种价值会随着推理强度、项目上下文和重置可用性而改变。@burkeholland 报告 了它在 UI 和日常工作上的正面效果(57 点赞、10 回复、3,715 浏览量),而回复又补进了成本和上下文连续性的保留条件。讨论串里还有人说自己意外收到了额外重置。更实际的需求,是在任务开始前,就看到模型选择、推理设置、预期预算和剩余额度;现有证据里能看到的,仍然只是手动观察,而不是这样的统一控制层。机会:直接。
4. 使用中的工具与方法¶
| 工具 | 类别 | 评价 | 优势 | 局限 |
|---|---|---|---|---|
| Copilot CLI + GitHub Mobile | 智能体 CLI 与移动端监督 | (+) | 实时手机通知、进度、需要输入提醒,以及返回会话日志的路径 | 这次发布解决的是监督,不是跨界面的完整任务连续性 |
Copilot app /security-review |
编辑器内安全审查 | (+) | 针对当前变更给出高置信度问题、严重程度 / 置信度,以及可执行修复 | 仍处于公开预览;重点是安全审查,而不是更广泛的代码质量 |
| GPT-5.6 Luna in GitHub Copilot | 编程模型 | (+/-) | 一手经验表明,它在基础 / 中等难度和 UI 工作上很快 | 更高的推理强度会缩小它在速度 / 成本上的优势;既有上下文也会影响切换成本 |
| Pi extension | 多智能体编排 | (+/-) | 在 Pi、Claude Code 和 Codex 之间路由研究、开发与审查 | 个人扩展;作者称工作流还没打磨成熟,TUI 限制仍在 |
| Power Platform skills | 插件市场 | (+) | 官方可复用技能、智能体和命令,覆盖 Power Platform 工作负载 | 权限配置仍然关键;大范围自动批准会授予机器级访问权限 |
| OpenCode Chrome Bridge | 浏览器控制桥接器 | (+/-) | 通过扩展和本地桥接器访问真实配置文件的标签页、会话、历史记录、截图和 CDP | 会触及已登录浏览器上下文;README 把安全使用限制在可信的本地工作流 |
| Supabase + Vercel + Claude Code | 生产应用工作流 | (+) | PR 预览、预览数据库、共享数据,以及一套可重复的非工程师构建栈 | 想要既快又安全,仍然需要专门设计过的工作流 |
满意度从更多可观察控制界面的正面证据,一路延伸到对权限、成本和 UI 碎片化的警惕。迁移模式并不是简单地从一个厂商切到另一个厂商:@davis7 会把 不同智能体分别用于研究、开发和审查(23 点赞、4 回复、554 浏览量);@burkeholland 则会把 更小的模型用于那些过去默认要用更大模型的工作(57 点赞、10 回复、3,715 浏览量)。常见的权宜方案是角色路由、手动跟踪重置次数,以及尽量把工作留在那个还能保住上下文的界面里。
5. 人们在构建什么¶
| 项目 | 构建者 | 功能 | 解决的问题 | 技术栈 | 阶段 | 链接 |
|---|---|---|---|---|---|---|
| Expert AI Developer Skills | @jggomezt | 面向编程智能体的可复用技能、行为规则、SDLC 工作流、sidecar 组件和后端插件 | 让质量闸门、测试规则、分支安全和安全检查可以复用,而不是每次重新提示 | Markdown skills / rules / workflows;Python 后端;MCP 集成 | 已发布 | 仓库 |
| Power Platform Skills | Microsoft | 面向构建 Power Platform 应用和自动化的智能体插件市场 | 为受支持的企业工作负载提供面向任务的技能和命令 | React、TypeScript、Vite、Expo、Node.js、PAC CLI、MCP | 已发布 | 仓库 |
| OpenCode Chrome Bridge | @PablitoPool | 让 OpenCode 通过本地桥接器控制真实 Chrome 配置文件 | 保留已登录浏览器上下文,而不是在无头会话里重建它 | Chrome MV3 扩展、Node.js 原生宿主、本地 HTTP 桥接器、OpenCode 插件、CDP | 已发布 | 仓库 |
| Pi multi-agent extension | @davis7 | 一个由 Pi 主导、会调用 Claude Code 和 Codex 子智能体分工协作的系统 | 在一条工作流里协调研究、开发和审查 | Pi、Claude Code、Codex、Effect v4 | Alpha | 作者 |
Copilot app /security-review |
GitHub | 审查未提交 / 尚在编辑的变更,找出高置信度安全问题 | 把一类聚焦的漏洞检查提前到编程循环里 | GitHub Copilot app | Beta | 发布说明 |
这些项目有一个共同的构建模式:围绕现有智能体打包一种运营能力,而不是替换智能体本身。@jggomezt 展示 的是一整套技能、规则、工作流和 sidecar 组件(2 点赞、2 回复、75 浏览量);@koruneko32767 分享 的则是一个官方市场,把同样的思路映射到 Power Platform 任务上(215 浏览量、2 收藏)。Chrome 桥接器属于另一种、但相邻的回应:它提供的是智能体原本缺少的有状态外部上下文,而它自己的警告,也让信任边界成了产品的一部分。
生产级参考案例则是 delight.ai 的工作流:案例研究称,20–25 个 Supabase 项目支撑着 200 多个应用,依靠的是 Claude Code 提交的 PR、Vercel 预览、Supabase 预览数据库,以及一个共享的 Prisma 单体仓库。@supabase 表示,这套配置让这家 220 人公司的团队可以持续发货,而不必把工程师从核心产品上拉走(6 点赞、2 回复、804 浏览量);案例研究还提到,是一位 AI 工程师搭起了那层安全与一致性机制。
6. 新动态与亮点¶
活跃编程界面内的安全审查¶
@GHchangelog 宣布,GitHub Copilot app 的 /security-review 已进入公开预览(12 点赞、1 回复、2,079 浏览量)。它的发布说明写明,这个功能会针对当前变更给出高置信度问题、严重程度与置信度、可执行修复,以及聚焦式检查。它之所以值得注意,是因为这把一种面向安全的智能体能力,变成了代码真正落地前的一次按需检查。
面向远程 CLI 工作的移动端介入¶
@github 宣布,GitHub Mobile 现在可以提醒用户远程 Copilot CLI 的进度和所需输入,然后再把他们带回日志(66 点赞、4 回复、30,371 浏览量)。图里的 “Needs input” 通知,把这个产品说法具体化了:即便是异步工作,也依然会有明确要求人类注意力介入的时点。
7. 机会在哪里¶
[+++] 跨界面的任务连续性 —— 组合起来看,这些证据显示出聊天 / 工作模式混乱、资产可能无法跨模式流动,以及新的手机级介入点。一个如果能在聊天、桌面、远程会话和移动端之间保住任务历史、工件、权限和审批的产品,就能直接击中当前的运营需求。
[++] 带权限的上下文桥 —— OpenCode Chrome Bridge 证明,人们确实想用实时浏览器会话;而它自己的“仅限可信本地环境”警告也说明,已登录状态必须配上可检查的作用域、可见的访问日志和可撤销能力。可复用技能市场则在另一侧强化了同样的需求:工具权限必须显式化。
[++] 模型路由与预算遥测 —— Luna 这条讨论,以及 Pi 那套角色路由工作流,都说明团队选模型时看的是任务角色、推理级别、已有上下文、速度和成本,而不是某一个基准测试。一个能在智能体启动前先估算并强制执行这些取舍的控制层,会直接回应重置次数和可见性焦虑。
[+] 面向非工程师构建者的生产级护栏 —— delight.ai 的案例,把高速的 AI 辅助构建和 PR 预览、预览数据库、共享数据以及由工程团队设计的工作流绑在了一起。这里的机会,是把这类护栏打包出来,卖给那些想增加构建者人数、但又不想放开生产权限的团队。
8. 要点总结¶
- 眼下最清晰的前沿,不是启动智能体工作,而是监督它。 GitHub Mobile 现在会提示远程 CLI 进度和卡住的输入,Copilot app 里也出现了针对当前改动的安全审查。@github 宣布 了前者(66 点赞、4 回复、30,371 浏览量);@GHchangelog 宣布 了后者(12 点赞、1 回复、2,079 浏览量)。
- 多智能体实践正在变成角色路由。 一套自定义 Pi 工作流把研究和审查交给 Claude Code,把开发交给 Codex;与此同时,一位 Copilot 用户则表示,更小的模型已经能处理 UI 和日常任务。@davis7 描述 了前者(23 点赞、4 回复、554 浏览量);@burkeholland 报告 了后者(57 点赞、10 回复、3,715 浏览量)。
- 上下文连续性现在已经是产品约束。 关于 ChatGPT / Codex 和 Claude 界面的回复,明确提到移动端行为差异、项目被模式切开,以及聊天历史丢失。@emollick 对比了 这些界面(99 点赞、18 回复、7,321 浏览量);@signulll 则认为 这种整合是分发动作(80 点赞、14 回复、8,020 浏览量)。
- 构建者正在给智能体外面再包一层工作流。 公开项目提供了技能、市场插件、浏览器上下文和审查检查;而最强的生产案例,则把预览环境和共享数据也并进了同一条模型辅助工作流。@jggomezt 展示 了前者(2 点赞、2 回复、75 浏览量);@supabase 报告 了后者(6 点赞、2 回复、804 浏览量)。