Twitter AI Agent - 2026-08-07¶
1. 人们在讨论什么¶
1.1 运行时词汇正在变成公开课程体系 (🡕)¶
相比 8 月 6 日更偏理论的控制面讨论,8 月 7 日把同样的想法重新包装成海报、课程讨论串和框架选型速查表。主导性问题不再是循环、图和运行框架是否重要,而是边界该怎么画、每一层该在什么时候选,以及怎样把这套栈教给新人。
@Nekt_0 认为(44 个赞、11 条回复、890 次浏览、33 次收藏),一个提示词只会给出一个答案,但一个循环会给出一个系统。配图之所以重要,是因为它把当天重复最多的论点压缩到了一页里:目标、上下文、行动、评估和记忆,建立在彼此分离的循环、图和运行框架职责之上,最后落在那句“优化的是机器,而不是句子”。

@rohit4verse 把(21 个赞、9 条回复、2,490 次浏览、32 次收藏)Sydney Runkle 的 LangChain 材料重新组织成一份关于 runtime、framework 与 harness 的决策指南。这组 4 张图异常具体:它把 Deep Agents 映射到完整的 harness 层,把 LangChain 映射到循环式 framework 层,把 LangGraph 映射到 runtime 层,然后说明何时确定性比智能体性更重要,以及三者如何仍然能组合进同一套栈里。




@elune0x 把(29 个赞、6 条回复、2,179 次浏览、29 次收藏)这套拆分推进得更远,认为生产级智能体需要回答 3 个不同问题:执行是否继续、下一步该去哪里,以及它可以改什么。最有用的一条回复来自另一位构建者,他把这三件事分别对应到循环日志、路由日志和权限闸门日志,从而把抽象分类学变成了可操作的调试模式。
@rvaniaaaa 分享了(14 个赞、1 条回复、209 次浏览、11 次收藏)一张单页图工程海报,把同样的词汇翻成工作流形状:扇出、归约、验证、综合,然后在两轮无新信息后停止。它还加入了具体失败模式,比如上下文塌缩、伪独立,以及静默节点故障。

@RoundtableSpace 推广了(77 个赞、14 条回复、48,318 次浏览、49 次收藏)一种“Google 放出了一个 2 小时课程”的说法,把图、循环和提示工程打包在一起;而一条回复立刻纠正来源,指出这套课程是社区制作的,并非 Google 官方发布。@unicodef1wn 放大了(49 个赞、13 条回复、695 次浏览、38 次收藏)另一份 2 小时拆解,包含持久记忆、可复用技能、token 浪费和并行智能体章节,说明运行时词汇已经多快地变成了可售卖的课程内容。
讨论要点: 最强的回复不是怀疑这些概念本身,而是担心误分类和误用。人们在纠正来源归属、提醒不要把三层架构套到简单脚本上,并要求每一层都给出明确日志。这说明这个领域争论的是操作边界,而不是基础概念。
与前日对比: 8 月 6 日把循环、图和运行框架确立为运行时可靠性的语言;8 月 7 日则把这种语言变成了海报、课程讨论串和框架选择启发式。
1.2 发现、信誉与支付被展示成一个统一的 marketplace 循环 (🡕)¶
marketplace 不再像模糊的智能体经济修辞,而开始呈现出明确缺失的表面:无密钥发现、服务排序、智能体身份、可验证推理,以及链上雇佣场所。最强的帖子不只是庆祝 marketplace,而是明确指出,在智能体能花钱或执行动作之前,哪些东西必须可查询、可审计。
@jerallaire 转发放大了(240 个赞、30 条回复、16,703 次浏览、25 次收藏)Circle 新的智能体服务发现层。Circle 的发行说明补充了具体机制:一个公开、无密钥的 Discovery API——GET https://api.circle.com/v2/x402/discovery/resources, 14 个查询参数,以及 900 多个经过制裁筛查和健康检查的服务。回复比掌声更有价值:一位构建者说,发现并没有解决身份、协商、凭证、记忆和执行;另一位则说,排序和信誉很重要,因为智能体也能非常高效地发现糟糕服务。
@CamKhosravi 分享了(5 个赞、1 条回复、43 次浏览)一张 Circle 财报幻灯片,用数字量化了同一个循环。它显示 x402 智能体支付量的 99.3% 用 USDC 结算、已有 900 多个已上线付费服务,以及一个 publish -> discover -> pay -> settle 的循环,其中信誉会反馈到下一笔交易。

@BNBCHAIN 表示(90 个赞、40 条回复、30,725 次浏览),BNB Smart Chain 上已经存在 20 万多个 AI 智能体,并呼吁构建者去做那个让人们能够找到、比较并雇佣它们的 marketplace。其链接的挑战简报异常明确地指出,可发现性本身就是瓶颈,因为用户现在仍要翻 X 讨论串和 GitHub 仓库,才能判断什么是真正在运行、有用且可信的。
@NxtCypher 推广了(119 个赞、90 条回复、16,556 次浏览)CyAI,把它描述为一个去中心化、可验证推理市场;官方的 Cysic AI 文档则把它定义成 ComputeFi 的自动化层。配图里的表格才是实质内容:中心化 API 提供的是单一供应商、固定且不透明的定价、单数据中心供给,以及不可验证的推理;而 CyAI 被包装成密码学可验证、分布式、自由市场、可审计的替代方案。

讨论要点: 有价值的怀疑并不是“marketplace 是假的”,而是“仅有发现还不够”。人们反复点名缺失的部分包括:排序、信誉、身份、凭证,以及推理或服务是否真按承诺执行的证明。
与前日对比: 8 月 6 日聚焦公开发现端点和支付轨道;8 月 7 日则把这些想法合并成 marketplace 设计、信誉循环,以及对构建场所本身的明确呼吁。
1.3 构建者开始为多智能体工作设计 operator surface (🡕)¶
另一个簇从抽象的编排讨论继续往前走,直接落到操作员究竟在哪里看到、引导和批准智能体工作。共同主题不是默认增加更多自治,而是更好的表面,让子智能体、本地文件、研究材料和人工评审能够混合在一起。
@yoheinakajima 展示了(24 个赞、1 条回复、2,667 次浏览、30 次收藏)一个受 ActiveGraph 启发、以仓库为中心的模块化智能体操作系统。公开的 ActiveGraph 仓库把它描述为一个事件溯源、响应式图运行时,其中日志是真实来源,运行可以重放和 fork,行为是对共享图作出反应,而不是彼此传递不透明消息。
@warpdotdev 演示了(59 个赞、5 条回复、3,841 次浏览、17 次收藏)新的 Warp Agent CLI UX,用来查看子智能体并配置它们的模型、harness 和环境。Warp 自己的 harness 文档说明,Warp Agent 是默认的 Oz harness,也是唯一能生成跨 harness 子智能体(如 Claude Code 或 Codex)的 harness,这让这条推文不只是一个 UI 打磨帖。
@buabaj_ 分享了(29 个赞、5 条回复、1,032 次浏览、12 次收藏)一个个人 workbench,把代码和研究放在同一个本地表面里,并在 Codex 与 Claude Code 模型外层用 Prime Agent 作为 harness。截图的信息量异常高:一张展示了代码与研究分栏的首页,一张展示了编码会话旁边的任务评审侧栏,第三张则展示了同一工作区内的 PDF 阅读与标注。在回复里,这位构建者说项目已经开源,但还没有打包成可分发产品。



讨论要点: 兴趣集中在可见性与控制上:怎样看见被阻塞的子智能体、怎样让运行保持本地、怎样把代码和研究合并,以及怎样把这些表面打包给其他人。operator UI 正在变成产品的一部分,而不只是产品外面的 shell。
与前日对比: 8 月 6 日扩展的是 Web 上适配智能体的表面;8 月 7 日则把焦点转向 operator 控制台、本地 workbench 和仓库本身。
1.4 运行框架质量成了可以基准化、也可以训练的东西 (🡕)¶
8 月 7 日还出现了更强的证据,表明 harness 本身现在已经是实验变量,而不是后台胶水。有两个簇尤其重要:一种是保持模型不变、只比较 harness 的开源基准,另一种是开始把多智能体交互视作可训练环境的 RL 栈。
@RamaswmySridhar 开源了(38 个赞、4 条回复、23,415 次浏览、17 次收藏)data-eng-bench,而这个仓库写得异常具体:103 个容器化 dbt 任务、隐藏的 pytest 验证器,以及 DuckDB 和 Snowflake 双后端。配图以直观方式表达了核心观点:在模型不变的情况下,不同 harness 会落到显著不同的 pass@1 和成本点位上。

@willccbb 称赞了(76 个赞、9 条回复、3,707 次浏览、15 次收藏)Prime Intellect 从单智能体 rollout 迈向多智能体系统的动作,并引用公告称 PRIME-RL 现在已经能够表达并训练任意智能体交互。Prime Intellect 的文章用第一类 Agent 和 Env 抽象,把智能体评审、自博弈和用户模拟这些变化讲得很具体。
@taylorotwell 表示(66 个赞、7 条回复、4,313 次浏览、13 次收藏),他暂停了智能体框架工作,腾出时间在一天内提交了一个 Laravel Scout pull request,为 Turbopuffer engine 增加语义搜索和混合搜索支持。这个公开 PR 是非常具体而非口号式的:它加入了 Turbopuffer engine、加权 BM25 搜索、数据库语义与混合搜索辅助函数、过滤器、分页逻辑和测试。
讨论要点: 这里最强的信号是方法论上的。人们越来越多地比较 model+harness 组合,而不只是模型名字,并把工作流拓扑、搜索和验证器视为一等杠杆。
与前日对比: 8 月 6 日已经出现了围绕 Prime Agent 的基准和运行时论断;8 月 7 日则进一步加入了公开基准套件、可训练的多智能体抽象,以及与这些想法直接关联的具体发货工作。
2. 令人困扰的问题¶
没有信任上下文或排序的发现机制¶
最响亮的 marketplace 抱怨并不是缺少智能体,而是缺少可读性。@jerallaire 转述了(240 个赞、30 条回复、16,703 次浏览、25 次收藏)发现只是第一步,而回复立刻堆出了缺失部分:身份、协商、凭证、记忆、执行和排序。@BNBCHAIN 用公开产品语言提出了同样的抱怨(90 个赞、40 条回复、30,725 次浏览),说构建者仍需要一个能让人们发现、比较和雇佣智能体的场所。BNB 讨论串里有条回复打趣说,20 万个智能体都已经存在了,却没一个会报税,这种直白的玩笑其实是在说 usefulness gap。值得构建程度:高。
当创建与判断共享同一个循环时,自治就会失灵¶
最明确的系统性挫败感在于:一旦把自治硬塞进同一个控制循环,好的助手就会变得脆弱。@panda_liyin 认为(19 个赞、7 条回复、1,574 次浏览、10 次收藏),编程智能体对于有人参与闭环的场景已经接近完美,也正因为如此,自治需要属于自己的智能体。一条回复把这个观点讲得更尖锐:负责渲染框架的系统,不应该同时决定它已经做完。@RamaswmySridhar 从评估角度展示了同一个问题(38 个赞、4 条回复、23,415 次浏览、17 次收藏):即便模型不变,隐藏验证器和 harness 选择也会改变结果。@Nekt_0 划分了循环、图和 harness 的职责,而 @elune0x 进一步把这套边界语言扩展到路由和权限控制。值得构建程度:高。
文案垃圾输出与模型漂移¶
质量抱怨非常具体,而不是泛泛而谈。@shannholmberg 列出了(18 个赞、11 条回复、2,071 次浏览、12 次收藏)避免 copywriting slop 的 5 种办法:更老的模型、删掉死板文风、严格上下文预算、voice-DNA skills,以及一个独立的评估智能体。配图把工作流说得非常明确。

最有力的一条回复认同:独立评估器是杠杆最大的修复,因为负责写作的同一份上下文,不应该同时负责评判输出。今天的权宜方案仍是手工调 harness 和切换模型,而不是一个稳定默认值。值得构建程度:中。
键盘优先的控制方式制造了注意力瓶颈¶
智能体构建者反复把 operator 带宽描述成新的限制。@nickvasiles 表示(26 个赞、7 条回复、1,074 次浏览、8 次收藏),下一个 OpenClaw 时刻会是语音,因为运营多任务队列的人受限的是注意力,而不是输入方式。回复认为,手机优先的 operator 和小企业用户宁愿说话而不是打字;但另一条回复立刻暴露了缺口:人们真正想要的是原生的实时语音模式,而不是 Telegram 或 WhatsApp 的语音壳子。值得构建程度:中。
3. 人们期望的功能¶
把发现、排序、身份与支付合在一起的 marketplace¶
Circle、BNB Chain 和 Cysic 各自描述了同一缺失栈的一部分。Circle 有无密钥发现和 USDC/x402 结算,BNB 想要一个可比较、可雇佣智能体的场所,而 CyAI 想要可审计的推理。回复中的直接诉求很清楚:人们想要的是一个 marketplace,让智能体能在同一条流程里被发现、排序、信任、支付和审计,而不是分散在多个工具之间。这是一个现实需求,不是抽象诉求,因为这些讨论串在“发现已经能用”之后,反复点名了后续断点。机会:直接。
把代码、研究和审批统一起来的 workbench¶
Warp、ActiveGraph 和 buabaj 的 Workbench 从不同角度指向同一种愿望:operator 想要一个地方,让子智能体、代码仓库、研究材料、日志和人工审批始终可见。Warp 强调子智能体树和跨 harness 协调,ActiveGraph 强调可重放状态与 fork-and-diff,Workbench 则强调面向不想长期待在终端里的人的混合代码/研究 UX。这个方向看起来更实际而不是空想,因为原型已经存在,只是仍然零散且往往不够打磨。机会:竞争性。
独立于生成器进行判断的验证层¶
Panda 对自治分拆的主张、shannholmberg 关于 eval agent 的建议,以及 data-eng-bench 的隐藏验证器,都在说同一件事:团队想要一层干净的能力,能独立于起草它的模型去批准、拒绝、重试或升级任务。今天的临时补丁是更多智能体、自定义规则和手工调 harness。一个可复用的验证层,如果能插入编程、写作和研究工作流,看起来就是直接需求。机会:直接。
面向忙碌 operator 的语音原生编排¶
Nick Vasilies 的讨论串和回复描述了一个狭窄但真实的需求:对于那些在路上、用手机或在多份工作间切换的人来说,语音应该成为一等编排模式。要求不仅是语音输入输出,而是低延迟、有状态、支持多智能体控制,同时不退回到文本优先的 UI。证据不如 marketplace 和验证主题厚实,但已经具体到值得重视。机会:新兴。
4. 使用中的工具与方法¶
| 工具 | 类别 | 评价 | 优势 | 局限 |
|---|---|---|---|---|
| Loop / graph / harness engineering | 编排方法 | (+) | 清晰分离重复、路由、权限和验证;Nekt_0、rohit4verse、elune0x 和 rvaniaaaa 给出了强视觉化的决策辅助 | 容易被过度套用到简单任务上;重新包装课程内容时也容易出现来源混淆 |
| Circle Discovery API | 发现 / 支付 API | (+/-) | 无密钥端点、14 个过滤条件、900 多个服务、经过制裁筛查的列表、USDC/x402 轨道 | 发现层仍然没有内建身份、排序、协商和记忆 |
| CyAI | 可验证推理 marketplace | (+/-) | 密码学可审计性、分布式供给、市场定价、可信执行叙事 | 证据仍主要来自发布框架,回复里几乎没有独立 operator 反馈 |
| ActiveGraph | 持久智能体运行时 | (+) | 事件日志是真实来源,可重放、可 fork-and-diff、运行可恢复 | 更像一套架构,而不是现成终端用户 workbench |
| Warp Agent | 编排 harness / UI | (+) | 跨 harness 子智能体、模型路由、可检查的转录、Skills/Rules/Memory 集成 | 用户仍想在编排树里看到更清晰的依赖关系和阻塞视图 |
| Prime Agent / PRIME-RL | 运行框架 + RL 栈 | (+) | 持久 REPL、持久 harness 状态,以及一等多智能体训练环境 | 能力强,但复杂度也高;对主流团队来说仍然偏研究导向 |
| data-eng-bench | 基准 / 评估 harness | (+) | 103 个真实 dbt 任务加隐藏验证器,让 model+harness 对比变得具体 | 目前只覆盖数据工程工作流 |
| Laravel Scout + Turbopuffer | 搜索基础设施 | (+) | 公开 PR 增加了加权 BM25、语义搜索、混合搜索、过滤器和测试 | 仍是一个开放中的 PR,还不是框架默认能力 |
总体满意度最高的时候,是工具把状态显式暴露出来,或者把接口做成可测量的:公开端点、日志、验证器、任务评审面板,或可重放的历史记录。只要帖子更多在讲 market 故事,而不是 operator 表面,情绪就会转为 mixed。常见的权宜方案包括:独立自治智能体、明确审批闸门、独立评估智能体、写作时退回旧模型,以及保持上下文可见的本地 workbench。迁移模式则是从提示词清单转向分层运行时、从独立智能体转向 operator 控制台、从只评估模型转向同时评估 model+harness。
5. 人们在构建什么¶
| 项目 | 构建者 | 功能 | 解决的问题 | 技术栈 | 阶段 | 链接 |
|---|---|---|---|---|---|---|
| Circle Discovery API / Agent Marketplace | Circle | 建立在 USDC/x402 服务之上的公开发现层 | 让智能体无需自定义发现管线就能找到可支付服务 | Circle Agent Stack、Discovery API、x402、USDC | 已发布 | release notes, tweet |
| CyAI | Cysic | 可验证 AI 推理 marketplace,也是 ComputeFi 的自动化层 | 用可审计、分布式执行替代不透明的中心化推理 | Cysic AI、ComputeFi、ZK 支撑的信任模型、分布式节点 | 已发布 | docs, tweet |
| ActiveGraph | @yoheinakajima | 以仓库为中心、事件溯源的持久智能体运行时 | 让长时间运行的智能体可以重放、fork 并审计 | Python、append-only event log、packs、SQLite/Postgres 存储 | Beta | repo, tweet |
| Warp Agent | Warp | 用于跨模型、跨 harness 编排子智能体的 harness 和 CLI | 给 operator 提供多智能体运行的可见性与控制 | Oz、模型路由、Skills、Rules、Memory、MCP、跨 harness 子智能体 | 已发布 | docs, tweet |
| Workbench | @buabaj_ | 围绕编程 harness 构建的本地代码与研究工作区,带任务评审和 PDF 标注 | 帮助不习惯终端的构建者在一个表面里审查智能体工作 | Prime Agent、Codex、Claude Code、本地笔记、PDF | Alpha | tweet |
| PRIME-RL multi-agent systems | Prime Intellect | 用于智能体评审、自博弈和用户模拟的训练与评估抽象 | 让多智能体交互本身变得可训练、可度量 | prime-rl、Agent/Env 抽象、验证器 | Beta | blog, tweet |
| data-eng-bench | Snowflake Labs | 面向编程智能体的 103 任务数据工程基准 | 用真实 dbt 任务和隐藏验证器比较 model+harness 组合 | Harbor、Docker、dbt、DuckDB/Snowflake、pytest 验证器 | 已发布 | repo, tweet |
| Laravel Scout Turbopuffer engine | @taylorotwell | 为 Scout 增加 Turbopuffer engine 与语义/混合搜索支持 | 改善在一套正在与智能体工作一同演进的框架里的搜索基础设施 | Laravel Scout、Turbopuffer、BM25、向量搜索、混合搜索 | Alpha | PR, tweet |
Circle、Cysic 和 BNB 的 marketplace 简报从 3 个方向展示了同一个构建触发器:现在已经有太多智能体和服务存在,却没有一个值得信赖的索引。Circle 在攻发现层,服务于付费服务;Cysic 在攻可验证推理;BNB 则公开要求生态去做目录层。
ActiveGraph、Warp 和 Workbench 展示了 3 种不同的 operator surface 策略。ActiveGraph 把日志本身做成产品,并让运行可以 fork;Warp 把编排和跨 harness 委派变成托管控制面;Workbench 则试图把同样的能力包装成混合代码/研究的本地 UI,让它更容易被接近。
data-eng-bench、PRIME-RL 和 Scout/Turbopuffer PR 指向第二种构建模式:做智能体基础设施,而不是终端用户外壳。一个让 harness 质量可测,一个让多智能体交互可训练,另一个则在构建智能体的框架内部收紧检索与评估。
6. 新动态与亮点¶
data-eng-bench 让 harness 对比不再容易被搪塞过去¶
@RamaswmySridhar 提出了(38 个赞、4 条回复、23,415 次浏览、17 次收藏)当天最有用的具体论断之一:同一模型、不同 harness,会得到显著不同的成本—质量结果。公开的 data-eng-bench 仓库用 103 个真实 dbt 任务和隐藏验证器,让这个说法可复现。
Circle 把 marketplace 循环量化了¶
低互动但高信息量的 Cam Khosravi 幻灯片(5 个赞、1 条回复、43 次浏览)比十几条泛泛的 marketplace 帖子更有价值。它给出了硬数字——99.3% 的 x402 智能体支付量以 USDC 结算、已有 900 多个已上线付费服务——还给出了一条 publish/discover/pay/settle 循环,让信誉能反馈到下一笔交易。
一个个人 workbench 把后终端时代的智能体 UX 具象化了¶
@buabaj_ 展示了(29 个赞、5 条回复、1,032 次浏览、12 次收藏)一个本地工作区,把笔记、PDF、编码会话和任务评审都放在同一个地方。截图让一个常见但仍缺少演示的观点变得可见:有些构建者想要智能体能力,但并不想承诺终端优先的界面。
PRIME-RL 把多智能体训练从理论推进到公开抽象¶
@willccbb 指出(76 个赞、9 条回复、3,707 次浏览、15 次收藏),Prime Intellect 的新多智能体栈是那个“长期被讨论的理论终于变得可用”的时刻。链接的 PRIME-RL 文章之所以值得注意,是因为它不只是说“multi-agent”,而是明确命名了 Agent 和 Env 抽象,并逐步展示评审、自博弈和用户模拟。
7. 机会在哪里¶
[+++] 具备信任上下文的智能体 marketplace —— Circle 的无密钥 Discovery API、Circle 的 marketplace 指标幻灯片、BNB 对“用户可以找到并雇佣智能体的场所”的诉求,以及 Cysic 关于可验证推理的叙事,都指向同一个缺口。真正强的版本不只是目录,而是同时包含排序、信誉、身份、支付和可审计性。
[+++] 独立的验证与审批层 —— panda_liyin 对自治分拆的主张、shannholmberg 的独立 eval agent、data-eng-bench 的隐藏验证器,以及 Nekt_0 与 elune0x 的 harness 语言,都在说同一件事:生成与判断需要不同的控制面。这个信号横跨编程、写作和长期自动化。
[++] operator workbench 与编排 UX —— Warp、ActiveGraph 和 Workbench 各自攻击同一个 operator 问题的不同部分:子智能体可见性、可重放状态、混合代码/研究上下文,以及人工审批。这个市场是真实的,但界面模式仍未定型。
[++] 领域专属的 model+harness 基准 —— data-eng-bench 让一个领域变得具体,而 Laravel Scout/Turbopuffer 的工作说明,相邻基础设施构建者已经在围绕这些工作流收紧检索和评估。市场仍有空间去做更多“harness 而非模型才是变量”的基准。
[+] 语音原生的 fleet control —— Nick Vasilies 的讨论串和回复表明,语音作为编排表面确实存在真实但仍在浮现的需求。这个诉求很具体——要的是面向多智能体工作的真正实时语音控制,而不是外挂式的语音 I/O。
8. 要点总结¶
- 智能体运行时话语已经从理论转向可教学的教义。 海报、分层图和课程讨论串,把循环、图和 harness 从小众术语变成了公开课程。(source)
- marketplace 问题现在是“发现 + 信任 + 支付”,而不是只有发现。 Circle、BNB Chain 和 Cysic 都在描述同一循环的不同部分,而回复反复把排序、身份和可审计性点名为下一批瓶颈。(source)
- 构建者的精力正转向 operator surface。 Warp 的子智能体树、ActiveGraph 的日志优先运行时,以及 buabaj 的本地 Workbench,都说明“人类如何看见并引导智能体”正在成为独立的产品类别。(source)
- harness 质量正在变得可测,也可训练。 data-eng-bench 让 model+harness 对比可以复现,而 PRIME-RL 则把多智能体交互本身变成可编程的训练环境。(source)
- 更高自治并没有降低对独立判断层的需求,反而在提高。 最强烈的抱怨都指向独立 eval agent、审批闸门,以及那些能说“不”或能在同一系统自评之前请求人工介入的自治编排器。(source)