跳转至

Twitter AI 智能体 - 2026-07-19

1. 人们在讨论什么

1.1 工程重心从提示词转向运行框架、循环与图(🡕)

占主导地位的技术观点是:能力出色的模型还需要一套经过工程化设计的运行环境,包括精心整理的上下文、工具、验证机制、停止规则,以及日益重要的专业化智能体协作。这延续了前一天对运行框架的关注,并更明确地展示出从单次调用走向智能体组织的演进路径。

@sairahul1 梳理了(246 个赞、22 条回复、21,536 次浏览、372 次收藏)5 个层层嵌套的层次:提示工程、上下文工程、运行框架工程、循环工程和图工程。循环层要求独立检查、以测试为依据的结束判定、预算限制和无进展检测;图层则加入了规划者、研究者、构建者、共享状态、审批关卡和条件路由。

区分提示工程、上下文工程、运行框架工程、循环工程和图工程的五层示意图,其中包括验证和多智能体协作

@_lopopolo 发布了(228 个赞、14 条回复、17,174 次浏览、402 次收藏)运行框架工程的 12 条论纲。该仓库将运行框架定义为围绕固定模型和编程智能体搭建的环境,其中承载本地要求、上下文、工具、权限、证据和以往工作的经验。

@VaibhavSisinty 描述了(86 个赞、13 条回复、7,659 次浏览、91 次收藏)从反复执行“规划—行动—观察”循环,转向用图在智能体之间路由状态和任务。有人在回复中指出了实际隐患:共享状态和评估仍是生产环境中的风险,因为并行智能体可能会放大陈旧上下文,或同时优化同一个指标。

@PawelHuryn 质疑了(7 个赞、7 条回复、1,033 次浏览)“图工程”这一称谓,认为清晰的目标、独立检查、战略上下文、自主权边界、状态机、评估和安全护栏都比新名称更重要。讨论串中的回复同样认为,这些标签只是对既有编排基础的又一轮命名。

讨论要点: 大家认同验证和状态边界的重要性,但对术语并无共识。最有力的反驳并非认为编排没有必要,而是认为,带有品牌色彩的循环或图词汇不应掩盖独立评估、明确的停止条件以及共享状态的归属权。

与前日对比: 前一份报告着重把运行框架视为可靠性的根源;当天则给出了一张五层图谱,并围绕图工程究竟是独立的下一层,还是换了新标签的传统编排,展开了直接争论。

1.2 上下文质量、持久记忆和评估器成为可靠性工作的重点(🡕)

多条入选内容都把智能体失败视为信息管理问题,而非模型选择问题。证据既包括上下文质量论文和实施评分标准,也包括关于持久、本地和结构化记忆的实际方案。

@omarsar0 重点介绍了(74 个赞、26 条回复、6,839 次浏览、106 次收藏)开源的 ProofAgent Harness 及其论文;它从角色清晰度、安全护栏覆盖度、指令一致性、工具模式质量、事实依据、注入防护和 token 效率等维度为上下文质量评分。@alex_verem 报告称(26 个赞、5 条回复、3,135 次浏览),该研究在固定模型、仅改变上下文的情况下,发现性能提高了 74%。

ProofAgent 论文首页,将上下文质量描述为可衡量的智能体可靠性前置指标

@alex_prompter 认为(13 个赞、3 条回复、4,814 次浏览、26 次收藏),反复执行 RAG 检索会在每次会话中重新构建同一套理解,因此提出了“维基记忆”:由智能体维护结构化 Markdown 知识库,而非反复推理原始文档。@itsharmanjot 介绍了(10 个赞、2 条回复、318 次浏览)Hindsight,它是一款本地 MCP 记忆服务器,提供保留、回忆和反思操作,还包含知识图谱与动态摘要。

维基记忆架构,展示 MCP 服务器、结构化知识图谱、统一记忆、生成的 Markdown 维基和同步流程

@Aiswarya_Sankar 表示(16 个赞、4 条回复、751 次浏览),空值防护、逻辑反转、异常吞没和陈旧钩子等反复出现的 PR 审查模式,应反馈回运行框架,而不是每次修复后就丢弃。

讨论要点: 这些方案都有结构、可供检查:运行前评估上下文,运行之间保留事实和摘要,再把实施反馈交给下一次运行。这比单纯要求更大的上下文窗口具体得多。

与前日对比: 7 月 18 日主要关注可检查的记忆和上下文评分;7 月 19 日则增加了公开发布的评分标准、固定模型下的上下文实验结果、本地记忆的具体做法,以及把 PR 评论作为可复用运营知识来源的思路。

1.3 自主能力被封装成浏览器技能、内容流水线和隔离运行时(🡒)

开发者展示了智能体如何在浏览器自动化、内容制作、财务和运行时隔离等领域开展具体工作。其共同模式是提供明确的执行界面,而不是抽象的“助手”。

@ctatedev 演示了(105 个赞、6 条回复、8,935 次浏览、100 次收藏)agent-browser 如何用 HAR 启动/停止命令记录浏览器网络流量,并借助技能生成客户端。@Sonofpeace0001 展示了(316 个赞、19 条回复、1,189 次浏览)一套定时运行的 Creao 工作流:它会研究视频开场钩子,以匹配创作者声音风格的方式编写脚本,生成配音和字幕,渲染后上传 YouTube Short,全程无需每天提示。

@RoundtableSpace 推出了(43 个赞、12 条回复、40,528 次浏览)AgentOS,宣称可为每个智能体提供独立的虚拟文件系统、进程表、网络栈和持久文件系统,冷启动仅需 6ms,且沙箱成本更低。一条回复认可其隔离能力,但也追问该系统将如何协调智能体实际承担的任务。

AgentOS 产品页面,介绍进程内智能体隔离、细粒度文件系统/网络/进程权限、持久文件系统和近乎为零的冷启动


2. 令人困扰的问题

嘈杂、短暂或无法评估的上下文

反复出现的最明显困扰不是模型能力不足,而是上下文需要重建、过度膨胀、已经陈旧或未经评估。@alex_prompter 表示(13 个赞、3 条回复、4,814 次浏览、26 次收藏),传统 RAG 迫使智能体在每次会话中重建同一套理解;@omarsar0指出(74 个赞、26 条回复、6,839 次浏览、106 次收藏)需要评估上下文质量,因为薄弱的上下文会导致偏离目标、幻觉、工具误用、暴露于注入攻击以及 token 浪费。严重程度:高。目前可见的应对方法包括结构化维基记忆、本地持久记忆、精心整理的文件和运行前评分;这个问题值得直接投入构建,因为实施方案和高互动量讨论中都出现了同样的痛点。

不加区分的模型路由导致成本和工作浪费

@adxtyahq 报告称(63 个赞、14 条回复、3,928 次浏览、47 次收藏),一款网站构建产品在初次重新设计使成本恶化至接近 5 美元后,又将每条提示词的平均 LLM 成本从约 3–4 美元降至 1–1.50 美元。该账号把最终的成本下降归因于重建架构、变更基准测试、生产测试,以及避免把所有任务都路由给 Opus 或 GPT-5.5。严重程度:中。这是一项实际的优化需求,但证据只来自一份实施报告,而非广泛的抱怨群体。

自主工具仍缺少可信的执行边界

@karlmehta 引用了(31 个赞、11 条回复、5,162 次浏览)一则警告,指出智能体技术栈缺乏身份验证、资产清单,也无法确认下载模型是否可信。一条回复具体说明了这种风险:MCP 工具可能继承当前已登录会话的 cookie,并在没有中间确认环节的情况下以用户身份执行操作。@BrianRoemmele 提到(30 个赞、15 条回复、3,981 次浏览)Hugging Face 披露了一套自主系统利用数据处理漏洞并收集凭据的事件;一条回复认为,在事件响应期间,模型必须能在证据和凭据所在位置开展操作。严重程度:高。提议的应对措施包括资产清单、身份验证、收窄权限、人工审批和隔离的执行界面,因此这是直接的构建机会,而不是文档问题。

模糊的工具故障让智能体浪费重试次数和 token

@bsvdrip 开始构建(7 个赞、4 条回复、261 次浏览)“Agentic Feedback Framework”,让 API 错误能够说明失败条件、预期输入、是否重试的决定和下一步操作。其指出的问题是,模糊的错误迫使智能体猜测,增加 token 使用量,并导致其臆造恢复路径。严重程度:中。提议的干预措施边界格外清晰:让 API 错误响应与成功响应一样可供机器采取行动。


3. 人们期望的功能

可衡量完整智能体上下文的运行前检查

最强烈的实际需求,是在智能体失败前判断指令、工具模式、检索材料、记忆和安全护栏是否适合此次运行。@alex_verem 介绍了(26 个赞、5 条回复、3,135 次浏览)ProofAgent 提议的上下文七项评分,而 @omarsar0 分享了(74 个赞、26 条回复、6,839 次浏览、106 次收藏)其开源运行框架。这是迫切的实际需求,且已有部分可用方案。机会:直接。

持久、本地且可整理成知识的记忆

@alex_prompter 希望(13 个赞、3 条回复、4,814 次浏览、26 次收藏)智能体能维护持续演进的结构化维基,而不是反复从原始文档中检索。@itsharmanjot 提供了(10 个赞、2 条回复、318 次浏览)一套本地替代方案,以事实保留、回忆、反思、知识图谱和 MCP 服务器为核心。这项需求重在实用而非愿景:持久上下文应当可检查、可移植,且不依赖云端 API。机会:竞争性。

具备审批、权限范围和清晰恢复路径的执行界面

@mimu_ai1 介绍了(25 个赞、13 条回复、14,174 次浏览)一个智能体:它以代码方式配置 Stripe 和 QuickBooks 访问权限、Postgres 账本与仪表板,同时执行每月 100 美元的预算上限和付款审批。@bsvdrip 提出了(7 个赞、4 条回复、261 次浏览)可操作的错误契约,使智能体无需猜测即可恢复。两者共同指向一项需求:智能体既能操作真实系统,又不会悄然越权或陷入盲目重试循环。机会:直接。


4. 使用中的工具与方法

工具 类别 评价 优势 局限
运行框架工程 方法 / 仓库 (+) 围绕固定工作智能体编码本地要求、权限、证据、工具和可复用经验 需要有意识地整理组织知识
ProofAgent Harness 评估 (+) 在判断行为之前,按 7 项可靠性标准为上下文评分 信息流中没有生产环境采用的证据
Hindsight 记忆 / MCP (+) 本地事实保留、回忆、反思、知识图谱和动态摘要 来自单一账号、互动量较低的实施报告
agent-browser 浏览器自动化 (+) 为浏览器工作提供 HAR 捕获和由此生成的客户端技能 一条回复追问它与其他浏览器使用方案相比如何
AgentOS 运行时隔离 (+/-) 宣称提供细粒度的单智能体执行边界和持久文件系统 一条回复质疑如何协调运行时层之上的工作
模型路由和缓存 成本优化方法 (+) 一份报告将架构和路由变更与每条提示词成本大幅下降联系起来 结果由账号自行报告,且实施细节不完整

@_lopopolo (228 个赞、14 条回复、17,174 次浏览、402 次收藏)运行框架工程与可重复的组织判断联系起来;@omarsar0(74 个赞、26 条回复、6,839 次浏览、106 次收藏)上下文质量与智能体评估联系起来。大家对明确结构和可衡量检查的评价偏正面,但讨论反复要求明确状态归属、比较不同浏览器工具,以及解决隔离运行时上层的协调问题。唯一清晰的迁移趋势,是从手写提示词和反复执行的原始 RAG,转向循环、精心整理的文件、结构化记忆和经过评估的上下文。


5. 人们在构建什么

项目 构建者 功能 解决的问题 技术栈 阶段 链接
Harness Engineering @_lopopolo 汇集论纲、操作手册和路由材料的仓库,用于塑造编程智能体周围的环境 让智能体能够找回本地要求、决策、权限和证据 仓库文档、AGENTS.md、上下文、工具 已发布 仓库
ProofAgent Harness @omarsar0 重点介绍 上下文质量评估框架 在智能体行为失败前检测不可靠的运行上下文 多评审者、共识评分;上下文标准 Alpha 仓库
Creao YouTube Shorts 智能体 @Sonofpeace0001 从研究到上传的定时 Shorts 流水线 免去反复研究、编写脚本、编辑和上传的工作 Creao 智能体、配音、字幕、渲染、YouTube 上传 已发布 推文
AgentOS @RoundtableSpace 重点介绍 面向编程智能体的轻量级、隔离式、类操作系统执行环境 减少沙箱启动和持久化方面的阻力 虚拟文件系统、进程表、网络栈、VM 隔离 Beta 推文
Agentic Feedback Framework @bsvdrip 能够解释预期输入和下一步恢复操作的 API 错误 避免工具失败后的盲目重试和臆造恢复方案 机器可读的 API 反馈 Alpha 推文
Wardn Hub @abhi16_93 收录已通过已知攻击面审计的技能 防止智能体盲目执行不安全的技能包 技能注册表和安全审计 Alpha 推文

最实质性的构建信号来自 harness-engineering 仓库。它表示,通过把要求、本地决策、权限、证据和反馈作为上下文与工具提供给固定工作智能体,可以提升后者的表现。@_lopopolo 发布了(228 个赞、14 条回复、17,174 次浏览、402 次收藏)该项目,将其定位为一年实践经验的提炼,而不是新的模型或框架。

其他项目则封装了具体的运营缺口:@Sonofpeace0001 自动化了(316 个赞、19 条回复、1,189 次浏览)定时发布工作流;@RoundtableSpace 展示了(43 个赞、12 条回复、40,528 次浏览)隔离运行时;@abhi16_93构建了(4 个赞、5 条回复、141 次浏览)经过安全审计的技能注册表。反复出现的构建模式是围绕智能体行动打造基础设施:可靠的上下文、受控访问、可恢复的错误和执行隔离。


6. 新动态与亮点

一项具体的上下文质量衡量方案

ProofAgent 论文和运行框架是信息流中最具体的可靠性成果:其提出的 7 项标准涵盖角色定义、安全护栏、指令一致性、工具模式、事实依据、注入防护和 token 效率。@alex_verem 报告称(26 个赞、5 条回复、3,135 次浏览),改变上下文让固定模型的性能提高了 74%;@omarsar0给出了(74 个赞、26 条回复、6,839 次浏览、106 次收藏)公开评估框架的链接。

浏览器工作正变成可复用的智能体技能

@ctatedev 发布了(105 个赞、6 条回复、8,935 次浏览、100 次收藏)一项 agent-browser 技能,可根据记录的网络流量生成客户端。这篇推文值得关注,因为它把探索性的浏览器交互转化为智能体可复用的成果,而不是一次性的手动会话。

实施反馈循环正在向提示词之外扩展

@Aiswarya_Sankar 指出(16 个赞、4 条回复、751 次浏览),PR 审查评论应成为智能体继承的数据集;@bsvdrip(7 个赞、4 条回复、261 次浏览)同一思路用于 API 错误。两者都把反馈从一次性的人类可读消息,转变为机器可用的改进信号。


7. 机会在哪里

[+++] 上下文可观测性与运行前评估 —— 信息流同时呈现了可衡量的上下文质量评估框架,以及关于反复执行 RAG 重建、状态陈旧或缺乏结构的实际抱怨。@omarsar0 分享了(74 个赞、26 条回复、6,839 次浏览、106 次收藏)一个开源方案,@alex_prompter描述了(13 个赞、3 条回复、4,814 次浏览、26 次收藏)反复处理上下文的失败模式。这项机会很强,因为它把明确的故障、评分方法和多种实施方向连接起来。

[+++] 安全执行控制平面 —— 智能体安全讨论指出了资产清单和身份验证缺失、实时会话凭据暴露、有边界的付款审批、技能审计以及运行时隔离等问题。@karlmehta 提出了(31 个赞、11 条回复、5,162 次浏览)可信保障缺口;@mimu_ai1在一个运营实例中展示了(25 个赞、13 条回复、14,174 次浏览)预算上限和付款审批。这个领域竞争激烈,但证据横跨策略、运行时和业务工作流各层。

[++] 面向工具和智能体的反馈契约 —— PR 审查模式和解释性 API 错误,都能让下一次执行利用以往的失败。@Aiswarya_Sankar 主张(16 个赞、4 条回复、751 次浏览)把审查模式反馈给运行框架;@bsvdrip明确提出(7 个赞、4 条回复、261 次浏览)能够指导恢复的错误响应。这是一个正在兴起的机会,且有清晰的接口层切入点。

[+] 可复用的浏览器操作发现 —— 由 HAR 生成的客户端和浏览器技能可以减少重复的手动集成工作。@ctatedev 演示了(105 个赞、6 条回复、8,935 次浏览、100 次收藏)这套工作流,但追问工具对比的回复表明,工具选择仍未尘埃落定。


8. 要点总结

  1. 模型周围的系统是当天的主要分析单元。 从提示词到图的五层图谱,以及运行框架工程仓库,都把可靠性视为上下文、工具、权限、检查和协作的问题,而非仅仅取决于模型选择。@sairahul1 梳理了(246 个赞、22 条回复、21,536 次浏览、372 次收藏)这些层次,@_lopopolo发布了(228 个赞、14 条回复、17,174 次浏览、402 次收藏)一份具体的运行框架操作手册。
  2. 上下文正成为可评估的生产输入。 @alex_verem 报告了(26 个赞、5 条回复、3,135 次浏览)固定模型下改变上下文的结果;@omarsar0重点介绍了(74 个赞、26 条回复、6,839 次浏览、106 次收藏)一套公开运行框架,明确列出所提议的评估维度。
  3. 持久记忆方案偏向结构化、本地且可复用的成果。 @alex_prompter 提出(13 个赞、3 条回复、4,814 次浏览、26 次收藏)维护一个 Markdown 维基;@itsharmanjot介绍了(10 个赞、2 条回复、318 次浏览)由本地知识图谱支撑的 MCP 记忆。
  4. 自主能力只有与受限权限和可恢复故障并存,才有价值。 信息流同时呈现了一套运行中的定时内容流水线、预算和审批控制、一项提议中的错误反馈框架,以及针对未经身份验证的智能体执行面的直接警告。@Sonofpeace0001 展示了(316 个赞、19 条回复、1,189 次浏览)完整的工作流自动化;@karlmehta警告了(31 个赞、11 条回复、5,162 次浏览)这一安全缺口。