Twitter AI - 2026-07-20¶
1. 人们在讨论什么¶
1.1 界面正从应用和页面转向智能体回答(🡕)¶
3 条具体讨论串都指向同一方向:技术用户正在绕过产品 UI,营销人员在尝试成为 AI 引用的源头层,而 SEO 从业者则看到,具体的对比页、定价页和文档页,比泛泛内容更重要。
@levelsio 认为(347 个点赞、68 条回复、198 次收藏、49,944 次浏览),他越来越常常完全跳过应用和网站,直接用 Claude Code 回答问题,或生成很小、但专门为目标而做的工具。他最具体的不满是 WHOOP 的日志流程:他想看桑拿、饮食、锻炼和睡眠之间的联系,但却说这个日志“几乎没法用”,因为连那些没去桑拿的日子也得手动登记。
@brodieseo 报告(36 个点赞、3 条回复、34 次收藏、2,677 次浏览),一张刚发布、面向电商客户的品类对比页,在一天内就成了 ChatGPT 的核心来源之一。做法不是直接点名竞争对手,而是发一张页面,从库存控制、验真和买卖双方信任这几个维度,把客户与“平台型市场”放在一起对照。

@alexgroberman 表示(30 个点赞、3 条回复、1,735 次浏览),在当前 Google 波动期里,撑得最好的企业,往往都拥有真正有用的定价页、集成页、实施页、对比页和客户成果页。他还明确把同类页面与 Google AI、ChatGPT、Claude、Perplexity 和 Grok 内部的可见性联系到一起。
讨论要点: 实际可执行的打法比“做 AI SEO”窄得多。被反复引用的,不是泛流量内容,而是答案引擎能直接拿来引用的具体对比页、真实定价与细节页、集成页和文档页。
与前日对比: 7 月 19 日更集中在模型路由和评估边界上;7 月 20 日最强的一条帖子则把问题往上推了一层:应用和页面本身,是不是已经不再是界面。
1.2 中国开放权重模型的话题,已从基准测试延伸到访问、定价与政策(🡕)¶
Kimi/Qwen 这一轮讨论没有停留在基准测试截图里。当天的讨论把安全拒答、免费预览入口、设计任务的性价比主张,以及“竞争力能否和双重用途风险切开看”的争论混在了一起。
@Cointelegraph 报道(73 个点赞、28 条回复、24,315 次浏览),David Sacks 声称,像 Kimi K3 这样的中国模型能修 Codex 和 Fable 因网络安全护栏而“碰都不碰”的安全 bug。回复随即分成两派:一边对拒答行为不满,另一边则担心,“发布得更快”并不能解决双重用途问题。
@TMTLongShort 警告(122 个点赞、13 条回复、31 次收藏、14,135 次浏览),如果把中国开源模型的进展当成给美国实验室施压的工具,可能会让政策制定者对更长期的就业与国家安全风险失去敏感度。在讨论串里,有人追问失业时间线时,作者的回答是:“美国大约在 2027 年中,国际上会更早。”
@israfill 发帖称(21 个点赞、8 条回复、11 次收藏、2,507 次浏览),Alibaba 的 qwen3.8-max-preview 已经在 chat.qwen.ai 免费开放,带 web-dev 模式,而且不需要 API key 或信用卡。帖子明确把这看成一种替代方案:不用“先烧一堆额度,只为了看看新模型值不值得切换”。
@DesignArena 声称(77 个点赞、5 条回复、13 次收藏、5,412 次浏览),在它的 web 应用设计基准里,Kimi K3 每个任务的成本比 GPT-5.6 Sol 低 3.2 倍,并称这是设计任务新的成本 / 性能前沿。这个说法只在那个基准内成立;它证明的是该账号测到了什么,而不是一场普适性的排行榜定论。
讨论要点: 最能直接转化为行动的,并不是抽象争论东西方模型竞赛,而是先打开免费预览、自己试。政治争论仍在持续,但真正把模型故事推成广泛用户话题的,是分发和可访问性。
与前日对比: 7 月 19 日的重点仍主要是 Kimi 的说法能否跳出狭窄测试泛化。到 7 月 20 日,这一话题扩展成访问和政策问题:免费预览、安全拒答和竞争力同时落在了同一簇讨论里。
1.3 算力讨论变得更具体:从资本开支论点走向家庭实验室和二手 GPU(🡕)¶
基础设施仍是主导话题,但语气变得更偏操作层面。最强的帖子不再只是投资者式的抽象论述,而是图示、硬件门槛和路由配置。
@moninvestor 认为(184 个点赞、9 条回复、11,465 次浏览),AI 算力符合杰文斯悖论:智能越便宜,对芯片、内存、网络、电力和数据中心的需求反而越高。
@MichaelGannotti 介绍(19 个点赞、5 条回复、9 次收藏、362 次浏览),他搭了一个个人 AI 实验室:核心是一台 NVIDIA DGX Spark、一台运行 8 个 Hermes 智能体的 AMD Ryzen Halo Strix 主机,以及一台运行另外 3 个智能体的 AMD Windows 机器,并在 GPT-5.6、GLM 5.2、Grok 4.5、Qwen 3.6 35B、Nemotron3-Embed-8B 和 Gemma 4 之间做上下文路由。其目标并不是“在本地跑一个大模型”,而是协调本地与云端智能之间的专长智能体。

@sudoingX 跑分(34 个点赞、8 条回复、18 次收藏、3,467 次浏览),把二手 RTX 3060 Ti 8GB 称作“眼下做本地 AI 性价比最高的单卡”,并声称 Bonsai 27B 1-bit 能在这张卡上以 42 tok/s、128k 上下文跑完整的无人值守智能体循环。作者在回复里补充说,这套配置需要 PrismML llama.cpp fork,大约占用 6.8GB VRAM,而在 8GB 卡上把上下文拉到 256k 会立刻 OOM。

讨论要点: 就连回复也不再纠缠“哪个模型赢了?”,而是转向协调成本、共享记忆和故障隔离。人们真正在优化的隐含层,已经是编排,而不只是推理品牌。
与前日对比: 基础设施话题仍然强势,但 7 月 19 日更多还是围绕路由使用量和市场份额叙事;到了 7 月 20 日,它更像操作说明书:硬件拓扑图、显卡容量门槛,以及明确的本地 / 云端路由选择。
2. 令人困扰的问题¶
比直接问智能体还慢的僵硬产品工作流¶
严重程度:高。@levelsio 表示(347 个点赞、68 条回复、198 次收藏、49,944 次浏览),对于高度个人化的问题,他已经不想再去迁就现有应用流程。WHOOP 的例子很具体:产品能存数据,却没法回答他真正关心的联系问题,除非额外做一堆手工记账。他的解决办法是让 Claude Code 把 WHOOP、饮食、桑拿和健身数据拉进一个一次性的 Web 应用里,或者干脆跳过生成出来的 UI,直接问智能体。
人们不只是在要求应用里多几个功能;他们是在拒绝“每一个查询都必须由固定 UI 居中转发”这件事。这个方向值得做,因为真正缺的那一层,是对个人或账户专属数据的结构化访问,而不是再来一个仪表盘。
智能体系统仍会败在隐藏约束和 token 纪律上¶
严重程度:高。@Axel_bitblaze69 抱怨(16 个点赞、10 条回复、3,842 次浏览),Claude Code “写的代码远比需要的多”,并提出一个 ponytail 技能,想用它来强制复用并缩小 diff。但 @bygregorr 反驳(14 次浏览)说,规划这一道本身就可能把节省吃掉;他举的一个重构例子里,预分析在任何代码改动发生之前就先花了大约 2k token。
同样的模式还出现在别处。@vipul_1011 表示(14 个点赞、2 条回复、129 次浏览),基准测试能告诉团队模型会在哪儿失败,但“很少告诉我们为什么失败,以及下一步该训练什么”。在 AI-agent-book 讨论串下,@m13v_ 补充(1 个点赞、16 次浏览)说,智能体代码“烂得比他维护的任何 repo 都快”,因为只要有一个工具的输出结构变了,整整一章内容就会过时。这个方向值得做产品:成本控制、回归检查和约束验证仍然是明显薄弱环节。
AI 搜索可见性波动很大,而且很难驾驭¶
严重程度:中高。@brodieseo 展示(36 个点赞、3 条回复、34 次收藏、2,677 次浏览),一张构图精心的对比页几乎立刻就能成为 ChatGPT 的引用来源。@alexgroberman 报告(30 个点赞、3 条回复、1,735 次浏览),一些企业在 7 月 11 日之后恢复了排名、CTR 和销售,而另一些企业已经把涨幅又吐了回去;早期赢家的共性,是具体页面特征,而不是泛泛 SEO 技巧。
当前的应对模式已经很明确:定价、集成、对比、成果、发货 / 退货政策、专家署名,以及持续更新的事实页面。这个方向值得做,因为运营负担正在从“排到某个位置”转成“成为答案引擎愿意引用的那个来源”。
3. 人们期望的功能¶
架在私有数据和受限 API 之上的专门化智能体¶
这是今天最明确的显性愿望。回应 levelsio 讨论串时,@arnasgold 问道(2 次浏览),应用和网站是否应该变成架在受限 API 和服务之上的“专门化智能体”,这样非技术用户就可以直接要结果,而不必自己把工具串起来。这不是空泛感觉,而是很实际的需求:用户指出的缺口,正是数据访问、工具编排和专业能力封装。机会:直接。
持久记忆,以及一个你没法和它争辩的记分员¶
这里的诉求是连续性加约束。@opentensor 把(45 个点赞、4 条回复、3,906 次浏览)Ditto 描述为一个带持久记忆、协作工作区和长时上下文的开源智能体化操作系统;公开的 tao.media 介绍 写道,它会存储组织、人员、项目和任务,并通过 MCP server 提供记忆访问。另一个方向上,@antpalkin 描述(32 个点赞、8 条回复、18 次收藏、729 次浏览),一位交易员直到采用“一个他没法跟它争辩的记分员”之后,表现才真正开始改善。这把实际的记忆需求和行为约束需求放到了同一个篮子里。机会:直接。
能把评估结果变成下一步训练数据的能力诊断¶
@vipul_1011 介绍(14 个点赞、2 条回复、129 次浏览)了 CRAFT:它把评分标准聚成能力树,找出薄弱节点,再生成有针对性的微调数据。@davidarngar 则在一篇学习路线图帖子下面 说得更直白(18 次浏览):先构建测试集、衡量检索质量、跟踪回归,再在生产环境里验证智能体。这是一个非常实际的需求,而且会立刻影响工作流。机会:直接。
品牌安全的 AI 引用控制¶
人们要的不是“更多内容”,而是能在答案引擎里可控地呈现自己。@brodieseo 展示(36 个点赞、3 条回复、34 次收藏、2,677 次浏览),品类对比页可以很快塑造 ChatGPT 的输出;与此同时,@alexgroberman 认为(30 个点赞、3 条回复、1,735 次浏览),定价页、文档页和对比页,正在成为搜索和 AI 可见性的长期资产。这是一个竞争型需求:工具赛道会很拥挤,但问题本身非常具体。机会:竞争激烈。
4. 使用中的工具与方法¶
| 工具 | 类别 | 评价 | 优势 | 局限 |
|---|---|---|---|---|
| Claude Code | AI 编程助手 | (+/-) | 对个人一次性应用和数据混搭来说已经够快;也是 Text-to-CAD 工作流生态的一部分 | 构建者抱怨它会生成过多代码,并在长会话里烧掉大量 token |
| ChatGPT | 答案引擎 / 消费级 LLM | (+/-) | 能很快引用新的对比页面,并影响电商场景里的呈现方式 | 输出依赖来源组合,而且会随着底层搜索波动一起变化 |
| Kimi K3 | 开放权重 LLM | (+/-) | 在设计、编程和修安全 bug 上的说法很强;反复被当作廉价高能力的参照点 | 这些说法都绑定特定基准测试,而且和安全 / 政策争论缠在一起 |
| Qwen3.8-Max-Preview | 开放权重 LLM | (+) | 浏览器里免费可用,带 web-dev 模式,不需要 API key 或信用卡 | 仍是预览版,讨论串里也没有公开的完整基准测试包 |
| 对比页 | 内容方法 | (+) | 能被 ChatGPT 快速引用,也能在不直接点名竞争对手的前提下帮品牌定位 | 需要非常谨慎的 framing,并且要随着答案引擎行为变化持续监控 |
| Bonsai 27B + PrismML llama.cpp | 本地模型 / 运行时 | (+) | 让 8GB 消费级 GPU 也能跑带长上下文的 27B 1-bit 智能体循环 | 需要自定义分支,而且 VRAM 余量非常紧 |
| DGX Spark + hybrid routing | 本地 / 混合推理 | (+) | 让单个操作者可以在本地和云端模型间切换,平衡隐私、成本和能力 | 仍是高度定制的搭建方式;今天的证据也只来自一位构建者的架构 |
| Unlimited OCR | OCR 模型 | (+) | 公开模型卡展示了一次性长时程解析,以及适配 Transformers、vLLM 和 SGLang 的配方 | 仍是偏工程化的技术栈;文档转换和服务化选择仍得由操作者自己处理 |
满意度从“这已经改变了我的工作方式”,一直延伸到“这东西能用,但背后的隐藏层又贵又脆”。Claude Code 和 ChatGPT 都足够有用,甚至能替代一部分常规产品交互,但两者也都会带来后续工作:前者要管 token 纪律,后者要管引用管理。
迁移路径很清晰。人们先用免费预览测试中国前沿模型,再决定是否为 API 付费;也在从“全靠云端”的预设,转向本地 / 云端混合栈;同时,把泛品牌页面替换成答案引擎能直接引用的对比页、定价页和集成页。共同的权宜方案并不只是换一个新模型,而是给模型外面多套一层控制。
5. 人们在构建什么¶
| 项目 | 构建者 | 功能 | 解决的问题 | 技术栈 | 阶段 | 链接 |
|---|---|---|---|---|---|---|
| Text-to-CAD | earthtojake | 用提示词生成并处理 CAD、URDF、SDF 和 G-code 产物的智能体技能库 | 把编程智能体接到真实世界的设计和制造工作流上 | Claude Code/Codex 插件、CAD Viewer、URDF/SDF/G-code 技能 | 已发布 | GitHub |
| Ditto SN118 | @heydittoai | 带持久记忆、工作区和长时上下文的智能体化操作系统 | 无状态智能体在会话、工具和团队之间会丢失连续性 | Bittensor SN118、记忆图谱、MCP server、工作区模型 | Beta | tweet, article |
| Hermes home AI lab | @MichaelGannotti | 在本地和云端模型之间路由工作的个人多智能体实验室 | 在平衡隐私、延迟和成本的同时协调专长智能体 | DGX Spark、AMD Ryzen Halo/7、GPT-5.6、GLM 5.2、Grok 4.5、Qwen 3.6 35B、Nemotron3-Embed-8B、Gemma 4、Microsoft 365 | Alpha | tweet |
| AI Agents in Depth | Bojie Li | 覆盖完整智能体技术栈的开源书籍及配套实验 | 实际可跑的智能体工程材料太零散,而且往往跑不起来 | GitHub 书籍、10 章、88 个配套项目、Apache 2.0 | 已发布 | GitHub |
| Unlimited OCR | Baidu | 面向多页文档解析的长时程 OCR 模型 | 逐页 OCR 会丢失结构、引用和隐私 | Transformers、vLLM、SGLang、Docker | 已发布 | Hugging Face |
| CRAFT | @vipul_1011 | 把评分标准聚类成能力树、诊断薄弱能力并生成定向微调数据的流水线 | 基准测试很少告诉团队下一步该训练什么 | 能力树、评分标准数据集、定向微调数据生成 | Alpha | arXiv |
Text-to-CAD 是当天最清晰的“智能体走出屏幕”案例。它公开的 README 覆盖 CAD 生成 / 编辑、本地查看、零件查找、URDF/SRDF/SDF 生成、G-code 切片,以及对接 Bambu Lab;而原始推文还描述了一个主要通过提示词驱动的 7-DoF 机械臂 demo。这正面回答了今天更大的那个问题:当代码生成变得便宜之后,什么东西仍然真正有价值。
Ditto 和 Hermes 家庭实验室,是同一个系统问题的两种解法。Ditto 把连续性做成共享记忆 / 工作区产品;Hermes 则把它做成一套自组装的本地 / 云端操作环境。二者都假设,难点早已不是“调用一个模型”,而是随着时间去路由、记忆并约束多个智能体。
Unlimited OCR 和 CRAFT 则说明,构建者的精力正在转向更窄、但很痛的基础设施原语:文档摄取和失败诊断。AI-agent-book 的发布也符合这个模式,只不过来自教育侧:不是再发一条励志讨论串,而是围绕上下文、工具、评估、后训练和多智能体协作,交出一大批可运行材料。
6. 新动态与亮点¶
Factorio 正在成为严肃的智能体评估试验场¶
@austingriffith 表示(23 个点赞、10 条回复、1,398 次浏览),他围绕“LLM 能不能为了娱乐性而被评估”这个问题,“一头扎进了智能体 / AI 评估的兔子洞”,而 Factorio 就是他使用的环境。关联的 factorio-agents 仓库 描述了一个多智能体竞技场:固定地图 seed、运行记分卡、逐决策账本、A/B 实验运行器、实时 VS 模式和观众仪表盘一应俱全,而且明确要让 AI 对人类、AI 对 AI 的比赛“值得看”,而不只是“能打分”。
AI 用在数学上,被讨论成工作流变化,而不是魔法表演¶
@littmath 对 Jacobian-conjecture 那一刻的反应是,这件事“非常看好 AI 对数学的近期影响”,但同时也把“解决著名公开难题”和更广泛的科学生成力区分开来。回复把讨论进一步推向二阶效应:有人说,困难猜想是孕育技术的温床;也有人认为,提前排除较弱的错误命题,本身就能节省大量时间。真正值得注意的,是整体语气:实践者已经在讨论研究激励和工作流会如何变化,而不只是为一个标题性成果喝彩。
7. 机会在哪里¶
[+++] 覆盖私有数据和账户专属工作流的智能体前端 — levelsio 的讨论串展示了一位用户如何为个人查询放弃固定 UI,而 arnasgold 的回复则把缺失的产品直接说破:需要有专门化智能体,架在受限 API 和服务之上,为非技术用户服务。Brodie 的 AEO 实验则从供给侧展示了同样的迁移:页面正在变成智能体的源材料,而不只是目的地。
[+++] 面向多智能体工作的记忆、路由和记分层 — Ditto、Hermes 家庭实验室,以及 antpalkin 所说的“一个你没法和它争辩的记分员”,都指向同一个缺口。团队真正需要的,是连续性、评估循环和可强制执行的约束,而不是又一个套在单模型外面的包装器。
[++] 面向中端硬件的本地优先套件 — 8GB 的 Bonsai/PrismML 配置,以及 Unlimited OCR 公布的配方,都说明人们想在普通消费级或准专业设备上跑出真正有用的本地 AI。这个机会属于中等强度,因为受众偏技术,但痛点明确,而且反复出现。
[++] 面向物理世界输出的编程智能体适配层 — Text-to-CAD 证明,人们想让智能体产出真正能走出聊天窗口的成果:CAD、URDF、机器人描述和打印任务。这比一个 demo 更强,因为公开仓库已经把技能面完整摊开了。
[+] 面向品牌的 AI 引用与波动可观测性 — Brodie 的引用页实验,以及 Alex Groberman 关于波动的讨论串,都表明这是一块真实市场需求,但赛道会很拥挤,而且归因依然混乱。正在浮现的优势,是把答案引擎引用与页面类型、转化和算法变化真正挂上钩的测量能力。
8. 要点总结¶
- 最大的产品信号不是新基准测试,而是界面塌缩。 一位高互动量创业者说,他现在做个人分析时,已经绕过应用和网站,直接使用 Claude Code,或者通过它生成的小工具。 (source)
- 开放权重模型的竞争,如今既是能力故事,也是分发和政策故事。 免费 Qwen 预览、Kimi 的设计 / 价格主张,以及 Sacks 的护栏争议,同一天都在高强度发酵。 (source)
- 基础设施讨论正在变得更偏运营。 最强的证据不只是股票逻辑,而是 DGX Spark 家庭实验室拓扑、8GB 本地智能体基准,以及横跨本地与云端模型的路由栈。 (source)
- 最可信的构建方向,是记忆层、评估层和物理输出适配层。 Ditto、CRAFT、Unlimited OCR 和 Text-to-CAD,瞄准的都是通用聊天界面解决不了的特定失效点。 (source)
- 品牌已经在学习:答案引擎引用的是具体商业页面,不是空泛的思想领导力内容。 今天的证据更偏向那些能在 ChatGPT 和 AI 搜索里被直接引用的对比页、定价页、集成页、实施页和文档页。 (source)