跳转至

Twitter AI - 2026-07-20

1. 人们在讨论什么

1.1 界面正从应用和页面转向智能体回答(🡕)

3 条具体讨论串都指向同一方向:技术用户正在绕过产品 UI,营销人员在尝试成为 AI 引用的源头层,而 SEO 从业者则看到,具体的对比页、定价页和文档页,比泛泛内容更重要。

@levelsio 认为(347 个点赞、68 条回复、198 次收藏、49,944 次浏览),他越来越常常完全跳过应用和网站,直接用 Claude Code 回答问题,或生成很小、但专门为目标而做的工具。他最具体的不满是 WHOOP 的日志流程:他想看桑拿、饮食、锻炼和睡眠之间的联系,但却说这个日志“几乎没法用”,因为连那些没去桑拿的日子也得手动登记。

@brodieseo 报告(36 个点赞、3 条回复、34 次收藏、2,677 次浏览),一张刚发布、面向电商客户的品类对比页,在一天内就成了 ChatGPT 的核心来源之一。做法不是直接点名竞争对手,而是发一张页面,从库存控制、验真和买卖双方信任这几个维度,把客户与“平台型市场”放在一起对照。

ChatGPT 引用详情视图,显示一张新的品类对比页在多个买家和卖家提示词中被引用

@alexgroberman 表示(30 个点赞、3 条回复、1,735 次浏览),在当前 Google 波动期里,撑得最好的企业,往往都拥有真正有用的定价页、集成页、实施页、对比页和客户成果页。他还明确把同类页面与 Google AI、ChatGPT、Claude、Perplexity 和 Grok 内部的可见性联系到一起。

讨论要点: 实际可执行的打法比“做 AI SEO”窄得多。被反复引用的,不是泛流量内容,而是答案引擎能直接拿来引用的具体对比页、真实定价与细节页、集成页和文档页。

与前日对比: 7 月 19 日更集中在模型路由和评估边界上;7 月 20 日最强的一条帖子则把问题往上推了一层:应用和页面本身,是不是已经不再是界面。

1.2 中国开放权重模型的话题,已从基准测试延伸到访问、定价与政策(🡕)

Kimi/Qwen 这一轮讨论没有停留在基准测试截图里。当天的讨论把安全拒答、免费预览入口、设计任务的性价比主张,以及“竞争力能否和双重用途风险切开看”的争论混在了一起。

@Cointelegraph 报道(73 个点赞、28 条回复、24,315 次浏览),David Sacks 声称,像 Kimi K3 这样的中国模型能修 Codex 和 Fable 因网络安全护栏而“碰都不碰”的安全 bug。回复随即分成两派:一边对拒答行为不满,另一边则担心,“发布得更快”并不能解决双重用途问题。

@TMTLongShort 警告(122 个点赞、13 条回复、31 次收藏、14,135 次浏览),如果把中国开源模型的进展当成给美国实验室施压的工具,可能会让政策制定者对更长期的就业与国家安全风险失去敏感度。在讨论串里,有人追问失业时间线时,作者的回答是:“美国大约在 2027 年中,国际上会更早。”

@israfill 发帖称(21 个点赞、8 条回复、11 次收藏、2,507 次浏览),Alibaba 的 qwen3.8-max-preview 已经在 chat.qwen.ai 免费开放,带 web-dev 模式,而且不需要 API key 或信用卡。帖子明确把这看成一种替代方案:不用“先烧一堆额度,只为了看看新模型值不值得切换”。

@DesignArena 声称(77 个点赞、5 条回复、13 次收藏、5,412 次浏览),在它的 web 应用设计基准里,Kimi K3 每个任务的成本比 GPT-5.6 Sol 低 3.2 倍,并称这是设计任务新的成本 / 性能前沿。这个说法只在那个基准内成立;它证明的是该账号测到了什么,而不是一场普适性的排行榜定论。

讨论要点: 最能直接转化为行动的,并不是抽象争论东西方模型竞赛,而是先打开免费预览、自己试。政治争论仍在持续,但真正把模型故事推成广泛用户话题的,是分发和可访问性。

与前日对比: 7 月 19 日的重点仍主要是 Kimi 的说法能否跳出狭窄测试泛化。到 7 月 20 日,这一话题扩展成访问和政策问题:免费预览、安全拒答和竞争力同时落在了同一簇讨论里。

1.3 算力讨论变得更具体:从资本开支论点走向家庭实验室和二手 GPU(🡕)

基础设施仍是主导话题,但语气变得更偏操作层面。最强的帖子不再只是投资者式的抽象论述,而是图示、硬件门槛和路由配置。

@moninvestor 认为(184 个点赞、9 条回复、11,465 次浏览),AI 算力符合杰文斯悖论:智能越便宜,对芯片、内存、网络、电力和数据中心的需求反而越高。

@MichaelGannotti 介绍(19 个点赞、5 条回复、9 次收藏、362 次浏览),他搭了一个个人 AI 实验室:核心是一台 NVIDIA DGX Spark、一台运行 8 个 Hermes 智能体的 AMD Ryzen Halo Strix 主机,以及一台运行另外 3 个智能体的 AMD Windows 机器,并在 GPT-5.6、GLM 5.2、Grok 4.5、Qwen 3.6 35B、Nemotron3-Embed-8B 和 Gemma 4 之间做上下文路由。其目标并不是“在本地跑一个大模型”,而是协调本地与云端智能之间的专长智能体。

使用 DGX Spark、两台 AMD 主机、混合模型路由和 Microsoft 365 集成的家庭 AI 实验室示意图

@sudoingX 跑分(34 个点赞、8 条回复、18 次收藏、3,467 次浏览),把二手 RTX 3060 Ti 8GB 称作“眼下做本地 AI 性价比最高的单卡”,并声称 Bonsai 27B 1-bit 能在这张卡上以 42 tok/s、128k 上下文跑完整的无人值守智能体循环。作者在回复里补充说,这套配置需要 PrismML llama.cpp fork,大约占用 6.8GB VRAM,而在 8GB 卡上把上下文拉到 256k 会立刻 OOM。

柱状图比较 6GB、8GB 和 24GB GPU 上 27B 本地智能体的吞吐量,其中 RTX 3060 Ti 8GB 为 42 tok/s

讨论要点: 就连回复也不再纠缠“哪个模型赢了?”,而是转向协调成本、共享记忆和故障隔离。人们真正在优化的隐含层,已经是编排,而不只是推理品牌。

与前日对比: 基础设施话题仍然强势,但 7 月 19 日更多还是围绕路由使用量和市场份额叙事;到了 7 月 20 日,它更像操作说明书:硬件拓扑图、显卡容量门槛,以及明确的本地 / 云端路由选择。


2. 令人困扰的问题

比直接问智能体还慢的僵硬产品工作流

严重程度:高。@levelsio 表示(347 个点赞、68 条回复、198 次收藏、49,944 次浏览),对于高度个人化的问题,他已经不想再去迁就现有应用流程。WHOOP 的例子很具体:产品能存数据,却没法回答他真正关心的联系问题,除非额外做一堆手工记账。他的解决办法是让 Claude Code 把 WHOOP、饮食、桑拿和健身数据拉进一个一次性的 Web 应用里,或者干脆跳过生成出来的 UI,直接问智能体。

人们不只是在要求应用里多几个功能;他们是在拒绝“每一个查询都必须由固定 UI 居中转发”这件事。这个方向值得做,因为真正缺的那一层,是对个人或账户专属数据的结构化访问,而不是再来一个仪表盘。

智能体系统仍会败在隐藏约束和 token 纪律上

严重程度:高。@Axel_bitblaze69 抱怨(16 个点赞、10 条回复、3,842 次浏览),Claude Code “写的代码远比需要的多”,并提出一个 ponytail 技能,想用它来强制复用并缩小 diff。但 @bygregorr 反驳(14 次浏览)说,规划这一道本身就可能把节省吃掉;他举的一个重构例子里,预分析在任何代码改动发生之前就先花了大约 2k token。

同样的模式还出现在别处。@vipul_1011 表示(14 个点赞、2 条回复、129 次浏览),基准测试能告诉团队模型会在哪儿失败,但“很少告诉我们为什么失败,以及下一步该训练什么”。在 AI-agent-book 讨论串下,@m13v_ 补充(1 个点赞、16 次浏览)说,智能体代码“烂得比他维护的任何 repo 都快”,因为只要有一个工具的输出结构变了,整整一章内容就会过时。这个方向值得做产品:成本控制、回归检查和约束验证仍然是明显薄弱环节。

AI 搜索可见性波动很大,而且很难驾驭

严重程度:中高。@brodieseo 展示(36 个点赞、3 条回复、34 次收藏、2,677 次浏览),一张构图精心的对比页几乎立刻就能成为 ChatGPT 的引用来源。@alexgroberman 报告(30 个点赞、3 条回复、1,735 次浏览),一些企业在 7 月 11 日之后恢复了排名、CTR 和销售,而另一些企业已经把涨幅又吐了回去;早期赢家的共性,是具体页面特征,而不是泛泛 SEO 技巧。

当前的应对模式已经很明确:定价、集成、对比、成果、发货 / 退货政策、专家署名,以及持续更新的事实页面。这个方向值得做,因为运营负担正在从“排到某个位置”转成“成为答案引擎愿意引用的那个来源”。


3. 人们期望的功能

架在私有数据和受限 API 之上的专门化智能体

这是今天最明确的显性愿望。回应 levelsio 讨论串时,@arnasgold 问道(2 次浏览),应用和网站是否应该变成架在受限 API 和服务之上的“专门化智能体”,这样非技术用户就可以直接要结果,而不必自己把工具串起来。这不是空泛感觉,而是很实际的需求:用户指出的缺口,正是数据访问、工具编排和专业能力封装。机会:直接。

持久记忆,以及一个你没法和它争辩的记分员

这里的诉求是连续性加约束。@opentensor (45 个点赞、4 条回复、3,906 次浏览)Ditto 描述为一个带持久记忆、协作工作区和长时上下文的开源智能体化操作系统;公开的 tao.media 介绍 写道,它会存储组织、人员、项目和任务,并通过 MCP server 提供记忆访问。另一个方向上,@antpalkin 描述(32 个点赞、8 条回复、18 次收藏、729 次浏览),一位交易员直到采用“一个他没法跟它争辩的记分员”之后,表现才真正开始改善。这把实际的记忆需求和行为约束需求放到了同一个篮子里。机会:直接。

能把评估结果变成下一步训练数据的能力诊断

@vipul_1011 介绍(14 个点赞、2 条回复、129 次浏览)了 CRAFT:它把评分标准聚成能力树,找出薄弱节点,再生成有针对性的微调数据。@davidarngar 则在一篇学习路线图帖子下面 说得更直白(18 次浏览):先构建测试集、衡量检索质量、跟踪回归,再在生产环境里验证智能体。这是一个非常实际的需求,而且会立刻影响工作流。机会:直接。

品牌安全的 AI 引用控制

人们要的不是“更多内容”,而是能在答案引擎里可控地呈现自己。@brodieseo 展示(36 个点赞、3 条回复、34 次收藏、2,677 次浏览),品类对比页可以很快塑造 ChatGPT 的输出;与此同时,@alexgroberman 认为(30 个点赞、3 条回复、1,735 次浏览),定价页、文档页和对比页,正在成为搜索和 AI 可见性的长期资产。这是一个竞争型需求:工具赛道会很拥挤,但问题本身非常具体。机会:竞争激烈。


4. 使用中的工具与方法

工具 类别 评价 优势 局限
Claude Code AI 编程助手 (+/-) 对个人一次性应用和数据混搭来说已经够快;也是 Text-to-CAD 工作流生态的一部分 构建者抱怨它会生成过多代码,并在长会话里烧掉大量 token
ChatGPT 答案引擎 / 消费级 LLM (+/-) 能很快引用新的对比页面,并影响电商场景里的呈现方式 输出依赖来源组合,而且会随着底层搜索波动一起变化
Kimi K3 开放权重 LLM (+/-) 在设计、编程和修安全 bug 上的说法很强;反复被当作廉价高能力的参照点 这些说法都绑定特定基准测试,而且和安全 / 政策争论缠在一起
Qwen3.8-Max-Preview 开放权重 LLM (+) 浏览器里免费可用,带 web-dev 模式,不需要 API key 或信用卡 仍是预览版,讨论串里也没有公开的完整基准测试包
对比页 内容方法 (+) 能被 ChatGPT 快速引用,也能在不直接点名竞争对手的前提下帮品牌定位 需要非常谨慎的 framing,并且要随着答案引擎行为变化持续监控
Bonsai 27B + PrismML llama.cpp 本地模型 / 运行时 (+) 让 8GB 消费级 GPU 也能跑带长上下文的 27B 1-bit 智能体循环 需要自定义分支,而且 VRAM 余量非常紧
DGX Spark + hybrid routing 本地 / 混合推理 (+) 让单个操作者可以在本地和云端模型间切换,平衡隐私、成本和能力 仍是高度定制的搭建方式;今天的证据也只来自一位构建者的架构
Unlimited OCR OCR 模型 (+) 公开模型卡展示了一次性长时程解析,以及适配 Transformers、vLLM 和 SGLang 的配方 仍是偏工程化的技术栈;文档转换和服务化选择仍得由操作者自己处理

满意度从“这已经改变了我的工作方式”,一直延伸到“这东西能用,但背后的隐藏层又贵又脆”。Claude Code 和 ChatGPT 都足够有用,甚至能替代一部分常规产品交互,但两者也都会带来后续工作:前者要管 token 纪律,后者要管引用管理。

迁移路径很清晰。人们先用免费预览测试中国前沿模型,再决定是否为 API 付费;也在从“全靠云端”的预设,转向本地 / 云端混合栈;同时,把泛品牌页面替换成答案引擎能直接引用的对比页、定价页和集成页。共同的权宜方案并不只是换一个新模型,而是给模型外面多套一层控制。


5. 人们在构建什么

项目 构建者 功能 解决的问题 技术栈 阶段 链接
Text-to-CAD earthtojake 用提示词生成并处理 CAD、URDF、SDF 和 G-code 产物的智能体技能库 把编程智能体接到真实世界的设计和制造工作流上 Claude Code/Codex 插件、CAD Viewer、URDF/SDF/G-code 技能 已发布 GitHub
Ditto SN118 @heydittoai 带持久记忆、工作区和长时上下文的智能体化操作系统 无状态智能体在会话、工具和团队之间会丢失连续性 Bittensor SN118、记忆图谱、MCP server、工作区模型 Beta tweet, article
Hermes home AI lab @MichaelGannotti 在本地和云端模型之间路由工作的个人多智能体实验室 在平衡隐私、延迟和成本的同时协调专长智能体 DGX Spark、AMD Ryzen Halo/7、GPT-5.6、GLM 5.2、Grok 4.5、Qwen 3.6 35B、Nemotron3-Embed-8B、Gemma 4、Microsoft 365 Alpha tweet
AI Agents in Depth Bojie Li 覆盖完整智能体技术栈的开源书籍及配套实验 实际可跑的智能体工程材料太零散,而且往往跑不起来 GitHub 书籍、10 章、88 个配套项目、Apache 2.0 已发布 GitHub
Unlimited OCR Baidu 面向多页文档解析的长时程 OCR 模型 逐页 OCR 会丢失结构、引用和隐私 Transformers、vLLM、SGLang、Docker 已发布 Hugging Face
CRAFT @vipul_1011 把评分标准聚类成能力树、诊断薄弱能力并生成定向微调数据的流水线 基准测试很少告诉团队下一步该训练什么 能力树、评分标准数据集、定向微调数据生成 Alpha arXiv

Text-to-CAD 是当天最清晰的“智能体走出屏幕”案例。它公开的 README 覆盖 CAD 生成 / 编辑、本地查看、零件查找、URDF/SRDF/SDF 生成、G-code 切片,以及对接 Bambu Lab;而原始推文还描述了一个主要通过提示词驱动的 7-DoF 机械臂 demo。这正面回答了今天更大的那个问题:当代码生成变得便宜之后,什么东西仍然真正有价值。

Ditto 和 Hermes 家庭实验室,是同一个系统问题的两种解法。Ditto 把连续性做成共享记忆 / 工作区产品;Hermes 则把它做成一套自组装的本地 / 云端操作环境。二者都假设,难点早已不是“调用一个模型”,而是随着时间去路由、记忆并约束多个智能体。

Unlimited OCR 和 CRAFT 则说明,构建者的精力正在转向更窄、但很痛的基础设施原语:文档摄取和失败诊断。AI-agent-book 的发布也符合这个模式,只不过来自教育侧:不是再发一条励志讨论串,而是围绕上下文、工具、评估、后训练和多智能体协作,交出一大批可运行材料。


6. 新动态与亮点

Factorio 正在成为严肃的智能体评估试验场

@austingriffith 表示(23 个点赞、10 条回复、1,398 次浏览),他围绕“LLM 能不能为了娱乐性而被评估”这个问题,“一头扎进了智能体 / AI 评估的兔子洞”,而 Factorio 就是他使用的环境。关联的 factorio-agents 仓库 描述了一个多智能体竞技场:固定地图 seed、运行记分卡、逐决策账本、A/B 实验运行器、实时 VS 模式和观众仪表盘一应俱全,而且明确要让 AI 对人类、AI 对 AI 的比赛“值得看”,而不只是“能打分”。

AI 用在数学上,被讨论成工作流变化,而不是魔法表演

@littmath Jacobian-conjecture 那一刻的反应是,这件事“非常看好 AI 对数学的近期影响”,但同时也把“解决著名公开难题”和更广泛的科学生成力区分开来。回复把讨论进一步推向二阶效应:有人说,困难猜想是孕育技术的温床;也有人认为,提前排除较弱的错误命题,本身就能节省大量时间。真正值得注意的,是整体语气:实践者已经在讨论研究激励和工作流会如何变化,而不只是为一个标题性成果喝彩。


7. 机会在哪里

[+++] 覆盖私有数据和账户专属工作流的智能体前端 — levelsio 的讨论串展示了一位用户如何为个人查询放弃固定 UI,而 arnasgold 的回复则把缺失的产品直接说破:需要有专门化智能体,架在受限 API 和服务之上,为非技术用户服务。Brodie 的 AEO 实验则从供给侧展示了同样的迁移:页面正在变成智能体的源材料,而不只是目的地。

[+++] 面向多智能体工作的记忆、路由和记分层 — Ditto、Hermes 家庭实验室,以及 antpalkin 所说的“一个你没法和它争辩的记分员”,都指向同一个缺口。团队真正需要的,是连续性、评估循环和可强制执行的约束,而不是又一个套在单模型外面的包装器。

[++] 面向中端硬件的本地优先套件 — 8GB 的 Bonsai/PrismML 配置,以及 Unlimited OCR 公布的配方,都说明人们想在普通消费级或准专业设备上跑出真正有用的本地 AI。这个机会属于中等强度,因为受众偏技术,但痛点明确,而且反复出现。

[++] 面向物理世界输出的编程智能体适配层 — Text-to-CAD 证明,人们想让智能体产出真正能走出聊天窗口的成果:CAD、URDF、机器人描述和打印任务。这比一个 demo 更强,因为公开仓库已经把技能面完整摊开了。

[+] 面向品牌的 AI 引用与波动可观测性 — Brodie 的引用页实验,以及 Alex Groberman 关于波动的讨论串,都表明这是一块真实市场需求,但赛道会很拥挤,而且归因依然混乱。正在浮现的优势,是把答案引擎引用与页面类型、转化和算法变化真正挂上钩的测量能力。


8. 要点总结

  1. 最大的产品信号不是新基准测试,而是界面塌缩。 一位高互动量创业者说,他现在做个人分析时,已经绕过应用和网站,直接使用 Claude Code,或者通过它生成的小工具。 (source)
  2. 开放权重模型的竞争,如今既是能力故事,也是分发和政策故事。 免费 Qwen 预览、Kimi 的设计 / 价格主张,以及 Sacks 的护栏争议,同一天都在高强度发酵。 (source)
  3. 基础设施讨论正在变得更偏运营。 最强的证据不只是股票逻辑,而是 DGX Spark 家庭实验室拓扑、8GB 本地智能体基准,以及横跨本地与云端模型的路由栈。 (source)
  4. 最可信的构建方向,是记忆层、评估层和物理输出适配层。 Ditto、CRAFT、Unlimited OCR 和 Text-to-CAD,瞄准的都是通用聊天界面解决不了的特定失效点。 (source)
  5. 品牌已经在学习:答案引擎引用的是具体商业页面,不是空泛的思想领导力内容。 今天的证据更偏向那些能在 ChatGPT 和 AI 搜索里被直接引用的对比页、定价页、集成页、实施页和文档页。 (source)