跳转至

Twitter AI - 2026-08-14

1. 人们在讨论什么

1.1 评判智能体表现时,看的是编排设计,不是挑模型 (🡕)

今天被反复提到的一课是,团队现在评判智能体,更看重编排方式、监督机制和反馈闭环,而不再只看底层模型本身。至少有 3 条高信号内容从不同角度说明了同一个结论:协调拓扑、运行框架设计和闭环评估,即使在模型不变的情况下,也会实质性改变结果。

@Argona0x 认为(166 个赞、4 条回复、312 次收藏、36,535 次浏览),Google Research 和 MIT 的一项 Nature 研究在提示词、工具和算力都不变的情况下,仅仅因为智能体图不同,就让同一批任务的表现从比单智能体差 70% 摆到比单智能体好 80.8%。给出的实操建议也异常具体:先为单智能体做基准测试,只有在单体基线较弱时才加入监督者,不要让工作智能体互相读取彼此的草稿,并在模型升级后重新跑一遍对比。

@0xClodex 总结了(17 个赞、10 条回复、18 次收藏、553 次浏览)Harrison Chase 的拆解:模型只占智能体栈的三分之一,剩下的部分落在上下文、运行框架、评估、可观测性,以及由 trace 驱动的改进闭环里。最有力的一条回复提炼了社区共识:团队往往只做到评估这一步,却从未搭建起把失败转成更好路由和上下文的飞轮。

讨论要点: 回复里并没有否认更强模型的重要性;大家只是把问题收束到了一个更具体的层面:监督机制、上下文注入时机和错误隔离,究竟在哪些地方比模型本身更重要。

与前日对比: 8 月 13 日已经强调了面向部署的度量;8 月 14 日又往前走了一步,开始直接讨论协调图本身。

1.2 开放权重重新显得可信,因为后训练和本地执行都在前进 (🡕)

今天,开放模型的讨论不再是意识形态之争。大家讨论的是,它们是否已经成为可落地的本地系统:能靠后训练、权重发布,以及在通用硬件上的工程技巧,拿到可量化的提升。

@kimmonismus 报告称(173 个赞、17 条回复、31 次收藏、12,121 次浏览),GLM-5.3 延续了 GLM-5.2 相同的 743B 基座模型,而所有提升都来自把后训练扩展到更长、更多工具使用的任务上。Z.ai 公开的 GLM-5.3 文档 也重复了这一说法,并列出 Terminal-Bench 3.0 从 4.6 跳到 28.3、DeepSWE v1.1 从 46.2 跳到 66.9、ExploitBench 从 24.4 跳到 54.4,同时因为安全评估还没跑完,开放权重暂缓发布。

GLM-5.3 基准测试表,对比其在编程、网络安全和智能体评分上相对 GLM-5.2、Claude、DeepSeek、Qwen 和 GPT 模型的表现

GLM-5.3 发布说明,强调更强的编程能力、新涌现的网络安全能力,以及开放权重发布前两周的延迟

@sudoingX 展示了(159 个赞、12 条回复、122 次收藏、6,709 次浏览),Qwen 3.8 27B 的多 token 预测头其实已经包含在发布的 GGUF 里,只需在 llama.cpp 里加一个参数开关就能启用,让 RTX 3090 从 31 tok/s 提升到 41.3 tok/s,5090 笔记本则从 36.7 tok/s 提升到 50.9 tok/s。回复里还补充了更多公开复现实验数据,包括一份 4090 报告——在生成 18,000 多个 token 的情况下达到 106.2 tok/s,还有一位 RX 9060 XT 用户称速度大致翻倍。

@rohanpaul_ai 强调了(9 个赞、1 条回复、2,063 次浏览)阿里巴巴的开放权重 Qwen3.8-27B:这是一个面向本地部署的 27B 多模态模型,具备 262K 原生上下文、可选的推理控制,并据称在 SWE-bench Pro、CoWorkBench 等智能体式任务上具有竞争力。附上的对比表让“适合本地部署”这件事从口号变成了更具体的论点。

Qwen3.8-27B 基准测试表,显示其在编程和智能体评分上,相较早期 Qwen 版本和 Claude Opus 4.6 Max 仍具竞争力

@paulg 观察到(247 个赞、39 条回复、17,524 次浏览),一年前几乎被判死刑的“初创公司调开放权重模型”这条路,如今“看起来又回来了”。回复把门槛说得很清楚:如果定制现在只要几小时而不是几周,而且开放模型在任务质量上已经足够接近,那么这条调优闭环就值得重新开启。

讨论要点: 眼下的争论不再是“开放还是封闭?”,而是差距是否已经小到,后训练、微调和本地部署能够切实胜过为通用前沿模型持续付租。

与前日对比: 8 月 13 日围绕更便宜的编程模型和任务经济性展开;8 月 14 日则补上了公开证据,表明开放权重和后训练现在确实能改变这笔账。

1.3 团队更信任针对工作负载的调优和第一方数据,而不是默认推理设置或泛化提示词 (🡕)

另一组强信号帖子认为,现在真正有价值的 AI 提升,来自为任务选对推理强度档位,并让模型接入真实运营数据,而不是盲目把推理强度拉高,或者让它给出泛泛的点子。

@octane_security 报告称(15 个赞、6 条回复、596 次浏览),在其安全检测流水线的两个阶段里,GPT-5.6 max 都不是最优配置;在新变体胜出的那个阶段,xhigh 以更低成本击败了 max。这张图的重要之处在于,它把“多想一点”从一句直觉,变成了一个需要实测的工作负载调优问题。

Octane Security 图表,对比 GPT-5.6 各变体在两个流水线阶段的表现,并显示 xhigh 或 high 配置以更低的索引成本击败 max

@morganlinton 发布了(14 个赞、3 条回复、1,411 次浏览)一组 VulcanBench 推理强度扫参结果:Grok 4.6 在 medium effort 时 pass@1 达到 87.0%,到 high 时掉到 73.9%,在 xhigh 才只部分回升。有条回复明确确认,在这套基准上 medium 的表现优于 high 和 xhigh——而这正是公开排行榜通常不会展示的那种旋钮级结果。

VulcanBench 报告,显示在 23 个已合并 PR 任务上,Grok 4.6 在 medium effort 下的 pass@1 高于 high 或 xhigh

@0xrux 认为(18 个赞、5 条回复、397 次浏览),Claude 更锋利的用法不是“给我 10 个视频创意”,而是把模型直接接到真实频道分析数据上,让它根据留存、CTR、搜索和评论来推理。@yunta_tsai (240 个赞、18 条回复、9,192 次浏览),Grok 4.6 多模态把日常视频评审工作流提升了 10 倍到 100 倍,并在回复里澄清,它能处理任意视频速度,同时仍能快速给出答案。

讨论要点: 这里共享的标准可以概括成“证据导向的 AI”:旋钮要对、连接器要对、工作负载要对、数据也要对。

与前日对比: 8 月 13 日把评估推进到面向部署的度量;8 月 14 日则把同样的思路推进到了推理强度控制和实时数据连接器。

1.4 构建者持续在发布狭窄的智能体工作表面,而不是一个通用机器人 (🡕)

今天最可信的产品分享,不是“一个智能体包办一切”,而是边界清晰、接口明确的系统:法务审查、渗透测试、具身 3D 智能体,或者机器人数据采集。

@harvey 表示(4 个赞、1 条回复、411 次浏览),它为 Review Tables 后训练了一个 GLM-5.2 变体,律师可以在最多 10,000 份文档上提出多达 500 个问题;同时,成本降低了 50%,答案和引用质量反而提升。配图也异常具体:一张展示文档网格界面,一张梳理合成数据集流水线,另外两张量化了它相对前沿基线在答案质量和成本上的取舍。

Harvey 成本与答案质量对比图,显示其训练后的 GLM-5.2 变体以更低的单元成本,位于前沿基线之上

Harvey 基准测试柱状图,显示训练后的 Review Tables 模型在答案质量上领先 Fable 5、GPT-5.6 Sol、Opus 5、Sonnet 5 和 GLM-5.2 基座模型

Harvey 数据集构建图,显示开源法务数据、任务生成、oracle 标注、专家审查,以及合成的 Review Tables 数据集

@tom_doerr 分享了(7 个赞、2,206 次浏览)PentestAgent;公开的 README 把它描述为一个基于 LiteLLM 的 TUI,带有 /assist/agent/crew、浏览器工具、包含渗透测试工具的 Docker 镜像,以及用于分层协作的 MCP 子智能体启动能力。@fourjjjjt 概述了(18 个赞、5 条回复、190 次浏览)three.ws;其公开的 README站点 把它描述为一个浏览器原生的 3D 智能体平台,支持 text/image-to-3D、实时语音和面部捕捉、MCP 与 A2A 工具连接,以及按次聊天结算的 USDC 支付流。@Kai_Nimo02 (18 个赞、17 条回复、96 次浏览)Axis Robotics 描述为面向物理 AI 的“复利式”数据引擎:仿真与人工纠错会把下一批机器人数据聚焦到当前模型的失败点上。

讨论要点: 这条信息流更奖励那些任务边界狭窄、数据边界明确、运行闭环可见的系统。

与前日对比: 8 月 13 日偏好的是相较通用聊天机器人更狭窄的工作表面;8 月 14 日则把这一模式延伸到了智能体平台、企业审查系统和机器人数据基础设施。


2. 令人困扰的问题

编排和推理旋钮仍会静默失效

严重程度:高。最清晰的痛点是,智能体质量可能会因为多数团队仍未显式度量的因素而骤然坍塌。@Argona0x 认为(166 个赞、4 条回复、312 次收藏、36,535 次浏览),只因智能体布线不同,同一任务就可能从明显负收益摆到明显正收益;@octane_security 展示了(15 个赞、6 条回复、596 次浏览)和 @morganlinton 展示了(14 个赞、3 条回复、1,411 次浏览),更高的推理设置会更贵,却仍可能因为工作负载不同而输给 medium 或 xhigh。@0xClodex 总结了(17 个赞、10 条回复、18 次收藏、553 次浏览)同一种从运行框架侧暴露出来的失效模式:当智能体失败时,缺的往往不是模型智力,而是上下文交付。当前的权宜方案,是显式做拓扑测试、按阶段扫推理强度档位,再配合 trace 驱动的评估闭环。这非常值得直接构建。

AI 系统在实际工作节点仍缺少正确的数据

严重程度:高。几条帖子抱怨的,与其说是模型弱,不如说是闭环里缺少证据。@0xrux 认为(18 个赞、5 条回复、397 次浏览),创作者如果没有真实的 YouTube 分析数据,只问点子,只会得到泛泛的垃圾输出;@Kai_Nimo02 则把(18 个赞、17 条回复、96 次浏览)机器人领域的瓶颈描述为缺少“行动互联网”,而不是模型智力。就连 Harvey 的 帖子(4 个赞、1 条回复、411 次浏览)也从企业法务工作的角度说明了同一点:只有当团队在精确的文档审查运行框架内部,构建出合成且经过审查的任务语料,质量才真正提升。当前的权宜方案,不是再写更泛的提示词,而是做连接器密集、面向特定领域的数据管道。这非常值得直接构建。

买家仍然分不清定制 AI 和薄套壳

严重程度:高。@mardehaym 报告了一起(8 个赞、6 条回复、1,009 次浏览)PE 尽调案例:一个号称专有的 AI 平台,最后发现只是套在 GPT-4o 外面的一层 React 前端和系统提示词;他也借此列出了 4 个反复出现的尽调缺口:模型依赖、训练数据责任、人才集中风险,以及集成失败风险。@paulg 指出(247 个赞、39 条回复、17,524 次浏览),开放权重模型的调优之所以再次可行,只是因为经济性和质量差距都变了;这也隐含着一个更高门槛:如果有人声称自己靠薄套壳就能建立持久差异化,现在更难自圆其说。当前的权宜方案,是做技术尽调,检查真实的模型所有权、训练数据来源,以及被替换风险。这非常值得直接构建。

企业 AI 的 ROI 和提供商选择仍然模糊不清

严重程度:中。@AlphaSenseInc 分享了(4 个赞、2 条回复、3 次收藏、510 次浏览)一段对 Dell 员工的采访摘要:在上下文重、token 消耗高的任务上,Anthropic 正从 OpenAI 手中拿走更多工作负载份额,因为它的质量更稳,规模化后的有效成本更低;但非编程类聊天机器人和推理工作的 ROI 依然为负,而开源部署还带着隐性的人员和集成成本。真正有用的抱怨并不是哪家模型提供商“已经永远赢了”,而是只有把 token 体量、隐私约束、切换摩擦和内部运维人头都算进去,真实成本才会显形。这值得围绕它做产品。

企业 AI 采访文字截图,突出聊天机器人和推理类工作仍为负 ROI,而编程工具是最明确的正回报

安全和审核系统的执行仍可能不均衡

严重程度:中。@Wallface 认为(6 个赞、74 次浏览),在扫描滥用行为时,X 的 AI 安全流水线似乎会跳过“High PageRank”账号,并附上一张公开审计图,显示某个已认证账号有 406 条存档攻击性帖子,而且这些攻击性帖子的中位触达高于该账号的普通内容。这条帖子并不能证明内部标签分配本身,但它确实呈现了一个具体用户投诉:论据来自代码阅读和归档结果,而不是抽象的公平口号。当前的权宜方案,是让系统具备独立可审计性,并在不同账号层级上一致应用分类器。这值得构建。

审计图汇总了 406 条已归档攻击性帖子、更高的攻击帖中位触达,以及一则关于审核扫描不均衡的公开投诉里点名的目标


3. 人们期望的功能

能按任务自动选择最佳配置的编排与推理强度调优

大家显然想要一个控制层,能决定何时保持单智能体、何时展开多路,以及每个阶段该买多少推理强度。@Argona0x 认为(166 个赞、4 条回复、312 次收藏、36,535 次浏览),监督机制和拓扑对结果的影响,比多加一次模型调用还大;@octane_security 展示了(15 个赞、6 条回复、596 次浏览)和 @morganlinton 展示了(14 个赞、3 条回复、1,411 次浏览),默认的 high/max 推理设置,放到真实流水线里可能反而是错误选择。这个需求很实际、很紧迫,而且直接和成本、延迟、失败率挂钩,而不是出于好奇。机会类型:直接。

低成本本地定制高能力开放模型

整条信息流都在追问这样一个世界:性能强的本地模型可以快速适配真实工作。@paulg 观察到(247 个赞、39 条回复、17,524 次浏览),开放权重模型的调优又回来了;@sudoingX 展示了(159 个赞、12 条回复、122 次收藏、6,709 次浏览),llama.cpp 的一个参数开关就能显著提高 Qwen 3.8 的消费级 GPU 吞吐;@RituWithAI 介绍了(8 个赞、65 次浏览)Unsloth,把它当作在笔记本或免费 Colab 上做微调的一条路径。这是一个直接的产品需求,因为大家要的是更快的适配闭环,而不只是更便宜的推理。机会类型:直接。

建立在用户自有数据上的有证据支撑的 AI 助手

几条帖子都指向同一种缺失的产品:能看到用户真实数据并基于其推理的助手,而不必逼用户手动导出数据,或者依赖脆弱的提示词绕行方案。@0xrux 想要(18 个赞、5 条回复、397 次浏览)Claude 直接连到 YouTube 分析数据;Harvey 的 帖子(4 个赞、1 条回复、411 次浏览)展示了建立在真实法务文档任务上的审查运行框架价值;而 @Kai_Nimo02 想要(18 个赞、17 条回复、96 次浏览)的,则是让机器人模型吃到围绕失败点的行动数据,而不是泛化的互联网规模文本。这个需求既实际也紧迫,因为抱怨的不是 token 不够,而是证据缺失。机会类型:直接。

面向 AI 业务的技术尽调与来源追踪工具

市场也在要求一种方式,去验证一家 AI 公司到底真正拥有什么。@mardehaym 报告了(8 个赞、6 条回复、1,009 次浏览)一起揭穿薄套壳的尽调失败,而 GLM-5.3 的讨论又补了另一层:如果同一个基座模型在后训练之后就能大幅改变表现,那么只看模型身份本身,根本不足以理解能力、安全性或护城河。这个需求一半是实际需求,一半是围绕采购、并购和合规的信任需求。机会类型:竞争型。


4. 使用中的工具与方法

工具 类别 评价 优势 局限
图工程 编排方法 (+/-) 把监督、多路展开和单智能体基线显式化;能实质性改善任务结果 收益依赖任务;额外智能体也可能让结果更差
GLM-5.3 开放权重基础模型 (+) 基座模型不变、后训练更强、编程/网络安全分数更高、1M 上下文 权重因安全审查延后;部分任务上仍落后于顶级闭源模型
Qwen3.8-27B 本地多模态开放模型 (+) 本地编程/智能体分数强、262K 原生上下文、可控推理、适合消费级 GPU 基准集仍在演进;部分说法仍由厂商或推文主导
Unsloth 微调栈 (+) 降低内存需求、可在低价硬件上运行、可导出到 Ollama/vLLM/GGUF 本数据集里的公开证据属二手信息,仍需用户自行验证
VulcanBench 推理强度扫参 基准测试 / 评估方法 (+) 能看出非单调的推理强度曲线、没跑完的实验,以及每个解决结果的成本取舍 套件规模小,且运行间波动意味着结果不具普适性
Octane 配置扫参 内部评估方法 (+) 按阶段测试配置,胜过默认 max 推理,并把成本与分数绑定 只适用于一条安全流水线;设置不一定能直接迁移
Claude YouTube 连接器工作流 连接器 / 分析助手 (+) 建议建立在留存、CTR、评论和频道数据上,而不是泛化提示词 依赖连接器接入;只有有第一方数据的场景才有帮助
Anthropic 在高 token 企业工作负载上的表现 模型提供商选择 (+/-) 在一个企业案例中,高 token 体量下具备更好的长上下文表现和更低有效成本;隐私立场也影响供应商选择 基础价格更高、工作流锁定存在,且整体非编程 ROI 仍为负
PentestAgent 安全智能体框架 (+/-) 多模型支持、浏览器和终端工具、Docker 镜像、MCP 子智能体 需要搭建、API key,以及在敏感领域中的操作判断
three.ws 具身智能体平台 (+/-) 浏览器原生 3D 智能体、text/image-to-3D、工具连接、支付、AR 界面范围复杂;可持续采用的证据仍处早期
Harvey Review Tables 定制模型 任务特定模型 + 运行框架 (+) 在明确的法务工作流内,以更低成本获得更好的答案/引用质量 领域特定,且只由一家公司内部任务界面支撑

整体情绪偏向乐观,且更偏好任务更窄、界面更明确的系统,但这种乐观是有条件的。大家喜欢 GLM-5.3、Qwen3.8-27B、Harvey 的定制模型,以及由连接器驱动的 Claude 工作流,不是因为它们更大或更新,而是因为它们看起来可部署、可度量。@AlphaSenseInc 分享了(4 个赞、2 条回复、3 次收藏、510 次浏览)一条更谨慎的企业迁移故事:Anthropic 正在上下文更重的工作上从 OpenAI 手中拿走份额,但在编程之外,整体 ROI 仍为负,开源栈也仍带着隐藏的集成成本。当天共同的权宜方案模式始终一样:调运行框架、调推理强度旋钮、接入第一方数据,再在真实工作流上验证,然后才为更多推理或更多智能体买单。迁移压力正把大家从通用前沿默认值推向一整套开放模型、评估扫参、领域连接器和有边界的智能体工作表面。


5. 人们在构建什么

项目 构建者 功能 解决的问题 技术栈 阶段 链接
Harvey Review Tables 定制模型 @harvey 为超大文档表格中的问答与引用而后训练的法务审查模型与运行框架 前沿模型推理成本过高,而且在审查表格规模下需要提升引用质量 GLM-5.2、Applied Compute AC2、合成法务任务生成、单轮 RAG、智能体式搜索 已发布 帖子
PentestAgent @tom_doerr 用于黑盒安全测试的开源框架,提供 assist、agent、crew 和交互模式 手工渗透测试工作流仍需要操作者在工具和模型之间做太多编排 Python、LiteLLM、Docker、Playwright、浏览器 + 终端工具、MCP 子智能体 Beta 仓库
three.ws @trythreews 支持具身 avatar、工具、支付和可选链上身份的浏览器原生 3D AI 智能体平台 纯文本智能体缺少差异化界面、变现通道和可移植的具身交互界面 Forge text/image-to-3D、MCP、A2A、LiveKit、ElevenLabs、Base/Solana、WebXR 已发布 站点 · 仓库
Axis 复利式数据引擎 @axisrobotics 仿真优先的机器人数据平台,会把人工投入导向当前模型的失败点 机器人模型缺少可扩展的行动数据和有针对性的失败纠正闭环 浏览器遥操作、仿真轨迹、AXIS-V1 数据集、自我中心视角采集、贡献跟踪 Alpha 帖子

Harvey 是当天最清晰的例子:一家公司如何把一个昂贵的前沿模型问题,收窄成一个领域特定的后训练和运行框架问题。配套材料同时展示了工作流界面和成本/质量取舍,使这个说法比一句泛泛的“我们微调了一个模型”具体得多。

Harvey Review Tables 界面,显示大量已上传合同、提取出的列,以及审查工作流中带引用的模型生成答案

PentestAgent 和 three.ws 指向另一条路:不是做通用聊天,而是做更有立场的智能体平台。PentestAgent 围绕安全工作流和工具访问收窄任务边界,three.ws 则把界面扩展到 avatar、支付和实时互动。Axis 体现的是第三种模式:构建者正沿着栈往下一层走,试图拥有未来机器人模型所依赖的数据引擎。


6. 新动态与亮点

开放权重发布开始继承前沿模型式的安全延迟

@kimmonismus 报告称(173 个赞、17 条回复、31 次收藏、12,121 次浏览),GLM-5.3 的权重在模型发布后还要大约两周才会放出,而 Z.ai 的公开 GLM-5.3 文档 也写明,基座模型保持不变,只是后训练把编程和网络安全分数显著拉高。之所以重要,是因为这组数据展示了一次开放模型发布被拖慢,并不是因为能力不够,而是因为需要在放出权重前先评估并加固这些新能力。

一项只需一个参数开关的本地提速,变成了社区级基准事件

@sudoingX 展示了(159 个赞、12 条回复、122 次收藏、6,709 次浏览),Qwen 3.8 已发布的多 token 预测头可以在 llama.cpp 里直接启用,无需再构建一个独立的 draft model。随后回复把这条帖子变成了一条小型公开复现实验串:不同 GPU 用户纷纷贴出自己的提速和设置。这件事之所以值得注意,是因为它表明社区已经把推理参数开关也当成了产品表面的一部分。

围绕 AI 审核的公开投诉,越来越像审计报告

@Wallface 认为(6 个赞、74 次浏览),其论据来自归档帖子、代码阅读和触达对比,而不是一句泛泛的公平抱怨。即便这条帖子并不能独立证明内部标签分配,它的证据结构本身也值得注意:指标、归档内容和分类器行为,被当作读者应该自行核验的对象,而不只是“相信我”式的叙述。


7. 机会在哪里

[+++] 面向智能体系统的编排与评估调优 —— 证据出现在第 1、2、4 节。@Argona0x 展示了,拓扑可以把结果从明显负向摆到明显正向;Octane 和 VulcanBench 则表明,默认推理设置既可能更慢,也可能更差。如果有产品能按阶段自动选择图结构、监督级别和推理强度设置,就能回应一个被反复提到的现实抱怨。

[+++] 面向领域工作流的第一方数据助手 —— Harvey 的审查表格模型、Claude 的 YouTube 分析连接器、Axis 机器人数据闭环,都指向同一个缺口:人们要的是基于用户自有证据推理的助手,而不是泛化提示词。这个机会很强,因为数据边界明确,痛点也已经进入运营层。

[++] 本地开放模型加速与定制工具包 —— GLM-5.3、Qwen3.8-27B、Qwen MTP 提速讨论串,以及 Unsloth 都显示,市场需要一整套东西,让强开放模型更快运行、更便宜适配、更容易自己掌控。竞争一定激烈,但需求具体,而且已经有实践者实验背书。

[++] AI 尽调与来源追踪基础设施 —— 薄套壳尽调故事和 GLM-5.3 安全延迟故事,都指向买家、投资人和运营者在评估 AI 系统时的信任缺口。能映射模型依赖、训练数据来源、后训练历史和替代风险的工具,将服务于采购、并购和合规,而不只是构建者。

[+] 机器人数据基础设施 —— Axis 的帖子还很早期,互动也不大,但它隔离出一个具体瓶颈:模型需要更多围绕失败点的行动数据。如果物理 AI 继续升温,数据层的价值可能会超过任何单个机器人演示。


8. 要点总结

  1. 智能体质量越来越是系统问题,而不只是模型问题。 最清晰的证据来自图工程和运行框架方面的帖子:监督、上下文注入时机和评估闭环都可能主导最终结果。(Argona0x)
  2. 开放权重的势头确实回来了,因为同一天里后训练和本地执行都在进步。 GLM-5.3 的提升没有改动基座模型,而围绕 Qwen 3.8 的讨论串关注的是实用的本地吞吐和部署,不只是头条发布。(kimmonismus)
  3. 把 max 设为默认的一刀切策略,正在失去公信力。 Octane 和 VulcanBench 都表明,更高的推理强度可能更贵,却在被实际测量的工作负载上更差。(octane_security)
  4. 最可信的构建者,都在持续收窄任务边界,而不是承诺一个万能智能体。 Harvey 瞄准法务审查表格,PentestAgent 瞄准黑盒安全测试,three.ws 瞄准具身化的浏览器原生智能体,Axis 瞄准机器人数据瓶颈。(harvey)