跳转至

Twitter AI - 2026-08-19

1. 人们在谈论什么

1.1 智能体运行框架成为可靠性的主要战场 (🡕)

最强的组群不再涉及哪个基模型在孤立中看起来最聪明. 这是关于模型周围的事物:删除护栏、技能评价门、供应商中立的绳索、货币硬化和篡改不明显的日志。 至少 5 件保留的物品将运行时视为现在决定智能体是否可用的东西。

@thsottiaux detailed(单位:千美元)792 点赞数,263 回复数,33,588 浏览量,49 收藏数) Codex 如何固定了破坏性的清理模式,临时工作清除可以指向真实的家庭目录而不是临时文件夹. 该帖子对于一个安全线条来说是异常具体的:它命名了重复使用的环境变量,如$HOME,添加删除目标检查和更安全的临时指令处理,收紧风险许可组合,并称 OpenAI 正在重现目标评价中的失败. 回复数保持了权衡的诚实:一个用户说 ChatGPT 已经删除了他们的应用程序的版本,另一个用户说新铁路现在在清理时"玩得太安全了".

@NVIDIAAI 报告(单位:千美元)112 点赞数,6 回复数,7,886 浏览量,56 收藏数),经核实的技能通过 41 点、 效果 39,和提高效率 35 横跨 300+ 基准。 附加的管道很重要,因为它显示升力不仅仅是一个营销平均值:技能先通过验证,然后分解,然后是现场评价层,用来衡量技能是否真正有助于完成一个真正的任务.

图表 NVIDIA 显示验证、减值和直播的技术评估管道 A/B 在技能获得报告之前进行评估

@svpino 争论(单位:千美元)37 点赞数,8 回复数,3,437(浏览量)80% 在实际使用日内看到故障,然后使用TrueForge作为反例。 推文和公开文件描述一个开源工具 MCP 工具、沙箱、批准、子代理和会议状态; 公众基准写入说它符合克劳德的经纪人 14 计算成本时的企业任务 30% 在 Opus 上少一点 4.8 和关于 75% 减:GLM-5.2。 。 。

TrueForge 架构图显示多个模型提供者,MCP 工具、技能、背景工程特征和人类对开源代理工具的认可

@predotdev 显示(单位:千美元)295oAuth 任务中增加一条现实的货币规则 5 奖励从 0.96 改为 0.25 不改变幸福的逻辑 这是比大多数领导板辩论更干净的失败故事,因为唯一的新要求是同时签入同一身份决定,按到场命令一次。

RL 任务硬化卡,显示模型分数下降 0.96 改为 0.25 在同一任务中添加同时签名要求后

@grybniak 争论(单位:千美元)2 回复数,24views),自动系统现在需要"飞行记录器",而所附的卡片对低参与线来说是异常的混凝土. 他们命名 OpenAI/Hugging Face, Anthropic,,,,,,,,AISI,以及 METR 然后将它们变成对不言自明的事件记录的三项明确要求:重建行动顺序、检测插入或遗漏,以及让独立审查人员核实完整性。

讨论见解:围绕 Warp,SkillEvaluator,和 Codex 的回复都集中在同一个问题上:一旦特工触碰了真正的系统,谁能看见权限,交接,失败的痕迹足够好地阻止损坏而不冻结所有自动化?

与前一天的比较:8 月(半天)18(c) 将利用设计视为基准收益的来源。 8 月(半天)19 将同一主题推入一个更实用的登记册:安全栏杆、审计轨迹、活技能吉他和货币故障模式。

1.2 AI 发现更结构化, 更辅助化 (🡕)

搜索/分发主题在 8 月之后没有消失 17 范围缩小了 而不是专注于爬行政策和漏掉的提示,最强的条目是出版助读页面,仪器解答引擎的能见度,以及构建 MCP 输入点,所以产品不仅被引用 AI 系统,但也可以在系统内部使用。

@jakezward 争论(单位:千美元)40 点赞数,10 回复数,3,094 浏览量,108Tally 的收藏数 AI 搜索现在是其顶级的获取频道,使用 10,000+ 据报每周有新用户说 AI 平台浮出水面,跟踪 ChatGPT 的注册 5x 五月过夜. 线程得到了关于力学的具体信息:比较中心、定价表、及时记录、审查收集、AI-面对解释者页,和 a21- 工具 - 工具 - TableMCP 服务器。 公众AI 信息页面MCP 文档直接支持框架: Tally 明确发布 AI 助理准则和披露https://api.tally.so/mcp ChatGPT,克劳德,Cursor,及相关客户服务.

AI 可见度排名截图显示 Tally 位于 Google 、 Typeform 、 Jotform 和 Fillout 的顶端位置

@alex_prompter (单位:千美元)2 点赞数,2 回复数,2,607 浏览量,4 收藏数) Reddit 在 ChatGPT 引用中的份额从 3.8% 至以下各处 1%8 月之后 14,将移位归为“快速观察”数据和背景搜索变化,将一个用户的移位扩展为几个较长、限定式重的搜索。 所附的图是有用的部分,因为它将这种说法转化为一个源格式规则:比较页面、文档和光谱列表比论坛线索更适合生成的搜索。

AI 搜索力学图显示 ChatGPT 将一个提示扩展为多个较长的搜索, 并倾向于比较页面、 文档和论坛线索上的光谱列表

回复数来自@Dinesh78039466在 Tally 线程中添加了从业者版本:硬的部分不是写过一次页面,而是每周通过 ChatGPT 重新运行购买者提问,以及记录哪些品牌被命名.

讨论见解:饲料的发现建议越来越不神秘了. "请推荐:AI"越来越意味着"出版 AI-可读页面,登录提示,并跟踪模型持续引用的来源".

与前一天的比较:8 月(半天)17 重点是爬行器控制和能见度遥测。 8 月(半天)19 转至助理化的文物:AI 信息页、即时生成的比较内容以及 MCP 使产品在被发现后可以调用。

1.3 开放型号是通过包装和可运行的工作流判断的,而不是原始重量 (🡒)

开放模式的势头依然强劲,但有趣的证据不仅仅是存在新的权重。 人们不断附上记忆足迹、准确的运行时设置、货币数字和边际工作基准。 可信度测试正在变成:其他人能复制这个设定吗?

@UnslothAI 已公布(单位:千美元)1,749 点赞数,92 回复数,96,001 浏览量,900 收藏数) Quen3.8- 怎么样?27B 动态 v3.0 超过 10% 更好的顶部 -1% 精确度相同。 公众解析文档拥抱脸型卡添加微博中仅提示的操作细节:1- 位变量大致适合 7- 怎么样?8GB, (中文).8- 位数需求 31GB, (中文).BF16 需求 56GB,则四位数的位置可以运行于 lama.cpp 和 Unsloth 桌面。

Unsloth 动态 v3.0 显示 Quen3 的图表 。8- 怎么样?27B 相对于其他的硬件级和四级大小与精度曲线 GGUF 提供者

@ornith_ 介绍(单位:千美元)49 点赞数,9 回复数,526 浏览量,21 收藏数). 欧尼思...1.5 作为 MIT-有执照的家庭成员 9B 稠密,35B 教育部,以及 397B 教育部,如:86.1 终极奔驰 2.1, (中文).86 打开 SWE-已经核实,56 在 DeepSWE,和 71.2 在 Tolathlon - 验证。 图像很重要,因为它把这些数字放在 DeepSeek 旁边 V4-闪电 GLM-5.2 和克劳德·奥普斯 4.8,使预定的竞技套装明确.

@ayam_alvin10 突出介绍(单位:千美元)48 点赞数,27 回复数,822 视图) 灵 --3.0- 包括精确的 vLLM 分支的闪光导线,MTP 设置、 吞吐量数字和完整的本地代理路径, 而不是空模型安装 。 实际索赔涉及可复制的装置:35 单流中的符号/秒,141 并列 8 个, 呼叫有线的工具, 和一个浏览器的带子,在结尾。

@HelloSurgeAI launched(单位:千美元)13 点赞数,3 回复数,1,386 浏览量,5 收藏数) 星期二边疆工作指数,其中寓言 5 得分 66.8, (中文).GPT-5.6 阿苏 66.7,则 DeepSeek v4 Pro 则 59.7 穿过一个混合的工作日套房。 该图表有助于保持开放模式的乐观:包装和可部署性得到改善,但有一个公共基准的顶端仍然有前沿封闭模型。

讨论见解:共享的证明标准不再是"信任我们的基准". 是"显示硬件等级,四级,分支,货币数字,比较集".

与前一天的比较:8 月(半天)18 已经关心可部署性。 8 月(半天)19 进一步向可公布的食谱、包装纪律和边际工作基准迈进。

1.4 基准转向流程质量和应用一级的工作( ) (🡕)

基准故事再次拓宽. 8 月(半天)18 已经从模型转向了金属 8 月(半天)19 从利用转向了工作本身:发现工作流,法律应用,生产事件分析,以及基准任务是否仍然够硬到重要的问题.

@rohanpaul_ai framed(单位:千美元)13 点赞数,7 回复数,2,606 视图)TRACES 作为发现的基准 AI 而不是回答检索。 链接Apodex 发现纸说调查的框架 561 工业,组装 423 高价值现实世界问题,已选定 20 并评估工具、修理、替代办法、一致性、证据和范围与最终成功分开。

@aguozy 已公布(单位:千美元)2 回复数,32 视图)AI 法律工作应用领导板。 所附图表是有用的证据,因为它将应用程序配置排在合同工作流中,GPT-5.6Sol(Codex/Web)和 Claude 变体在双子座前组装 3.1 显示视图中的 Pro 和微软副驾驶.

法律基准图表,对照多种形式质量,规划合同-工作流任务通过率 AI 应用程序,使用 GPT-5.6Sol 和 Claude 变体集中在牵头区域

@PhyByte 介绍(单位:千美元)2 点赞数,1 回复数,116Dev Bench 作为生产调查工作的基准:日志分析、异常检测、模式相关性、衡量时间序列、根源摘要、多式联运 RCA,以及效率。 记分卡比发射副本更能说明问题,因为它们显示的是加权的优先业务事项,而不是一个抽象的分数,包括发现异常点。25% 和多式联运 RCA 时间 20%。 。 。

@morganlinton 显示(单位:千美元)5 点赞数,6 回复数,830 视图),从建构方看基准饱和度是什么样子. 他的纸条上写着 Grok4.5 已解决 20 页:123 新的 Python eval 套房中的任务,他视这套套房为证据太容易,而不是边界已经最终解决的证据。

讨论见解:即使是支持性的回复数,也强调了这一进程,而不是一字不差。 这个问题不断演变:系统是否善于调查,修复错误,幸存的货币,解决了真正的应用形状?

与前一天的比较:8 月(半天)18 从原始模型到利用和搜索后端,扩大了基准。 8 月(半天)19 它们再次扩大到发现系统、法律应用、生产诊断和饱和控制。


2. 什么令人们沮丧

快乐之道的代理 演示仍然破解 一旦出现真正的条件

严重性:高. 最具体的挫折不是模型 IQ 是关于演示路径外的脆性@svpino (单位:千美元)37 点赞数,8 回复数,3,437(浏览量)80% 在真正使用一天之内 代理演示失败,@thsottiaux(单位:千美元)792 点赞数,263 回复数,33,588 浏览量,49bookmarks)描述了一个可以删除用户文件的 Codex 清理错误,以及@predotdev(单位:千美元)295 视图)显示分数崩溃 0.96 改为 0.25 在 OAuth 任务中添加一个货币规则后。@grybniak(单位:千美元)2 回复数,24),然后将同样的痛苦变成了可观察性的投诉:没有飞行记录器,最终输出就不再足够了. 应对模式是明确和昂贵的——桑德箱、批准、范围缩小和更多的木材。 这是直接值得建造。

基准饱和是隐藏失败模式 人们实际关心

严重性:高. 饲料反复显示,目前的基准格式可以给生产中仍然脆弱的系统打理。@morganlinton(单位:千美元)5 点赞数,6 回复数,830 意见)a20 页:123 格鲁克 4.5 作为标志 他的 Python eval 太容易了 而不是一个稳定的赢家@rohanpaul_ai(单位:千美元)13 点赞数,7 回复数,2,606 意见)TRACES 因为很多重要问题 都没有答案@aguozy(单位:千美元)2 回复数,32 有争论的律师使用应用程序而不是模型,以及@PhyByte(单位:千美元)2 点赞数,1 回复数,116 加权异常探测和多式联运 RCA 较易分类。 人们正在通过建造特定域的套房,增加货币层和应用程序层,以及拒绝信任单分领导板来应对. 这是直接值得建造。

AI 现在对结构化文献的奖励比环境社会证明多

热度:中高. 搜索-分发线意味着对任何依赖通用引用或论坛嗡嗡声的人征收新税。@jakezward(单位:千美元)40 点赞数,10 回复数,3,094 浏览量,108 收藏数)将 Tally 的游戏本描述为比较页,AI-面对解释、迅速遥测和 MCP 连接,同时@alex_prompter(单位:千美元)2 点赞数,2 回复数,2,607 浏览量,4Bookmarks)说,Powerwatch 的数据显示 Reddit 在 ChatGPT 中的引用份额在搜索变得更具修饰力后急剧下降. 工作轮廓是可操作的,而不是创造性的:写页回答模型所写的搜索,然后继续测量. 这是值得建造的。

云软件厂仍然没有接受的许可和爆炸半径答案

热度:中高.@zachlloydtweets(单位:千美元)50 点赞数,6 回复数,2,997 浏览量,26Bookmarks)将云软件工厂定位为每个开发商的代理无序扩展的答案,但回复数立即转移到爆炸半径:你如何在数据库访问,检查点,以及每次运行的交割范围进行测距?@svpino认为大多数团队应该从基金会开始,参考从安全角度添加相同的信息:身份,沙箱,语义网关必须合作. 团队正通过集中代理在云中进行应对,但许可模式仍未确定. 这是值得建造的。


3. 人们希望存在的

自动代理机的飞行记录器

最明显的实际要求是,要有一个不言自明的记录,说明一个智能体实际上做了什么。@grybniak(单位:千美元)2 回复数,24),并让独立审查人员核实完整性,同时@thsottiaux(单位:千美元)792 点赞数,263 回复数,33,588 浏览量,49bookmarks)描述了为何存在这种需要:当清理逻辑出错时,用户需要确切知道目标是什么以及原因. 公众参考提供了一种有签名交易和可审计分类账的部分模式,但更广泛的市场仍然缺乏标准的运行时级记录器。 机会类型:直接。

流程质量、货币和应用的基准

人们实际上要求一个更像真正工作的基准层。@rohanpaul_ai(单位:千美元)13 点赞数,7 回复数,2,606(浏览量)TRACES 因为许多科学任务需要发现而不是检索,@predotdev(单位:千美元)295) 显示同时行为可以突破看来已经解决的任务,@aguozy(单位:千美元)2 回复数,32 有争议法律买方需要应用领导板而不是模型领导板。 这种需要是实际和紧迫的,因为公众得分日益影响购买、路由和信任。 机会类型:直接。

AI-面对文档、快速遥测和本地助理入境点

Tally 线使这种需求在产品方面变得明确。@jakezward(单位:千美元)40 点赞数,10 回复数,3,094 浏览量,108 收藏数)描述了一种 AI 信息页、即时记录、比较内容、审查收获和远程 MCP 服务器作为一个协调获取表面,同时@alex_prompter(单位:千美元)2 点赞数,2 回复数,2,607 浏览量,4 收藏数)认为,ChatGPT 内部的源首偏好已经转向了匹配扩展的,限定重的搜索的页面. 需要不仅仅是 "SEO(单位:千美元)AI" ;这是助理阅读、引用和可以采取行动的新控制面。 机会类型:直接。

扩大的云工厂,而不是未经管理的笔记本电脑代理

@zachlloydtweets(单位:千美元)50 点赞数,6 回复数,2,997 浏览量,26 收藏数明确规定了需求:公司需要能够对云层中的工作进行分解、分类、执行、审查和监测的代理商,但他们不希望每个工程师在笔记本电脑上即兴地进行堆叠。MCP 证书。@svpino设计出同样需要的绳索@kane_120(单位:千美元)5 点赞数,2 回复数,134 公司已经雇用了能够从专业角度评估这些编码代理工作流的人。 需求是实际的,但市场将具有竞争力,因为许多销售商竞相成为控制飞机。 机会类型:竞争性。


4. 使用的工具和方法

工具 类别 攻击 强度 限制
编码 /GPT-5.6 代码 编码代理 (+/-) 添加删除目标检查、更安全的临时指令处理、更严格地审查风险指令以及基于重播的安全 val 只因为有破坏性的清理行为传到用户手中;一些回复数已经抱怨它现在可能过错
TrueForge 特工牵引 (+) MCP 工具、沙箱、批准、次级代理、当地和托管模式以及针对克劳德管理智能体的公共成本/质量基准 需要利用设置和基础设施选择;目前的公共基准故事中心是一个 14- 任务企业套房
SkillEvaluator 智能体技能评价 (+) 将验证、分解和现场评价分开,然后报告衡量升力,而不是假设每一种技能都有帮助 公开证据大多仍然是供应商制作的,第三方验证少于成熟的基准项目
Unsloth 动态 v3.0 为文三.8- 怎么样?27B 量化/开放型包装 (+) 索 赔 >10% 顶级 1% 相同规模的改进,7- 怎么样?8GB 1-bit 选项,以及与本地常见运行时的兼容性 仍然取决于供应商运行的基准方法和谨慎的硬件/运行时调试
Ornith-1.5 打开 LLM (+/-) MIT 许可证、量化变体和强烈的编码/代理基准差 社会证据和独立验证比边境封闭式释放要少得多
塔利语 NameAI 资料+MCP 萨阿斯/AI 发现 (+) 组合 AI-面对文件,助理准则,MCP 进入,并迅速将能见度跟踪到一个采购表面 需要不断保持结构化内容并持续进行引用测量
TRACES/ Apodex 发现 研究基准 (+) 评价工具的使用、修理、替代办法、一致性、证据和范围,而不是仅仅评价最后答案 新的基准,公共采用率低,第三方运行有限
DevBench 业务基准 (+) 分数生产调查工作,披露权重,包括价格敏感性比较 早期基准,现场排名仍在变化
星期二边疆工作指数 工作日基准 (+/-) 将图表读取、长文本工作、写作、判断和代理任务合并为一个专业-情报分数 一个滚动的分数可以平整重要的任务等级差异

最快乐的反应是,这些工具暴露了它们的工作流假设。 人们相信,当他们表明结果是如何产生的、加权的以及失败界限位于何处时,他们就会利用这些手段和基准。 移徙模式从一个通用的领导板转向一个混合的工具链:公共工作日指数、实用法律基准、生产-调查套房、AI-以及使模型在下面可互换的不偏重任何用途。


5. 什么是人们是建筑

项目 谁造的? 它会做什么 问题解决了 堆叠 阶段 链接
扭曲工厂 @zachlloydtweets 云软件构件层,用于分类、规格、执行、审查、核实和监测工作 每个开发商的代理设置 ROI,治理和难以管理的证书范围 API, (中文).SDK, (中文).CLI,Slack/Linear/Jira/GitHub/ (英语:MCP 连接, 云端智能体 贝塔 员额
TrueForge (英语) @svpino/ TrueFoundry (真爱) 用聊天方式使用开源代理 UI, (中文).HTTP API, (中文).SDK、批准、试剂和沙箱 团队需要一个生产运行时 围绕模型而不是临时演示 类型脚本,节点.js, SQLite/Postgres, Redis,,MCP, (中文).UI SDK 沙盒 已装运 员额, (中文).还原, (中文).benchmarking
塔利语 NameAI 发现堆栈 @jakezward铺面塔利 助理记者 AI 信息页面,MCP 服务器、 比较内容和用窗体构建器包裹的快速遥测 产品需要可以发现和在答录引擎内部使用,而不仅仅是搜索结果 SaaS 建构器,AI 资料文件,MCP 服务器, OAuth, ChatGPT 应用程序, Claude 连接器 已装运 员额, (中文).AI 信息, (中文).MCP 文档
Porkicoder 标签标记 77M @hornswoggle567 生成小本地模式 1- 怎么样?3 来自编码会话上下文的单词终端标签标题 平行 AI 编码会话在本地工作流中变得难以区分 FLAN-T5-小微调,6,200 双子座 3.5Flash-Lite 法官,数字海洋 RTX 6000 艾达,M4 马克斯 CPU 推论 已装运 员额
法律基准领导板 @aguozy 合同工作流和数据提取的应用程序级领导板 律师选择应用,而不是原始模型, 需要边行任务传递证据 基准利用、应用记分卡、合同/数据采集轨道 阿尔法 员额
零信托代理参考 @GoogleCloudTech 具有签名交易、沙箱和语义网关控制的参考客户支持和返回代理 自主特工需要安全边界 才能逃过越狱和密码处决 谷歌 ADK 双子座 云 KMS/HSM 图案、图像、语义网关 阿尔法 员额, (中文).还原

TrueForge 和 Warp Industries 从相反的端点指向相同的构造模式.@svpino framedTrueForge 作为可重复使用的开源套路,大多数团队应该从,而@zachlloydtweets framed作为云控制平面的摇摆工厂 使毒剂在工程上可以测量和治理 常见的触发器在两个线程中都很明显:交互式笔记本电脑代理是有成效的,但它们在规模上很难审计,比较,以及安全许可.

Tally 显示了第二种模式:AI-原产地分布本身正成为产品表面. 公众文件证实了线条的说法,即 Tally 不仅为人类参观者建造了内容,而且 AI 摘要页,助理准则,MCP 访问,以及 AI-准备的比较材料。 这与老旧的"写博客文章和希望"游戏本有质的不同,因为它假设助理是买家旅程的一部分,也是产品运行时的一部分.

更小的建筑也一样清晰@hornswoggle567 fine-tuned(单位:千美元)77M 选项卡命名模型,因为编码会话中的文件夹模糊性很烦人,值得设计本地模型,以及@aguozy launched一个法律应用领导板,因为律师评价工作流,而不是参数数。@Al_Grigor added整个趋势下的一个有用的公共代码层,通过出版 10 AI 跨 FastAPI、OpenAI 反应的航运实验室讲习班 API,Batch/Flex 成本控制,Cloudflare,Vercel,和 11Labs.

重复的建造模式是一致的: 控制飞机周围的特工,AI-面对产品周围的发现表面,开发者人类工程学的狭隘专家模型,以及评分应用或工作流而不是原始模型的基准产品. 多个构建者正在从不同角度解决相同的元问题: 转动 AI 从一个令人印象深刻的演示进入一个系统,有人可以路由,审计,比较,维护.


6. 新建和显著

编码代理评价成为明确的有偿作用

@kane_120 flagged(单位:千美元)5 点赞数,2 回复数,134a Mercor 作用,用于 "ML 工程师(编码代理经验)". 公众任务页面说接受的任务报酬 $400,通常采用 2- 怎么样?3 明确要求已经使用 Codex、Claude 代码、Cursor、Windsurf 或双子座的人 CLI 这一点值得注意,因为它将特设小组的编码代理评价转变为专门的合同劳动。

Google 发布了一个零信任参考代理而不是通用安全口号

@GoogleCloudTech 共享(单位:千美元)4 点赞数,1 回复数,409 一个参考客户支持和回报代理, 公众repository具体涉及三层:交易的密码身份,生成代码的 gVisor 式沙箱,以及能够阻断越狱式提示的语义网关。

提供公共代理的讲习班将部署模式转变为可重复使用的代码

@Al_Grigor published(单位:千美元)105 视图)10 AI 带有公共代码的航运实验室讲习班,包括端到端 FAQ 代理,Lambda 部署,Cloudflare 和 Vercel 架构,Batch/Flex 评价成本控制,以及 11Labs 语音导师. 显著的转变不仅是材料是公开的,而且讲习班是作为工作部署途径安排的,有设置说明和明确的堆放,而不是高级辅导。


7. 机会在哪里

[+++] 代理运行时安全和可观察层——Codex 的删除修补,predotdev 的货币崩溃,grybniak 的飞行记录器论证,TrueForge 的认可/sandboxing,以及 Google 的零信任引用都指向了相同的漏洞:人们需要能够约束,登录,重建的系统,并审查代理行为而不关闭自动化.

[+++]AI-产品发现控制飞机- 塔丽的 AI 信息页面,MCP 服务器, 即时遥测和答题引擎比较页面, 加上 explex prompter 描述的“ 即时观察” 式引文转换, 显示帮助团队发布的产品可持久打开 AI-可读来源和衡量助手如何引用它们。

[++] 应用级基准产品. . . . . .TRACES,"法律基准","Dev Bench","星期二",和摩根林顿的饱和度说明都显示了对评分工作流,货币,和处理质量的评价工具的需求,而不只是模拟 trivia 或一弹一弹的答案.

[++] 具有范围许可的云软件厂和 ROI 遥测—— Worp Industries and TrueForge 显示产品形状,而 Mercor 的评价者角色则显示周围已经形成的操作劳动力. 机会不仅仅是协调,而是许可、检查站、衡量和按团队规模进行成本质量比较。

[+] 开发者工作流的小型本地专家模型- Unsloth 的包装工作,Ling 部署指南,和 PorkiCoder Tab Namer77M 这一切都表明,有空间 狭窄,快速,私人模式 做一个工作流好,而不是追求一般的前沿地位。


8. 外卖

  1. 最强的进步信号从模型质量转移到运行时质量.最高标志的项目是删除护栏、技能评价门、吊带设计以及飞行记录,而不是仅一个新的模型。 (来源页:1
  2. AI 发现正在变成一个辅助产品表面。Tally 的线和公开的文档显示 AI 信息页面,MCP 端点和即时遥测目前与传统产品页并列。 (来源页:1
  3. 开放模型在运送精确部署文物时赢得了关注.Unsloth,Ornith,和 Ling 都用量化细节,运行时设置,硬件要求,或侧式图表来配对其索赔. ()来源页:1
  4. 基准设计正朝着流程质量、应用软件和货币方向发展。 TRACES 法律基准,Dev Bench,0.96- 准备...0.25OAuth 的例子都认为,最后答案的准确性本身并不足够。 (来源页:1
  5. 评估和监督编码智能体正在成为其本身的工作类别。Mercor 的公开角色表明公司已经需要专家 可以比较边境编码代理 现实的 ML 以及随后的工作。 (中文(简体) ).来源页:1