科技

国产龙虾Claw大对决 百度第一小米第二

0
Please log in or register to do it.
阅读量:6

游戏资讯

国产龙虾Claw大对决 百度第一小米第二

2026年08月08日 · 萌头条编辑部

国产办公AI迎来”龙虾大对决”:百度文心助手以97.62分登顶,小米MiMo Claw紧随其后。10款产品均分突破94.53分,这场竞争已经从基础能力之争,升级为专业精度与稳定性的终极比拼。

全员站上90分,头部混战进入”毫厘之争”

本次横评覆盖10款主流国产办公AI,每项任务独立重复三次取平均值,最大程度上规避了单次输出带来的偶然误差。结果令人惊喜:10款产品平均分达到94.53分,第一名与最后一名之间仅相差6.31分。即便排名垫底的产品也拥有扎实的基础能力,并未出现真正的掉队者。

更值得关注的是头部格局。百度文心助手以97.62分登顶,总分第二的小米MiMo Claw与第三名腾讯WorkBuddy分差仅有0.13分——头部四款产品分数全部突破96分,任何一次版本迭代或任务侧重的调整,都可能重新洗牌。这种”毫厘之争”恰恰说明,国产办公AI的综合实力已经进入同一水平线,简单拉差距的时代结束了。

代码开发成”分水岭”,专业纵深才是硬差距

分维度来看,内容创作与记忆能力两大板块几乎所有产品都接近满分,写文案、长对话上下文留存等基础办公需求,各家已经做到”人人都会”。数据处理、行业调研板块得分略降,开始显现梯度。唯独代码开发维度撕开了最大的裂缝——行业平均分仅86.99分,最高与最低之间相差17.59分,远远甩开其他测试项。

小米MiMo Claw在此维度拿到97.22分,断层领先其他产品。这背后并不偶然——代码开发对逻辑推理、上下文理解和精确输出的要求呈指数级上升,既考验模型的”知识储备”,也考验厂商在工程调教上的硬功夫。如果连代码都能驾驭,日常办公任务自然是降维打击,这也是小米能稳居总榜第二的关键筹码。

稳定性成隐形标尺,精细化竞争时代已来

榜单之外,另一组隐性问题同样值得警惕——部分总分靠后的产品在多次重复测试中输出差异极大,相同指令每次结果参差不齐。这种”薛定谔式”的稳定度对办公场景是致命的,毕竟没人希望同样一句指令,换个时机就得到两份完全不同的方案,日常使用中埋下的隐患远大于分数本身。

总体而言,国产办公AI已经告别”能不能用”的粗放阶段,正处在”好用、可靠、专业”的精细化竞争节点。对普通用户来说,日常文案和简单表格处理,绝大多数产品都能胜任;但若涉及大量数据处理、行业深度调研甚至代码编写,头部产品,尤其是文心助手与MiMo Claw,显然更适配重度办公场景。想要在这场龙虾大战中笑到最后,光有”大钳子”还不够,还得看能不能各种场合都夹得稳、夹得准。

— END —

萌头条编辑部原创发布 · 转载请注明出处

任天堂强调“定期推出新作”至关重要:这是扩大Switch2装机量的基石
华纳澄清《黑客帝国5》被取消传闻 官宣还在拍摄中
您必须 登录 后才能评论。