补一份 9 月 17 日更新:这周把前面的实验整理成了 DeepDeck WebMCP Bench ,可以测模型完成浏览器任务的能力,也可以测同一模型开启/关闭 WebMCP 后的实际收益。
现在内置 8 个开源网站、49 道任务,覆盖查询、搜索、购物、预约、课程和业务流程;题库起点来自 WindTunnel ,保留了上游署名。也支持直接输入网站 URL + query 做消融实验,不需要 Docker ;可以用网站原生工具,或指定自己的 WebMCP 实现。
这次跑了 GPT-5.6 Terra 、DeepSeek v4.1 Flash 和 Hy3 。两组都保留完整默认工具,包括 Chrome DevTools MCP ,只切换 WebMCP ;每题 10 分钟,不限步数。
全 49 题的评分通过数(开启/关闭)分别是 49/49 · 49/49 、48/49 · 47/49 、49/49 · 48/49 。效率统一看三个模型、两组都通过的同一批 46 题:
• Terra:总 token 5,888,869 → 3,793,871 ,Agent 耗时 1,710.8s → 1,138.1s ,步数 413 → 268 。
• DeepSeek:16,199,466 → 11,974,070 token ,1,870.3s → 1,348.5s ,708 → 572 步。
• Hy3:16,275,045 → 12,572,972 token ,2,880.5s → 2,221.0s ,694 → 608 步。
以上箭头均为关闭 → 开启 WebMCP 。
两个感受:一是给足可读取页面结构、执行操作的工具,文本模型也有机会完成不少基础浏览器任务;不能把 computer use 只理解成看截图点坐标。二是单次推理快,不一定让整个任务更快。这批任务中 Terra 用的 token 和 Agent 步数更少,开启 WebMCP 后步数减少约 35.1%,DeepSeek 为 19.2%,Hy3 为 12.4%;最终总耗时也更短。
我猜训练目标可能会考虑任务完成时效,在刷分与用户等待时间之间做取舍。但这只是猜测,本次实验无法反推出任何厂商的训练奖励或证明其牺牲了 benchmark 成绩。
这批每题每组只跑了 1 次;默认推理强度的实际档位未记录,接口、分词方式与部分环境版本不同,因此不是严格的跨模型能力排名。总 token 包含缓存读写,不等于费用,DeepSeek 的 API 估算费用反而更低。评分疑点、环境补跑和失败都在报告中说明。
完整结果、逐题数据与使用方式:
https://deepdeck.getmegaportal.com/zh/benchmarks源码与运行文档:
https://github.com/jo32/DeepDeck/blob/main/docs/webmcp-benchmark.md如果你在做网站 WebMCP 或 Agent ,可以拿自己的任务跑一组,看看工具究竟减少了哪些步骤。文字经 AI 辅助整理,数字已对照公开报告。