jo32's recent timeline updates
@tt7 你关于那天规律罗辑题的思考是对的,同时对方也是对的,没必要道歉,也没必要与对方继续讨论。因为对方从一开始并没有考虑你提出 series 概念的价值,同时我认为对方的解决方法是正确的也是毫无价值的,因为这种方法对任何离散点适用缺没有预测功能。
Nov 4, 2015
jo32

jo32

V2EX member #5991, joined on 2011-02-24 22:49:31 +08:00
Per jo32's settings, the topics list is hidden
Deals info, including closed deals, is not hidden
jo32's recent replies
补一个 Flash 的浏览器任务实测。先说明,我用的是 DeepDeck ,这次用的是小米官方 API ,没测 Pro ,也没测 Coding Plan 。

从 49 题里取同一组 43 道可比题,开启 WebMCP ,按实际 token 用量、包含缓存折扣估算,统一美元:
MiMo V2.6 Flash:$0.187 ,37 分钟
GPT-5.6 Luna:$0.314 ,23 分钟
DeepSeek V4.1 Flash:$0.249 ,20 分钟(按当时低谷价)

关闭 WebMCP 时,三者分别用了 43 、35 、27 分钟。开启后,执行轮次分别少了 6%、22%、14%。

我比较在意工具使用这一块:MiMo 调 WebMCP 121 次,比 Luna 的 80 次还多,但没省下那么多步骤。所以这轮看下来是成本够低,速度慢一些,工具用得还不够高效。调用多不等于利用得好。

这些是中低难度浏览器任务,用来观察体验,不能直接当编程能力排名。每题每个开关条件只跑一次,接口、运行版本也有差异,先供大家参考。

逐题结果和费用计算都在这里: https://deepdeck.getmegaportal.com/zh/benchmarks#results
补一份 9 月 17 日更新:这周把前面的实验整理成了 DeepDeck WebMCP Bench ,可以测模型完成浏览器任务的能力,也可以测同一模型开启/关闭 WebMCP 后的实际收益。

现在内置 8 个开源网站、49 道任务,覆盖查询、搜索、购物、预约、课程和业务流程;题库起点来自 WindTunnel ,保留了上游署名。也支持直接输入网站 URL + query 做消融实验,不需要 Docker ;可以用网站原生工具,或指定自己的 WebMCP 实现。

这次跑了 GPT-5.6 Terra 、DeepSeek v4.1 Flash 和 Hy3 。两组都保留完整默认工具,包括 Chrome DevTools MCP ,只切换 WebMCP ;每题 10 分钟,不限步数。

全 49 题的评分通过数(开启/关闭)分别是 49/49 · 49/49 、48/49 · 47/49 、49/49 · 48/49 。效率统一看三个模型、两组都通过的同一批 46 题:
• Terra:总 token 5,888,869 → 3,793,871 ,Agent 耗时 1,710.8s → 1,138.1s ,步数 413 → 268 。
• DeepSeek:16,199,466 → 11,974,070 token ,1,870.3s → 1,348.5s ,708 → 572 步。
• Hy3:16,275,045 → 12,572,972 token ,2,880.5s → 2,221.0s ,694 → 608 步。
以上箭头均为关闭 → 开启 WebMCP 。

两个感受:一是给足可读取页面结构、执行操作的工具,文本模型也有机会完成不少基础浏览器任务;不能把 computer use 只理解成看截图点坐标。二是单次推理快,不一定让整个任务更快。这批任务中 Terra 用的 token 和 Agent 步数更少,开启 WebMCP 后步数减少约 35.1%,DeepSeek 为 19.2%,Hy3 为 12.4%;最终总耗时也更短。

我猜训练目标可能会考虑任务完成时效,在刷分与用户等待时间之间做取舍。但这只是猜测,本次实验无法反推出任何厂商的训练奖励或证明其牺牲了 benchmark 成绩。

这批每题每组只跑了 1 次;默认推理强度的实际档位未记录,接口、分词方式与部分环境版本不同,因此不是严格的跨模型能力排名。总 token 包含缓存读写,不等于费用,DeepSeek 的 API 估算费用反而更低。评分疑点、环境补跑和失败都在报告中说明。

完整结果、逐题数据与使用方式: https://deepdeck.getmegaportal.com/zh/benchmarks
源码与运行文档: https://github.com/jo32/DeepDeck/blob/main/docs/webmcp-benchmark.md

如果你在做网站 WebMCP 或 Agent ,可以拿自己的任务跑一组,看看工具究竟减少了哪些步骤。文字经 AI 辅助整理,数字已对照公开报告。
补上主帖里还没测的部分:WebMCP 到底能省多少?这次测了选书、读 X 、整理 HN 评论,结果不一样。

先说两组条件较接近的实验,都是普通浏览器和已安装 WebMCP 工具各跑 5 轮:

1. 从 Books to Scrape 的 65 本书中选最便宜的三本,再取详情。两组全部成功。WebMCP 耗时中位数从 46.807 秒降到 29.855 秒,总 Token 减少 52.0%。
2. 读取 X 的三条固定帖子。两组也全部成功。WebMCP 耗时中位数减少 10.3%,总 Token 反而增加 8.4%。

普通浏览器这两组允许 DevTools 和临时脚本;测的是安装工具后的重复使用,没算第一次构建、准备和后续维护成本。总 Token 包含缓存读取、重复上下文,不能直接当成省了多少费用。

HN 测的是评论正文和“回复了谁”。WebMCP 完整成功 3/3 ,CU 组 0/3 ;两组不同期,实时评论数量也不同,所以只单独分析完成度,不拿它算等量任务的加速倍数。

实验是 9 月 10–13 日的记录,模型路由为 openai-codex/gpt-6-astra 。图表、完整方法和汇总数据:
https://deepdeck.getmegaportal.com/zh/webmcp/experiments

另一个可以直接试的更新是工具目录。目前有 Hacker News 、X ,以及开发预览阶段的 NGA ;可以查看 GitHub 项目,通过对应版本的入口在 DeepDeck 安装,遇到问题回上游提 Issue 或贡献修复:
https://deepdeck.getmegaportal.com/zh/webmcp

目录刚起步,收录不代表每项功能都经过验证。DeepDeck 是 MIT 开源的非官方 DeepSeek Harness macOS 客户端。

你日常有哪个网站操作,每次都要让 Agent 重新找页面、翻页、抄字段?最好举一个具体任务,我想用这样的流程继续验证复用是否划算。

文字经 AI 辅助整理,数据已核对,配图来自线上页面。
@mygao666 是的,这是一个客户端,因为需要接某个 agent harness ,就先自己做了。

btw ,codex 其实也支持 webmcp ,只要你的网站支持 webmcp ,用 codex 的 browser 打开这个网站,它就会调用这个站点的 mcp ,但现在 webmcp 的普及率比较低,它没有像我现在这样子,可以给某个网站补 webmcp 。
@DLtianzheng 是个好建议。
@blogbbs 嗯嗯,是的呢,感谢,主要是用来说明 Web Intents for LLMs 这个协议能做出怎么样的效果。
图没贴对,再来一遍:

![pk0Tzut.png]( https://s21.ax1x.com/2024/06/18/pk0Tzut.png)
https://spellboard.app 我自带搜索也是用同一个协议写的,例如搜索 V2EX 😄:

[![pk0Tzut.png]( https://s21.ax1x.com/2024/06/18/pk0Tzut.png)]( https://imgse.com/i/pk0Tzut)
Jun 8, 2022
Replied to a topic by no996 Apple 知道 M1 的蓝牙不好,但没想到可以这么差
2021 m1pro mbp + sony xm4 ,蓝牙卡顿音质差,有线音质好,一个天一个地(摔
真 tm nb 的操作,双赢的典范,帮电影方回本了不说,字节则是将前期囧妈的宣传转化为字节系 app 的下载。
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   5430 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 35ms · UTC 06:08 · PVG 14:08 · LAX 23:08 · JFK 02:08
♥ Do have faith in what you're doing.