可以帮忙用 llama-benchy (
https://github.com/eugr/llama-benchy )测一下吗?之前用两台 spark 测过预览版的 deepseekv4 flash ,当时跑起来还蛮吃力的,想看看现在性能怎么样
"""
| model | test | t/s (total) | t/s (req) | peak t/s | peak t/s (req) | ttfr (ms) | est_ppt (ms) | e2e_ttft (ms) |
|:------------------------------|------------:|----------------:|----------------:|-------------:|-----------------:|------------------:|------------------:|------------------:|
| deepseek-ai/DeepSeek-V4-Flash | pp2048 (c1) | 955.27 ± 193.11 | 955.27 ± 193.11 | | | 2257.64 ± 530.54 | 2251.15 ± 530.54 | 2257.64 ± 530.54 |
| deepseek-ai/DeepSeek-V4-Flash | tg32 (c1) | 38.67 ± 1.58 | 38.67 ± 1.58 | 39.93 ± 1.63 | 39.93 ± 1.63 | | | |
| deepseek-ai/DeepSeek-V4-Flash | pp2048 (c2) | 919.38 ± 159.59 | 586.78 ± 244.14 | | | 3948.41 ± 1160.98 | 3941.91 ± 1160.98 | 3948.41 ± 1160.98 |
| deepseek-ai/DeepSeek-V4-Flash | tg32 (c2) | 39.08 ± 20.50 | 25.04 ± 9.26 | 58.67 ± 3.09 | 29.79 ± 3.35 | | | |
| deepseek-ai/DeepSeek-V4-Flash | pp2048 (c4) | 924.07 ± 122.40 | 358.73 ± 142.02 | | | 6692.54 ± 2550.41 | 6686.05 ± 2550.41 | 6692.54 ± 2550.41 |
| deepseek-ai/DeepSeek-V4-Flash | tg32 (c4) | 18.68 ± 2.40 | 10.41 ± 5.84 | 71.33 ± 4.03 | 19.42 ± 1.32 | | | |
llama-benchy (0.3.7)
date: 2026-05-18 16:43:49 | latency mode: api
"""