# dsh-live-perf-gauges [English](README.md) DeepSeek Harness Web 的“汽车仪表盘”式实时性能条:在输入框下方显示 Decode tok/s、TTFT、端到端 Prompt 速率、流事件/MTP 指标和输出 token。 ## 指标口径 - **Decode tok/s**:生成期间每 250ms 刷新。适配器若提供累计 usage,则优先使用;否则根据同一会话已完成步骤自动校准字符/token 比例,全新会话在尚未校准时不会捏造 tok/s。步骤结束后始终以服务商 usage 为准。 - **TTFT**:从 `step/start` 到第一段文本、思考或工具参数增量的耗时。 - **Prompt/TTFT**:逻辑 Prompt(`input + cache read + cache write`)÷ 端到端 TTFT。它不会再标成 vLLM 内核 Prefill,因为其中包含 DSH 开销、网络/排队时间与缓存 token。 - **Stream**:显示 DSH 逻辑增量事件频率和每事件生成 token;服务商 usage 到达后,后者为精确值,可用于观察 MTP/投机解码 acceptance。 - **Output**:同样遵循“先估算、后精确校正”。 插件绝不会假设“一条 SSE = 一个 token”。开启投机解码时,一个被接受的 MTP token 组可以由同一条流事件携带。 本插件不访问网络,不保存提示词、消息正文、工具参数或密钥;它只读取会话事件流中已有的时间戳、计数和最终 token usage。 ## 安装 ```sh dsh plugin --profile web add github:TnzGit/dsh-live-perf-gauges ``` 重启正在运行的 `dsh web`,然后硬刷新浏览器。下一次模型步骤开始后,性能条会显示在输入框下方。 ## 开发 ```sh npm test ``` 仓库直接提供无外部依赖的 Host 和 Client 构建产物,安装时无需构建。 ## 许可证 MIT