ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

dsh-our-free-model 速度统计原理:windowTokens 与 decodeWindow 如何避免虚假 tok/s

dsh-our-free-model 速度统计原理:windowTokens 与 decodeWindow 如何避免虚假 tok/s dsh-our-free-model 速度统计原理windowTokens 与 decodeWindow 如何避免虚假 tok/s【免费下载链接】dsh-our-free-model在 dsh 里装上这个插件即可无需登录、注册或填 API Key就能使用包括 DeepSeek V4.1 Flash、Kimi K3 在内的前沿模型——完全免费不限量。 All you do is install this plugin in dsh: no login, no sign-up, no API key — the frontier models are just there, DeepSeek V4.1 Flash and Kimi K3 among them. Completely free, with no usage cap.项目地址: https://gitcode.com/gh_mirrors/ds/dsh-our-free-modeldsh-our-free-model 是 dsh 里的免费大模型插件装上即用无需登录、注册或 API KeyDeepSeek V4.1 Flash、Kimi K3 等前沿模型开箱可用且不限流量。它的设置页还有一块速度统计看板但 tok/s 这个数字很容易造假——早期版本曾给一条实际约 40 tok/s 的车道报告出 2 941 tok/s。本文带你彻底搞懂 windowTokens 与 decodeWindow 两个函数如何联手守住这个数字的诚实底线。虚假速度的两个真实案例 问题出在分子和分母度量的不是同一段时间。团队用真实流量抓到了两个典型案例一看不见的 reasoning token 撑大了分子。一次调用计费 422 个输出 token其中 291 个是 reasoning token——但一个推理帧都没流出。这些 token 在第一个可见 token 之前就已生成完毕若全算进分子除以答案文本落地的 1.2 秒就发布出 349 tok/s而答案实际只有 108 tok/s。案例二1 毫秒的解码窗口。一次真实记录在首 token 等待 2 977 ms 之后63 个输出 token 在 1 ms 内解码完毕直接算出 63 000 tok/s这一个点就把 26 次调用的均值抬高到 2 493 tok/s——而该车道真实水平约 40 tok/s。直连读包的探针scripts/probes/decode-window.mjs证实网关并非批量投递64 个帧均匀分布在 5.6 秒里。所以锅不在网关而在算法。第一道防线windowTokens 剔除没流出的 tokenwindowTokens() 回答一个问题哪些输出 token 可以被诚实地除以实测窗口规则只有两条如果推理内容确实逐帧流出sawReasoning为真窗口覆盖了推理阶段全部输出 token 计入分子如果推理没有流出任何帧就把reasoningTokens从分子中扣掉——它们在窗口起点之前就已生成完毕算进解码速度属于张冠李戴。对应到案例一422 − 291 131 个 token除以 1.2 秒得到的才是真实的 108 tok/s。第二道防线decodeWindow 的两条硬边界分子修正后decodeWindow() 再守住分母侧。两个常量写得很直白MIN_DECODE_MS 250、MAX_CREDIBLE_TPS 250。判定逻辑分四步调用失败、分子为 0、或窗口短于 250 ms——这根本不是一个测量直接丢弃算出的速率超过 250 tok/s——帧必然被合并投递了不是真速度同样丢弃结果非有限数值丢弃通过检验才返回可测量的 tps。该车道实测的持续输出速度是几十 tok/s所以 250 tok/s 的上限远在任何真实值之外被丢弃的调用不会被平均进统计而是不参与求和。看板如何汇总Σtoken / Σ秒而非速率平均recordUsage() 把每次完成的调用累加进按天、按模型的桶里速度图表取的是Σtoken ÷ Σ秒的总量比值而不是对各次调用的 tok/s 取平均——正是后者曾被那个 1 ms 窗口抬高三个数量级。不可测量的调用其窗口时间和 token 都不进总和。这也是为什么看板上某些模型的速度栏显示—答案集中在一两个大帧里落地的模型不具备可测量的输出速度诚实地留白好过编一个数字。相关决策记录见 README 的为什么速度那一栏会显示 — 一节。一键验证本地跑通速度统计测试 两条命令即可亲眼看规则生效node scripts/speed-stat-test.mjs——speed-stat-test.mjs 逐条断言未流出的 reasoning 必须离开分子、1 ms 窗口不算测量、561 tok/s 判定为帧合并、任何一次调用都不得被平均成虚假的 tok/snode scripts/probes/decode-window.mjs——decode-window.mjs 实时调用两个免费模型逐帧打印到达时间与负载把插件报告的速率和全部输出 token 的速率并排对照一目了然。核心实现分布在 src/stream.js流解析与windowTokens与 src/store.js窗口判定与统计累加配合 src/adapter.js 中首次 delta 的时间戳打点构成完整链路。小结防线函数防住的骗局分子windowTokens()未流出的 reasoning token 虚增速度分母decodeWindow()过短窗口与帧合并导致的超光速汇总recordUsage()单点极值污染整体均值速度统计的意义不在于炫耀 tok/s而在于让数字配得上免费不限量的免费大模型插件这一体验你看到 40 tok/s它就该是 40 tok/s。【免费下载链接】dsh-our-free-model在 dsh 里装上这个插件即可无需登录、注册或填 API Key就能使用包括 DeepSeek V4.1 Flash、Kimi K3 在内的前沿模型——完全免费不限量。 All you do is install this plugin in dsh: no login, no sign-up, no API key — the frontier models are just there, DeepSeek V4.1 Flash and Kimi K3 among them. Completely free, with no usage cap.项目地址: https://gitcode.com/gh_mirrors/ds/dsh-our-free-model创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表