Skip to content

About

Kernel-optimization cockpit plugin for DeepSeek Harness: live panel + kernel loop + second-model supervision (AKO-friendly)

Resources

Stars

5 stars

Watchers

0 watching

Forks

Repository files navigation

dsh-kernel-opt

DeepSeek Harness 插件:实时查看并干预算子优化过程

简体中文 | English

check License: MIT DSH 0.1.0-rc.6 — 0.1.2-rc.1

觉得有用的话,欢迎点个 star 🌟

新版评测面板的专注展示:真实 NVIDIA H20 会话,18 次优化评测与 1 次收尾验证;左侧为选定候选的 5.58 倍加速结果,右侧为可交互曲线,下方为当前方案与最近评测。
单卡 NVIDIA H20 会话:18 次优化评测、1 次收尾验证;选定候选耗时 292µs,自报加速比 5.58×。

News

  • 🚀 [2026.08.17] dsh-kernel-opt 开源发布:实时评测面板、按预算运行并自行收尾的优化循环,以及可选的第二模型监督。

目录

简介

dsh-kernel-opt 是 DeepSeek Harness(DSH)的插件。算子优化要跑很多轮,它把每一轮的评测结果实时画进同一个会话,人可以边看边介入。

模型一轮轮地读代码、改代码、跑评测,同一个会话里多出一个「评测」页签。结果摘要展示当前可用的结果、参考与当前耗时;旁边用一条实线按顺序连接成功评测的结果,失败轮次保留原有位置。未通过验证的候选用红色空心点标出,不计入最佳结果;未测得耗时的点画在坐标轴下方。

悬停、点击或用键盘选择数据点,可以查看该次评测的指标,并直接展开来源、方案和代码改动。下方保留当前方案与最近五次评测,环境和监督记录等详情可通过「查看完整记录」展开。录制或演示时,点击右上角的「专注展示」即可全屏查看面板;按 Esc 返回会话。

每个点都带着自己的来源和可信程度,见下面的评测契约。

随时可以发消息改变方向,和平时用 DSH 一样。模型换思路时,可以压缩自己的上下文后继续。

面板显示的内容全部从会话日志投影而来,插件不另存一份,所以回放一个会话,画面与当时实时看到的一致。

评测命令在哪台机器上执行,GPU 就在哪里:本机、容器、投到集群的作业都可以。插件本身不需要 GPU。

安装

与 AKO 生态平台的关系

DSH 与其他支持 MCP 的 coding agent 一样,可以通过 AKO Runtime MCP 接口使用平台的评测、记录和提交功能。 dsh-kernel-opt 提供 DSH 内的优化面板与循环,安装本插件不是平台接入的前提。 AKO 服贸会主演示 agent 为 lingji(灵玑OS),DSH 可作为另一个 agent 展示同一套接入方式。

安装插件

安装需要 DeepSeek Harness,以及 PATH 中有 pnpm——dsh plugin 会把参数转发给 pnpm。面板属于 DSH 的 web 界面,所以插件要装进 web profile。

插件本身不需要构建,lib/ 已经提交进仓库。

# 仓库是公开的,不需要凭据
dsh plugin --profile web add "github:xieTwim/dsh-kernel-opt"

# 或者钉住某个 commit,使安装可复现
dsh plugin --profile web add "github:xieTwim/dsh-kernel-opt#<commit-sha>"

# 或者安装本地 checkout,用于开发
dsh plugin --profile web add /path/to/dsh-kernel-opt

如果还没有 dsh,上面的命令可以走 npx:npx -p @deepseek-ai/dsh dsh plugin …,启动则是 npx -p @deepseek-ai/dsh dsh web。

升级时用新的 sha 再执行一次 add。

重启 dsh web,然后验证:

dsh --profile web --dump-config | grep kernel-opt   # 应该能看到这个插件

快速开始

  1. 安装插件,重启 dsh web。
  2. 把算子放进工作目录。 参考实现、输入数据、你自己的评测脚本都是可选的,形式不限,模型会自己确认有哪些材料并把评测接起来。没有参考实现时,最初那版算子会被冻结为分母。连评测脚本也没有时,使用内置评测器:检查正确性、取中位数计时、每次换新的输入值,并用一项检查识别重放缓存答案的实现,参考实现只计时一次然后冻结。它运行在 Python 与 PyTorch 上,执行评测的那台机器需要有 CUDA GPU。
  3. 新建一个「算子优化模式」的会话,告诉它三件事:算子在哪、怎么评测、预算和硬件。也可以用输入框旁边的启动器直接交给循环。
  4. 打开会话顶部的「评测」页签,曲线、状态、方案、监督都在这里。随时发消息即可改变方向。

「算子优化模式」是插件写入 ~/.dsh/.agent-presets/kernel-opt/ 的一个 agent preset,每次启动时同步到当前插件版本;你手动改过的文件不会被覆盖,preset.install: false 可以整个关闭。插件添加的工具和命令只存在于这个模式,其他会话不会加载。

→ docs/mode.md

接入你自己的评测

面板对评测方式不做任何假设。 你自己的脚本、现成的评测器、投到远端机器的作业,只要往 stdout 打印一行,就成为曲线上的一个点:

KERNEL_EVAL={"artifact":"solution/kernel.py","latency_ms":1.23,"correct":true}

必需:artifact(测的是哪个文件)与 correct。测到延迟时带上 latency_ms。可选:compiled、error、native_metrics(数值映射)、reward_hack_detected、advisory、workload_indices。一行一个评测,从行首开始,JSON 之后可以跟其他字符。

评测器本身就是工具(MCP 或注册工具)时不需要打印这一行,它结果文本中的同名字段直接进入面板。名称中含 kernel_evaluate 的工具默认收录,其余的写进 benchTools 配置。

每个点都记录了来源,面板直接显示出来:自报的点会附上产生它的那条命令;模型收尾时,插件会自己把那条命令重跑一遍。过程由模型自报,最终数字由插件复测。 复测不是无条件的:可以关闭,记录下来的命令超过 300 字符也无法复测,这两种情况下面板会标明最终数字未经复测。

→ 全部字段、信任级、统一分母(以及缺少它会如何影响整轮的可比性)、去重规则:docs/eval-contract.md

循环

模型做完一轮,循环推它继续,直到预算用完或者收尾。

在界面上开关:「评测」页签顶部有循环与监督两行;会话还是空的时候页签尚未出现,用输入框旁边的启动器,选项相同。

预算只计优化评测——收尾时的验证、以及模型在同一回合内多做的那次,都保留并单独显示。预算用完、或连续两轮没有新评测,循环会先要一次收尾(装回最优版本、finalize、总结)再停。人可以随时打断:停止按钮和中断回合都立刻生效且不做收尾,你发的消息也优先于循环要发的内容。

监督是把运行摘要和最近几次的真实改动交给第二个模型,让它评判这一轮是怎么跑的:预算、方向多样性、有没有做性能分析、自报点的命令行像不像真评测、diff 与方案是否一致。它不读整份算子代码——算子快不快,由评测器实测回答。复审没有结论不等于通过:失败、超时、没有答复都不留记录,也不阻塞循环。

同一份状态也可以用 slash 命令驱动。三件事只能靠它们:手填下拉列不出来的复审模型、在循环运行期间调整监督(界面上那一行此时锁住)、把操作写进消息交给脚本。

/kloop [n]                          # 启动,默认预算 20 次评测;stop 停止,status 查看
/supervise on                       # 打开第二模型复审
/supervise use <provider>/<model>   # 手填本会话的复审模型

→ docs/loop.md

文档

文档 内容
docs/eval-contract.md 评测契约全文:两条通道、全部字段、信任级、finalize 复测、统一分母、去重规则
docs/mode.md 算子优化模式:它让模型做什么、往会话里加了什么、面板显示什么、内置评测器、以及它安装了哪些文件
docs/loop.md 循环与监督:每一轮怎么判定、空会话如何启动、复审模型如何选择、复审能查出和查不出什么
docs/config.md 全部配置项,以及 HTTP 接口
docs/limits.md 已知边界,按对面板判读的影响程度排序
docs/development.md 开发、插件如何注册自己、支持的宿主版本与 semver、CI

兼容性

两端都实测过:DeepSeek Harness 0.1.0-rc.6 与 0.1.2-rc.1(dist-tag next)都能加载,开发依赖钉在 0.1.1-rc.2(dist-tag latest)。一份构建装进任意一版:0.1.2 改掉的整段日志读取器由插件自己按宿主实际有哪个来选。peer 范围比这个区间宽(它收下 <0.2 的正式版),那是「认为能装」,不是「装过」。

插件用到了 2026-08-11 那次改名引入的宿主 API(httpServer→webServer、compact→compaction),更旧的宿主无法加载。peer 范围是对 DSH 的各个分包分别声明的,而不是对 @deepseek-ai/dsh 整体,也不是一段——宿主每开一条 0.1.x-rc 线就要补一段,原因见 docs/development.md。

许可

MIT,见 LICENSE。

致谢

  • AKO4ALL:插件的内置评测器(preset/kernel-opt/evaluator/bench.py)由 AKO4ALL 附带的评测脚本改写而来。
  • KernelBench:AKO4ALL 的脚本内联了它的核心评测逻辑,因此它也传到了这里。

两者都是 MIT,许可声明原样收录在 THIRD_PARTY_NOTICES.md 与文件头部。

About

Kernel-optimization cockpit plugin for DeepSeek Harness: live panel + kernel loop + second-model supervision (AKO-friendly)

Resources

Stars

5 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages