
开源自托管决策模型 Kev 全家桶发布:0.8B/4B/9B 三款迁移 Qwen3.5 底座,API 兼容 TypeSafe System One
Jared Palmer 开源 Kev 决策模型家族:0.8B/4B/9B 三款 LoRA+指针头模型挂在冻结 Qwen3.5 基座上,类型化问题单次前向出校准概率,域外测试 Kev-9B 达 0.852。API 与 TypeSafe System One 对齐,支持 CUDA/ROCm/Apple Silicon,可自行微调,Apache-2.0。
相关标签
开源自托管决策模型 Kev 全家桶发布:0.8B/4B/9B 三款,迁移 Qwen3.5 底座,API 兼容 TypeSafe System One
Kev 是一组可以自己训练、自己运行的小型”Jev 类”决策模型:类型化问题进、校准概率出,单次前向传播完成,不生成任何文本。本次 kev-family 发布带来 Kev-0.8B、Kev-4B、Kev-9B 三款开源模型(Apache-2.0,含 Qwen 基座),每个 checkpoint 都是一个 rank-16 LoRA 适配器加一个指针头,挂在冻结的 Qwen 基座上,基座模型在首次加载时自动下载。
作者为 Jared Palmer(Turborepo 作者),项目与 Devin 协作构建,API 与 TypeSafe 的 System One 完全对齐——可以直接把 TypeSafe 官方 Python SDK 指向本地服务器。
迁移 Qwen3.5 底座:一次受控对照实验
2026-09-20 更新中,整个家族从 Qwen3 迁移到 Qwen3.5 底座(训练数据与配方不变),构成一组仅改变基座的受控对比。在锁定的域外测试集上:
| 模型 | 基座 | 域内(dev/测试) | 域外(dev/测试) |
|---|---|---|---|
| Kev-9B | Qwen3.5-9B-Base | 0.872 / 0.874 | 0.822 / 0.852 |
| Kev-4B | Qwen3.5-4B-Base | 0.872 / 0.871 | 0.797 / 0.837 |
| Kev-0.8B | Qwen3.5-0.8B-Base | 0.825 / 0.834 | 0.652 / 0.684 |
| Kev-8B(Qwen3 旧版) | Qwen3-8B-Base | 0.863 / 0.870 | 0.796 / 0.780 |
| Jev(托管参考) | – | 0.845 / – | 0.857 / – |
Kev-9B 比旧版 Kev-8B 高 7.3 个百分点(95% CI +2.8~+11.7),Brier 分数低 0.08。官方建议从 Kev-4B 开始用。旧 Qwen3 checkpoint 仍发布在 Hub 上但不再维护——它们在 Mac 上跑得更快(Qwen3.5 的 DeltaNet 层在 Apple Silicon 上暂无快速内核,4B 模型五题请求约 0.8s vs 旧版 0.17s)。
2026-09-21 三款模型又追加了一轮短训练(含显式天数的策略用例与无证据题目的均匀答案训练),域外测试成绩进一步提升:Kev-9B 0.837→0.852、Kev-4B→0.837、Kev-0.8B→0.684。
架构:一次前向回答所有问题
每个 checkpoint = rank-16 LoRA 适配器 + 小型指针头,基座权重全部冻结。状态文本与所有问题编进同一条 token 序列,注意力掩码保证每个问题只能读状态和它自己,读不到其他问题;指针头把每个选项的 </opt> 隐状态与问题的 <decide> 隐状态打分后 softmax 出概率。合并提问与分开提问的概率差异在 fp32 测试中仅 4e-6。
支持三种决策原语:noul(是/否概率)、choice(1–255 个选项的多选)、score(1–255 级序数评分),可在同一次请求中混合。服务端按 token 预算切片执行(每条前向至多一行 16,384 token),内存不随问题数增长。
可校准、可自托管、可微调
- 校准:域内单温度校准。局限也如实列出——按 5% 错误预算可自动化的决策占比(0.45–0.57)仍低于 Jev 的 0.70。
- 部署:支持 CUDA、ROCm 与 Apple Silicon(经 MLX)。4B/9B 可装进 32 GB Mac;H100/MI300X 上五题请求仅数十毫秒。服务默认绑定本机,
KEV_API_KEY可开启 Bearer 鉴权。 - 微调:几百条标注样本的短微调通常比改提示词更有效。
--init_from从已发布 checkpoint 续训——有用户实测,从基座冷启微调只有 0.33,而--init_from保住 0.83 并在新域达到 0.88。--batch 1 --accum 8时 0.8B 模型只需 4 GB 显存。 - 配套工具:web playground(选项顺序敏感性检查)、HF Spaces 在线 Demo、Modal 一键 H100 训练研究流水线(预注册判据 + 只读一次的锁定测试),甚至还有给编码代理用的
kev-finetuneskill。
诚实的评估
评估数据全部冻结(checksum 记录在 manifest),README 的每个公开数字都有 CI 校验(scripts/verify_claims.py)。外部测试集上 Kev 仍不敌 Jev:WANLI 0.703 vs 0.758,TypeSafe 102 题一致率 0.809 vs 0.891——文档长度超训练上下文是部分原因,更长训练上下文在路线图上(#48)。知识类问题(MMLU 0.74 vs Jev 0.90)由基座决定,换 MoE 基座也没能改善。
上手
# 直接解压运行(tarball 含适配器、head.pt、tokenizer、模型卡与锁定测试结果)
tar -xzf kev-4b.tar.gz
KEV_DTYPE=bf16 uv run --extra serve python -m kev.serve --run kev-4b --port 8009
# 或从源码
git clone https://github.com/jaredpalmer/kev.git && cd kev
uv sync --extra serve
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-4b --port 8009
需要 Python 3.12⁄3.13 与 uv,Qwen3.5 模型要求 transformers >= 5.17。发布件提供全部 tarball 与 SHA-256 校验文件,权重同步发布在 Hugging Face Kev collection。
更多资讯
想看更多优质内容?
浏览所有资讯