开源自托管决策模型 Kev 全家桶发布:0.8B/4B/9B 三款迁移 Qwen3.5 底座,API 兼容 TypeSafe System One

开源自托管决策模型 Kev 全家桶发布:0.8B/4B/9B 三款迁移 Qwen3.5 底座,API 兼容 TypeSafe System One

4小时前
duguying
3 阅读
来源:GitHub Releases

Jared Palmer 开源 Kev 决策模型家族:0.8B/4B/9B 三款 LoRA+指针头模型挂在冻结 Qwen3.5 基座上,类型化问题单次前向出校准概率,域外测试 Kev-9B 达 0.852。API 与 TypeSafe System One 对齐,支持 CUDA/ROCm/Apple Silicon,可自行微调,Apache-2.0。

相关标签

#Kev#决策模型#Jev#Qwen3.5#LoRA#开源软件#TypeSafe

开源自托管决策模型 Kev 全家桶发布:0.8B/4B/9B 三款,迁移 Qwen3.5 底座,API 兼容 TypeSafe System One

Kev 是一组可以自己训练、自己运行的小型”Jev 类”决策模型:类型化问题进、校准概率出,单次前向传播完成,不生成任何文本。本次 kev-family 发布带来 Kev-0.8B、Kev-4B、Kev-9B 三款开源模型(Apache-2.0,含 Qwen 基座),每个 checkpoint 都是一个 rank-16 LoRA 适配器加一个指针头,挂在冻结的 Qwen 基座上,基座模型在首次加载时自动下载。

作者为 Jared Palmer(Turborepo 作者),项目与 Devin 协作构建,API 与 TypeSafe 的 System One 完全对齐——可以直接把 TypeSafe 官方 Python SDK 指向本地服务器。

迁移 Qwen3.5 底座:一次受控对照实验

2026-09-20 更新中,整个家族从 Qwen3 迁移到 Qwen3.5 底座(训练数据与配方不变),构成一组仅改变基座的受控对比。在锁定的域外测试集上:

模型 基座 域内(dev/测试) 域外(dev/测试)
Kev-9B Qwen3.5-9B-Base 0.872 / 0.874 0.822 / 0.852
Kev-4B Qwen3.5-4B-Base 0.872 / 0.871 0.797 / 0.837
Kev-0.8B Qwen3.5-0.8B-Base 0.825 / 0.834 0.652 / 0.684
Kev-8B(Qwen3 旧版) Qwen3-8B-Base 0.863 / 0.870 0.796 / 0.780
Jev(托管参考) 0.845 / – 0.857 / –

Kev-9B 比旧版 Kev-8B 高 7.3 个百分点(95% CI +2.8~+11.7),Brier 分数低 0.08。官方建议从 Kev-4B 开始用。旧 Qwen3 checkpoint 仍发布在 Hub 上但不再维护——它们在 Mac 上跑得更快(Qwen3.5 的 DeltaNet 层在 Apple Silicon 上暂无快速内核,4B 模型五题请求约 0.8s vs 旧版 0.17s)。

2026-09-21 三款模型又追加了一轮短训练(含显式天数的策略用例与无证据题目的均匀答案训练),域外测试成绩进一步提升:Kev-9B 0.837→0.852、Kev-4B→0.837、Kev-0.8B→0.684。

架构:一次前向回答所有问题

每个 checkpoint = rank-16 LoRA 适配器 + 小型指针头,基座权重全部冻结。状态文本与所有问题编进同一条 token 序列,注意力掩码保证每个问题只能读状态和它自己,读不到其他问题;指针头把每个选项的 </opt> 隐状态与问题的 <decide> 隐状态打分后 softmax 出概率。合并提问与分开提问的概率差异在 fp32 测试中仅 4e-6。

支持三种决策原语:noul(是/否概率)、choice(1–255 个选项的多选)、score(1–255 级序数评分),可在同一次请求中混合。服务端按 token 预算切片执行(每条前向至多一行 16,384 token),内存不随问题数增长。

可校准、可自托管、可微调

  • 校准:域内单温度校准。局限也如实列出——按 5% 错误预算可自动化的决策占比(0.45–0.57)仍低于 Jev 的 0.70。
  • 部署:支持 CUDA、ROCm 与 Apple Silicon(经 MLX)。4B/9B 可装进 32 GB Mac;H100/MI300X 上五题请求仅数十毫秒。服务默认绑定本机,KEV_API_KEY 可开启 Bearer 鉴权。
  • 微调:几百条标注样本的短微调通常比改提示词更有效。--init_from 从已发布 checkpoint 续训——有用户实测,从基座冷启微调只有 0.33,而 --init_from 保住 0.83 并在新域达到 0.88。--batch 1 --accum 8 时 0.8B 模型只需 4 GB 显存。
  • 配套工具:web playground(选项顺序敏感性检查)、HF Spaces 在线 Demo、Modal 一键 H100 训练研究流水线(预注册判据 + 只读一次的锁定测试),甚至还有给编码代理用的 kev-finetune skill。

诚实的评估

评估数据全部冻结(checksum 记录在 manifest),README 的每个公开数字都有 CI 校验(scripts/verify_claims.py)。外部测试集上 Kev 仍不敌 Jev:WANLI 0.703 vs 0.758,TypeSafe 102 题一致率 0.809 vs 0.891——文档长度超训练上下文是部分原因,更长训练上下文在路线图上(#48)。知识类问题(MMLU 0.74 vs Jev 0.90)由基座决定,换 MoE 基座也没能改善。

上手

# 直接解压运行(tarball 含适配器、head.pt、tokenizer、模型卡与锁定测试结果)
tar -xzf kev-4b.tar.gz
KEV_DTYPE=bf16 uv run --extra serve python -m kev.serve --run kev-4b --port 8009

# 或从源码
git clone https://github.com/jaredpalmer/kev.git && cd kev
uv sync --extra serve
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-4b --port 8009

需要 Python 3.123.13 与 uv,Qwen3.5 模型要求 transformers >= 5.17。发布件提供全部 tarball 与 SHA-256 校验文件,权重同步发布在 Hugging Face Kev collection

返回列表

更多资讯

想看更多优质内容?

浏览所有资讯