TypeDecide 首页

模型介绍 · 校准研究

System-One 4B 模型介绍

System-One 4B scorer 是基于 Qwen3.5-4B-Base 的 LoRA 评分模型,对每个候选逐项打分并在问题内归一化概率。本页说明其训练配置、温度校准和研究价值,同时标明 384 token 上下文、候选规模与非商业许可证限制。

返回模型目录
非商业概率校准LoRA仅评测

System-One 4B 是什么?

System-One 4B scorer 在 Qwen3.5-4B-Base 上增加标量评分头,并用 LoRA 训练。它逐一评分 typed question 的候选项,再在每个问题内部执行 softmax,不进行自回归文本生成。

模型卡标注总参数约 4.236B,其中约 30.5M 为可训练参数。训练设置包含 384 序列长度、最多 16 个训练选项和验证集拟合温度 2.350。

这个项目的价值主要在于公开一条可复现的“候选评分—概率归一化—温度校准”研究路径,而不是提供可直接商用的通用模型。即使模型卡报告了 Accuracy、ECE 和 Brier,也只能解释该版本在其评测设置下的表现。

开发者
pngwn
技术路线
Qwen3.5-4B + LoRA Scorer
模型规模
4.24B
许可证
CC-BY-NC-4.0
语言范围
模型卡未给出多语言覆盖结论
输入长度
训练序列长度 384
运行环境
Transformers · PEFT · Qwen3.5-4B Base
资料核验
2026-09-19

推理路径

一次结构化决策如何形成

逐选项评分

每个 yes/no、choice 或 score 候选经过标量评分头,最终输出空间严格等于调用方提供的候选集合。

LoRA 适配器

发布物是依附 Qwen3.5-4B-Base 的 PEFT 适配器,部署时还需要加载对应的基础模型。

验证集温度

项目在验证集上拟合温度并报告 ECE、Brier 等指标,适合研究概率校准流程而非直接宣称通用准确率。

采用判断

适合做什么,以及先检查什么

适合评估

  • 研究固定候选单次评分、Brier/ECE 和温度校准的非商业实验
  • 需要完整权重适配器和公开训练设置作为复现实验起点
  • 能够接受 384 token 输入和训练候选上限的受控评测

已知限制

  • 许可证为 CC-BY-NC-4.0,不能默认用于商业产品、付费服务或商业内部生产。
  • 训练时高基数任务的候选集被限制为 16 个;模型卡虽评测全部候选,但大候选空间仍需单独测试。
  • 序列长度 384 会截断长 State、长评论或复杂上下文。
  • 项目明确说明准确率远低于前沿模型,价值主要是固定选项下的单次延迟与校准分布。

来源与边界

公开资料,不是 TypeDecide 统一实测

本页根据项目模型卡、仓库说明和其中公开的训练或评测设置整理。不同项目的硬件、数据集、版本、温度与样本量不同,公开数字不能直接组成排行榜;生产采用前仍需复核许可证并在目标数据上重测。

继续了解

把模型信息放回实际决策流程