逐选项评分
每个 yes/no、choice 或 score 候选经过标量评分头,最终输出空间严格等于调用方提供的候选集合。
模型介绍 · 校准研究
System-One 4B scorer 是基于 Qwen3.5-4B-Base 的 LoRA 评分模型,对每个候选逐项打分并在问题内归一化概率。本页说明其训练配置、温度校准和研究价值,同时标明 384 token 上下文、候选规模与非商业许可证限制。
System-One 4B scorer 在 Qwen3.5-4B-Base 上增加标量评分头,并用 LoRA 训练。它逐一评分 typed question 的候选项,再在每个问题内部执行 softmax,不进行自回归文本生成。
模型卡标注总参数约 4.236B,其中约 30.5M 为可训练参数。训练设置包含 384 序列长度、最多 16 个训练选项和验证集拟合温度 2.350。
这个项目的价值主要在于公开一条可复现的“候选评分—概率归一化—温度校准”研究路径,而不是提供可直接商用的通用模型。即使模型卡报告了 Accuracy、ECE 和 Brier,也只能解释该版本在其评测设置下的表现。
推理路径
每个 yes/no、choice 或 score 候选经过标量评分头,最终输出空间严格等于调用方提供的候选集合。
发布物是依附 Qwen3.5-4B-Base 的 PEFT 适配器,部署时还需要加载对应的基础模型。
项目在验证集上拟合温度并报告 ECE、Brier 等指标,适合研究概率校准流程而非直接宣称通用准确率。
采用判断
来源与边界
本页根据项目模型卡、仓库说明和其中公开的训练或评测设置整理。不同项目的硬件、数据集、版本、温度与样本量不同,公开数字不能直接组成排行榜;生产采用前仍需复核许可证并在目标数据上重测。
继续了解