TypeDecide 首页

模型介绍 · Direct Logits

Reflex 模型介绍

Reflex 是基于开放 Qwen 权重的 Direct Logits 决策层,支持文本、JSON、图像、多问题并行评分和温度校准。本页区分 4B GPU 服务与 0.8B WebGPU 演示的能力边界,并说明候选数量、底座许可证和业务重校准要求。

返回模型目录
技术评估多模态WebGPU温度校准

Reflex 是什么?

Reflex 是在开放权重 Qwen 模型上实现的决策层。它接收文本、JSON 或图像 State,以及 Choice、Score、Noul 问题,从候选 logits 中返回受限选项和概率,而不是生成自由文本。

默认 Python 示例使用 Qwen3.5-4B;项目还提供基于约 650 MB Qwen3.5-0.8B 的浏览器 WebGPU 演示。两种形态共享相近请求结构,但小型浏览器版本的能力和校准程度更有限。

Reflex 更像一套可替换底座的决策方法与参考服务,而不是只有一个固定权重的模型产品。实际能力会随 Qwen 版本、视觉能力、提示布局和温度参数变化,因此部署记录必须同时保存底座 revision、精度、候选结构和校准数据。

开发者
kshetrajna12
技术路线
Qwen + Direct Logits
模型规模
0.8B–4B+
许可证
MIT(底座另审)
语言范围
取决于所选 Qwen 底座及专项数据
输入长度
取决于底座与请求布局
运行环境
Linux/NVIDIA GPU;另有 WebGPU 演示
资料核验
2026-09-19

推理路径

一次结构化决策如何形成

直接读取 logits

候选答案由调用方预先定义,模型只在这些候选上归一化概率,避免自由文本解析和 Schema 漂移。

多问题与图像

同一请求中的问题独立并行评分;State 可以包含文件路径、URL 或 data URI 形式的图像。

部署后校准

项目提供温度拟合命令。温度可以改善置信度可信度,但不能补足模型在具体任务上的准确率。

采用判断

适合做什么,以及先检查什么

适合评估

  • 需要文本与图像共同参与固定选项判断的本地实验
  • 希望用 Jev 风格请求形状搭建自托管服务的开发团队
  • 需要在浏览器中展示小模型结构化决策流程的原型

已知限制

  • 默认 4B 示例需要 Linux、NVIDIA GPU、Python 3.12;项目称 8 GB 显存足够,但仍应按实际底座验证。
  • 浏览器 0.8B 演示被项目明确描述为更小且校准更弱,不能代替服务器版本的评测。
  • 仓库代码采用 MIT,但所选 Qwen 底座、训练数据和后续检查点的许可证仍需分别审核。
  • 项目展示的校准数字来自其 MMLU 设置;业务阈值必须使用目标领域标注数据重新测量。

来源与边界

公开资料,不是 TypeDecide 统一实测

本页根据项目模型卡、仓库说明和其中公开的训练或评测设置整理。不同项目的硬件、数据集、版本、温度与样本量不同,公开数字不能直接组成排行榜;生产采用前仍需复核许可证并在目标数据上重测。

继续了解

把模型信息放回实际决策流程