CognitiveBench

Protocol 0.8

方法与测量边界

参与者与研究数据

不需要注册账号。当前研究版仅纳入主动知情同意的 18 岁及以上参与者;年龄使用分组范围,教育背景、睡眠、疲劳、噪声、咖啡因和预计中断作为解释测试状态的协变量,而不是能力分数的一部分。

测试入口

Quick Assessment 使用倒序数字、选择反应和 6 题探索性矩阵推理短版(约 8–12 分钟);Full Assessment 使用全部七项并按会话种子随机平衡模块顺序(约 50–70 分钟);Single Test 保留各模块完整协议。不同测试原始分数不相加。

Matrix Reasoning

原创规则生成器在每题生成后按渲染特征校验。大小只有 28、44、64 px 三档,matrix 与候选区共用映射。圆、正方形、菱形、正六边形和三角形按各自旋转对称性归一化;视觉等价候选会使题目被丢弃并重生。难度记录 rule count、rule types、interaction depth、spatial complexity 和 candidate similarity,设计难度不等同于经验难度。 候选项使用三属性全因子结构,使每个选项在候选集合中的总体相似度相同;候选属性值必须在前八格中出现,“选熟悉属性”策略也按随机水平回归测试。补位属性只使用行恒定或列恒定载体,并单独记录载体属性、模式和数量,不混入正式规则数。布尔集合位置按题随机生成。

Figure Weights

relation depth 来自关系系数矩阵中能够确定目标表达式的最小关系子集,而不是显示关系总数。任何捷径都会让题目重生;无关关系只使用推理链外图形。系统同时记录总关系数、无关关系数、分支因子和必要中间值。 关系方向、运算结构、符号顺序和目标组合均由种子控制生成,并逐题验证唯一解。目标组合不得直接出现在数值关系左侧;深度 1 必须由至少两个同形图形推导单个图形。每题六个候选值来自六道同一推理深度、独立生成且通过结构校验的题目,再由题库中预先均衡的答案排序位置决定实际展示哪一道关系题。因此正确值与干扰值具有相同数值先验;经验答案频率、奇偶性和接近 8 等只看选项的攻击均按 1/6 随机水平回归测试。

时间与数据质量

反应时间以 performance.now() 记录。计时任务在开始前公开时限,不显示连续倒计时,仅在长时限最后 10 秒提示。切换窗口或失焦会标记当前 trial 为 interrupted,主要评分排除这些 trial。 浏览器 rAF 时间戳位于绘制前阶段,和真实像素出现之间仍存在刷新率及显示链路误差。OSPAN 至少有 3 个有效基线反应后,算术时限按练习提交反应时的均值加 2.5 个标准差设置且不低于 2000 ms;基线不足时使用 8000 ms。算术正确率低于 85% 时明确标记为不可解释。

统计口径

公开汇总默认只纳入首次正式暴露。每组达到隐私阈值才显示;未来只有首次暴露有效样本 N≥100 时,才可能显示明确标注为实验性样本的 percentile。当前不提供 IQ、常模分数或能力标签。

已知限制

浏览器、键盘、屏幕刷新率、语言熟练度、自助环境和非概率抽样都会影响结果。当前版本尚未完成重测信度、结构效度、效标效度、跨设备等值性或代表性常模验证,不能用于诊断或高风险决策。