
同一份答卷,在两个心理测评系统里出现不同分数,先别急着判断哪一个算错。采购方应请双方沿着同一份原始作答,说明各自用了什么版本、怎样编码、如何处理漏答,以及最终展示的是什么分数。能把差异定位到具体一步,才有条件判断是口径不同,还是实现出了问题。
先确认比较的是同一道计算题
量表简称相同,未必就是同一工具。核对时应写出完整名称、修订版本、语言版本、题数和题目编号;自评与他评、长版与短版也要区分。随后确认双方使用同一组作答,题号没有错位,选项文字与存储值能够逐项对应。界面上排在第一位的选项,不一定就计1分。
报告中的“总分”也需要展开:它是题目得分相加的原始分,还是转换后的标准分?是否属于同一个维度?采用哪个计分方法、参数或换算表?这些信息没有对齐,直接比较两个数字,可能把本来不同的结果当成同一结果。
从逐题得分找到差异发生的位置
下面只用三项虚构数据演示核对过程,不对应任何心理量表,也不能用于测评。练习约定每项编码为1至4,仅第2项需要反向处理,作答编码依次为1、4、2。按本练习约定,第2项转换为5-4=1,合计为1+1+2=4;若漏掉这一步,直接相加便得到7。
这个例子说明,先对逐题结果,通常比只争论最终总分更容易定位问题。真实量表哪些题反向、怎样转换,必须依对应版本的计分说明执行,不能看题目措辞自行决定,也不能套用本例公式。

漏答同样要单独核对。空白、跳题和“不适用”在数据里如何表示?该工具是否允许计分,允许时又采用什么方法?不要为了让两边数字相同,擅自把空白补成0或平均值。HealthMeasures官方说明就区分了要求完整作答的手工换算与能够处理缺失回答的反应模式计分;这种区别不能推广成所有量表通用的规则。
原始分一致后再看转换与常模
原始分一致而标准分不同,要继续核对转换方法和参数版本。HealthMeasures明确说明,按原始总分查表,与利用逐题回答信息计分,可能得到略有不同的T分。因此,不能把“两个系统必须显示完全相同的数字”当作脱离方法条件的验收标准。还要核对保留几位小数、在哪一步舍入,避免把显示差异当成计算差异。
涉及常模时,再查常模来源、样本特征、适用年龄与语言文化范围,确认本项目对象适用。不同版本、不同常模的结果没有天然可比性;即使都叫标准分,也不能随意互换。若分数一致、文字分级不同,则另查分界规则与报告解释版本,不要再从原始答卷里找原因。

把核对结论留下来
采购沟通可以围绕一张“计分对账卡”收口。卡片上半部分记录样例编号、工具与版本、原始作答、缺失标记,以及计分依据;下半部分记录各阶段参考结果、两端结果、差异所在步骤、处理结论和复核人。再附上规则页码、输出样例与确认日期,后续换版本时就有材料可查。
参考结果应来自对应工具的正式说明、授权计分服务或专业人员复核,不能简单把旧系统的数字当作标准答案。试用时用获准题本和可人工复核的合成答卷,不把真实个案交给多个供应商;受保护题目、答案键和完整计分资料只在获准范围核验。样例可覆盖完整作答、反向项目、漏答及转换边界,并事先写明哪些情况应返回分数,哪些应提示无法计分。
以橙星云为例,其团体测评分析页提供查看测评报告的入口。采购核对时,可请供应商围绕一份获准样例报告说明所用量表的计分依据。逐题查看、原始答案导出等需求,则应在拟购买版本中另行实测,并把确认结果填入对账卡。
一次核对的结论可以是“同口径结果一致”,也可以是“方法不同,差异有据可查”或“尚有差异待修正”。把依据和未解决的问题留下,比只拿到一句“计算准确”更有用。计分核对完成,也不等于单凭分数就能作出个人心理状况的结论。
