
“准确率达到90%,能提前发现心理危机。”机构看到这样的介绍,首先需要弄清:这个数字识别的是什么,在什么人群、什么时间范围里验证过。量表能反映某类当前症状,不代表它已被验证能预测某个人未来会发生什么。
选购橙星云这类心理测评平台时,也应把两项能力分别看清:系统能否按规则筛出需要进一步查看的报告,以及某项测量或预测主张是否有相应的专业证据。软件自动出结果,并不会自动补齐后一项证据。

为什么“九成准确”不等于“预警者九成会出事”
看一个纯粹用于解释统计概念的假设:某个群体有1000人,在规定时间内,10人会发生某个明确定义的目标事件,990人不会。假设某工具能找出前一组的90%,也能正确排除后一组的90%。这些数字不是任何量表、学校或产品的实测表现。
结果是:会发生事件的10人中,9人被提示、1人被漏掉;不会发生事件的990人中,891人被正确排除、99人仍被提示。于是,全部108名被提示者里,真正发生该事件的有9人,占约8.3%。
“能找出多少会发生事件的人”叫敏感度;“能正确排除多少不会发生事件的人”叫特异度;“被提示的人中有多少实际发生事件”则是阳性预测值。三个问题的分母不同,不能都用一句“准确率90%”代替。目标事件本来有多常见,也会改变阳性预测值。

这个算例不表示其余被提示者没有心理困扰或不需要帮助,也不表示未被提示者安全无虞。它只说明:群体统计数字不能直接变成个人未来的保证书。
先核验“预测什么”,再看百分比
机构可以请提供方说明四件事:第一,目标是当前症状、专业评估结论,还是未来某种事件;第二,未来是多长时间,事件如何确认;第三,研究对象与本机构准备测评的人群是否相近;第四,数字是否来自独立验证,漏掉了多少人,又有多少提示最终未对应目标事件。
例如,一项工具与另一份情绪量表结果相近,只能为特定测量问题提供证据。若要宣称预测未来危机,还需对应未来事件及观察时间的验证,不能把两种结论混用。即使存在群体层面的关联,也应认真核对适用范围和局限。
英国NICE的NG225指南针对已发生自伤者明确提出,不应使用风险工具或量表预测未来自杀或重复自伤,也不应据此决定谁能接受治疗或出院。这里引用的是特定临床场景下的专业指南,并非把它当作中国学校的管理规定;它提示我们,高后果判断不能依赖量表分层替代对现实需要与安全的评估。
预警功能的价值,要落在后续工作上
橙星云当前的预警功能,是按具体量表配置规则,把符合条件的报告集中到预警列表,帮助工作人员确定哪些结果需要进一步查看。规则命中率、列表人数或预警等级,都不能直接表述为未来危机发生概率。
评估橙星云的使用价值时,可以实际检查:工作人员能否方便地找到相关报告、核对触发依据,并区分待处理、已处理和已忽略。这样的能力有助于组织筛查后的工作;专业人员仍需结合当事人的当前状态、具体困难和必要的其他信息作出判断。
机构也应保留主动求助和现实观察的响应渠道。明确的安全担忧不能因为“这次没有预警”而被搁置,出现紧急情况应及时按既定流程联系相应专业支持。采购时真正值得追问的,是证据支持到哪里,以及发现线索后谁来继续了解和提供帮助。
参考资料
NICE NG225(2022):Recommendations,1.6 Risk assessment tools and scales
NICE NG225:Rationale and impact,Risk assessment tools and scales
