
系统升级完成,页面能打开,测评能提交,就可以放心继续用了?对已经运行的心理测评系统,还要核对一个容易漏掉的问题:相同条件下,原本正确的结果有没有被改坏。
适合机构做的检查,不是临时找人随手答几份,而是保存一组固定答案,写明对应版本和预期结果,升级后再按相同条件验证。这就是结果回归检查。重点也不是要求所有结果一字不变,而是分清哪些应保持一致,哪些应按变更说明改变。
先写预期 再看升级后的结果
升级前先请供应商说明,这次改动涉及什么。只是调整页面,还是修正计分、结果解释或预警规则?受到影响的是哪些量表、哪些设置?没有这份说明,看到差异时就很难判断它是修复还是新问题。
记录可以分成两组:未涉及规则变更的样例,继续使用已核对的预期结果;明确涉及修正的样例,根据确认后的规则重新确定预期,并注明依据。不能等升级后看到什么,就把什么填成“正确答案”。
以橙星云已确认的预警功能为例,规则按具体量表配置,并非每个量表都必须开启预警。因此,“相同答案”还不够,比较时也要固定量表、规则和是否启用预警等条件。

固定样例要留下能重做的材料
一份样例至少记下样例编号、完整答案、量表及相关规则版本、必要的人群条件、预期分数、报告对应关系和预警结果。页面上找不到版本号时,应向供应商取得可识别本次配置的说明,记录在检查材料中,不要自行猜测。
样例优先使用专门准备的虚拟测试数据,避免拿真实来访者的敏感答卷反复试验。应当覆盖机构常用量表,并包含规则下应触发与不应触发预警的情况;边界样例由熟悉量表规则的人员确认,不能凭常识编一套分数或阈值。
旧系统输出也不天然等于正确答案。至少要由专业人员和供应商共同核对样例依据,尤其是本次正在修复的错误。若题目本身发生变化,原答案无法直接对应,就另建新版本样例,不能强行逐题套用。
沿着同一份答案核对三处
计分先看“数值是否符合预期”。按该量表实际提供的项目核对,不能只看一个总分就结束。出现差异时,先排除选错量表、录错答案或条件不一致,再请供应商定位。是否允许舍入差异,也应事先明确。
接着看报告有没有对应到正确的测试人、量表和本次提交。数值正确,却打开了另一份报告,同样不能通过。在橙星云的团体分析中可以继续查看具体测评报告,这个入口可用于核对从团体结果到个人报告的对应关系。
报告版式或用语如果在此次变更范围内,应对照约定检查内容是否完整、含义是否正确,不必把每一处换行都当成错误。预期保持不变的结果解释,却不能用“只是改了样式”含糊带过。
预警还要把触发结果和处理状态分开看。橙星云现有预警列表包含待处理、已处理、已忽略等状态;“是否触发”回答规则判断,“是否已处理”回答工作人员的处理进度。检查保留的测试记录时,要核对原状态;新提交的样例则按双方确认的新记录预期检查,不能要求它继承旧记录的处理状态。
差异没有解释清楚 就先挂起这一项
检查表不必复杂,每行保留样例编号、升级前后版本、预期结果、实际结果、是否通过和差异说明。只有“符合预期”“经确认的规则变化”“待查差异”分开记录,后来接手的人才知道哪些已经查清。
发现异常后,应把样例、复现条件和实际结果交给供应商,并确认影响范围及临时使用安排。修复后用原样例重测,再检查可能受影响的其他样例;不要靠换一份答案证明问题消失。
这套做法可以先从人工核对开始。自动回归、版本快照和回滚是否可用,需要按实际项目确认。一次检查也不能证明所有情况都没问题,但它能留下明确依据:哪些结果核过,哪些变化有解释,还有哪些差异尚未关闭。
