信度和效度不是同一件事
很多用户会问:“这个测试准不准?”在测评领域,这个问题不能只用一个词回答。通常至少要区分信度和效度。
信度关注结果是否稳定。例如,在相近条件下,同一类题项是否给出相对一致的结果;同一个人在短期内重复作答,结果是否大体接近。 效度关注测评是否真的在测它声称要测的东西。例如,职业兴趣测评是否在观察兴趣,而不是能力;人格维度是否在解释行为倾向,而不是道德评价。
一个测评可以比较稳定,但不一定有效;也可以目标清楚,但结果稳定性不足。因此,信度和效度需要分开看。
常见的信度问题
信度不是单一指标。常见讨论包括内部一致性、重测稳定性和评分一致性。
内部一致性关注同一维度下的题项是否大致在观察同类内容。重测稳定性关注间隔一段时间后结果是否保持相对稳定。评分一致性则更适合涉及人工评分的场景。
FermatMind 当前公开说明中暂不提供具体信度数值。没有公开、可审核的资料时,不应把任何数值写成已验证结论。
常见的效度问题
效度也有不同层次。内容效度关注题项是否覆盖了目标构念的合理范围。结构效度关注结果结构是否符合模型假设。效标关联效度则关注结果是否与外部指标存在合理关系。
例如,如果一个职业兴趣测评声称解释工作环境偏好,它就应当围绕活动偏好、环境偏好和职业探索来组织内容,而不是暗示自己能判断能力或预测高风险职业结果。
当前公开说明中暂不提供 FermatMind 各测试的具体效度数值、样本范围或常模信息。发布任何具体数值前,都需要 science review 和法律/合规 review。
常模和比较对象为什么重要
有些测评结果需要参照群体来解释。一个分数本身不一定有意义,关键在于它与什么样的人群、什么样的版本、什么样的语言环境进行比较。
如果没有说明样本、语言版本和适用范围,用户就不应把结果理解成普遍排名。当前公开说明中暂不提供具体常模和样本数时,应保持 Unknown。
误差不是失败,但必须承认
测评会有误差。误差可能来自题目理解、作答状态、语言差异、文化经验、近期事件和模型限制。承认误差并不等于否定测评价值,而是让用户知道结果应如何使用。
更合适的做法是:把结果当成参考线索,用真实经历和持续观察继续验证。对于重大决定,不应只看一次测评结果。
FermatMind 当前证据表述原则
在没有公开验证资料之前,FermatMind 不应声称某个测试“绝对准确”“绝对权威”“已被大规模证明”或“可以预测结果”。更合适的表述是:该测试用于辅助自我观察,具体信度、效度、样本和常模资料在当前公开说明中为 Unknown。
信度高是不是就代表测试有效?
不一定。信度说明结果较稳定,但效度才关心测评是否测到了目标内容。两者需要分开看。
什么是内部一致性?
内部一致性关注同一维度下的题项是否在观察相近内容。它是信度讨论中的一种,但不是全部。
没有常模数据时还能看结果吗?
可以作为自我观察参考,但不应把分数理解成普遍排名或严格比较。常模缺失应标为 Unknown。
FermatMind 目前是否公布具体信效度数值?
当前公开说明中暂不提供具体数值。没有经过审核的资料不应被写成已验证结论。
结果有误差是不是说明测试没用?
不是。误差说明结果有解释边界。测评仍可用于提出问题和辅助反思,但不能作为唯一依据。