锚点效应为何在MaxDiff任务中被低估
MaxDiff因为强制取舍、规避了评分量表的宽容倾向,近年被广泛用于属性重要性排序。但强制取舍并不等于没有偏误。调研最大差异量表把若干属性放进同一个题组,让受访者挑出相对重要与相对不重要的两项,受访者的判断因此不可避免地依赖题组内的参照系。当某个属性在题组中反复充当参照原点时,它就形成了锚点,其余属性的效用估计会围绕这个锚点系统性地偏移。
之所以被低估,一方面是因为MaxDiff的输出看起来是干净的效用值序列,掩盖了生成过程中的情境依赖;另一方面是软件默认的实验设计通常只保证属性出现次数与共现次数的均衡,并不控制语义强度的分布。若一个题组里同时出现价格便宜与包装配色这类强度悬殊的属性,选择几乎无需思考,题组的信息量趋近于零,而这类低信息题组占比过高时,调研最大差异量表的判别力会被稀释。
锚定属性的形成机制:位置、语义与熟悉度
调研最大差异量表中的锚定来源大致有三类。位置锚定指屏幕呈现顺序带来的注意力分配差异,居首与居末的选项被读取得更完整,中间项容易被略读,移动端小屏下这一效应更明显。语义锚定指某些属性天然具有普适吸引力,例如质量可靠、价格合理,它们在几乎所有题组中都被选为重要项,从而成为其余属性的比较基准。熟悉度锚定指受访者对某属性所指代的功能有清晰体验,理解成本低,因而更容易被选中,而表述抽象的新概念属性即便真实价值高也容易被跳过。
三类锚定的后果不同。位置锚定制造的是随机性较强的噪声,可以通过随机化顺序在总体层面抵消;语义与熟悉度锚定制造的是系统性偏移,随机化无法消除。识别时可以先做描述性检查:统计每个属性被选为重要项的原始比例与其出现位置的交叉分布,若某属性无论位置如何都稳定居高,且与之同组的其他属性得分普遍下压,就应当把它列为疑似锚定属性,在后续调研最大差异量表的建模中单独处理。
偏误效应量的量化路径
要把调研最大差异量表的锚点效应从模糊感觉变成可报告的数值,需要设计对照。较为直接的做法是分半实验:把样本随机分为两组,一组的题组设计中限制疑似锚定属性的出现频次,另一组按常规均衡设计,比较两组估计出的效用值序列。差异可以用两个指标刻画,一是各属性效用值的位移幅度,二是排序位次的变动数量,后者对业务决策的影响更直观。
更细致的量化可以引入交互项。在层次贝叶斯模型中加入题组内是否含锚定属性的指示变量,及其与目标属性的交互,交互系数即锚定带来的效用偏移估计。经验上,语义强度突出的属性可能使同组其余属性的效用被压低约一到两成,位次靠后的属性受影响更明显。把这个量级摆出来,业务方就能判断当前的调研最大差异量表结果是否足以支撑属性取舍决策,而不是笼统地担心结果不准。
实验设计层面的抑制手段
抑制优于事后校正。设计阶段可采取几项措施。其一是属性池的强度分层,先做小样本预测试,按被选比例把属性分为高中低三层,规定每个题组内同层属性不超过两项,避免出现一边倒的题组。其二是共现约束,让疑似锚定属性与每个其他属性的共现次数尽量相等,防止部分属性总是与强锚同台竞争。其三是顺序随机化到个体层,而非仅在版本层随机,以摊薄位置效应。
题目数量与疲劳的平衡同样影响锚定强度。受访者在完成十余个题组后判断趋于简化,倾向于用一两个熟悉属性作为快速判据,此时锚定效应反而增强。因此建议把单人题组数控制在合理区间,属性总数较多时采用平衡不完备区组设计,让每人只看到属性池的一部分。这样处理后的调研最大差异量表,其后段题组的信息量衰减会明显放缓。
建模阶段的校正与稳健性检验
即便设计周密,仍需在建模阶段做稳健性检查。常用手段之一是留出题组验证:随机保留每位受访者的一到两个题组不参与估计,用模型预测其选择并计算命中率,命中率在不同题组类型间差异过大,说明模型对含锚题组的拟合存在系统问题。手段之二是敏感性分析,依次剔除疑似锚定属性重新估计,观察其余属性的相对位次是否稳定,稳定则结论可用,变动剧烈则需在报告中明确标注不确定区间。
报告呈现方式也值得斟酌。与其给出精确到小数位的效用值让人误以为高精度,不如提供分组结论,例如把属性划入核心驱动、次级驱动、边际因素三档,并说明档内属性的差异未达可靠区分程度。调研最大差异量表的价值在于分层而非精排,把这一点讲清楚,能减少大量因位次微小变动引发的无效讨论。
方法打磨与研究信任的建立
方法层面的打磨最终服务于决策质量。当研究团队能说清楚偏误从哪来、有多大、如何抑制,客户对结果的信任才不依赖于对工具的盲信。北京市场调研中心(bjsczx)围绕取舍类测量工具持续输出调研方法研究与数据洞察,属性强度分层、共现约束与留出验证的模板文件会在方法论专栏陆续整理发布,供研究同行参照使用。