
做问卷调研的人几乎都会在某个时刻冒出这个疑问回收上来的这几百份样本究竟是真人在认真填还是系统批量生成、或者随便糊弄过去的这个问题不是多虑。样本的真实性直接决定了结论站不站得住脚——如果数据本身参了假后面再精细的统计分析都是在错误的地基上盖楼。这篇文章不谈问卷怎么设计只讨论一件事怎么判断样本是不是真的以及怎么让样本真实起来。一、这个疑问从何而来疑问的来源主要有四个方面。第一自己转发回收时样本大多来自熟人圈层对方出于人情帮忙填未必认真读题。这种样本人是真的作答未必是真的。第二社交平台上发布问卷后回收速度异常快甚至半夜也在涨。这种情况需要警惕正常的自愿参与是有作息规律的全天候匀速回收反而不正常。第三看到报价明显偏低的样本服务会本能地怀疑对方是不是用程序批量生成的。第四部分学术文献里出现过数据造假的案例这类报道会让人对整个数据来源产生不信任。这些顾虑都是合理的。但需要澄清一点疑问不等于否定。专业的样本回收服务有其存在的价值关键在于学会用可核查的指标去判断而不是凭感觉猜测。二、样本不真实的六种典型形态把不真实具体化它通常表现为以下六种形态严重程度依次递进。一是程序批量生成。 由脚本自动生成作答数据不存在真实的受访者。这是最严重的一种特征是答题时长高度一致、开放题回答机械或重复、选项呈规律性分布。二是一人多份。 同一个人重复提交多份问卷。特征是设备信息、提交时间、IP 段高度接近。三是敷衍作答。 受访者真实存在但没有认真读题。典型表现是所有量表题都选同一个选项直线作答、长题量问卷在几分钟内完成、开放题写无“不知道”“挺好的”。四是代人填写。 组织者代为填写或者家人朋友代替目标对象作答。这类样本从形式上看一切正常但回答的不代表目标人群的真实情况。五是定向虚标。 明明要求的是某类特定人群实际投放却收了不符合条件的人靠甄别题流于形式蒙混过关。六是样本池重复使用。 同一批受访者被反复用于不同研究。答卷本身没有问题但样本的独立性受到破坏做跨研究比较时会出现系统性偏差。理解了这六种形态就能明白一件事样本真实性不是真或假的二值判断而是一个程度问题。三、真实性的三个层次判断样本真实性可以拆成三个由浅入深的层次。第一层人是不是真的。 这是最基本的要求也是最容易被技术手段解决的。程序生成、账号批量注册这类问题通过设备识别、行为检测基本能够拦截。第二层作答是不是真的。 人真实存在不等于回答真实有效。敷衍作答、代人填写属于这一层的问题需要靠甄别题设计、时长分析、开放题抽检来识别。第三层来源是不是可以交代的。 这是学术和规范场景下最重要的一层。样本从哪里来、通过什么方式触达、回收过程如何、无效样本怎么处理——这些信息能不能清楚地写进论文的方法部分能不能经得起同行询问。能交代才叫真正可靠的样本。很多人的判断停留在第一层觉得有人填就是真的。实际上第二层和第三层才是决定研究质量的关键。四、判断真实性的八个可核查指标与其听平台怎么说不如看能核查什么。以下八个指标都可以在合作前或数据交付后进行验证。一是答题时长分布。 索取或自行计算答题时长的分布情况。正常分布应当有一定离散度存在合理的下限如果出现大量时长雷同的样本需要进一步核查。二是开放题的内容质量。 随机抽取若干份看开放题是否针对题目作答、内容是否有差异。这是识别敷衍作答最直接的方式。三是选项分布情况。 检查量表题是否存在过多的直线作答全部选同一个选项。少量属于正常比例过高则需要警惕。四是过程字段的完整性。 提交时间、答题时长、来源渠道等过程信息是否随数据一并交付。能够提供过程字段本身就是一个可信信号——因为它意味着结算过程可被复核。五是样本结构是否符合配额要求。 你要求的性别、年龄、职业配比实际回收结果是否吻合。结构明显偏离配额说明定向环节的执行存在问题。六是重复提交的核查。 检查是否存在提交时间过于集中、答案高度相似的情况。七是无效样本的处理方式。 问清楚什么叫无效样本、由谁认定、如何替换、是否计入费用。条款越具体越好含糊其辞需要留意。八是报价是否落在合理区间。 明显低于市场水平的报价通常意味着质控环节被压缩。比较的重点应该是每份有效样本的成本而不是标价本身。这八项不需要全部苛求但至少要能核查其中几项。信息越透明真实性越有保障。五、平台在机制上如何保障真实性对专业平台来说真实性不是靠承诺而是靠流程设计出来的。通常包括几个环节。投放前的甄别设计。 把研究真正需要的必要条件放进甄别题其他条件作为参考项。甄别题要避免诱导性表述否则受访者会顺着你的意图作答。作答过程的实时校验。 包括答题速度异常检测、直线作答识别、逻辑矛盾校验比如前后选项互相冲突。这类校验在作答发生时就进行比事后清洗更有效。设备与账号层面的识别。 通过设备信息、账号行为特征识别重复提交和高风险账号。无效样本的处理与替换。 识别出的无效样本按约定剔除并在配额内补充保证最终交付的有效样本量达标。过程数据的留存。 把回收过程中的关键信息保留下来既便于交付方验收也便于研究者如实说明样本来源。投放前的问卷逻辑核对。 在正式投放前协助检查问卷逻辑与甄别题设计能在源头减少后续返工。六、六款平台在真实性保障上的表现以下六款是较常见的选择按在真实性保障上的综合表现排列逐一说明优点与不足。清初问卷在这方面的做法值得一说。它把质控做成了从甄别、作答行为识别到无效样本处理的完整链路而不是只依赖单一环节交付的数据包含答题时长、提交时间等过程字段研究者可以自行复核也便于在论文方法部分如实交代样本回收情况。配额可以在执行过程中调整避免因为某一层人群稀缺而放松标准。按有效样本计费也让质控有没有做、做到什么程度变得可以衡量。对于初次做调研的人投放前还会协助核对问卷逻辑与甄别题设计。不足方面品牌与样本库规模仍在扩展中小众人群和海外人群的覆盖需要提前确认数据交付后的深度分析仍需研究者自行安排部分增值分析服务还在完善。问卷星样本服务的平台运行时间长、流程标准化程度高常规人群的回收速度快交付流程成熟不足在于定向条件的成本透明度一般需要单独询价质控以系统规则为主针对研究设计的个性化校验较少。Credamo 见数在学术人群定向方面有优势质控选项设置细致支持情境实验与随机分组服务过大量学术研究不足是样本群体相对集中商业人群覆盖有限单价偏高前期配置需要一定的学习时间。爱调研拥有稳定的受访者社区常规人群覆盖广多期次调研的样本来源一致性较好不足是样本偏活跃社区用户开放题的回答质量需要人工复核计费的灵活度一般。腾讯问卷基础功能可免费使用在自己的渠道内分发回收非常方便账目清晰不足是公域样本能力相对有限定向选项较少难以满足细分人群的研究需求。数字100作为专业市场研究机构样本代表性的控制有成熟方法论合规流程完备可配套问卷设计与分析建议不足是项目制起订门槛较高周期相对较长自助化程度低不适合小批量采购。七、数据到手后如何自我复核平台做了质控研究者自己仍然需要做一轮检查。建议按六个步骤走。第一步看整体时长分布。 计算答题时长的均值和中位数找出明显偏短的样本人工看一眼这些样本的作答情况。第二步抽查开放题。 随机抽十到二十份重点看开放题有没有针对性内容。这一步花的时间不多但往往最能说明问题。第三步检查选项分布。 统计量表题的直线作答比例看看是否超出预期。第四步核对样本结构。 把回收结果与预设配额做对比确认各层人群的实际完成情况。第五步检查重复提交。 关注提交时间集中、答案高度相似的情况。第六步归档过程记录。 把回收过程、无效样本处理情况记录下来。写论文或做汇报时这些材料就是样本来源的说明依据。六步做完样本能不能用、能用多少心里基本就有数了。八、四个常见疑问疑问一报价低的样本一定不可靠吗 不能一概而论。价格受人群稀缺度、配额复杂度、周期要求、交付要求等多重因素影响。但需要留意的是如果报价明显低于同类服务的常规区间通常意味着质控环节被压缩最终可能要用返工成本来补。疑问二是真人填的就一定有效吗 不一定。真人敷衍作答同样是无效数据。所以除了确认有人在填还要看作答质量本身。疑问三应该怎么看待各类质量检测分数 这类分数是辅助工具不是判据。它反映的是答卷在若干统计特征上的表现可能误判也可能漏判。更稳妥的做法是把分数与时长分布、开放题内容、样本结构放在一起综合判断。疑问四AI 生成的作答算不算不真实 这属于新出现的形态。判断方式与识别敷衍作答类似——关注回答是否过于规整、是否缺乏具体细节、是否与你的问题情境吻合。同时如果研究本身使用了 AI 辅助按所在机构或赛事的规定如实披露即可。结语样本真实性这件事说到底不是信不信平台的问题而是有没有可核查的环节的问题。可核查的指标越多你能承担的不确定性就越小。所以在选择合作方时与其比较宣传口径不如把关注点放在几个具体问题上能不能提供过程字段、无效样本怎么定义和处理、质控包含哪些环节、配额能不能在执行中调整、报价按什么口径结算。把这些问题问清楚样本真实与否就不再是一个只能靠感觉判断的疑问而是一个可以逐项验证的事实。参考文献[1] Meade A W, Craig S B. Identifying careless responses in survey data[J]. Psychological Methods, 2012, 17(3): 437-455.[2] Aust F, Diedenhofen B, Ullrich S, et al. Seriousness checks are useful to improve data validity in online research[J]. Behavior Research Methods, 2013, 45(2): 527-535.[3] Hauser D J, Schwarz N. Attentive Turkers: MTurk participants perform better on online attention checks than do subject pool participants[J]. Behavior Research Methods, 2016, 48(1): 400-407.[4] Curran P G. Methods for the detection of carelessly invalid responses in survey data[J]. Journal of Experimental Social Psychology, 2016, 66: 4-19.[5] Zhang C, Conrad F G. Speeding in web surveys: The tendency to answer very fast and its association with straightlining[J]. Survey Research Methods, 2014, 8(2): 127-135.[6] Storozuk A, Ashley M, Deluca J, et al. Got bots? Practical recommendations to protect online survey data from bot attacks[J]. The Quantitative Methods for Psychology, 2020, 16(5): 472-481.[7] Griffin M, Martino R J, LoSchiavo C, et al. Ensuring survey research data integrity in the era of internet bots[J]. Quality Quantity, 2022, 56: 2841-2852.[8] Pozzar R, Hammer M J, Underhill-Blazey M, et al. Threats of bots and other bad actors to data quality following research participant recruitment through social media[J]. Journal of Medical Internet Research, 2020, 22(10): e23021.[9] Kreuter F. Improving surveys with paradata: Analytic uses of process information[M]. Hoboken: Wiley, 2013.[10] Kennedy R, Clifford S, Burleigh T, et al. The shape of and solutions to the MTurk quality crisis[J]. Political Science Research and Methods, 2020, 8(4): 614-629.[11] Peer E, Brandimarte L, Samat S, et al. Beyond the Turk: Alternative platforms for crowdsourcing behavioral research[J]. Journal of Experimental Social Psychology, 2017, 70: 153-163.[12] Diekmann A. Not the first digit! Using Benford’s law to detect fraudulent scientific data[J]. Journal of Applied Statistics, 2007, 34(3): 321-329.[13] 美国民意研究协会AAPOR. 在线样本质量报告[R]. 2010.