有效验证的最小实验设计
固定问题集与引擎,每次只改一类变量(如补第三方测评),再比较提及率、推荐位与有效引用源。
实验记录至少包含:questionSetVersion、引擎名单、采样起止、改动了什么、改前/改后证据包位置。公开口径模板见 方法报告。
步骤做什么不要做什么
定基线同题同引擎采一轮并留原件挑好看的截图当基线
改一类变量只补一种证据类型或实体字段同时改题、改引擎、狂发稿
复测同一窗口规则再采换题后仍对比旧曲线
下结论看高意图格子是否移动用综合分掩盖单引擎空白
波动怎么办?
生成式答案日内会抖。用窗口内聚合(如双周)与证据留存,而不是单次截图。趋势与竞品同题差距,比绝对分更可靠。
若必须对外沟通,写清采样周期与局限,禁止无法复核的「行业第 N」。
- 波动是常态;无原件的「涨了」不可审计。
- 改题集必须升版本,旧数据归档。
- 成功单位:提及/推荐位/引用类型,不是发稿量。
和内容排期怎么对齐
复测窗口应写进 引用策略 与内容 brief。发稿日不等于生效日;给发现与引用留时间,再采第二轮。