如何进行德尔菲研究,使推理在多轮中得以保留
德尔菲法通过迭代的匿名回合和受控反馈收集专家判断:独立的第一轮回应,汇总反馈,第二轮修订,重复进行直到收敛或稳定的分歧。现有的德尔菲工具是调查软件——它在回合之间传递数字,却失去了推理,因此小组成员看到小组的变化却不知道原因。要运行一个推理得以保留的德尔菲:将一个可证伪的命题框架作为根本主张;收集第一轮的立场作为独立的支持/反对论点(在提交之前没有人看到其他人的观点);可选地从多个AI模型中引入额外的立场,并清晰标记;将第一轮的评分作为定量记录;让受控反馈成为立场本身及其评分分布——而不是主持人的释义;让小组成员在第二轮通过问答链质询立场(与立场作者的四轮对话——AI撰写的立场自动回答,因此混合小组是可行的)并通过平行审查链挑战它们;通过妥协链调和近似重复;通过比较各轮的评分分布来衡量收敛;并报告共识立场及其推理下的存续异议——稳定的分歧是一种发现,而不是失败。前期声明的承载限制:Argumentree提供独立性(在提交之前没有人看到其他人的输入),而不是匿名性——论点携带其作者在一个私有租户上。如果真正的匿名性对您的小组至关重要,请在Argumentree.AI公共租户上运行,它支持未经身份验证的贡献。也没有回合管理者(回合是您时间限制的促进惯例),也没有内置的收敛统计(导出评分并计算肯德尔的W或报告分布)。
德尔菲方法的设计目标——独立性、迭代性、可测量的收敛性——更好地描述了一个论证平台,而不是调查工具。运行它,以确保推理得以存活:
- 首先决定匿名性问题:私人租户给你 独立性(归属作者,没有锚定);真正的匿名性需要一个公共的 Argumentree.AI 租户。
- 第一轮:独立立场作为论据,由每位评审评分 — 该差距是本轮的定量记录
- 控制反馈就是论点本身及其分布——中间没有主持人的释义
- 第二轮:通过问答链进行审问,通过平行审查链进行挑战,调和重复项——然后测量两个分布之间的收敛性,并报告分歧。
这个小组讨论的结果没有人能解释。
德尔菲研究的第三轮结束,主持人给小组发邮件:达成共识。十年采纳问题的中位数从6.1上升到7.8;标准差减半;报告几乎自己写好了。然后一位小组成员——一位谨慎的成员——回复了一个揭示真相的问题:"我修正了我的估计,因为第二轮总结说小组对乐观有充分的理由。我可以看看那些理由吗?我想知道我同意了什么。”
没有好的答案。这些轮次是调查。在它们之间,专家小组看到了中位数、四分位数和一位主持人的两段摘要。原因——无论是什么具体论点促使十一位专家上调——都被输入到自由文本框中,压缩到摘要中,然后消失了。专家小组达成了一致;基于什么推理,没人能说。
这不是一个失败的研究;这是标准实践,使用标准工具,并且浪费了该方法最好的特性。Delphi 是围绕一个精确的洞察设计的:匿名性和独立性消除了扭曲面对面小组的主导和地位效应,而受控反馈让真实的判断在没有社会压力的情况下转变。调查软件提供了独立性,但失去了反馈的实质。这个教程保持推理,进行相同的轮次。
基于调查的德尔菲法在轮次之间失去的内容
德尔菲法的一个回合产生两样东西:一个分布(小组的立场)和一套推理(原因)。调查工具是为第一个而构建的。第二个则被压缩成自由文本字段,然后转化为主持人的总结——这在专家之间悄然插入了一个无法追责的编辑。第二轮的参与者并不是在回应同伴的论点;他们是在回应这些论点的释义。对于一个其整个认识论是结构化集体判断的方法来说,失去这一点是件奇怪的事情——集体方法的历史在很大程度上是关于这一反馈步骤的争斗历史。
你需要的
一个小组(通常由8到20名专家组成)、一个协调员,以及每个德尔菲问题的一个Argumentree讨论。回合是您宣布的时间限制提交窗口;教程假设有两个回合加一个报告,可以延长。
设置:问题、评审团——以及匿名决定
在其他任何事情之前,方法论者首先会检查的一个决定是:您的小组实际上需要什么——独立性还是匿名性——因为它们并不是同一回事,而平台默认提供其中之一。
- 1将命题框架设定为根本主张 — 可证伪,而非开放式的:"到2032年,X将成为标准临床实践",而不是"X的未来是什么?" 一个模糊的根本会产生无法评估的立场。检查点:根本主张可以被支持和反对。
独立 ≠ 匿名 — 根据此选择你的租户
在私人Argumentree租户上,论点带有其作者:你得到的是独立性——在提交之前,没有人能看到其他人的输入,这消除了锚定效应,让小组可以自由撰写。它不会消除后续回合中的身份效应,因为名字是可见的。经典的德尔菲法要求匿名性。如果你的小组需要它——高级和初级专家混合,政治敏感话题——在Argumentree.AI公共租户上进行研究,在那里支持未经身份验证的贡献,且观点不具名。在你的方法部分说明你使用了哪个属性;这种权衡是现实的,审稿人会询问。
第一轮:独立职位,然后是数字
- 1独立提交窗口。 每位小组成员在根下添加支持或反对的立场 — 在提交之前看不到其他人的立场。这是该方法所要求的独立性,由媒介而非对主持人过程的信任来强制执行。检查点:每位小组成员都有≥1个立场;没有人看到或编辑过其他人的立场。
- 2可选:标记的AI评审员。 从多个模型中生成额外的职位。每个论点都有来源标记,因此机器的立场总是可以与专家的立场区分开来。这扩大了立场空间;它并不增加专业知识——这种区分很重要,并应包含在您的报告中(请参见下面的混合小组部分)。检查点:AI立场明显标记。
- 3第一轮评分。 每位评审对每个职位进行评分 — 一个数值加一个标签,使用您定义的锚点(“1 = 不可信 … 9 = 几乎确定”)。这是本轮的定量记录。检查点:完整的评分矩阵;锚点一次性声明,始终如一地使用。
带有推理的控制反馈
现在步骤调查工具无法做到。第二轮的反馈文档不是主持人写的总结——而是树本身:每个位置,都是其作者(或模型)自己的话,附带其评分分布。小组成员可以清楚地看到小组认为哪些论点强有力,哪些论点分歧,哪些论点沉没——中间没有任何编辑性的改述。主持人的工作缩减为后勤:宣布时间窗口,指向树。
调查工具,轮次之间
每个项目的中位数和四分位数;自由文本评论压缩为主持人摘要。该小组的动态是可见的;其推理则不可见。
论证树,回合之间
职位本身,每个都有其评级范围。修订的评审员可以指出使他们改变观点的论点——你的方法部分也可以如此。
第二轮:审问、挑战、调和
第二轮是经典的德尔菲法所说的“根据反馈进行修订”。随着推理的可见性,修订变得积极——三个结构化的步骤,每个步骤都是与立场作者的四轮对话:
- 1审问 — 问答链。 在修正立场之前,先理解它:你的问题、作者的回答、后续问题、回答 — 完整。对于人工智能立场,模型会自动回答,因此小组不会因为某个成员而被阻塞。检查点:改变意见的立场会有链条解释原因。
- 2挑战 — 评审链。 评估一个立场为不支持;作者回应;后续;回应。N 名小组成员挑战一个立场 = N 条平行链 — 这正是德尔菲所希望的结构:平行独立的批评,绝不通过一个小组线程重新进入状态。检查点:有争议的立场携带已完成的挑战。
- 3调和近似重复项 — 妥协链。 两位持有几乎相同观点的专家在评分中重复计算了一个观点。一个专家向另一个专家提出合并的表述,并记录在案。检查点:没有未合并或未解释的重复对。
- 4第二轮评级。 在相同的基准下重新评级所有内容。检查点:第二个完整矩阵,准备进行比较。
混合面板:在不增加专业知识的情况下添加模型
因为AI撰写的立场回答它们自己的链条——回溯到写出它们的模型——人类与AI混合的专家小组确实是可行的:使用模型来扩展第一轮的立场空间,然后让人类专家在第二轮中交叉审查机器的立场,并在没有任何人负责机器一方的情况下获得实质性的回复。要明确这带来了什么:更广泛的输入,而不是增加的专业知识。模型的立场是一个措辞得当的模式,而不是一个判断的职业,标签的存在是为了让你的收敛数字可以在有和没有机器行的情况下进行计算。何时扩大输入有帮助,何时仅仅是稀释,这是其自身的文献——当人群出错时涵盖了失败模式;反面,为什么独立判断在真正独立时聚合得如此良好,是加尔顿和孔多塞的故事。
您最后一个小组讨论的问题
当它收敛时——有人能说出为什么吗?如果答案是一个移动的中位数,你测量了协议而从未捕捉到达成的共识。
测量趋同,报告异议
收敛是回合之间评分分布的缩小,你可以通过比较它们来衡量——诚实地说,可以手动或导出:没有内置的收敛统计,没有自动的肯德尔W,没有稳定性测试。导出这两个矩阵并计算你的领域所期望的,或者定性地报告分布(“十四个位置中有十二个缩小;两个进一步分裂”)。
并报告异议。一个小组在多个回合中稳定地不同意的立场——相同的分布,两个极端在完成的链条中都有辩护——是一项发现,可以说是最有价值的类型:它标志着专家判断真正分歧的地方,并附有两个极端的推理。将其平均化是德尔菲法中唯一不可原谅的罪过。树状图使异议可引用:存活的反对意见、其作者(或其匿名的公共租户替代者)以及它所经历的挑战。
诚实的局限性
- ✗独立并不等于匿名 — 这句话需要明确指出并值得重申:私人租户的论点是有归属的。如果匿名在方法论上是必要的,请使用 Argumentree.AI 的公共租户,并在您的写作中说明。
- ✗没有回合经理。 没有关闭第一回合的按钮,也没有每回合的可见性限制。回合是你通过时间限制和指示来执行的一个促进性约定——明确说明,不要暗示不存在的自动化。
- ✗没有内置的收敛统计量。 Kendall's W、稳定性测试等需要您从导出的评分中计算。
- ✗评分是一个单一的标记值,而不是带有验证锚点的李克特量表。请在标签中定义您的锚点,并在各轮中保持不变。
- ✗一条链是四个回合,然后完成。 需要更多的专家争论会得到一个电话——链条记录了已经问过和回答过的内容。
实用课程
- ✓在第一轮之前写下锚点并将其粘贴到每个窗口公告中。所有混乱的德尔菲数据中有一半是锚点漂移。
- ✓跨时区慷慨的时间框窗口 — 每轮72小时适用于国际小组;链条本质上是异步的。
- ✓每位评审的Cap Round-1职位(三个就足够了)。德尔菲奖励考虑的是职位,而不是数量。
- ✓在回合之间冻结树。 宣布在窗口外的提交将被移除 — 只有在主持人进行时,回合约定才有效。
您最终可以发送的回复
回到那位谨慎的评审员的电子邮件:"我可以看看理由吗?我想知道我同意了什么。" 在这个版本的研究中,答案是一个链接。这里有十四个职位;这里是那个在两个评审链未能影响后其评分范围崩溃的职位;这里是感动了你和其他十一人的交流。附带理由的共识——这一直是该方法的承诺。
来源与进一步阅读
- Dalkey, N., & Helmer, O. (1963). 德尔菲法在专家使用中的实验应用. 管理科学, 9(3).原始的RAND公式:带有控制反馈的迭代匿名轮次。
- Linstone, H. A., & Turoff, M. (编辑) (1975). 德尔菲法:技术与应用. 亚迪生-韦斯利.标准的方法论参考,包括本教程的控制反馈部分所涉及的反馈设计变体。
- Rowe, G., & Wright, G. (1999). 德尔菲技术作为预测工具:问题与分析。《国际预测杂志》,15(4)。对德尔菲法有效因素的关键评估——独立性、迭代、反馈质量——以及实施中常见的失败之处。
常见问题
如何一步一步地进行德尔菲研究?
定义一个可证伪的命题,并招募一个小组(通常为8-20名专家)。第一轮:每位小组成员独立提交支持和反对的观点,而不查看其他人的观点,然后每个人根据既定的锚点对每个观点进行评分。受控反馈:小组看到观点本身及其评分分布。第二轮:小组成员通过问答链质询观点,通过评审链挑战观点,调和近似重复的观点,并重新评分。比较两个评分分布的收敛性;如有需要,重复一轮;然后报告共识观点和存活的异议及其理由。为每轮的提交窗口设定时间限制——轮次是一个促进的约定,而不是一个自动的状态。
在德尔菲中,独立性和匿名性有什么区别?
独立性意味着在提交自己的意见之前,没有人能看到他人的输入——这消除了锚定效应和首发者的主导地位。匿名性意味着贡献在整个过程中没有归属——这还消除了小组在阅读和反应彼此立场时的地位效应。经典德尔菲法要求匿名。一个私有的Argumentree租户提供带有归属的独立性;如果匿名在方法论上是必需的(混合资历、政治敏感话题),可以在Argumentree.AI公共租户上进行研究,支持未经认证的贡献——并在方法部分说明您使用的属性。
什么是控制反馈,它为什么重要?
控制反馈是小组在回合之间看到的内容——通常是一个汇总(中位数、四分位数)加上理由的总结。这很重要,因为它是判断合法转变的机制:专家在没有社会压力的情况下根据小组的观点进行修正。标准的失败是调查工具反馈数字加上主持人的释义,因此小组成员回应的是编辑的压缩,而不是同伴的实际论点。直接反馈各自的立场,附上他们的评分分布而不进行释义,是本教程对标准工作流程的最大改进。
在德尔菲研究中,如何衡量共识或收敛性?
通过比较各轮的评分分布:收敛是对一个位置的分布范围的缩小,而不是主持人的声明。导出轮次矩阵并计算您的领域所期望的——Kendall's W用于一致性、四分位差阈值或跨轮次的稳定性测试——因为没有内置的收敛统计量。同样重要的是:将稳定的不一致报告为发现。在两个轮次中具有相同广泛分布的位置,且两个极端在完成的链条中都有辩护,标志着专家判断中的真正分歧,而将其平均化则会误导小组。
AI模型可以成为德尔菲小组的一部分吗?
作为标记的输入扩展器,是的。第一轮种子轮有来自多个模型的职位——来源已被标记,因此机器职位始终是可区分的——而且由于AI撰写的论点会自动回答它们自己的问答链,人类专家可以在第二轮中交叉审查机器职位,并在没有任何人力支持的情况下获得实质性回复。两个学科保持这一过程的诚实:报告有和没有机器行的收敛情况,并且绝不要将模型描述为增加专业知识。它们扩展了候选职位的空间;判断仍然由人类来做。
德尔菲法需要多少专家和轮次?
经典指导建议,对于一个集中问题,面板人数大约在8到20人之间——人数足够小,以便每位小组成员都能真正参与每个立场,同时又足够大,以使分布具有意义。两轮通常可以解决大多数问题,只要反馈包含推理而不仅仅是数字;当第二轮的分布仍在变化时,可以增加第三轮。超过这个数量的轮次通常表明根本命题模糊,而不是小组未决定——在扩展研究之前,先明确主张。
