AI Governance

AI决策追踪:企业AI合规中的缺失环节

AT
Argumentree Team
AI Compliance
March 18, 2026
12 min 阅读

AI决策追踪:企业AI合规中的缺失环节

AI决策追踪是保持具有影响力的AI决策可重构和可证明的工程学科:捕捉推理链和替代方案、决策时的模型身份和输入、人类检查点和覆盖,并保持这些记录具有防篡改的特性。它不同于普通的日志记录,后者记录发生了什么;追踪记录的是为什么,以一种能够经受审计的形式。监管地图,带有当前日期:欧盟AI法案的高风险制度要求自动事件日志记录(第12条),提供者和部署者至少保留六个月的日志(第19条、第26条),技术文档保留十年(第18条),人类监督(第14条),在15天内报告严重事件——对于广泛事件可缩短至两天(第73条),以及受影响人员的解释权(第86条);在2026年数字综合法案(欧盟条例2026/1744)之后,这些义务自2027年12月2日起生效(对于受监管产品中的AI为2028年8月),罚款高达3500万欧元或全球营业额的7%。GDPR第22条目前适用,CJEU的SCHUFA判决将其扩展到被依赖的评分。在美国:联邦储备委员会的SR 11-7模型风险指导(模型清单、验证、文档),CFPB关于算法不利行动的ECOA通函,纽约市地方法第144号的偏见审计,以及科罗拉多州重新通过的AI法(SB 26-189:消费者通知、30天的不利结果解释、人类审查,自2027年1月1日起生效)。自愿框架:NIST AI RMF和ISO/IEC 42001。追踪的四个支柱:推理捕捉、人机协作验证、防篡改的轨迹和偏见模式监测。第三方模型不妨碍合规:围绕输入、输出、上下文和人类审查的追踪层满足部署方的义务。Argumentree提供了追踪的人类决策层;其兄弟AIAgentree追踪自主AI代理。

Share:
简而言之

您的日志记录了系统所做的事情。监管者、审计员或您自己的事后分析会询问为什么——关于几个月前的一个特定决策,涉及模型版本和审核该决策的人。决策追踪是使这个问题可回答的学科。

  • 追踪 ≠ 记录:日志记录发生了什么;追踪记录为什么 — 推理、替代方案、模型身份、人为检查点 — 在决策时以防篡改的方式。
  • 真实日期:欧盟人工智能法案的高风险记录/监督/文档义务自2027年12月2日(2026年数字综合法案)起生效;根据GDPR第22条——根据SCHUFA裁决,即使是依赖的评分——现在适用。
  • 四个支柱:推理捕获、人机验证、可篡改证据的记录和模式监控
  • 第三方模型不是借口——围绕输入、输出、上下文和人工审查的追踪层是你必须构建的,无论使用的是哪个模型。
AI决策记录 — 三部分系列

当算法影响重要决策而没有人保留推理时,会发生什么:责任缺口及其背后的真实灾难,人工智能决策审计轨迹的结构,以及决策追踪的合规工程。

  1. 1.The AI Accountability Gap: When Algorithms Make Million-Dollar Mistakes, Who's Responsible?
  2. 2.The AI Decision Audit Trail: Recording What the AI Recommended and What a Human Decided
  3. 3.AI Decision Tracing: The Missing Link in Enterprise AI Compliance您在这里

请求在星期二到达,来自审计团队,内容礼貌而具体:对于3月11日标记的客户,展示系统使用的输入、运行的模型版本、评分的替代方案,以及审核结果的人员姓名。你的工程师可以重新运行管道——使用今天的数据,通过今天的模型,得出今天的答案。他们无法做的是展示3月份发生的事情,因为模型自那时以来已经重新训练了两次,输入快照从未保存,而“人工审核”只是一个在Slack上的点赞,没有人进行了归档。

团队将会制作一些东西——一个合理的重建,并附上对延迟的歉意。这正是审计存在的目的,以区分证据。重建是关于可能发生的事情的故事。痕迹是对实际发生的事情的记录。

这篇文章是三部分系列中的工程部分——在责任缺口(为什么不负责任的自动决策会导致灾难)和AI决策审计轨迹(记录本身的五个领域)之后。在这里:决策追踪在实践中的意义,2026年变更后实际情况的监管地图,实施的四个支柱,以及如何在模型属于他人的情况下进行实施。

您无法对记录进行改装。
你只能对故事进行改编。

为什么追踪是内置的,或者根本没有

“决策追踪”实际上意味着什么

每个生产系统都有日志。追踪是一种不同的学科,提出了不同的问题。传统日志回答的是发生了什么:请求已接收,模型已调用,响应已返回,200 OK。决策追踪回答的是结果为何是这样的——为此,必须捕捉四个普通日志几乎从不记录的内容:输出背后的推理(产生输出的因素、论据或链条)、考虑和评分的替代方案、决策者的确切身份(当时的模型版本和输入,而不是今天的状态),以及人工检查点——谁进行了审查,他们更改了什么,覆盖了什么。

本系列第二部分与审计追踪的关系很简单:审计追踪是单个受AI影响的决策留下的记录;追踪是确保每个重要决策都有这样的记录存在、不能被悄悄编辑,并且可以在几个月后按需生成的能力。一个是文档;另一个是使文档可信赖的管道。

监管地图 — 以实际日期为准

欧盟人工智能法案是关于决策追踪的最明确的法规,其日程在2026年发生了变化,因此值得准确说明。对于高风险系统(附录III领域:就业、信贷、教育、基本服务、执法等),该法案要求在系统生命周期内进行自动事件记录(第12条),提供者和部署者需至少保留六个月的日志(第19条和第26条),技术文档保存十年(第18条),需有有意义的人类监督,具备干预或推翻的权力(第14条),严重事件报告 — 需立即报告,且不迟于15天,对于广泛事件缩短至两天(第73条) — 以及解释权:受影响的人员可以要求清楚说明人工智能在关于他们的决策中的作用(第86条)。罚款最高可达3500万欧元或全球营业额的7%。

日期:2026年数字综合法案(欧盟法规(EU)2026/1744,2026年7月生效)将高风险义务从2026年8月推迟到2027年12月2日——对于根据现有欧盟安全法嵌入产品中的人工智能则推迟至2028年8月。没有推迟的内容包括:自2025年2月生效的禁令、2025年8月的通用人工智能义务、2026年8月的透明度和内容标签义务——以及GDPR第22条,自2018年以来限制完全自动化决策,并且根据CJEU的SCHUFA判决,即使是由第三方生成的评分,只要决策组织对此高度依赖,也在其范围之内。如果你等到2027年12月才开始保存决策记录,你已经错过了今天适用的法律。

美国 按照行业逐个监管相同的物质。自2011年以来,银行一直遵循联邦储备银行的 SR 11-7 模型风险指导——模型清单、独立验证、足够的文档以便第三方理解模型的工作原理;这是目前生产中最接近追踪手册的东西。消费者金融保护局的2022-03号通告要求债权人遵循《平等信贷机会法》(ECOA)的具体理由要求,无论算法的复杂性如何。纽约市的 地方法第144号 要求对自动招聘工具进行年度偏见审计和候选人通知。而 科罗拉多州 — 值得谨慎引用,因为大多数摘要描述的是一项不再存在的法律 — 在2026年5月废除了并重新制定了其人工智能法案(SB 26-189,取代了从未生效的SB 24-205):自 2027年1月1日 起,在重要决策中使用人工智能的部署者必须向消费者提供使用前通知、人工审核,并在不利结果发生后的30天内提供书面解释,开发者则需向部署者提供技术文档;执法权专属于州检察长。

在法规周围坐落着自愿搭建的框架,审计师越来越将其视为参考:NIST AI风险管理框架(治理、映射、测量、管理)和ISO/IEC 42001,这是可认证的人工智能管理系统标准。两者都不是法律;两者都将“我们认真对待人工智能治理”转化为可检查的结构——并且两者都假设本文所讨论的决策记录已经存在。

即使“仅仅是一个分数”也是一个自动化的决定。
当组织依赖它时。

— 在CJEU案件C-634/21(2023)之后,SCHUFA判决的一句话

决策追踪的四个支柱

去掉缩略语,以上每个框架都要求相同的四个能力:

1. 推理捕获

追踪记录了原因,而不仅仅是结果:输出背后的因素或论点,以及考虑过的替代方案。在这里,结构胜过散文——以明确的论证图(主张、证据、反例)捕捉的推理是可检查的,而后期的段落式理由则不可如此,并且它是在决策时捕捉的,而不是从一个已经改变的模型中按需生成的。

2. 人机协作验证

定义了检查点,在这些检查点上,指定人员在输出生效之前进行审查——审查过程本身被记录:谁、何时、批准或覆盖,以及原因。一个没有记录的监督步骤与完全没有监督在后期是无法区分的。

3. 防篡改痕迹

在决策时记录的内容,保留了模型版本和输入状态,并受到保护以防止静默编辑。一旦可以在事后修改记录,其中的每一条条目就失去了证据价值——记录与故事之间的区别,变得结构化。

4. 模式监控

个别决策看起来可能合理,但整体模式却并非如此——这是每一个记录在案的歧视案例所传达的教训,从荷兰的福利算法到抵押贷款批准的差异。每个决策都有其痕迹;监测通过决策读取这些痕迹,寻找单一记录所无法显示的偏差。

“我们使用第三方模型——我们能遵守吗?”

是的——而这个反对意见把架构搞反了。你无法追踪供应商模型的内部结构,但作为部署者约束你的义务大多数情况下并不要求你这样做。它们要求的是在决策中的一方:你发送的输入、你收到的输出、你使用它的上下文、审查它的人,以及你可以给受影响者的理由。所有这些都存在于一个你拥有的追踪层中,包裹在其背后的任何API周围。

供应商关系增加了三项职责,而不是减少它们:记录为什么选择这个模型以及如何验证其适用于您的使用;根据决策固定并记录模型版本,以便“哪个模型在三月运行”即使在供应商发布更新后也有答案;并且合同中包含审计支持和保留条款,以便在监管机构询问时,提供者的证据部分可以被获取。诚实的让步是:对于真正不透明的基础模型,模型级别的推理捕获是有限的——这正是为什么最重要的推理捕获是人类的,在输出成为决策的检查点处。

从哪里开始——现在截止日期已经改变

16个月的推迟不是等待的理由;这是建筑胜过改造的窗口期。根据定义,痕迹只能在决策时刻创建——在现在和2027年12月之间未被捕捉的任何东西将永远是重建。而已经适用的两种制度,22条和普通可审计性,并不受推迟的影响。

务实的步骤有三个,其中没有一个需要合规部门。盘点 AI 输出影响重要决策的点——关于人、钱或战略——无论它们是否涉及附录 III 列表。将每个点包裹在记录的人类判断中:系统推荐了什么,谁做出了决定,以及为什么,在决策时写下。将记录集中在某个可搜索的地方,这样“给我看看 3 月 11 日的决定”就是一个查询,而不是一个项目。这是追踪的 80%,即使没有监管机构询问,这也是值得的——因为你自己的事后分析会询问。(有关企业追踪实施——审计要求、保留、访问控制——与我们的团队联系。)

Argumentree 的适用范围 — 人类决策层

Argumentree 实现了人们在 AI 协助下做出决策的支柱。AI 将围绕一个问题的论点和证据结构化为一个利弊树(以结构而非散文的方式捕捉推理);人们对论点进行权衡、反驳和评分,指定的决策者记录结果(人机协作,审查本身也在记录中);完成的讨论作为可搜索的决策记录持久存在,并包含其完整的论证历史(记录是结构化的,而非自由文本,因此可以进行模式审查)。

在本系列中,范围线的重要性超过了任何地方:当决策由自主AI代理做出时——管道根据模型输出进行操作而没有人类检查——追踪问题就转移到了机器内部,这正是我们兄弟产品AIAgentree的领域,它记录代理的推理、分类和审查事件以便进行监管审计。人类在AI输入的帮助下做出决策:Argumentree。代理做出决策:AIAgentree。大多数企业,经过诚实评估,今天需要第一个,且比他们想象的更早需要第二个。

3月11日的测试

选择六个月前一个重要的自动化或人工智能辅助的决策。你今天能提供:当时的输入、运行的模型版本、输出,以及审核该决策的指定人吗?如果不能,你只有日志——而不是痕迹。

在你需要证据之前先建立管道

回到星期二的请求。在一个有追踪的组织中,通常在一个下午就能得到回答:这是输入快照,这是模型版本,这是它评分的备选方案,这是审阅者记录的判断以及客户应得的解释。没有什么英雄主义——只是提前建立的管道,在决策时捕捉到后来没人能诚实重现的内容。

这就是“人工智能合规”的真实内容,一旦去掉缩略词:留下证据的决策。法律条款汇聚于此,框架假设它,而——无论日历如何变化,这一部分使得它值得去做——你的组织在有了它的情况下运作得更好,因为满足审计员的同一痕迹就是防止已解决问题被重新从记忆中诉讼的记录。截止日期变了。方向没有变。

审计从不询问您的系统能做什么。它询问的是您的组织能证明什么。

让每一个AI辅助的决策都可证明。

结构化推理、称为人类检查点的内容,以及可搜索的记录——为您的团队在使用AI时所做决策提供的追踪层。

来源与进一步阅读

常见问题

什么是AI决策追踪,它与日志记录有什么不同?

AI决策追踪是保持有影响力的AI决策可重构和可证明的学科:捕捉输出背后的推理、考虑的替代方案、决策时的确切模型版本和输入,以及人类检查点——谁进行了审查,他们覆盖了什么——以防篡改的记录。普通日志回答“发生了什么”(请求进,响应出);追踪回答“结果为何如此”,以一种能够在几个月后经受审计的形式。实际测试:日志让你今天重新运行管道;追踪让你展示三月份发生了什么,使用三月份的模型和三月份的输入。

欧盟人工智能法案对决策追踪有什么要求,截止日期是什么时候?

对于高风险系统,该法案要求在系统生命周期内进行自动事件记录(第12条),提供者和部署者至少保留六个月的日志(第19条和第26条),技术文档保存十年(第18条),进行有意义的人类监督(第14条),立即报告严重事件,且不迟于15天——对于广泛事件可缩短至两天(第73条)——并为受影响人员提供解释权(第86条)。在2026年数字综合法案之后,这些高风险义务自2027年12月2日起生效(对于嵌入受监管产品中的人工智能为2028年8月)。罚款可达3500万欧元或全球营业额的7%。禁止措施、通用人工智能职责、透明度职责——以及GDPR第22条——按其原定的早期时间表适用。

GDPR在2027年人工智能法案的截止日期之前是否已经要求任何事项?

是的。自2018年以来,GDPR第22条限制了仅基于自动化决策的法律或类似重大影响的决定,赋予了人类干预和质疑决定的权利——而欧洲法院的SCHUFA判决(2023年12月)认为,即使是由第三方生成的评分,当决策组织严重依赖它时,也算作这样的自动化决策。信贷中的不利行动解释义务(美国的ECOA)今天同样适用。等待到2027年12月才开始保存决策记录的组织,已经错过了当前生效法律的时限。

公司可以使用第三方AI模型,同时保持可追溯和合规的决策吗?

是的。您无法追踪供应商模型的内部结构,但部署方的义务主要要求您提供决策的相关信息:您发送的输入、您收到的输出、使用的上下文、审核该输出的人以及您可以给受影响者的解释——这些都存在于您拥有的追踪层中,包裹在API周围。供应商关系增加了三项职责:记录模型选择和验证以适应您的用例、为每个决策固定并记录模型版本,以及合同约定审计支持和保留。对于不透明的基础模型,最有价值的推理是人类的推理,特别是在输出成为决策的检查点。

美国对人工智能决策追踪适用哪些规则?

逐个行业:银行根据联邦储备委员会的SR 11-7模型风险指导(模型清单、独立验证、文档 — 自2011年以来)运营;根据CFPB通告2022-03解读的ECOA,债权人必须提供具体、准确的理由以说明不利行动,无论模型复杂性如何;纽约市的地方法第144号要求对自动招聘工具进行年度偏见审计和通知;科罗拉多州重新实施的人工智能法(SB 26-189,取代从未生效的2024年法案)要求在2027年1月1日起的不利结果发生后30天内提供消费者使用前通知、人为审核和书面解释。NIST的人工智能风险管理框架和ISO/IEC 42001为审计员提供了自愿参考的框架。

一个组织应该从哪里开始进行决策追踪?

三个步骤,均不需要合规部门。首先,盘点AI输出影响重要决策的点——关于人、钱或战略——无论其监管分类如何。其次,为每个点附上记录的人类判断:系统推荐了什么,谁做出了决定,为什么,在决策时书写(痕迹只能在当时创建;其他一切都是重建)。第三,将记录集中在某个可搜索的地方,以便生成特定决策的历史成为查询而非项目。现在就开始,而不是等到截止日期:在2027年12月之前未捕获的记录在之后无法创建。

留下证据的决定。

以结构捕捉的推理,在检查点记录的监督,以及可搜索的轨迹——合规作为良好决策的副产品。

无需信用卡几分钟内设置完成随时取消
AT

关于 Argumentree Team

AI Compliance

The Argumentree team is building the collaborative decision-making platform Argumentree. Our mission is to transform how organizations make, document, and learn from decisions.

相关文章

加入讨论

决策追踪是合规成本还是运营优势?在社区中阐述你的观点。

在Argumentree论坛上讨论