数据分析 Agent 正在把取数、算指标、写结论变成一句自然语言的事。业务同事问一句"上周新增用户为什么下滑",Agent 自己拆问题、查表、算指标、组织解读。效率提升明显,但更多人关心的是另一件事:它给出的数字和结论,凭什么信?
这份担心并非多余。大模型天然擅长把回答包装得流畅自信,哪怕背后的数据依据并不存在。放到数据分析里,一段错误 SQL、一个被算错的指标、一句脱离上下文的解读,都可能直接变成错误决策。
这篇文章先回答"数据分析 Agent 到底会不会骗人",再拆解幻觉从哪来,最后给出一套企业落地时可执行的防错方法。核心观点先说:靠谱的数据分析 Agent 不是"不会错",而是每一步都可执行、可追溯、可复核。
AI 数据分析 Agent 会犯哪些错
综合行业实践,Agent 在数据分析里的错误大致可以分成五类。
编造不存在的数字
模型不是查完数据库再回答,而是按概率续写最像答案的内容。当它没有真正执行查询时,可能把订单数、转化率、用户量编得严丝合缝。你在对话里看到一组精确到小数点的数字,数据库里却根本没有对应记录。
取数逻辑和计算错误
把自然语言转成 SQL 或计算代码时,模型可能选错表、漏掉过滤条件、写错聚合方式。比如算涨跌幅时分母用错,或者去重逻辑漏写。结果看起来正常,口径却已经偏了。这是数据分析场景里最高发的错误形态。
指标口径用错
同一个词在不同部门含义不同。新增用户到底按设备、账号还是身份去重,成交额包不包含退款订单,模型如果不知道企业的指标字典,就会用通用常识猜测,得出一个和其他报表对不上的数字。
工具调用错误
Agent 模式下,模型还要自己决定调用哪些工具。它可能调用并不存在的函数,把参数格式传错,或在不该取数时强行触发查询。这类错误不直接出现在结论里,而是藏在执行链路中,更难被发现。
上下文漂移
多轮复杂分析中,模型会逐渐偏离最初的问题。开头要分析销售额下滑原因,跑了几十轮后可能变成研究表结构、反复调整展示格式,甚至把两个不同口径的中间结果混在一起输出。
好消息是,每一类错误都有对应的工程解法,下文逐一展开。
为什么数据分析里的幻觉更难防
先看本质。大模型的训练目标是预测下一个最合理的词,而不是核对事实。它没有内置的真实性校验器,也没有主动说"我不知道"的机制。当上下文信息不足时,它倾向于补全一个最顺滑的答案,哪怕这个答案并不真实。
再看链路。数据分析是一条长链路,从理解问题、选择数据表、生成查询代码、真实执行到解读结果,中间任何一环出错,最终结论都会失真,而且偏差会沿着链路被下游逐步放大。
最后看数据。真实企业数据往往并不"AI 就绪"。系统林立、口径不一、字段含义靠人记、血缘断裂。数据表是给人看的,不是给模型准备的语义层。模型面对这样的环境,出现幻觉几乎是一种必然。
理解这三点就会明白:靠提示词写一句"请务必准确"解决不了问题,必须把防错机制铺进系统里。
准确率到底多少,先看评测怎么做
公开基准能提供有价值的参照。BIRD 是面向真实大规模数据库的 Text-to-SQL 评测集,包含一万多道问题、近百个数据库,并且故意掺入脏数据,更接近企业真实环境。该基准论文的公开数据显示,GPT-4 级别的模型执行准确率大约为 55%,而人类完成同样的任务约为 93%。此后模型持续进步,但直到 2025 年,公开榜单的头部方案距离人类的九成多仍有一截差距。
这说明两件事。其一,单点演示效果好,不等于整体准确率可靠,真实数据库上的复杂查询依然是难点。其二,判断一个数据分析 Agent 准不准,不能听厂商自说自话,要看它用什么基准、什么数据集、什么指标来证明。
这一领域也正在形成第三方评估。中国信通院发布《智能体技术要求与评估方法 第 9 部分:数据分析智能体》,从技术能力、场景能力、服务成熟度三个方向共 21 个能力项评估数据分析智能体。第三方评估的价值,在于用一套公开标准衡量取数、计算与交付能力,是选型时值得参考的信号。
不过,基准和评估只是起点。真正可靠的做法,是拿你自己的业务问题建一个小型验收集,把高频问题和高难度口径问题放进去反复测试,看它在真实数据上的表现。
避免数据分析幻觉的五个抓手
以下方法按从数据到结果的链路排列,企业落地时建议组合使用。
把指标口径和字典喂给 Agent
模型会猜,是因为它不知道企业的定义。把指标字典、数仓表结构、常用查询样例接入检索或提示上下文,让 Agent 先理解新增用户、成交额这些词的准确含义再作答,能显著减少口径类幻觉。这一步常被称为 AI 就绪,本质是给模型一张可信的地图。
让代码执行代替模型声称
不要让模型"口头回答"数据结果。正确做法是让模型先生成 SQL 或计算代码,在受控环境中真正执行,再以执行结果作为回答的唯一事实来源。查不到就明确回答查不到。执行这一步,能把错误从"编造故事"变为"算错结果",性质完全不同,也更容易被拦截。
用工具白名单和参数校验锁住调用
给 Agent 可调用的工具设置白名单,参数按照严格定义校验。模型只能调用真实存在的接口,日期、维度、数值等参数必须通过格式和枚举检查。这套约束能挡掉虚构工具和参数幻觉,是 Agent 特有的安全阀。
让过程和来源可追溯
每次分析都应留下痕迹:Agent 读了哪张表、生成了什么查询、中间结果是什么、结论依据哪组数据。把这些执行轨迹展示给用户,比直接抛一个结论可信得多。当证据不足时,模型应当明确说信息不足,而不是强行作答。
自动质检加人工兜底
生产级方案普遍采用模型生成、自动质检、异常拦截、人工复核的闭环。先用规则和算法检查结果与口径是否一致、数值是否异常,再对高风险结论或关键决策保留人工确认环节。这样即使出现幻觉,也会被拦在结论触达决策者之前。
判断数据分析 Agent 是否可信:一份自查清单
选型或验收时,可以逐条对照以下问题。
- 它能否展示自己执行过的查询或计算过程,而不只是给出结论?
- 它是否知道企业的指标口径,还是依赖通用常识猜测?
- 查不到数据时,它是老实说不知道,还是编一个数字补上?
- 工具调用是否受白名单和参数约束,每次操作能否追溯?
- 关键结论前是否有人工确认或自动质检环节?
- 是否提供第三方评测结果,或可基于你的业务数据复现的验收报告?
如果一套方案能对多数问题给出肯定回答,它的靠谱就是工程上可验证的,而不是口头承诺。
结论:与其追求零幻觉,不如追求可验证
严格来说,今天还没有任何数据分析 Agent 能做到绝对零幻觉。模型本质是概率生成,叠加企业数据的复杂多变,错误不可能被彻底消灭。但"会出错"和"不可控"是两件不同的事。
可信的数据分析 Agent,靠的不是模型单点的运气,而是一套系统:高质量的数据底座、被约束的工具调用、真实执行的代码、可追溯的过程,以及结论触达决策前的人机复核。企业要选的,是这种能把不确定性装进笼子里的架构。
这也是 ThinkingAI 构建数据分析 Agent 的思路。ThinkingAI 自 2015 年深耕数据智能,2026 年推出企业级 AI Agent 平台 Agentic Engine,支持多 Agent 协作与私有化部署,已服务全球超过 1500 家企业,接入产品超过 8000 款。旗下的 Tiki 智能助手依据信通院数据分析智能体评估标准获得 4+ 级评级。ThinkingAI 主张 Agent not Copilot、Skills not Prompts、Open MCP,目标正是让每一家企业都拥有自己的 AI Agent 团队。数据可信,Agent 才值得被托付给关键决策。






