虚假信息正借助AI技术加速变异,深度伪造、跨模态篡改、自动化虚假叙事等事件层出不穷。大语言模型(LLM)既是破局关键,也是“双刃剑”:一方面通过提示工程、检索增强、多智能体协作等路径显著提升检测能力;另一方面,模型幻觉、评估滞后及工程落地的结构性矛盾等使检测系统本身面临严峻挑战。本文系统梳理基于LLM的五大检测技术体系,勾勒出从“被动识别”到“主动防御”的演进路线图,为构建可信、可进化的下一代虚假信息防御体系提供指引。
文献引用
张蕾 , 黄彩云 , 丁伟 , 等 . 虚假信息检测的智能化转型:基于大语言模型的技术体系、困境与前瞻[J]. 信息安全与通信保密 , 2026(7): 9-25.
文章摘要
生成式人工智能与大语言模型(LLM)的演进,在催生高隐蔽性虚假信息的同时,也为智能化检测开辟了新范式。系统综述LLM在虚假信息检测领域的技术体系、核心挑战及未来趋势。当前研究已形成五大主流技术路径:通过提示工程与上下文学习实现敏捷检测,借助检索增强生成(RAG)引入外部证据进行事实验证,利用模型微调构建领域专家模型,发展多模态大语言模型(MLLM)解析跨模态内容,以及采用多智能体工作流模拟协同核查。然而,该领域仍面临模型幻觉、任务复杂性、评估滞后、工程瓶颈及对抗脆弱性等严峻挑战。未来突破方向在于构建具备可验证推理能力的可信模型,打通深度语义理解与主动防御之间的壁垒,建立动态、科学的评估体系,最终形成适应智能时代挑战的综合性防御体系。
0
引 言
虚假信息(misinformation)指信息生产者出于特定目的,故意传播与可验证事实不符的内容,具有主观操纵性与客观可证伪性。其表现形式包括假新闻(fake news)、谣言(rumor)、误导性信息(disinformation)等,常被用于操纵舆论、实施欺诈或干扰政治进程,对个人权益、社会信任乃至国家安全构成严重威胁。虚假信息检测旨在通过语义分析、传播结构挖掘与时序建模等方法,对信息真实性进行概率性判定,涵盖假新闻检测(fake news detection)、谣言检测(rumor detection)、事实核查(fact-checking)等子任务。
大语言模型(large language model,LLM)正在深刻改变信息生态。一方面,生成式预训练变换器(generative pre-trained transformer,GPT)等模型凭借强大的语义理解与知识整合能力,推动检测范式从浅层规则匹配转向深层语义推理与多模态融合;另一方面,其生成能力降低了高欺骗性虚假内容的制作门槛,导致深度伪造文本与自动化虚假叙事激增,大幅增加了识别与治理难度。这种“攻防一体”的态势,使虚假信息领域的人机对抗持续升级。
在此背景下,系统梳理LLM赋能虚假信息检测的最新进展,剖析其原理与局限,并展望未来方向,具有重要学术与现实价值。本文力求全面呈现研究全景,涵盖提示工程(prompt engineering)、检索增强生成(retrieval-augmented generation,RAG)、模型微调(model fine-tuning)、多模态大语言模型(multimodal large language model,MLLM)及多智能体工作流(multi-agent workflows)5大技术路径,深入分析模型可信性、任务复杂性、评估体系、工程化部署与对抗鲁棒性等挑战,并前瞻性地探讨构建技术可信、评估科学、系统高效的防御生态,为后续研究提供清晰的路线图。
1
虚假信息检测技术演进
虚假信息检测技术的发展与自然语言处理和人工智能的整体进步紧密同步,其范式经历了从依赖人工特征工程,到利用数据驱动表示学习,再到依托大模型内在知识与复杂推理能力的根本性转变。这一演进过程不仅反映了计算能力的提升和算法模型的创新,更体现了对虚假信息本质认知的深化:从将其视为简单的标签分类问题,逐步上升为涉及语义理解、证据推理、社会语境分析和意图识别等维度的复杂认知任务。
1.1 早期阶段:基于规则与机器学习的浅层特征工程
在深度学习兴起前,虚假信息检测主要依赖显式规则与传统机器学习,将任务简化为二分类或多分类问题,效能高度受制于人工特征工程。基于规则与词典的方法利用关键词、正则表达式及黑白名单进行过滤,这类方法简单直接但泛化能力极差,易被改写规避。传统机器学习方法如朴素贝叶斯(Naive Bayes)、支持向量机(support vector machine,SVM)、决策树(decision tree)和随机森林(random forest)等算法,依托文本、传播网络及用户行为等手工构造特征进行分类,模型性能完全取决于特征工程的质量。
基于规则与机器学习的浅层特征工程方法虽具备可解释性强、计算成本低等优势,但存在根本局限:
(1)依赖专家经验,难以捕捉深层语义与上下文;(2)特征与虚假性的关联浅显且脆弱;
(3)无法有效应对未知类型的虚假信息,泛化能力严重不足。
1.2 深度学习阶段:端到端的表示学习与上下文建模
随着深度学习的兴起,循环神经网络(recurrent neural network,RNN)和卷积神经网络(convolutional neural network,CNN)的成功推动虚假信息检测进入自动特征学习时代,模型开始从原始数据中自主挖掘判别性表示。早期工作利用RNN建模文本时序依赖,捕捉上下文信息。为应对图文混合的虚假信息,事件对抗神经网络(event adversarial neural network,EANN)引入对抗训练以剥离事件特定特征,学习跨事件的通用欺骗模式。后续研究进一步引入实体增强和跨模态对齐机制,通过识别和匹配文本与图像中的实体来提升检测精度。图神经网络(graph neural network,GNN)则被广泛应用于建模社交传播,通过聚合用户与帖子的拓扑结构信息辅助判断。以双向变换器模型(bidirectional encoder representations from transformers,BERT)为代表的Transformer架构进一步推动了虚假信息检测范式的演进,仅需简单微调即可大幅超越传统模型。
深度学习阶段实现了从“人工设计”到“数据驱动”的飞跃,能捕捉更复杂的语义关联。然而局限依然显著:(1)依赖大规模高质量标注数据,标注成本高且主观性强;(2)模型多为“黑箱”,决策过程难以解释;(3)纯数据驱动,难以应对需要复杂世界知识与多步推理的虚假信息;(4)对分布外样本的泛化能力有限。
1.3 后LLM时代:语义理解与知识推理驱动的新范式
以GPT-3/4、羊驼模型(large language model meta AI,LLaMA)等为代表的LLM的出现,标志着虚假信息检测进入了第3个范式阶段。LLM拥有千亿甚至万亿参数,能够在海量文本上进行预训练,具备强大的语言生成能力、深度语义理解能力和一定的逻辑推理能力。检测的核心任务从“模式识别(pattern recognition)”转向“事实验证(fact verification)”和“解释性推理(explanatory reasoning)”,不再仅输出一个真/假标签,而是能够生成完整的推理链条,解释判断依据并给出证据。
通过提示工程设计的提示词,能够激发LLM的推理能力,使其支持零样本/少样本检测,摆脱了对任务特定标注数据的绝对依赖。在高质量事实核查数据上对通用LLM进行全参数微调或参数高效微调(parameter-efficient fine-tuning,PEFT),如低秩适应(low-rank adaptation,LoRA),可获得面向该领域的专家模型。GPT-4V、LLaVA等MLLM能够同时处理和/or理解文本、图像、视频,为检测跨模态不一致的虚假信息提供统一框架。例如,Qi等人通过指令微调使模型学会识别图文间的细微矛盾,FakeShield则实现了图像篡改的检测与定位。相较于LLM依赖内部训练知识进行端到端推理并快速给出判断,基于多智能体方法将核查任务分解为声明分解、证据检索、可信度评估、逻辑验证等子任务,由多个智能体或模块协作完成。这种设计模拟了人类核查员的工作流程,能够显著提高可解释性和可靠性。
基于语义理解与知识驱动的LLM方法具有强大的零样本/少样本泛化能力、深度语义理解能力和逻辑推理能力,且通过生成自然语言解释能够提升结果可信度。然而,该方法仍存在模型幻觉导致误判或编造证据、计算与部署成本高昂、评估体系滞后以及对抗性攻击风险等局限。
2
基于LLM的虚假信息检测
LLM的涌现,将虚假信息检测的核心范式从基于特征的判别,转变为基于语义理解与证据推理的生成式验证。当前,已发展出多种互补的技术路径,共同构成了一个从直接能力调用到复杂系统化工作的完整谱系。本节将系统阐述提示工程与上下文学习、RAG、模型微调与适配、MLLM及多智能体工作流5大主流方法体系,剖析其原理、应用与相互关联。
2.1 提示工程与上下文学习
提示工程与上下文学习是应用LLM最直接、最灵活的方式,其核心在于不改变模型参数,仅通过精心设计的提示词,引导模型利用其在预训练中获得的知识和推理能力,完成虚假信息检测任务。这种方法本质上是将检测任务“格式化”为模型能够理解的文本生成或分类问题,具体包括零样本与少样本提示、思维链提示、结构化提示与角色扮演、自洽性采样与投票。
2.1.1 零样本与少样本提示
零样本提示仅依赖指令激发模型的常识推理与分类能力,但在面对复杂语境时泛化能力有限。少样本提示则通过引入精心筛选的高质量示例,激活模型的类比学习能力,为其补充关键的决策边界信息。这种“示范”机制能够显著优化模型对科学类虚假信息等复杂语义的捕捉精度,弥补纯指令微调的不足。
2.1.2 思维链提示
思维链提示(chain-of-thought,CoT)通过引导LLM进行分步推理(如主张分解、事实比对、综合判定),以提升模型的可靠性与可解释性。在零样本场景下,CoT能显著提升性能,但也有研究指出,其在假新闻检测中的表现仍不及经过全量微调的专用小模型,这揭示了单纯依赖通用推理能力的局限性。
2.1.3 结构化提示与角色扮演
通过角色设定(如“事实核查员”)与结构化输出约束,引导LLM进行专业化推理。Self-Checker作为纯提示驱动框架,利用结构化提示在零样本下完成声明分解与证据评估。虽然该框架能有效激发上下文学习能力,但其性能仍显著落后于全量微调的专用模型(如BERT),这凸显了提示工程在追求专家级精度上的局限。
2.1.4 自洽性采样与投票
自洽性采样与投票从LLM中多次生成多样化推理路径并进行答案聚合(如多数投票),利用内部共识提升判断的鲁棒性。SelfCheckGPT据此评估生成内容的真实性:针对事实性内容,模型生成趋于稳定一致;而针对虚构内容,采样结果则呈现显著分歧。该方法仅通过模型自身输出的不一致性,即可实现无需外部知识的黑盒幻觉检测。
提示工程与上下文学习不必依赖大量标注数据或昂贵的模型训练,即可快速验证LLM在特定虚假信息类型上的检测潜力。凭借LLM强大的通用知识,该方法能够处理训练数据中未出现过的虚假信息模式或话题。通过CoT等技术,模型能提供判断依据,有助于核查员理解和验证。
2.2 RAG
RAG通过“先检索、后生成”机制锚定外部事实,以缓解模型知识陈旧与幻觉问题。系统先从可信源(如维基百科、新闻档案)检索相关证据,再将证据与声明一并输入模型中,要求其基于给定的上下文进行推理与解释。RAG具体包括基础RAG、高级RAG以及平衡RAG、图RAG与多模态RAG。
2.2.1 基础RAG
基础RAG是最经典、最直观的RAG实现范式,遵循“检索—拼接—生成”的线性流程,旨在通过引入外部知识来约束和增强LLM的生成过程,在降低幻觉风险的同时增强了核查结果的可信度和可验证性,但其性能易受检索质量(如无关文档、冗余文档)影响。
2.2.2 高级RAG
为克服基础RAG的缺陷,研究者提出了多种高级RAG技术,引入查询重写、多轮检索、结果重排、事实核查后处理等模块,在检索前、检索中、检索后各环节进行优化。例如,Li等人提出采用多轮LLM驱动的RAG,当初步证据不足时,能自动生成新的查询进行再搜索,逐步构建证据体系;Khaliq等人则采用树式检索,在推理的每一步生成多个问题分支并选择最佳路径,实现更深入的证据探索。
2.2.3 平衡RAG、图RAG与多模态RAG
针对虚假信息数据集中正负样本不平衡的问题,平衡RAG能够在检索的同时提供正例(虚假信息)和负例(真实信息)的示例,帮助模型更好地区分虚假信息。图RAG将知识图谱的结构化关系引入检索,如Chang等人利用知识图谱中的社区结构来增强信息的准确性和相关性。多模态RAG支持对图像、视频、表格等多模态证据的检索与融合,核心挑战在于跨模态的精准对齐与检索,以及如何将多模态证据有效地整合到生成过程中。
RAG将生成过程锚定于外部可验证的证据,是缓解模型幻觉最主流的技术路径之一。通过更新外部知识库,系统能够获取最新信息,从而有效应对新兴事件相关的虚假信息。此外,生成的判断可引用具体的证据来源,增强结果的可信度和可验证性。
2.3 模型微调与适配
尽管通用LLM在零样本/少样本场景下具备出色的泛化能力,但在虚假信息检测这类高精度、强领域依赖的任务上仍表现受限。模型微调与适配通过利用高质量标注数据对预训练参数进行有监督更新,使其内部表示与推理模式更贴合任务的分布和领域特性,从而精准识别特定领域(如政治、健康、金融)中特有的语言陷阱、逻辑漏洞及事实冲突。模型微调与适配包括全参数微调、PEFT、指令微调以及领域自适应与元学习。
2.3.1 全参数微调
全参数微调(full fine-tuning)通过更新模型全部权重,实现底层表征的深度重塑,在数据充沛时能逼近该预训练模型在虚假信息检测任务上的性能上限。然而,该方法需存储完整的梯度与优化器状态,计算和存储开销极大,且极易破坏预训练阶段习得的通用语义知识,即引发灾难性遗忘。因此,全参数微调仅适用于数据充沛且算力充裕的场景。
2.3.2 PEFT
为降低全参数微调的成本并缓解遗忘风险,PEFT通过冻结主干参数、仅训练少量新增参数实现高效适配。LoRA及其变种是目前最主流的PEFT方法,通过在注意力层注入低秩矩阵,以极小参数量逼近全量微调性能。QLoRA结合量化技术,进一步将大模型训练降至消费级显卡可行范围。实证研究表明,LoRA微调后的Llama 2在虚假信息检测中表现优异,且因其保留了原始知识,有效规避了灾难性遗忘。
2.3.3 指令微调
指令微调(instruction tuning)通过在“指令—输出”对上训练模型,增强其遵循自然语言指令及泛化至未知任务的能力。在虚假信息检测中,可将任务形式化为“基于证据分析声明真实性”等复杂指令。文献表明,基于提示微调的方法在无/低资源场景下能够精准判断核查优先级,性能超越BERT及GPT系列模型。高质量数据(源于标注、转换或合成)是指令微调成功的关键,其能将谣言验证、立场检测等多任务统一于指令框架,并通过嵌入思维链要求激发模型的深层推理能力。
2.3.4 领域自适应与元学习
虚假信息检测在现实世界中面临领域漂移与低资源的双重挑战。领域自适应(domain adaptation)与元学习(meta-learning)通过跨域知识迁移应对此难题。元学习旨在“学会学习”,实现仅用少量目标领域样本快速适应新任务,如MetaFEND融合元学习与神经过程,仅凭少量样本即可检测未知事件。作为领域自适应的主流实现手段之一,对抗训练引入领域鉴别器,约束特征提取器生成领域不变表示,有效缩小分布差异,增强模型在新领域中的泛化能力。
模型微调与适配将通用LLM精准转化为虚假信息检测任务的领域专家。在特定数据集上微调后的模型,性能通常远超零样本或少样本提示方案。通过在高质量事实核查数据上训练,可明确教导模型遵循证据、避免编造,从而减少幻觉。
2.4 MLLM
面对日益复杂的跨模态虚假信息,单一模态分析已难以满足检测需求。GPT-4V、LLaVA、Qwen2-VL等MLLM通过联合理解图像、文本、音频与视频,能够有效捕捉跨模态不一致性与深度伪造特征,识别出单模态模型难以发现的欺骗模式。MLLM包括跨模态语义一致性检验、单模态伪造痕迹识别以及外部知识与证据增强。
2.4.1 跨模态语义一致性检验
真实信息通常具有图文语义自洽性,而虚假信息常存在跨模态矛盾。MLLM通过细粒度对齐(如实体、情感、场景),能有效识别“图文不符”或“断章取义”等现象。上下文语义一致性学习(contextual-semantic consistency learning,CSCL)框架通过并行解码器分别捕捉图像与文本的局部拼接异常,以及深层的情感、主体冲突,显著提升了对局部伪造的感知能力。跨模态语义一致性检验方法仅依赖内容本身进行分析,无需外部检索,兼具高精度与高效率,适合对海量社交媒体内容进行实时初筛。
2.4.2 单模态伪造痕迹识别
数字编辑(如PS处理、DeepFake生成、AIGC合成)会在数据层遗留可检测的“指纹”。针对这类痕迹的检测方案可分为2大主流路线:一是物理痕迹分析法,检测图像在采集、压缩、存储过程中存在的固有模式异常;二是数据驱动法,利用深度神经网络(如FakeShield)学习纹理、边缘等视觉差异,精准识别AIGC生成的结构扭曲或平滑纹理。此类单模态检测聚焦于数据层面的技术性篡改,不受语义误导干扰,有效弥补了跨模态一致性检验的盲区,特别适用于对抗DeepFake等技术驱动型伪造。
2.4.3 外部知识与证据增强
仅分析信息内部的一致性难以应对复杂虚假信息,需引入外部权威证据进行交叉验证。通过实体链接将声明映射至结构化知识图谱(如Wikidata),可获取客观背景知识。例如,Cao等人利用维基百科的实体描述补充新闻文本实体语义,Zhang等人则融合多模态知识以增强表示。基于证据的图推理方法利用图神经网络聚合多源证据语义,提升虚假信息判别能力。外部知识与证据增强方法不仅缓解了模型幻觉与偏见,还能通过连接实时知识库或搜索引擎,突破静态知识滞后性,实现对新兴事件的动态核查。
MLLM凭借视觉Transformer的细粒度感知能力与LLM的复杂推理能力,实现跨模态协同分析。其不仅能同步检测深度伪造与图文矛盾,更可突破传统粗粒度分类局限,通过细粒度定位(如篡改区域、失实陈述)精准揭示复杂的跨模态欺骗关系。
2.5 多智能体工作流
LLM的应用方式可以分为非智能体式和智能体式,虚假信息检测工作流如图1所示。非智能体式将模型视为执行者,依赖提示工程、RAG或微调进行单次调用,易受幻觉干扰。智能体式则将任务分解为子任务,调度配备专用工具、记忆及差异化指令的智能体集群,通过多智能体的通信、辩论与协同决策,实现更高鲁棒性与透明度的检测。现有研究可归纳为模块化流水线式、辩论与审议式、检索增强与工具调用式、异构集成与群体决策式4种典型架构,反映了从任务分解到集体涌现的渐进演化路径。

图1 基于LLM的智能体式与非智能体式虚假信息检测工作流
2.5.1 模块化流水线式架构
模块化流水线式架构是多智能体系统在虚假信息检测领域工程化程度较高的范式之一,其核心在于任务分解与角色专业化。系统将端到端流程解构为专职阶段,包括信息感知与解析、证据检索与关联、逻辑与一致性验证、领域专家评估及综合研判与报告生成。Bukke等人提出了一种证据感知的多角色智能体框架,通过检索员、分析师、评估员等角色顺序执行证据检索与多模态融合,形成典型实例。该架构凭借模块化设计实现高可解释性与易扩展性,各智能体可独立优化,适用于新闻核查与多模态内容审核等需系统化证据处理的复杂任务。
2.5.2 辩论与审议式架构
辩论与审议式架构模拟司法或议会流程,通过设立主张者、反对者与裁判等角色,使智能体围绕声明真实性展开对抗性交互,以达成共识或裁决。例如,基于证据的辩论式虚假信息检测框架(evidence-based debate-to-detect,ED2D)构建了模拟5阶段法庭辩论(开场陈述、反驳、自由辩论、结束陈述、判决)的智能体框架;TruEDebate则遵循林肯-道格拉斯辩论格式,组织正反方进行对抗性讨论。这种对抗机制将辩论过程转化为可解释输出,通过暴露论点弱点有效抑制模型幻觉与偏见,显著提升结论的可信度。该架构适用于政治声明、科学争议等需深度权衡多方证据的复杂核查任务。
2.5.3 检索增强与工具调用式架构
检索增强与工具调用式架构赋予智能体主动调用外部资源的能力,突破参数知识的静态局限。与传统被动线性RAG不同,智能体系统基于ReAct范式(“思考—行动—观察”),根据推理状态决策检索时机、查询优化及证据融合。解释驱动动态检索框架(explanation-driven dynamic retrieval,ExDR)依据置信度动态触发检索,模块化证据锚定推理框架(modular evidence-grounded reasoning inference toolkit,MERIT)则协调视觉验证与事实核查等多模块工具调用。这种“工具内学习”范式在知识扩展与泛化能力上显著优于试图将所有知识压缩进模型参数的“权重内学习”范式,通过引入实时、可追溯的外部证据,有效应对突发新闻与科学论断等时效性强的核查任务。
2.5.4 异构集成与群体决策式架构
异构集成与群体决策式架构融合集成学习与群体智能,通过聚合模型架构与数据视角各异的智能体,形成超越单一智能体的综合判断力,有效抵御偏见与对抗攻击。多智能体验证框架(multi-agent verification system,MAVS)采用加权机制整合图神经网络与生成式人工智能(立场、情感、验证专家),在基准测试中展现了高精度与高鲁棒性;自动决策优化多智能体框架(multi-agent framework with automated rule optimization,MARO)则通过优化决策规则融合多专家见解,提升跨域性能。该架构凭借模型多样性显著降低过拟合风险,适用于对检测准确率与鲁棒性要求严苛的场景,以及需要防御未知新型虚假信息的场景。
多智能体工作流通过角色分工、结构化交互与集体决策,突破了单体LLM、传统RAG等非智能体式方法的静态“黑箱”局限。前者则将模型转化为主动的“认知体”,模拟人类审议与制衡过程,将端到端分类重构为可分解、可辩论的动态认知流程;后者则将模型视为被动的“检测器”,决策孤立且难追溯。这一机制显著提升了复杂任务的检测精度、对抗鲁棒性、决策透明度及对演化生态的持续适应能力。
2.6 5大方法体系的对比:差异定位与协同增效
基于LLM的虚假信息检测已构筑起5层互补的技术生态,其对比如表1所示。提示工程与上下文学习作为敏捷前端,以低成本激发模型通用能力;RAG充当动态证据引擎,通过锚定外部知识缓解幻觉,保障实时核查;模型微调与适配深入特定领域,通过参数优化打造适配专业任务、高检测精度的领域专用模型;MLLM聚焦感知中枢,精准捕捉跨模态的深层语义冲突;多智能体工作流则是顶层协调框架,通过任务分解与角色协同,将前4种方法有机编织为可解释、抗干扰的复杂系统。
表1 基于LLM的虚假信息检测5层技术生态对比

本质上,这5种方法呈现“敏捷交互—证据供给—专业深化—模态扩展—系统集成”的演进逻辑。下一代系统将迈向组合式人工智能范式:以多智能体为骨架,以提示工程为神经脉络,动态调度微调专家与多模态感知,辅以检索增强的事实校准,从而构建具备持续进化能力的可信防御体系。
3
核心挑战与问题
尽管LLM为虚假信息检测带来了深刻的范式变革,但其在实际应用中仍面临一系列严峻且相互关联的核心挑战。这些挑战根植于模型可信性、任务固有复杂性、评估体系滞后性、系统工程瓶颈及系统对抗脆弱性5个层面,构成了当前技术走向实用化的主要障碍。
3.1 模型可信性危机
LLM固有的幻觉现象(即生成看似合理但实际错误的内容),是检测系统可信度的致命弱点。在检测任务中,幻觉可能导致双重危害:一是将真实信息误判为虚假,或为正确判断提供错误的推理依据;二是模型自身可能成为高质量虚假信息的生成来源。此外,模型内部隐含的社会与文化偏见可能被放大,导致对不同群体或议题的检测结果存在偏差。尽管RAG可缓解知识过时与不足的问题,但检索质量的不确定性及多源证据冲突时的整合困难,使得构建完全可信的决策依据依然任重道远。
3.2 任务复杂性难题
虚假信息日益呈现多模态深度伪造与跨平台传播的复杂形态。尽管MLLM近年来取得显著进展,但在细粒度跨模态语义对齐(如经过高阶润色、语义偏差隐晦的图文不匹配内容)、时序一致性分析(如深伪视频的时序伪影检测)以及社会语境理解(如社群专属隐喻表达、反讽语义与情境化语义识别)方面,现有模型能力仍有显著差距。同时,虚假信息制造者会持续进行对抗性演化,设计专门绕过基于LLM检测的样本,要求检测系统具备动态、在线的抗对抗攻击能力。
3.3 评估体系滞后性
现有评估体系已难以准确衡量和驱动前沿检测技术的发展。主要问题体现在以下方面:
一是静态基准的局限性。大多数公开数据集(如FEVER、LIAR)规模有限、领域覆盖窄,且与当前快速演变的在线虚假信息生态严重脱节,无法有效评估模型在真实开放环境中的泛化能力。
二是评估指标的单一性。过度依赖准确率、F1值等传统分类指标,缺乏对模型事实一致性、推理连贯性、解释可信度及抗对抗攻击能力的综合评估。
三是评估方法的循环依赖。日益流行的使用LLM本身作为评估者的做法虽高效,但评估结果受提示工程影响巨大,且评估者自身的幻觉与偏见问题会导致评估结果的可信度存疑。
3.4 系统工程瓶颈
将前沿的LLM检测技术转化为稳定、可用的服务,在工程层面面临严峻的挑战,具体如下:
一是计算成本与实时性的矛盾。MLLM和复杂多智能体系统的推理延迟高、计算资源消耗巨大,难以满足社交媒体平台对海量内容进行毫秒级响应的需求。
二是系统复杂性与可靠性的权衡难题。尤其是多智能体工作流涉及多个模型的协调、通信和状态管理,其设计、调试和维护成本极高,且故障模式复杂。
三是数据隐私与合规风险,检测系统处理大规模用户生成内容时,需在检测效果与隐私保护、合规审计之间取得平衡。
3.5 对抗性挑战升级
在动态对抗环境中,攻击者为规避检测,已发展出旨在绕过或瘫痪LLM检测系统的多层次对抗策略,构成严峻的现实威胁,具体如下:
一是提示注入与模型越狱攻击。属于浅层直接攻击手段,攻击者通过在虚假信息中嵌入特定指令,操纵依赖上下文学习的检测模型,使其忽略核查逻辑或输出预设结论。
二是多模态对抗样本攻击。面向MLLM跨模态检测链路实施干扰,通过对图像、文本添加人眼难以察觉的扰动,干扰模型的跨模态一致性判断。
三是知识库与训练数据投毒攻击。从底层数据源形成深层认知威胁,攻击者通过污染RAG系统的检索源或向微调数据集注入“毒化样本”,从认知源头破坏模型的判断基准。
四是模型侦察探测攻击。以批量查询方式持续试探系统,攻击者通过大量查询分析模型的决策边界与证据偏好,进行系统性探测以优化攻击策略。
五是算力资源耗尽攻击。针对多智能体复杂工作流顶层架构,依靠高频、大规模请求持续占用系统算力,造成检测服务延迟甚至瘫痪。这些策略揭示了当前系统在对抗环境下的固有脆弱性,将攻防博弈从静态性能比拼推向动态系统韧性对抗。
4
未来发展趋势与研究方向
面对模型可信赖性、任务复杂性、评估滞后性、工程瓶颈与对抗脆弱性等核心挑战,虚假信息检测领域的研究正沿着明确的技术路径演进。其发展趋势紧密围绕构建可信、自适应、可评估且可部署的下一代检测系统展开,呈现出从算法创新到生态构建的鲜明特征。
4.1 模型可信赖性演进
为系统解决幻觉、偏见与知识局限等问题,研究焦点正从提升性能指标转向构建内生可信保障机制。在推理机制上,从单纯优化任务准确率转向构建可验证、可追溯的推理框架,强调输出结果需具备逻辑严谨性,并与外部证据可交叉验证;在知识体系上,从依赖训练时封装的静态参数化知识,转向构建动态开放、可持续更新的认知系统,通过高级检索增强与安全参数编辑实现知识的实时演化和纠偏;在价值对齐上,从模型开发的后期考量转变为内生性要求,系统性内嵌细粒度的公平性约束、深度可解释性接口以及常态化的算法审计流程。检测系统的设计目标从构建一个高效的“分类工具”,全面升级为打造一个具有稳定认知能力、可问责、能与人类核查员协同工作的“可信智能体”。
4.2 任务复杂性应对
为应对虚假信息日益凸显的多模态融合、强对抗性演化与高语境依赖性等极端复杂性挑战,技术发展正从传统的单模态分析与被动响应方法,全面转向构建具备深度统一理解与主动前瞻防御能力的新一代检测体系。在理解维度上,从依赖浅层图文特征匹配或统计异常检测,转向构建能够进行细粒度、因果性跨模态推理的统一架构,使模型不仅能感知表层不一致,更能依据客观现实逻辑、社会情境与复杂叙事逻辑,揭示深层语义矛盾与伪造动机,并推动检测、定位与溯源的一体化融合;在防御维度上,从滞后于攻击的脆弱性修补,转向将对抗性鲁棒性内化为模型固有属性,通过对抗训练、可认证鲁棒性等方法构建内生韧性,并发展基于威胁情报预警和博弈论策略的动态主动防御机制,实现从“被动识别”到“主动干预”的范式跃迁。检测系统得以穿透复杂伪装,预见新型威胁,从而在高度动态和对抗性的信息环境中保持优势。
4.3 评估体系重构
为应对现有评估体系在静态基准、单一指标与循环依赖等方面的滞后性困境,虚假信息检测领域正致力于构建贴近动态、对抗性现实信息生态的评估科学体系。在基准构建上,传统静态数据集被能够持续集成最新多模态虚假信息样本、内置对抗性攻击生成器、覆盖多元文化语境的动态基准平台所取代,为检测技术提供持续的压力测试与演进驱动力;在评估维度上,建立涵盖事实准确性、逻辑鲁棒性、证据支持度和解释可理解性的多维度综合评估矩阵;在方法论上,突破使用LLM作为评估者的循环依赖,采用混合人类专家判读、可控测试集验证与形式化方法的混合评估策略,并发展元评估技术以科学衡量不同评估工具自身的信度与效度。这一系统性重构旨在使评估本身成为推动检测技术向更可靠、更公平的方向发展的动力。
4.4 系统工程范式转型
为破解高计算开销、系统协调复杂度与合规风险等工程部署瓶颈,研究推动系统工程范式从集中僵化的传统架构,向分布式高效计算、标准化灵活协同与内嵌式敏捷治理三位一体的新范式演进。在计算架构上,从依赖单一大型云端模型,转向探索模型压缩、稀疏化推理与条件计算技术,采用“边缘轻量感知—云端深度分析”的协同架构,以实现效率与性能的全局最优。在系统设计上,为驾驭多智能体系统的复杂性,通过定义智能体间通信协议、任务规划语言与协同决策接口来推动标准化,降低构建可靠、可扩展协同系统的工程门槛。在治理模式上,将合规性要求从外部附加约束转化为系统内生属性,通过在设计源头内嵌隐私增强技术、算法透明接口与全程审计追踪,为前沿技术的负责任落地与规模化部署提供清晰、可信的路径。
4.5 对抗性演进博弈
为应对不断演进的对抗性攻击,未来防御体系必须构建“检测—响应—进化”的动态韧性。核心在于发展自适应与动态防御机制,如可实时识别并过滤提示注入的智能监控模块,以及融合对抗训练的在线学习框架,使系统能快速适应新型攻击模式。同时,需推动鲁棒性成为模型核心能力,通过在训练中系统纳入对抗样本并进行鲁棒性基准测试,增强模型对扰动与噪声的免疫力。在系统层面,必须建立面向对抗的工程范式,包括实施安全的RAG管道验证、可信的模型供应链审计,以及能抵御资源耗尽攻击的弹性服务架构。尤为关键的是,需强化可解释性驱动的攻击归因能力,通过加强推理溯源,系统能够在检测到攻击时快速定位其手法与路径,实现从被动防御到主动响应的转变。防御与攻击将在博弈中共同进化,唯有将对抗性韧性深度融入系统设计,才能构建出可持续应对未来威胁的下一代信息防御体系。
5
结 语
本文系统梳理了LLM时代虚假信息检测的5大技术体系。尽管从提示工程演进至多智能体协作已展现巨大潜力,但该领域仍深陷模型幻觉、评估滞后及工程落地的结构性矛盾,并面临提示注入、数据污染与系统探测等动态对抗新威胁。未来突破需构建动态协同的治理生态。在技术上,从单纯性能优化转向构建可验证推理与持续进化的内生机制;在范式上,发展深度融合理解与主动前瞻防御的新架构;在评估上,建立动态、多维的科学评估标准;在工程上,实现高效协同与内嵌治理的转型。尤为关键的是,须将对抗演进思维纳入顶层设计,发展具备动态韧性、主动免疫与可归因能力的下一代防御体系。最终目标并非追求绝对无误的检测,而是通过技术与生态的双重创新,系统性抬高虚假信息传播门槛,增强社会辨识韧性,在智能时代守护理性对话的基石。
本文省去了参考文献,以方便排版
作者简介
张 蕾(1996—),女,博士,工程师,主要研究方向为内容安全、认知对抗等;
黄彩云(1994—),女,博士,工程师,主要研究方向为网络空间测绘等;
丁 伟(1995—),男,本科,工程师,主要研究方向为网络空间安全;
潘盈吟(1996—),女,博士,工程师,主要研究方向为对称密码、序列密码算法等;
朱治丞(1988—),男,博士,高级工程师,主要研究方向为网络空间安全、物联网安全;
杨 慧(1987—),女,博士,正高级工程师,主要研究方向为网络空间测绘、内容安全等。
声明:本文来自信息安全与通信保密杂志社,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。