拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

COLING 2025:LLM Safety 相关论文整理

COLING 2025:LLM Safety 相关论文整理 总目录 大模型安全研究论文整理 2026年版https://blog.csdn.net/WhiffeYF/article/details/159047894COLING 2025LLM Safety 相关论文整理官方入口COLING 历届论文总入口ACL Anthologyhttps://aclanthology.org/venues/coling/COLING 2025 会议及同期研讨会论文总览https://aclanthology.org/events/coling-2025/COLING 2025 Main Proceedingshttps://aclanthology.org/volumes/2025.coling-main/COLING 2025 Industry Trackhttps://aclanthology.org/volumes/2025.coling-industry/COLING 2025 System Demonstrationshttps://aclanthology.org/volumes/2025.coling-demos/会议总览页同时列出同期研讨会论文集本文收录范围为 COLING 2025 Main Proceedings 和 Industry Track。单篇页面可查看标题、摘要和 PDF。筛选口径本文共梳理32 篇与 LLM Safety 相关的论文涵盖越狱攻防、安全对齐、后门、隐私与机器遗忘、Agent/工具调用安全、内容安全与可信评测以及 RAG 公平性。少数论文属于安全或隐私的邻近方向具体范围见文末说明。越狱攻击与红队评测序号论文标题简介其它1Monte Carlo Tree Search Based Prompt Autogeneration for Jailbreak Attacks against LLMs提出基于蒙特卡洛树搜索的 MPA 方法自动搜索并生成对抗性后缀以提升跨开源与闭源 LLM 的越狱攻击效率和成功率。MainACL Anthology 官方链接2“Not Aligned” is Not “Malicious”: Being Careful about Hallucinations of Large Language Models’ Jailbreak提出 BabyBLUE 越狱评测框架辨别真正给出可用有害指导的越狱输出与被误判为成功的幻觉输出提高红队评测的可靠性。MainACL Anthology 官方链接3Revisiting Jailbreaking for Large Language Models: A Representation Engineering Perspective从表示工程视角发现与模型自我安全防护相关的内部激活模式并展示增强或削弱这些模式可以直接调节 LLM 的抗越狱能力。MainACL Anthology 官方链接4Automated Progressive Red Teaming提出 APRT 自动渐进式红队框架通过意图扩展、意图隐藏与恶意样本生成的多轮协同规模化构造更具欺骗性的安全攻击提示。MainACL Anthology 官方链接5Exploiting the Index Gradients for Optimization-Based Jailbreaking on Large Language Models提出 MAGIC通过利用后缀 token 的梯度索引信息缓解 GCG 越狱优化中的间接效应在保持或提升攻击成功率的同时加速搜索。MainACL Anthology 官方链接越狱防御、指令安全与安全对齐序号论文标题简介其它6Intention Analysis Makes LLMs A Good Jailbreak Defender提出推理阶段即可使用的 Intention Analysis 两阶段防御先分析用户真实意图再生成符合策略的回答从而显著降低多类越狱攻击的成功率并保持有用性。MainACL Anthology 官方链接7Unraveling the Mystery: Defending Against Jailbreak Attacks Via Unearthing Real Intention提出 RID 越狱防御先提取用户真实意图再用梯度引导的词语删减处理原提示以降低攻击成功率并尽量保留模型效用。MainACL Anthology 官方链接8Multitask-Bench: Unveiling and Mitigating Safety Gaps in LLMs Fine-tuning系统分析不同下游任务微调造成的 LLM 安全护栏退化并构建多任务安全数据以降低跨任务攻击成功率同时尽量保持模型帮助性。MainACL Anthology 官方链接9ALIS: Aligned LLM Instruction Security Strategy for Unsafe Input Prompt提出类似操作系统用户态/内核态权限分层的 ALIS 指令安全策略将输入分解为原子指令并在与系统约束冲突时拒绝或忽略从而增强对提示注入和越狱的抵抗力。MainACL Anthology 官方链接10CONTRANS: Weak-to-Strong Alignment Engineering via Concept Transplantation提出 ConTrans将弱但已对齐模型中的价值对齐概念向量提取、变换并移植到更强模型的残差流实现低成本的弱到强安全对齐迁移。MainACL Anthology 官方链接11On Weaponization-Resistant Large Language Models with Prospect Theoretic Alignment提出 KT-IPA 前景理论对齐框架面向开放权重模型在再微调后容易绕过安全限制的问题提高模型对滥用和武器化的抵抗能力。MainACL Anthology 官方链接12Aurora-M: Open Source Continual Pre-training for Multilingual Language and Code发布 15B 多语言开放模型 Aurora-M并引入人工审核的安全指令微调与安全评测将持续预训练、多语言能力和面向安全标准的对齐结合起来。IndustryACL Anthology 官方链接后门攻击与防御序号论文标题简介其它13Exploring Backdoor Vulnerabilities of Chat Models提出面向多轮聊天模型的分布式触发后门攻击把触发条件分散到不同对话轮次中并显示该后门具有高攻击成功率且难以被后续安全再对齐移除。MainACL Anthology 官方链接14Gracefully Filtering Backdoor Samples for Generative Large Language Models without Retraining提出 GraCeFul将样本梯度映射到频域后聚类以无需重新训练的方式识别生成式 LLM 的后门训练样本并显著压低后门攻击成功率。MainACL Anthology 官方链接隐私、数据泄露与机器遗忘序号论文标题简介其它15Con-ReCall: Detecting Pre-training Data in LLMs via Contrastive Decoding提出 Con-ReCall利用成员与非成员上下文引起的不同分布偏移进行对比解码提升对 LLM 预训练文本的成员推断能力。MainACL Anthology 官方链接16Learning to Refuse: Towards Mitigating Privacy Risks in LLMs构建 RETURN 真实个人数据遗忘基准并提出 NAUF使 LLM 能针对指定个人学习拒答和遗忘其信息同时尽量保留无关知识与通用能力。MainACL Anthology 官方链接17Gradient Inversion Attack in Federated Learning: Exposing Text Data through Discrete Optimization提出 FET 离散优化梯度反演攻击从联邦学习共享梯度中恢复文本实验主要使用 TinyBERT 与 BERT 系列模型揭示私有文本训练中的泄露风险。MainACL Anthology 官方链接18Alternate Preference Optimization for Unlearning Factual Knowledge in Large Language Models提出 AltPO把遗忘集上的负反馈与域内正反馈联合用于偏好优化在删除指定事实知识的同时改善遗忘后输出质量并维持整体模型效用。MainACL Anthology 官方链接19Unveiling Entity-Level Unlearning for Large Language Models: A Comprehensive Analysis提出实体级机器遗忘任务并系统评估现有方法指出彻底删除某一实体相关知识仍较困难并分析遗忘集知识覆盖率和规模等关键影响因素。MainACL Anthology 官方链接20Get Confused Cautiously: Textual Sequence Memorization Erasure with Selective Entropy Maximization提出 EMSO通过选择性熵最大化与稀疏参数更新减少 LLM 复现指定训练文本的现象同时尽量维持模型效用以应对隐私与版权风险。MainACL Anthology 官方链接21DP-FROST: Differentially Private Fine-tuning of Pre-trained Models with Freezing Model Parameters提出在差分隐私微调中冻结不重要参数、只更新筛选出的参数以缓解大规模预训练模型使用差分隐私训练时常见的效用下降问题。MainACL Anthology 官方链接22Resource-Efficient Anonymization of Textual Data via Knowledge Distillation from Large Language Models将 LLM 的匿名化能力蒸馏到轻量级编码模型并结合 NER 与正则表达式在不依赖外部 LLM API 的情况下实现跨领域文本脱敏并降低隐私暴露。IndustryACL Anthology 官方链接23LLM Evaluate: An Industry-Focused Evaluation Tool for Large Language Models构建本地部署的工业 LLM 评测系统使内部客户数据无需发送给第三方 API并统一管理数据集、模型与推理流程。IndustryACL Anthology 官方链接Agent 与工具链安全序号论文标题简介其它24The Dark Side of Function Calling: Pathways to Jailbreaking Large Language Models系统揭示 LLM 函数调用链中的安全缺口并提出 jailbreak function 攻击说明工具调用中的对齐差异可被利用同时给出防御提示等缓解方案。MainACL Anthology 官方链接25RealSafe: Quantifying Safety Risks of Language Agents in Real-World提出 RealSafe 语言智能体安全评测框架在 14 类真实应用场景、正常/模糊/恶意上下文及多种攻击下系统量化 Agent 的决策与防御风险。MainACL Anthology 官方链接内容安全、合规、可信评测与 Guardrail序号论文标题简介其它26STAND-Guard: A Small Task-Adaptive Content Moderation Model提出可跨任务适配的小型内容审核模型 STAND-Guard通过多种审核任务指令微调提升对未见审核任务的泛化能力以较低部署成本支持 LLM 内容安全。IndustryACL Anthology 官方链接27A Recipe For Building a Compliant Real Estate Chatbot面向房地产聊天机器人构造通用指令和安全数据并微调 Llama-3-8B-Instruct以降低歧视性引导和 redlining 等风险提升领域合规与安全行为。IndustryACL Anthology 官方链接28Lightweight Safety Guardrails Using Fine-tuned BERT Embeddings以约 6700 万参数的 Sentence-BERT 构建轻量安全护栏在 AEGIS 安全基准上取得接近大型 LLM Guardrail 的效果同时降低延迟和维护成本。IndustryACL Anthology 官方链接29LionGuard: A Contextualized Moderation Classifier to Tackle Localized Unsafe Content提出面向新加坡语境和 Singlish 的本地化内容审核分类器 LionGuard显著改善通用审核 API 对本地毒性、仇恨和暴力表达识别不足的问题。IndustryACL Anthology 官方链接30Can Large Language Models Differentiate Harmful from Argumentative Essays? Steps Toward Ethical Essay Scoring构建 HED 有害作文检测基准评估 LLM 能否区分正常论证与含种族主义、性别偏见等有害观点的文本并揭示现有模型在伦理内容识别上的不足。MainACL Anthology 官方链接31AraTrust: An Evaluation of Trustworthiness for LLMs in Arabic提出阿拉伯语 LLM 可信性评测基准 AraTrust以 522 道人工编写的选择题评估真实、伦理、隐私、违法内容与有害言论等维度。MainACL Anthology 官方链接RAG 安全 / 可信性公平性序号论文标题简介其它32Does RAG Introduce Unfairness in LLMs? Evaluating Fairness in Retrieval-Augmented Generation Systems提出面向 RAG 的公平性评测框架发现人口属性相关偏差会同时出现在检索与生成阶段提示 RAG 多组件链路需要进行端到端的可信与公平治理。MainACL Anthology 官方链接趋势观察越狱攻防出现自动化与机制分析MCTS、梯度索引和渐进式自动红队用于构造攻击意图分析、表示空间分析及分层指令策略用于理解或抵御越狱。安全对齐关注微调后的可靠性多任务微调导致的护栏退化、弱到强概念迁移以及开放权重模型再次微调后的滥用风险成为明确议题。后门研究延伸至多轮聊天多轮分布式触发攻击与无需重新训练的后门样本过滤均有正式论文。隐私研究覆盖检测、攻击与缓解成员推断、梯度反演、个人和实体级遗忘、训练文本记忆擦除、差分隐私及文本匿名化构成多条路线。Agent 与工具调用的安全边界开始受关注函数调用越狱和真实应用场景的 Agent 安全评测是本届直接相关的代表工作。内容安全兼顾轻量部署与语言语境小模型护栏、本地化审核器和阿拉伯语可信评测说明审核能力需适应场景及语言差异。RAG 相关工作主要讨论公平性所收录论文分析检索与生成阶段的偏差属于可信性研究不能等同于 RAG 投毒或提示注入攻防。专门讨论推理模型、VLM/VLA 与图-LLM 安全攻防的工作较少这些方向尚未成为本届会议的集中议题。范围说明Gradient Inversion Attack 与 DP-FROST 等论文主要研究预训练语言模型或 BERT 系列属于训练隐私邻近工作Aurora-M 与 LLM Evaluate 分别以模型发布和本地评测为主要贡献涉及安全对齐或客户数据隐私。RAG 公平性论文属于可信 AI 邻近方向。
返回列表