NLPCC 2026 共享任务6: 第二届大语言模型生成文本检测评测

July 27, 2026 · View on GitHub

English Version

任务官网: https://nlp2ct.github.io/NLPCC-2026-Task6-Detection/

会议信息


简介

大型语言模型(LLM)的快速发展带来了虚假信息生成、有害内容传播、滥用误用等一系列严峻挑战。在此背景下,高效区分 LLM 生成文本与人类原创文本,已成为自然语言处理领域亟待解决的重要课题。当前,LLM 生成文本检测技术已取得显著进展,然而相关研究多集中于英文场景,面向中文的系统性研究与技术探索仍较为匮乏。本共享任务旨在弥补这一研究缺口,构建性能更强的中文 LLM 生成文本检测模型,推动该领域在中文语境下的研究与应用落地。

继第一届 LLM 生成文本检测共享任务(NLPCC2025,新疆)成功举办,2026 第二届 LLM 生成文本检测共享任务在首届基础上实现重要升级:任务形式从二分类扩展为三分类,即在区分人类原创(Human-Written)与 LLM 原生生成(LLM-Generated)文本的基础上,新增对 LLM 优化润色(LLM-Refined)文本的识别,更贴合大型语言模型的实际应用场景。参赛队伍需基于组委会提供的原始训练数据,设计并实现文本检测算法,实现对不同来源文本的精准判别,并接受压力测试。


最新消息

  • [ 2025.06.22 ] 📢 最终排行榜已发布!详见成绩部分。系统论文征集现已开启 — 详见论文征集
  • [ 2025.06.16 ] 🏆 第二阶段(封闭评测)现已开启!测试数据已开放。提交截止时间:2026年6月20日 23:59(GMT+8)
  • [ 2025.06.05 ] 🚀 第一阶段(开放评测)现已开启!测试数据Codabench 评测平台已开放。
  • [ 2025.05.08 ] 🔄 我们更新了数据集,将数据内的 MGT 统一修正为 LGT,以和文档对应。其他没有任何改变,原来训练集中的 MGT 即是 LGT(标签为 2)。带来不便和困惑表示抱歉。
  • [ 2025.04.15 ] 💡 我们已经发布了具体的任务指引和训练数据 ~
  • [ 2025.03.20 ] 🔥 NLPCC-2026 Task 6 任务的注册已经开放,欢迎报名!

数据集

本次任务的训练集主要采样和改编自 CUDRT(TIST 2026)公开数据集(中文子集:基于前25%token续写));第一、二阶段测试集均取自 ACL 2026 录用论文 DetectRL-X 的中文数据集。评测数据集在 DetectRL 基准(NeurIPS 2024)框架基础上扩展构建,包含多种生成模型和领域数据,以保证评测场景的真实性与挑战性。

训练集

包含来自4种大语言模型和2个领域的数据。具体来说,数据来源包括新闻和学术写作,生成模型包括 GPT-4、Qwen、ChatGLM 和 Baichuan。训练集总共包含 20,370 对样本。每对样本包含“ID”, “HWT”, “LGT”, “HLT” 四个字段,ID标识每条样本编号,“HWT”, “LGT”, 和“HLT” 分别代表“人类写作的样本”,“大模型生成的样本”,“大模型增强的样本”。

数据下载

训练数据可以在以下 Github 文件夹链接中找到:

带标签的完整测试数据(第一阶段和第二阶段)及官方打分脚本已开源,可用于结果分析、对照实验和基线复现。

测试集(第一阶段)

第一阶段的开放评测测试数据现已发布:

测试集(第二阶段)

第二阶段(封闭评测)的测试数据现已开放获取:

数据限制

  • 为了支持检测系统的开发,允许参赛者基于提供的训练数据进行数据处理、增强,但不得引入任何外部额外新的数据集。

数据格式

数据以 JSON 对象的格式进行存储。

  • 训练数据样式:
{
  "ID": sample ID,
  "HWT": "text written by a human",
  "LGT": "text generated by a model",
  "HLT": "text written by a human, then refined by a model",
}
  • 测试集样式:
{
  "id": test sample ID,
  "text": "HWT, LGT, or HLT",
  "label": "label (HWT: 0, LGT: 1, HLT: 2)",
}

评估指标

该任务的官方评估指标是 macro-averaged F1-Score。


提交与评估

本次评测任务提交平台为 Codabench。第二阶段(封闭评测,最终排名)现已开启。提交截止时间为 2026年6月20日 23:59(GMT+8)。每队最多可提交 100 次(最终排名以最后一次提交的材料结果为准,系统已设定 Force Last 强制取最后一次提交)。提交期间无法查看分数;最终排行榜将于 2026年6月22日 前统一公布。期间第一阶段的公开评测通道将关闭。

每支队伍需将以下三项材料打包提交,缺少任何一项将视为无效结果。为方便打分脚本自动扫描合规性,三项材料须严格按以下名称命名:

  1. 测试结果文件 — 须命名为 prediction.json。包含所有样本的 JSON 文件,保持 id 字段不变,每个样本须包含 idlabel 两个字段(HWT → 0,LGT → 1,HLT → 2)。

  2. 代码与数据 — 须命名为 code_and_data.zip。数据增强、数据处理、模型训练及推理的全部源代码,以及完整的训练数据集(包含增强或处理后的样本)。需附带 README.md 和环境配置文件(如 requirements.txt)。

  3. 技术报告 — 须命名为 technical_report.pdf。详述所采用的方法。不设语言限制,中文或英文均可。所有方案将严格保密,NLPCC 2026 会议结束后统一删除(不存档)。

账号要求

  • 每队仅限使用一个账号提交,账号名称须与报名时的 System Name (ID) / 系统名称 (ID) 一致。若 Codabench 账号名称与已注册的系统名称 (ID) 不一致,只需将提交的最外层 ZIP 压缩包命名为已注册的系统名称 (ID),并使用报名时注册的同一邮箱地址提交即可。我们将通过已注册邮箱与压缩包名称交叉核验成绩有效性。
  • 打包格式等详见 Codabench Get Started → Submission 指引。

注意事项

  • 如发现违反比赛规则的行为,参赛成绩将被取消。
  • 截止日期之后提交的成绩将不被受理。
  • 组织方将保留所有权利,包括但不限于在比赛过程中根据实际情况修改比赛规则、数据等,所有修改会第一时间同步给所有参赛队伍以邮件的形式,也请参赛队伍保持关注我们的任务官网 [最新消息]。
  • 如果在比赛过程中遇到任何问题,欢迎通过以下邮箱联系我们:nlp2ct.junchao@gmail.com

比赛规则

以下规则严格禁止,违反者将被取消成绩。

禁止使用测试集进行开发 — 不得以任意形式使用第一阶段或第二阶段测试集样本开发或优化检测器。包括但不限于伪标签、对测试集进行无监督方法等。仅可使用官方训练集,扩展方式仅限于合法的基于训练集的数据增强,不可引入新的外部数据源。

单文本预测 — 预测环节须以单个文本作为输入、输出标签,不得对整个数据集进行批量处理,须保证方法的实际可用性。

禁止对测试集提取特征 — 规则方法仅可在训练集上提取特征。采用此类方案的队伍须提供统计脚本,证明特征在训练集上可被统计性地观测到。若无法在训练集上验证,将取消成绩。

禁止外部数据与联网 — 禁止使用 RAG(检索增强生成)、联网搜索或任何形式的外部数据源。允许调用大模型 API 直接进行文本判别,但不得引入外部信息。

大模型 API 日志保留 — 如调用大模型 API 进行检测,须保留完整的问答日志,以备可能的核查。


初步日程 (Tentative Schedule)

日期任务
2026年3月20日共享任务发布及参赛征集
2026年3月20日报名开始
2026年4月15日发布详细的任务指南和训练数据
2026年5月25日报名截止
2026年6月5日第一阶段测试数据发布(开放评测)
2026年6月15日第一阶段提交截止(已延长)
2026年6月16日第二阶段测试数据发布(封闭评测)
2026年6月20日第二阶段提交截止
2026年6月22日最终排行榜公布,征集系统报告和会议论文
2026年7月17日系统论文提交截止

成绩

本次共享任务共收到 41 支队伍 报名,为 NLPCC 2026 全部共享任务中报名人数最多的赛道。其中完成 Codabench 平台注册的队伍共 29 支,开放评测阶段提交有效成绩的队伍共 23 支,参与第二阶段封闭评测的队伍共 13 支

前五名队伍及宏平均 F1 成绩:

名次队伍单位宏平均 F1
1Evil-Detect中国科学院信息工程研究所0.8888
2Tele_StrarAGI中国电信人工智能公司星辰通用人工智能实验室0.8393
3希望都队郑州大学0.7745
4ZZUNLP_Zhao郑州大学0.7475
5CEDAR北京理工大学0.7299

完整排名请查看 Codabench


论文征集

系统报告与会议论文征集工作现已正式启动。本次任务共有 7 篇 邀请论文收录名额,录用论文将收录于 Springer LNAI 系列 NLPCC 2026 会议英文论文集。

邀请投稿: 前 5 名队伍获正式邀请提交系统论文。

公开投稿: 面向所有符合资格的报名队伍额外开放 2 个 论文征集名额。

投稿资格: 仅在开放评测或封闭评测阶段提交过有效成绩的队伍具备投稿资格。

论文提交细则:

  • 语言: 仅限英文。
  • 格式: LNCS 排版格式(支持 LaTeX 或 Word 模板)。
  • 篇幅: 全文上限 12 页,参考文献与附录一并计入。
  • 文件格式: PDF。
  • 提交渠道: OpenReview
  • 截止时间: 2026年7月17日 03:59 PM UTC-0(请以 NLPCC 官方通知为准)。
  • 官方说明: http://tcci.ccf.org.cn/conference/2026/shared-tasks/

特别说明: 获得邀请不保证自动录用。若受邀论文质量不达标,组委会有权从公开投稿中择优替代。


组织者

本共享任务由澳门大学自然语言处理与葡汉机器翻译实验室(NLP2CT)、华中师范大学以及阿里云联合主办。


常见问题

问: 在哪里可以注册/报名参加本次共享任务?队伍报名能否更新?

答: 填写以下链接以报名:https://alidocs.dingtalk.com/notable/share/form/v018K4nyeZ1wGK0YnLb_dv19yqvsgs3oebp3pcjys_bUfwzOn。在报名截止时间前,可重复填写此链接以更新队伍报名信息。


问: 本次任务对模型参数量、数据增强方法或所使用的模型是否有任何限制?如果进行模型集成,对总参数量有没有要求?

答: 本次 NLPCC 2026 Share Task 6 任务对单模型参数量没有任何限制,同时若采用模型集成方案,对集成后的总参数量也无相关参数约束。允许使用开源大模型、闭源 API 进行文本释义、改写等数据增强操作,此类操作完全符合比赛规则。


问: 训练集的数据来源是新闻和学术写作,所用为四种生成模型。后续测试数据中也是这两种来源和这四种模型吗,还是会扩充?测试数据是否采用与训练集相同的续写方式生成?是否会包含格式符号或不完整文本?

答: 正如 README 中【数据集】部分所述,测试集将采用另一个数据集的分布外数据(DetectRL 基准,NeurIPS 2024)扩展构建,不再局限于训练集所涵盖的新闻、学术领域以及四类生成模型。测试数据将可能引入未知领域文本与未知生成模型,包括不同的数据生成方案,进行多维度压力测试,从而全面客观地综合评估检测器在真实应用场景下的实际性能表现。测试集 LGT 文本不一定采用训练集同款前 25% token 续写方式;即便采用续写生成,也会对前置 token 做清洗,整体测试集质量更高。测试集会经过严格预处理清洗,不会保留 "\n" 等冗余格式符号。测试集基本不会出现文本突然中断的情况,但不会强制要求均以句号完整收尾,会保留如新闻末尾署名标注等现实场景自然存在的文本形式,用于检验模型真实鲁棒性。


问: 训练集中存在纯英文文本且标签为 HLT、约 2000 条以 "123" 结尾且前文与人类文本相同的样本,且 README 中标注为 LGT 而实际数据集为 MGT,这些应如何理解?

答: 训练集中出现的纯英文文本标签为 HLT 的样本,以及约 2000 条以 "123" 结尾、前文与人类文本重复的样本,均为 CUDRT 数据集原生噪声,我方未做额外清洗处理。数据清洗工作由各参赛队伍自行设计方案处理。关于标签不一致:训练集中的 MGT 即为 LGT(标签为 2),后续会更新数据集,将数据内的 MGT 统一修正为 LGT,并同步发布官方更正通知。


问: 本次任务是否允许使用伪标签,即测试集的数据能否用我们的模型推理一遍,将预测结果作为伪标签加入训练集以扩充训练数据?

答: 本次任务不允许使用测试集数据进行伪标签操作。任何形式的利用测试集样本及预测伪标签加入训练数据进行模型优化的行为均不被允许。因为在真实应用场景中,利用测试集数据进行伪标签的做法并不成立,所以在本次比赛中也不允许此类操作。官方测试集仅用于最终提交的评测。任何形式的利用测试集数据进行训练、微调、伪标签构建或数据增强的行为,将被视为违反比赛规则。参赛队伍仅可使用官方提供的训练集。训练集的扩展方式仅限于已公布的合法的数据增强方法,不可显式引入新的数据来源。


问: 预测时是可以通过整个数据集来输出标签,还是必须输入单个文本输出标签?

答: 预测环节必须输入单个文本输出标签,该要求旨在保证模型在实际应用场景中具备真实可用性。


问: 能否利用未清理干净的特征(如格式符号等)进行规则分类?

答: 允许基于训练集提取特征并开展规则分类,但禁止对测试集提取特征。采用此类规则方案的参赛队伍必须提供统计脚本,以证明该特征在训练集上可被统计性地观测到。若规则无法在训练集上验证,将取消成绩——请谨慎使用。


问: 能否通过内置大模型 API 进行联网搜索(如 RAG)判别文本?

答: 可以调用内置大模型 API 完成文本判别工作,但使用 RAG(检索增强生成)或任何形式的联网查询视为违规,该行为违反了禁止引入外部数据源的赛事规则。


参考文献

以下是和本次shared task相关的文献,如果你的研究使用了相关数据集,或者本次任务对你有帮助,请考虑引用以下文献:

@article{wu2024detectrl,
  title={Detectrl: Benchmarking llm-generated text detection in real-world scenarios},
  author={Wu, Junchao and Zhan, Runzhe and Wong, Derek F and Yang, Shu and Yang, Xinyi and Yuan, Yulin and Chao, Lidia S},
  journal={Advances in Neural Information Processing Systems},
  volume={37},
  pages={100369--100401},
  year={2024}
}
@inproceedings{wu-etal-2026-detectrl,
    title = "{DetectRL-X}: Towards Reliable Multilingual and Real-World {LLM}-Generated Text Detection",
    author = "Wu, Junchao and Liu, Yefeng and Zhu, Chenyu and Zhang, Hao and Wu, Zeyu and Shi, Tianqi and Du, Yichao and Wang, Longyue and Luo, Weihua and Su, Jinsong and Wong, Derek F.",
    booktitle = "Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)",
    month = jul,
    year = "2026",
    address = "San Diego, California, United States",
    publisher = "Association for Computational Linguistics",
    url = "https://aclanthology.org/2026.acl-long.1773/",
    doi = "10.18653/v1/2026.acl-long.1773",
    pages = "38247--38294"
}
@inproceedings{wu2025overview,
  title={Overview of the NLPCC 2025 Shared Task 1: LLM-Generated Text Detection},
  author={Wu, Junchao and Zhan, Runzhe and Wang, Qianli and Yuan, Yulin and Chao, Lidia S and Wong, Derek F},
  booktitle={CCF International Conference on Natural Language Processing and Chinese Computing},
  pages={263--274},
  year={2025},
  organization={Springer}
}
@article{tao2026toward,
  title={Toward Reliable Detection of LLM-Generated Texts: A Comprehensive Evaluation Framework with CUDRT},
  author={Tao, Zhen and Chen, Yanfang and Xi, Dinghao and Li, Zhiyu and Xu, Wei},
  journal={ACM Transactions on Intelligent Systems and Technology},
  volume={17},
  number={2},
  pages={1--35},
  year={2026}
}

我们在LLM生成文本检测领域的其他成果,可供参考:

  • Wu, J., Yang, S., Zhan, R., Yuan, Y., Chao, L. S., & Wong, D. F. (2025). A Survey on LLM-Generated Text Detection: Necessity, Methods, and Future Directions. Computational Linguistics, 1-66.
  • Wu, J., Zhan, R., Wong, D. F., Yang, S., Liu, X., Chao, L. S., & Zhang, M. (2025, January). Who Wrote This? The Key to Zero-Shot LLM-Generated Text Detection Is GECScore. In Proceedings of the 31st International Conference on Computational Linguistics (pp. 10275-10292).
  • Chen, X., Wu, J., Yang, S., Zhan, R., Wu, Z., Luo, Z., Wang, D., Yang, M., Chao, L. S., & Wong, D. F. (2025). RepreGuard: Detecting LLM-Generated Text by Revealing Hidden Representation Patterns. Transactions of the Association for Computational Linguistics13, 1812-1831.

如果您是该领域的新的研究人员,我们希望以下论文可以帮助您快速熟悉该领域(持续更新中):

  • Bao, G., Zhao, Y., Teng, Z., Yang, L., & Zhang, Y. Fast-DetectGPT: Efficient Zero-Shot Detection of Machine-Generated Text via Conditional Probability Curvature. In The Twelfth International Conference on Learning Representations.
  • Hans, A., Schwarzschild, A., Cherepanova, V., Kazemi, H., Saha, A., Goldblum, M., ... & Goldstein, T. (2024, July). Spotting LLMs With Binoculars: Zero-Shot Detection of Machine-Generated Text. In International Conference on Machine Learning (pp. 17519-17537). PMLR.
  • Koike, R., Kaneko, M., & Okazaki, N. (2024, March). Outfox: Llm-generated essay detection through in-context learning with adversarially generated examples. In Proceedings of the AAAI Conference on Artificial Intelligence (Vol. 38, No. 19, pp. 21258-21266).
  • Zhu, B., Yuan, L., Cui, G., Chen, Y., Fu, C., He, B., ... & Gu, M. (2023, December). Beat llms at their own game: Zero-shot llm-generated text detection via querying chatgpt. In Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing (pp. 7470-7483).
  • Yu, X., Qi, Y., Chen, K., Chen, G., Yang, X., Zhu, P., ... & Yu, N. (2024). Dpic: Decoupling prompt and intrinsic characteristics for llm generated text detection. Advances in Neural Information Processing Systems, 37, 16194-16212.
  • Hu, X., Chen, P. Y., & Ho, T. Y. (2023). Radar: Robust ai-text detection via adversarial learning. Advances in neural information processing systems, 36, 15077-15095.
  • Yu, X., Chen, K., Yang, Q., Zhang, W., & Yu, N. (2024, November). Text fluoroscopy: Detecting LLM-generated text through intrinsic features. In Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing (pp. 15838-15846).
  • Wang, P., Li, L., Ren, K., Jiang, B., Zhang, D., & Qiu, X. SeqXGPT: Sentence-Level AI-Generated Text Detection. In The 2023 Conference on Empirical Methods in Natural Language Processing.
  • Ma, S., & Wang, Q. (2024, November). Zero-shot detection of LLM-generated text using token cohesiveness. In Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing (pp. 17538-17553).
  • Bao, G., Zhao, Y., He, J., & Zhang, Y. Glimpse: Enabling White-Box Methods to Use Proprietary Models for Zero-Shot LLM-Generated Text Detection. In The Thirteenth International Conference on Learning Representations.
  • Zhou, H., Zhu, J., Su, P., Ye, K., Yang, Y., Gavioli-Akilagun, S., & Shi, C. AdaDetectGPT: Adaptive Detection of LLM-Generated Text with Statistical Guarantees. In The Thirty-ninth Annual Conference on Neural Information Processing Systems.
  • Zhu, X., Ren, Y., Fang, F., Tan, Q., Wang, S., & Cao, Y. DNA-DetectLLM: Unveiling AI-Generated Text via a DNA-Inspired Mutation-Repair Paradigm. In The Thirty-ninth Annual Conference on Neural Information Processing Systems.

...


版权所有 © 2026 NLP2CT 实验室。保留所有权利。