对“言外之意”的理解是人类交际的核心能力。而以往针对大语言模型的评测更侧重其在具体垂域中的表现,较少从语用推理与隐喻义识别角度评估模型的语言能力。

本评测共设计两个核心赛道,旨在系统评估大语言模型在中文语境下的会话语义理解能力与隐喻理解能力。

目前评测任务数据集已发布!

赛道一:会话含义理解

会话含义评测赛道所提供的数据集源于国产情景喜剧《爱情公寓》。剧中对话涵盖社交、消费、工作、情感、职场、家庭等日常生活场景,其语言诙谐幽默,大量运用双关、夸张、比喻等修辞手法。同时,剧情也融合了传统文化典故和流行文化梗,这些特征可考察大语言模型在真实、动态对话中的会话含义理解能力。

为避免过于冗长导致引入无关信息干扰模型的判断,每段对话只截取能推导出会话含义的最小必要语段,即从触发线索句起,到含义被确认或取消的首个后续句止,这样能够确保语段保留完整的可推理链条。

本次评测数据集共计490段多轮对话。

会话含义数据集统计

赛道二:隐喻理解与生成

赛道三提供自主构建的中文隐喻能力评测数据集,来源涵盖文学作品、政治文本、日常对话三大真实语言场景,包含现成语料与改编语料两类,所有语料均经过多轮人工标注与一致性检验,明确标注句子是否含隐喻、本体、喻体及隐喻深层含义。

数据集规模共计4180条语料,涵盖文学作品、政治文本、日常对话三大来源。语料类型涵盖结构隐喻、方位隐喻、本体隐喻三类核心隐喻类型,其中隐喻句2090条(文学600条、政治600条、对话890条),非隐喻句2090条,所有语料均经过多轮人工标注与一致性检验,明确标注句子是否含隐喻、本体、喻体及隐喻含义。

隐喻能力评测数据集分布概况

具体任务网址与数据集:https://github.com/blcuicall/CCIME2026