我院两项粤语AI成果亮相2026世界人工智能大会

作者:    时间:2026-07-30    点击数:

2026世界人工智能大会期间,由广州大学、广州市社科联共建的粤语语料库建设与大模型评测广州市哲学社会科学重点实验室于7月19日应邀亮相大会“人工智能高质量语料生态论坛”,现场重磅发布两项原创核心成果——AI-DimSum粤语语料库平台(中文名:点心粤语语料库)搜索2.0、粤语真实语音上下文交互能力评测基准CRS-Bench,以方言垂类数据底座打造广州AI差异化竞争力。

中国工程院院士、粤语语料库建设与大模型评测重点实验室首席科学家方滨兴以《数据决定粤语AI的上限》为题作主旨报告。他指出,大模型“表面会说”,并不等于“真正懂得”。制约粤语大模型发展的首要因素,已不只是模型参数、算法效率和算力条件,更在于高质量、有规模、可持续增强的粤语数据仍显不足。真正需要建设的,是一套贯通数据、模型、评测、安全与应用的粤语AI数据基础设施。


图1 方滨兴院士做主旨报告


重点实验室主任、广州大学网络空间安全学院齐佳音教授代表重点实验室介绍了AI-DimSum粤语语料平台搜索2.0和粤语真实语音上下文交互能力评测基准CRS-Bench两项最新研究成果。前者作为重点实验室在语料规模迈入TB级后推出的重要升级,具备三大特色:所有语料自带“身份证”,来源更可信;搜索结果分三层呈现——精确、关联和推荐,内容更丰富;融合社交功能和生态应用,实现搜索即社交、搜索即传播、搜索即应用。后者由重点实验室与GOMAX LAB合作建设,基于真实粤语语音资源,体现地域变体、包含上下文情景、具有文化语义复杂度,开辟了AI粤语能力评测的新赛道。


图2 齐佳音教授发布成果


齐佳音教授表示,此次发布的两项成果是广州将丰富鲜活的粤语资源转化为可用数据资产的重要实践。搜索平台2.0让海量粤语语料“找得准、信得过”,为教育、文创、媒体和人工智能企业提供了便捷可信的数据服务入口;评测基准则让模型能力“测得清、评得准”,有效避免“普通话迁移假象”和“伪粤语自我放大”两类偏差,将评测结果反馈到数据建设端,驱动模型能力持续提升。

本届论坛聚焦高质量语料生态建设,共有25位院士出席,主旨演讲嘉宾汇聚图灵奖得主、6位中国工程院院士,共同围绕“高质量垂域语料如何破解AI落地瓶颈”展开深度研讨,为行业热议的“语料路径之争”给出答案。

2024年11月,广州大学与广州市社科联联合成立粤语语料库建设与大模型评测重点实验室,采取“1+1+N”协同模式,联动大湾区多方资源推动粤语语料建设从专业工程走向社会参与、从资源整理走向生态培育。重点实验室由中国工程院院士、广州大学网络空间安全学院名誉院长方滨兴教授,国家语言服务与粤港澳大湾区语言研究中心主任、香港科技大学(广州)/广州大学原党委书记屈哨兵教授担任双首席科学家,广州大学网络空间安全学院齐佳音教授担任重点实验室主任、人文学院院长禤健聪教授担任重点实验室副主任。



Copyright © 2022 广州大学网络空间安全学院 版权所有