头条广大

当前位置: 首页 · 头条广大 · 正文

头条广大

我校两项粤语AI成果亮相2026世界人工智能大会
来源:粤语语料库建设与大模型评测重点实验室 初审:张芳 复审:梅淑宁 终审:何瑞豪 发布日期:2026/07/21
初审 张芳 复审 梅淑宁
终审 何瑞豪

2026世界人工智能大会期间,由广州大学、广州市社科联共建的粤语语料库建设与大模型评测广州市哲学社会科学重点实验室于7月19日应邀亮相大会“人工智能高质量语料生态论坛”。本届论坛聚焦高质量语料生态建设,共有25位院士出席,主旨演讲嘉宾汇聚图灵奖得主、6位中国工程院院士,共同围绕“高质量垂域语料如何破解AI落地瓶颈”展开深度研讨,为行业热议的“语料路径之争”给出答案。

实验室在论坛现场重磅发布两项原创核心成果——AI-DimSum粤语语料库平台(中文名:点心粤语语料库)搜索2.0、粤语真实语音上下文交互能力评测基准CRS-Bench,以方言垂类数据底座打造广州AI差异化竞争力。此次粤语AI成果亮相世界人工智能大会,是广州大学实践人文与科技跨学科交叉融合的又一鲜活例证。

中国工程院院士、粤语语料库建设与大模型评测重点实验室首席科学家方滨兴以“数据决定粤语AI的上限”为题作主旨报告。他指出,大模型“表面会说”,并不等于“真正懂得”。制约粤语大模型发展的首要因素,已不只是模型参数、算法效率和算力条件,更在于高质量、有规模、可持续增强的粤语数据。真正需要建设的,是一套贯通数据、模型、评测、安全与应用的粤语AI数据基础设施。

方滨兴院士作主旨报告

重点实验室主任、广州大学网络空间安全学院齐佳音教授代表重点实验室介绍了AI-DimSum粤语语料平台搜索2.0和粤语真实语音上下文交互能力评测基准CRS-Bench两项最新研究成果。前者作为重点实验室在语料规模迈入TB级后推出的重要升级,具备三大特色:所有语料自带“身份证”,来源更可信;搜索结果分三层呈现——精确、关联和推荐,内容更丰富;融合社交功能和生态应用,实现搜索即社交、搜索即传播、搜索即应用。后者由重点实验室与GOMAX LAB合作建设,基于真实粤语语音资源,体现地域变体、包含上下文情景、具有文化语义复杂度,开辟了AI粤语能力评测的新赛道。

齐佳音教授发布成果

齐佳音表示,此次发布的两项成果是广州将丰富鲜活的粤语资源转化为可用数据资产的重要实践。搜索平台2.0让海量粤语语料“找得准、信得过”,为教育、文创、媒体和人工智能企业提供了便捷可信的数据服务入口;评测基准则让模型能力“测得清、评得准”,有效避免“普通话迁移假象”和“伪粤语自我放大”两类偏差,将评测结果反馈到数据建设端,驱动模型能力持续提升。

据悉,2024年11月,广州大学与广州市社科联联合成立粤语语料库建设与大模型评测重点实验室,采取“1+1+N”协同模式,联动大湾区多方资源推动粤语语料建设从专业工程走向社会参与、从资源整理走向生态培育。重点实验室由中国工程院院士、广州大学网络空间安全学院名誉院长方滨兴教授,国家语言服务与粤港澳大湾区语言研究中心主任、香港科技大学(广州)/广州大学原党委书记屈哨兵教授担任双首席科学家,广州大学网络空间安全学院齐佳音教授担任重点实验室主任、人文学院院长禤健聪教授担任重点实验室副主任。

一年来,重点实验室围绕“兼容岭南文化”和“兼容人工智能”两项目标,建设AI-DimSum多模态通用粤语语料库平台,现已汇聚超100万字文本、3000小时高保真语音和1TB+音视频,建成岭南文化粤语思维链问答数据、粤语内容安全关键词语料、粤语大模型安全评测数据集等特色语料,孵化出粤语内容安全检测“保险箍”、粤语智能配音、粤语学习工具等10余款应用,入选国家语言文字信息化十大新闻和国家关键领域语言科技赋能创新项目案例,并在第五届琶洲算法大赛中承办了“点心杯——粤语及其内部方言分片的语音识别模型构建”赛事,向全球AI开发者提供独家高质量算法训练数据。

AI-Dimsum APP    

AI-Dimsum Cantonese Corpus公众号

从把粤语“存下来”,到让粤语“用起来”;从守护一方乡音,到建设数字中文新基建,广州大学粤语语料库建设与大模型评测重点实验室正在探索方言资源智能化保护的新路径。下一步,重点实验室将继续推动优质粤语语料的常态化汇聚和规范化标注,加强标准建设、完善评测基准与搭建治理工具,迈出从科研成果到产业应用转化的关键一步;并以广东先行试点为基础,加强粤港澳大湾区语料共建、标准协同和场景合作。



上一条:我校学子在第二十五届全国大学生机器人大赛ROBOTAC总决赛获多项大奖
下一条:我校湾区青年国情教育实践团赴贵州开展社会实践活动

广州大学版权所有  COPYRIGHT©1999-2016,   GUANGZHOU  UNIVERSITY   -联系我们-网站地图  粤ICP备 05008855号