01 / 项目动态
上海理工大学AI赋能美育课题组科研成果落地南昌市中小学生艺术节
智能评分系统首次应用于市级美育合唱赛事,探索“人工评审+AI辅助”新模式
2026年7月8日,南昌市第九届中小学生、幼儿艺术节顺利告一段落。本届艺术节由南昌市教育局主办,以“美育润心 向美而行”为主题,自5月19日启动以来,历时近两个月,涵盖校级、县(区)级、市级三级赛事体系,依次开展了预热、学校比赛展演、县(区)比赛展演及市级集中展演等阶段。

本届艺术节的一大亮点,是首次引入由上海理工大学“人工智能赋能美育课题组”与西湖大学袁鑫教授人工智能课题组联合自主研发的MultiF0合唱AI评分系统。该系统面向多人合唱场景,融合MultiF0多基频音高检测、音准识别、节奏分析、Pitch提取、Jitter/Shimmer稳定性分析及共振参数分析等多项核心技术,可对合唱团队在音高准确度、节奏一致性、声音稳定性及整体演唱表现等方面进行智能分析,为现场专家评审提供客观、精准的数据参考。
通俗而言,这一创新举措如同世界杯赛事中引入VAR视频辅助裁判,通过“人工评委+AI辅助评分”的协同机制,进一步提升赛事评分的客观性、公平性与科学性。

早在2025年11月,由上海理工大学沪江学院与光电信息与计算机工程学院联合组建的AI赋能美育课题组所研发的“数智人Diva AI”评分系统,便已在首届中德智声国际音乐节复赛(中国区决赛)中成功应用。赛事采用“12位真人专家评委+Diva智能评分”的融合评价机制,相关研究成果已发表于《声音杂志》(Journal of Voice)、《科学报告》(Scientific Reports)等国际权威期刊,并已申请6项软件著作权和3项发明专利。
据了解,本届艺术节的参与对象涵盖南昌市中小学生(含小学、初中、普通高中、职业高中、中等职业学校)、幼儿园学生,以及教师、教研科研人员和教育行政管理人员。艺术表演类比赛分为幼儿组、小学组、中学组(含中职)和教师组;艺术作品类分为小学组、中学组(含中职)和教师组;学生艺术实践工作坊及中小学幼儿园美育改革创新优秀案例则不设分组。
本届艺术节明确要求各学校落实“人人能参与、班班会组织、校校有特色”的工作目标,积极推动AI音乐、美术创作等新技术在美育实践中的合理运用。此次MultiF0合唱AI评分系统的引入,让科技不再是论文中的概念,而真正成为服务学生、助力教师、推动美育发展的实在力量。
展望未来,AI与美育的结合绝非简单的技术叠加,而是构建一个有机共生的教育生态系统。教师始终是培育学生的核心力量,AI则作为强大的辅助工具,为教学提供更丰富的手段,为学生拓展更广阔的学习空间。二者的深度融合,将全面助推学校新一轮教育综合改革,为新时代培养兼具创新精神、审美能力和人文情怀的高素质人才。


02 / 平台介绍
以智能分析,支持美育实践
面向赛事组织、日常教学与学生练习,连接评价、反馈与成长。
AI赋能美育评价,数据驱动美育发展。平台面向南昌市第九届中小学生、幼儿艺术节,围绕科学评价、精准分析、全面发展与美育润心,提供音准分析、技巧分析、面部情感分析与赛事数据大屏四大功能模块。
管理员端
用于赛事主办方统一管理教师与学生用户,集中完成音频收集、评分统计与赛事数据总览。
老师端
教师可代表学校报名参赛,并在日常教学中对学生练习进行点评与评分。
学生端
学生可查看个人练习进度,并将练习结果反馈给教师。
模块 01
合唱音准分析模块
本模块支持用户通过在线录音或音频上传的方式进行音准分析与评分。
阅读完整说明
系统基于多基频(Multi-F0)估计框架,能够在同一时间帧内同时解析多条音高轨迹,并通过基于短时傅里叶变换(STFT)的高分辨率时频分析结合音高显著性建模(F0 Salience Estimation),对真实基频成分进行增强建模,有效抑制伴奏干扰、谐波重叠与环境噪声影响。
在此基础上,通过帧级音高追踪(Frame-wise F0 Tracking)与时间连续性约束机制,构建稳定、连续的音高轨迹,实现毫秒级时间分辨率的音高与音分偏差判断。
分析结果以音高轨迹与频谱可视化形式呈现,并支持导出毫秒级音高与音分数据,便于用户对练习过程中的音准稳定性、偏差位置与细微变化进行精细检查,满足教学、训练与比赛评估等专业应用需求。

模块 02
人工智能声乐技巧分析模块
本模块基于深度学习模型,对声乐演唱中的多项技巧进行自动分析与评分,重点支持对共鸣、喉头位置、声音位置与腔体打开四个核心声乐维度的综合评估。
阅读完整说明
系统采用CAMPPlus声学建模架构,以MFCC等声学特征为输入,通过卷积神经网络(CNN)与时序建模网络(TDNN)的融合结构,对声音在时频维度上的变化进行联合建模。
在特征提取阶段,模型引入ODConv动态卷积机制(Omni-Dimensional Dynamic Convolution),通过多维注意力对卷积核进行自适应调制,显著增强模型对不同演唱风格、音色差异及演唱状态变化的感知能力。
该模块可广泛应用于教学反馈、训练评估与比赛评分等场景,为声乐表现提供结构化、可量化的技术支持。

模块 03
面部情感识别分析模块
本模块基于ML5和Meyda开展情感分析。系统通过人脸检测与关键点定位模型,实时捕捉眉眼、嘴部等关键面部特征点,并基于预训练的表情识别网络,对多种基础情绪状态进行概率化判断。
阅读完整说明
在音频层面,模块引入Meyda提供的帧级声学特征(如RMS、ZCR、MFCC等),与面部表情结果进行时间对齐,实现表情变化与声音状态的跨模态关联分析。
该多模态情感分析框架在技术设计与指标选择上,与维也纳大学(University of Vienna)音乐与系统音乐学方向的Christoph Reuter教授团队保持学术交流与合作,并参考其在音乐情感感知、表演心理与声学—感知映射关系方面的研究成果进行优化。
最终分析结果以情绪类别、置信度及变化趋势的形式输出,为声乐教学、训练评估及舞台表现分析提供可靠的多模态数据支持。

模块 04
赛事数据大屏
赛事数据大屏支持全流程数据可视化与决策分析,包括赛事分布、参与人数趋势、项目分布、成绩分布、多维统计、趋势分析与实时监控。
阅读完整说明
情感数据大屏通过融合面部表情与声学特征开展多模态情感识别,以雷达图、趋势图与占比图呈现多维指标,支持多位选手同屏展示与横向对比,以直观的情感数据可视化辅助舞台表现评估。

项目背景与美育改革
项目旨在构建全市级数字化美育新生态,以AI赋能新时代学校美育改革与艺术实践体系建设。
美育改革背景包括:深入贯彻新时代学校美育工作要求,落实立德树人根本任务;构建“校—县(区)—市”三级展演机制,搭建美育交流平台,推动学校、家庭、社会互动互联;推进“校校有特色、班班有活动、人人有项目”,让所有学生享有接受美育的机会,促进区域美育均衡发展;推动AI、数字化、新媒体赋能艺术教育,鼓励创新开放,提升作品艺术表现力和展演效果;建设全市常态化学生艺术展演体系,完善全员艺术展演机制,打造美育品牌与长效发展生态。
全市级艺术赛事矩阵包括艺术表演、艺术作品、AI创作、工作坊和教师技能大赛5大活动类别,20余项市级专项赛事贯穿全年、持续开展,覆盖中小学、幼儿园与教师群体。学校、县区与市级集中展演形成三级联动机制,层层选拔、优中选优、全市展示;AI音乐、AI美术创作作为AI专项首次纳入。
传统赛事评测存在人工评分标准不统一、评委差异大,大规模评分耗时且难以实时反馈,缺少可供赛后复盘的详细演唱数据,以及多声部音准与整体性判断依赖经验等问题。Resodiva方案分别通过毫秒级多声部音高轨迹追踪、共鸣和喉头位置等核心维度自动评分、面部表情与声音状态跨模态分析,以及比赛数据实时可视化提供支持。
通过AI分析、数据沉淀、智能评测与可视化平台建设,推动南昌市学校美育工作迈入智能化、标准化、数字化。
科研基础与前期应用
项目介绍材料列示了DIVA国际人工智能脑科学多模态音乐感知与教育实验室的现有基础:软件著作权7项,专利5项,论文11篇(含在投)。本项目获得“上海市人工智能促进科研范式改革赋能学科跃升计划”优秀案例。
前期应用包括中德智声国际音乐节中的AI赋能声乐表演与美育展演。
平台价值
AI分析:对音准、技巧、情感进行多维度智能评估。
数据沉淀:演唱数据可留存、可复盘。
智能评测与公平公正:项目介绍提出与236位专家评审标准对齐,并通过AI评分与专家标准对齐验证。
可视化平台:赛事数据全流程可视化,支撑科学决策。
区域治理:支撑市、区两级美育质量监测。
构建全市级数字化美育新生态,推动南昌市学校美育工作迈入智能化、标准化、数字化新时代。