“做中悟”成果展
《基于 Gradio 的多模态 AI 综合应用平台》——《智能媒体计算综合项目实践》“做中悟” 高阶项目式课程学生成果展示
学生:刘宇翔 指导教师:翟书颖、高利鹏、张海林(中软)
一、课程背景说明
本成果出自软件工程专业《智能媒体计算综合项目实践》,课程依托数字图像处理、深度学习、Web 工程开发交叉知识,融合企业级 AI 系统部署真实工程需求、计算机视觉前沿科研模型(YOLOv8、RoBERTa 姿态检测、文本情感分类),以完整可落地的多模态 AI 平台为挑战性综合项目,引导学生从环境搭建、模块化编码、多模态功能开发、线上部署、故障调优全流程自主探究、协同解决复杂工程问题,是典型 “科研课题融入课堂、交叉学科创新产品落地” 的课程实践载体。
二、作品开发对应的课程教学目标达成说明
1. 夯实智能媒体工程工具链,拆解复杂系统工程问题
课程要求学生掌握 OpenCV、PyTorch、HuggingFace 开源生态、Gradio Web 交互开发全套工具。本作品学生自主完成 Windows 端 Anaconda 独立工程环境搭建,解决多库版本依赖冲突(transformers、gradio、huggingface-hub 三角兼容问题);将综合平台拆解为文本、图像、视频、实时摄像头、对话五大类多模态子模块,完成模型加载、UI 布局、推理逻辑、部署配置分层解耦开发,完整达成课程 “对复杂媒体处理系统建模、分解分析” 核心能力目标。
2. 多方案对比验证,自主研究解决项目关键瓶颈
课程倡导研究性学习,鼓励学生针对工程痛点查阅资料、设计对比实验验证方案。开发过程中学生自主定位并攻克 7 类典型工程 Bug:Python 模块导入全局模型绑定失效、视频编码浏览器不兼容、Gradio 流式输出组件适配错误、预训练模型分类头不匹配等;针对局域网 / 公网 / 密码认证 / HuggingFace Spaces 四种部署方案做对比测试,量化记录各模块推理耗时、界面响应延迟,以实测数据论证方案优劣,实现 “自主发现问题 — 调研多类解法 — 实验验证优化” 的研究式学习闭环。
3. 跨领域知识融合,设计具备落地价值的交叉创新系统
作品融合自然语言处理、计算机视觉、实时流媒体 Web 开发三类交叉学科技术,搭建包含 10 大功能标签页的一站式 AI 服务平台,覆盖中文文本情感分析、图像 / 视频目标检测、人体骨骼姿态识别、实时摄像头流式处理、9 类图像艺术滤镜、多轮会话智能对话多模态能力,可直接离线本地运行、局域网共享、公网线上托管,具备课堂演示、小型业务辅助分析的实际应用价值。
三、作品核心功能与课程实践环节对应
本项目对应课程第四大综合实践模块《智能媒体计算平台集成综合实践》全部功能由学生独立编码实现:
1.基础 Gradio 交互开发(课程基础实验环节)
完成单文本交互、多输入多输出表单、静态图像滤镜、实时文本 Live 交互、摄像头流媒体基础 Demo,吃透 Interface 简易界面与 Blocks 自由布局两API,掌握事件绑定、会话状态、流式生成器基础原理。

基础文本交互界面

多输入多输出天气应用

图像滤镜灰度效果

摄像头实时流式处理
2.前沿深度学习模型工程化集成(科研课题融合教学)
NLP 模块:基于 RoBERTa 预训练模型完成中文评论情感二分类,支持单条 / 批量文本推理;
视觉检测模块:集成 YOLOv8 目标检测、YOLOv8-Pose 人体 17 关键点姿态估计,支持图片、本地视频、实时摄像头三类媒体输入;
图像增强模块:基于 OpenCV/Pillow 实现复古、素描、浮雕、边缘检测等 9 种艺术滤镜,覆盖课程图像灰度变换、空间滤波教学知识点。

文本情感分析正面样本

图像车辆目标检测

人体姿态骨骼检测

复古滤镜图像转换
3.Web 服务多模式部署(企业工程实践导向)
学生自主实现局域网访问、公网临时链接、账号密码登录、HuggingFace 云端托管四种工业级部署方式,配套队列并发、全局模型单例加载、视频 H.264 转码等性能优化方案,模拟企业 AI 演示系统上线全流程,强化工程落地思维。

密码登录验证界面

云端Spaces运行页面

平台启动模型加载日志
4.会话状态与多轮对话创新拓展(交叉创新拓展内容)
利用 Gradio 会话状态 gr.State 实现用户隔离多轮对话助手,内置数学运算、规则问答功能,预留大模型 LLM 接入接口,拓展课程多模态交互边界,培养学生系统功能扩展创新能力。

多轮对话助手界面
四、课程育人价值体现
1.工匠精神与严谨求实科学素养
学生完整记录每一类算法、模型、部署方案的性能测试数据,量化界面加载、图像推理、视频流式处理耗时,针对图像失真、视频无法播放、模型预测失效等问题逐一溯源、复现、修复,实验报告完整留存故障现象、根因分析、优化方案全流程记录,践行课程思政中精益求精的工程工匠精神。
2.科技自立自强创新意识
项目全程基于国产开源生态(清华镜像源、HuggingFace 中文预训练 RoBERTa 模型)完成开发,学生自主对比国内外深度学习框架部署差异,在实验报告中提出国产大模型轻量化接入平台的优化改进思路,树立自主创新的技术发展思维。
3.AI 技术向善职业伦理塑造
作品内置实时摄像头检测、图像生成功能,课程同步配套 AI 伦理课堂研讨,学生在项目文档中主动分析本平台图像识别、视频处理功能的正向应用场景(运动姿态分析、商品质检、舆情文本分析),并标注隐私数据采集、画面实时识别的使用规范,建立技术服务社会、恪守伦理底线的职业价值观。
五、作品创新点与课程学习成效总结
1.课程实践创新亮点
① 一站式模块化多模态集成平台,统一 Blocks 架构承载文本、图像、视频、流媒体全类型 AI 能力;
② 全局模型单例加载机制、yield 流式视频处理、浏览器兼容视频转码等工程化优化方案,解决行业 AI 演示系统通用性能痛点;
③ 完整多场景部署方案,兼顾课堂离线演示、局域网小组共享、云端公网展示多类教学使用需求;
④ 代码分层解耦设计,UI、模型加载、推理业务分离,具备良好二次开发拓展性,契合课程 “可迭代工程产品” 培养导向。
2.学生综合能力收获
通过本项目,学生完成从理论知识点到可运行工程系统的完整转化,具备独立完成 AI 多模态 Web 应用需求分析、环境搭建、功能开发、故障排查、线上部署全流程能力;能够自主查阅前沿技术资料、对比多种技术方案并量化评估,具备解决智能媒体领域复杂交叉工程问题的核心素养,达成课程三大核心教学目标,是 “做中悟” 项目式教学模式落地的代表性成果。
六. 学生实践感悟
参与本门 “做中悟” 项目式课程、独立完成多模态 AI 综合应用平台开发,让我收获了与传统理论课堂截然不同的实践成长。老师们的授课专业讲解条理清晰、深入浅出,课程配套实践任务兼具趣味性与挑战性,和常规课程学习模式差异显著,高强度的实操训练也切实推动我的工程开发能力稳步提升,对我而言是十分珍贵的学习契机。
起初我仅掌握各类深度学习算法基础,在整合项目时接连遭遇依赖版本冲突、模型加载异常、媒体流浏览器兼容等诸多工程难题,课程并未直接给出标准答案,而是引导我自主查阅技术资料、设计多套方案对比验证,在反复调试排错的过程中,我逐步意识到智能媒体系统落地不仅依赖算法能力,环境搭建、模块化架构、线上部署、性能优化等工程化环节同样至关重要。
从基础交互 Demo,到集成文本分析、目标检测、人体姿态识别、实时摄像头处理等十大功能的完整平台,我完整走完需求实现、性能测试、多方式部署全流程,充分理解多学科交叉技术融合的产品设计思路。整门课程以项目驱动学习,让我摆脱被动接收知识的模式,在动手实操、自主攻坚中内化专业知识、锤炼解决复杂工程问题的能力。
七、展示文末备注
本作品为课程学生独立完成综合实践成果,完整开发文档、性能测试数据、故障调优记录详见配套实验报告;课程持续开放该综合项目作为年度挑战性实践课题,后续将持续引导学生接入国产大模型、WebRTC 低延迟实时流、结果缓存系统筹进阶优化方向,持续深化研究性、创新性实践教学。
附件【基于 Gradio 的多模态 AI 综合应用平台.pdf】
附件【1.mp4】
