课程
2865 字
约 9 分钟
大三下
计算机专业小学期实训全栈成果报告 (Project Summary)
专业实践与小学期实训·更新于 2026-09-15
计算机专业小学期实训全栈成果报告 (Project Summary)
实训方向:网络数据采集、深度学习目标检测、大模型 Agent 工作流与多模态自动化生成
开源协议:CC BY-NC-SA 4.0
📑 目录索引
- 一、 实训项目全景概述
- 二、 模块一:网络爬虫与多源数据采集 (0705)
- 三、 模块二:YOLOv5 人脸目标检测与模型训练 (0706)
- 四、 模块三:跨境电商 AI 智能客服与 RAG 知识库 (0707)
- 五、 模块四:AI 漫剧一键生成与剪映工程自动化 (0708)
- 六、 核心技术栈与能力矩阵
- 七、 技术总结与未来展望
一、 实训项目全景概述
在本次小学期实训中,紧密围绕数据工程、计算机视觉、知识库检索增强(RAG)与生成式 AI(GenAI)工作流四大前沿方向,完成了 4 个高度连贯且具有工程实用价值的子项目:
timeline
title 2026 夏季小学期技术演进全景
Day 1 (0705) : 网络爬虫实战 : Requests / XPath / BeautifulSoup / 正则清洗 : 采集豆瓣榜单与人脸原始样本
Day 2 (0706) : 目标检测与模型训练 : OpenCV Haar 自动标注 : YOLOv5 迁移学习与精度评测
Day 3 (0707) : RAG 智能体对话系统 : Coze 工作流编排 : 意图分流拦截 + 568条FAQ知识库检索
Day 4 (0708) : 多模态漫剧工业化工作流 : 四幕戏剧提示词编排 : 批处理视频生成 + 剪映全轨工程草稿
二、 模块一:网络爬虫与多源数据采集 (0705)
1. 核心任务与完成情况
- 豆瓣电影 Top 榜单爬取:
- 使用
requests定制请求头绕过基础反爬,利用lxml的XPath语法精准抽取 250 部电影的名称、导演、主演、类型、地区、海报 URL、评分及评价人数。 - 通过内置
csv模块将半结构化 HTML 转化为标准 CSV 数据表。
- 使用
- 明星正面人脸数据集采集:
- 针对壁纸站点多页 URL 规律进行自动化分析(
index_{page}.html)。 - 按 5 位明星分类抓取高质量正面人脸图片 34 张,为后续 YOLO 目标检测提供干净的图像源。
- 针对壁纸站点多页 URL 规律进行自动化分析(
# 核心抓取与清洗片段
divs = page_html.xpath('//div[@class="article"]/div[@class="doulist-item"]')
for div in divs:
score = div.xpath('./div//div[@class="rating"]/span[2]/text()')[0]
comment_nums = re.findall(r'\d+', div.xpath('./div//div[@class="rating"]/span[3]/text()')[0])[0]
三、 模块二:YOLOv5 人脸目标检测与模型训练 (0706)
1. 自动标注与数据集切分
传统目标检测标注成本高昂,本项目编写了 zidong_biaozhu.py:
- 利用 OpenCV 的预训练 Haar Cascade 模型进行面部初筛与粗定位。
- 采用自适应边界外扩算法( 面部尺寸)保证头部轮廓完整。
- 自动将像素绝对坐标转换为 YOLO 归一化格式 。
- 按照 8:2 黄金比例 自动化切分并生成
train/与val/目录结构。
2. 迁移学习与评估
- 基于
yolov5s.pt预训练权重在自建数据集上迭代训练 50 轮。 - 导出的
best.pt权重在测试集上表现优异,混淆矩阵及 PR 曲线验证了对 5 位目标明星人脸的高置信度识别。
四、 模块三:跨境电商 AI 智能客服与 RAG 知识库 (0707)
1. 痛点分析与分流设计
传统智能客服直接调用大模型会导致:① 简单问候浪费大量 Token;② 涉及平台封控/刷机规则等专业问题时产生幻觉。
2. 解决方案
在 Coze 平台搭建三层过滤流:
- 意图识别层(Python 自定义插件):
greeting-> 立即输出固定欢迎语(0 Token 消耗)。human-> 输出人工客服/导师工单链接。rag-> 进入专业知识库检索流程。
- RAG 知识检索层:
- 载入包含 568 条权威问答 的本地知识库(
跨境电商数据.xlsx)。
- 载入包含 568 条权威问答 的本地知识库(
- 精准回答与安全兜底:
- 检索命中:结合上下文使用 RAG 约束提示词精准作答。
- 检索未命中:滑动至通用大模型进行安全兜底。
五、 模块四:AI 漫剧一键生成与剪映工程自动化 (0708)
1. 创作流程革新
解决传统 AI 创作中上下文遗忘、提示词反复修改、音视频拼接繁琐的问题,实现了从“一句话主题”到“剪映全轨可编辑工程”的飞跃。
graph TD
A[用户输入: 主题 + BGM] --> B[TT1-Pro 编剧节点]
B -->|提炼四幕高光文案| C[批处理引擎]
C -->|并发生成| D1[分镜1 视频]
C -->|并发生成| D2[分镜2 视频]
C -->|并发生成| D3[分镜3 视频]
C -->|并发生成| D4[分镜4 视频]
D1 & D2 & D3 & D4 --> E[时间轴与字幕计算]
E --> F[生成 CapCut/剪映 draft_content.json]
F --> G[本地剪映秒级打开 二次微调]
2. 核心技术创新
- 三幕剧四节点文案法则:奠基、推进、爆发、收束,单段严格控制在 30~40 字(1.4 倍语速 5 秒朗读完)。
- 全分轨工程输出:视频轨、音频轨、字幕轨相互独立,允许创作者在本地剪映中自由调整转场、滤镜与音效。
六、 核心技术栈与能力矩阵
| 领域 | 核心工具 / 算法 | 达成的工程指标 |
|---|---|---|
| 网络爬虫 | Requests, lxml (XPath), BS4, Regex | 250 条电影元数据清洗,34 张高清人脸图爬取 |
| 计算机视觉 | OpenCV (Haar Cascade), PyTorch, YOLOv5 | 全自动人脸数据集标注,目标检测 mAP 表现优异 |
| 知识检索 (RAG) | Coze Workflow, Vector Retrieval, Excel DB | 意图识别准确率 95%+,568 条电商 FAQ 低幻觉问答 |
| 生成式 AI | LLM Prompt Engineering, Diffusion Video, CapCut API | 端到端 AI 漫剧工业化生产,原生剪映工程草稿直出 |
七、 技术总结与未来展望
通过本次小学期实训,完整打通了从底层数据采集、中间视觉模型训练到顶层大模型 Agent 与多模态生成工作流的完整链条,验证了现代 AI 工具链与自动化工作流的高效融合。
未来拓展方向:
- 多模态知识图谱构建:调用大模型进行命名实体识别(NER)与 RDF 关系抽取,结合向量嵌入(Embedding)构建更强大的领域知识图谱。
- 端到端 Agent 自动化部署:进一步探索本地部署的开源大模型(如 DeepSeek / Qwen)结合 LangChain / LlamaIndex 的本地化 RAG 解决方案。
📄 开源许可证
本项目遵循 CC BY-NC-SA 4.0 许可协议开源。













