视频加载失败

课程

2865 字
约 9 分钟

计算机专业小学期实训全栈成果报告 (Project Summary)

专业实践与小学期实训·更新于 2026-09-15

计算机专业小学期实训全栈成果报告 (Project Summary)

实训方向:网络数据采集、深度学习目标检测、大模型 Agent 工作流与多模态自动化生成
开源协议CC BY-NC-SA 4.0


📑 目录索引


一、 实训项目全景概述

在本次小学期实训中,紧密围绕数据工程、计算机视觉、知识库检索增强(RAG)与生成式 AI(GenAI)工作流四大前沿方向,完成了 4 个高度连贯且具有工程实用价值的子项目:

timeline
    title 2026 夏季小学期技术演进全景
    Day 1 (0705) : 网络爬虫实战 : Requests / XPath / BeautifulSoup / 正则清洗 : 采集豆瓣榜单与人脸原始样本
    Day 2 (0706) : 目标检测与模型训练 : OpenCV Haar 自动标注 : YOLOv5 迁移学习与精度评测
    Day 3 (0707) : RAG 智能体对话系统 : Coze 工作流编排 : 意图分流拦截 + 568条FAQ知识库检索
    Day 4 (0708) : 多模态漫剧工业化工作流 : 四幕戏剧提示词编排 : 批处理视频生成 + 剪映全轨工程草稿

二、 模块一:网络爬虫与多源数据采集 (0705)

1. 核心任务与完成情况

  • 豆瓣电影 Top 榜单爬取
    • 使用 requests 定制请求头绕过基础反爬,利用 lxmlXPath 语法精准抽取 250 部电影的名称、导演、主演、类型、地区、海报 URL、评分及评价人数。
    • 通过内置 csv 模块将半结构化 HTML 转化为标准 CSV 数据表。
  • 明星正面人脸数据集采集
    • 针对壁纸站点多页 URL 规律进行自动化分析(index_{page}.html)。
    • 按 5 位明星分类抓取高质量正面人脸图片 34 张,为后续 YOLO 目标检测提供干净的图像源。
# 核心抓取与清洗片段
divs = page_html.xpath('//div[@class="article"]/div[@class="doulist-item"]')
for div in divs:
    score = div.xpath('./div//div[@class="rating"]/span[2]/text()')[0]
    comment_nums = re.findall(r'\d+', div.xpath('./div//div[@class="rating"]/span[3]/text()')[0])[0]

三、 模块二:YOLOv5 人脸目标检测与模型训练 (0706)

1. 自动标注与数据集切分

传统目标检测标注成本高昂,本项目编写了 zidong_biaozhu.py

  • 利用 OpenCV 的预训练 Haar Cascade 模型进行面部初筛与粗定位。
  • 采用自适应边界外扩算法(1.8×1.8\times 面部尺寸)保证头部轮廓完整。
  • 自动将像素绝对坐标转换为 YOLO 归一化格式 (class_id,x_c,y_c,w,h)(class\_id, x\_c, y\_c, w, h)
  • 按照 8:2 黄金比例 自动化切分并生成 train/val/ 目录结构。

2. 迁移学习与评估

  • 基于 yolov5s.pt 预训练权重在自建数据集上迭代训练 50 轮。
  • 导出的 best.pt 权重在测试集上表现优异,混淆矩阵及 PR 曲线验证了对 5 位目标明星人脸的高置信度识别。

四、 模块三:跨境电商 AI 智能客服与 RAG 知识库 (0707)

1. 痛点分析与分流设计

传统智能客服直接调用大模型会导致:① 简单问候浪费大量 Token;② 涉及平台封控/刷机规则等专业问题时产生幻觉。

2. 解决方案

在 Coze 平台搭建三层过滤流:

  1. 意图识别层(Python 自定义插件)
    • greeting -> 立即输出固定欢迎语(0 Token 消耗)。
    • human -> 输出人工客服/导师工单链接。
    • rag -> 进入专业知识库检索流程。
  2. RAG 知识检索层
    • 载入包含 568 条权威问答 的本地知识库(跨境电商数据.xlsx)。
  3. 精准回答与安全兜底
    • 检索命中:结合上下文使用 RAG 约束提示词精准作答。
    • 检索未命中:滑动至通用大模型进行安全兜底。

五、 模块四:AI 漫剧一键生成与剪映工程自动化 (0708)

1. 创作流程革新

解决传统 AI 创作中上下文遗忘、提示词反复修改、音视频拼接繁琐的问题,实现了从“一句话主题”到“剪映全轨可编辑工程”的飞跃。

graph TD
    A[用户输入: 主题 + BGM] --> B[TT1-Pro 编剧节点]
    B -->|提炼四幕高光文案| C[批处理引擎]
    C -->|并发生成| D1[分镜1 视频]
    C -->|并发生成| D2[分镜2 视频]
    C -->|并发生成| D3[分镜3 视频]
    C -->|并发生成| D4[分镜4 视频]
    D1 & D2 & D3 & D4 --> E[时间轴与字幕计算]
    E --> F[生成 CapCut/剪映 draft_content.json]
    F --> G[本地剪映秒级打开 二次微调]

2. 核心技术创新

  • 三幕剧四节点文案法则:奠基、推进、爆发、收束,单段严格控制在 30~40 字(1.4 倍语速 5 秒朗读完)。
  • 全分轨工程输出:视频轨、音频轨、字幕轨相互独立,允许创作者在本地剪映中自由调整转场、滤镜与音效。

六、 核心技术栈与能力矩阵

领域核心工具 / 算法达成的工程指标
网络爬虫Requests, lxml (XPath), BS4, Regex250 条电影元数据清洗,34 张高清人脸图爬取
计算机视觉OpenCV (Haar Cascade), PyTorch, YOLOv5全自动人脸数据集标注,目标检测 mAP 表现优异
知识检索 (RAG)Coze Workflow, Vector Retrieval, Excel DB意图识别准确率 95%+,568 条电商 FAQ 低幻觉问答
生成式 AILLM Prompt Engineering, Diffusion Video, CapCut API端到端 AI 漫剧工业化生产,原生剪映工程草稿直出

七、 技术总结与未来展望

通过本次小学期实训,完整打通了从底层数据采集、中间视觉模型训练顶层大模型 Agent 与多模态生成工作流的完整链条,验证了现代 AI 工具链与自动化工作流的高效融合。

未来拓展方向:

  1. 多模态知识图谱构建:调用大模型进行命名实体识别(NER)与 RDF 关系抽取,结合向量嵌入(Embedding)构建更强大的领域知识图谱。
  2. 端到端 Agent 自动化部署:进一步探索本地部署的开源大模型(如 DeepSeek / Qwen)结合 LangChain / LlamaIndex 的本地化 RAG 解决方案。

📄 开源许可证

本项目遵循 CC BY-NC-SA 4.0 许可协议开源。

Profile Image of the Author
Sonder
好想要技术
这是公告标题
这只是一个公告
分类
标签
站点信息
构建平台
GitHub Actions
博客版本
Firefly v6.16.7
文章许可
CC BY-NC-SA 4.0
文章目录