视频加载失败

课程

767 字
约 3 分钟

lab02_question

自然语言处理labs/lab/lab02/docs·更新于 2026-09-15

一、实验目的

理解并掌握TextRank关键字提取算法。

三、实验内容

TextRank算法是一种基于图的用于关键词抽取和文档摘要的排序算法,由谷歌的网页重要性排序算法PageRank算法改进而来,它利用一篇文档内部的词语间的共现信息(语义)便可以抽取关键词,它能够从一个给定的文本中抽取出该文本的关键词、关键词组,并使用抽取式的自动文摘方法抽取出该文本的关键句。TextRank算法的基本思想是将文档看作一个词的网络,该网络中的链接表示词与词之间的语义关系。

本实验我们分别利用结巴工具和TextRank4zh两种方法实现TextRank算法。

三、实验语言和平台

Python3.7,AI Studio 平台,本实验需要4学时。

四、实验内容和分析

(1)进入课节5,查看实验内容《基于TextRank算法的两种关键词提取》,读懂这两种算法,为主要代码做注释,自行编写代码完成,输出“燕山大学是河北省人民政府、教育部、工业和信息化部、国家国防科技工业局四方共建的全国重点大学,河北省重点支持的国家一流大学和世界一流学科建设高校,北京高科大学联盟成员。”这段话的关键词和权重。

(2)从[高校名称]新闻网上自行寻找一篇新闻,将其粘贴在一个记事本文件中,然后在代码中读取这个文件,分别使用jieba工具和TextRank4zh提供的抽取关键词的方法来输出关键词,可以尝试输出5个、10个等。

(3)编写一个停用词过滤算法,其能够读取停用词表,并且对读入的文档进行停用词过滤后再利用TextRank4zh进行关键词抽取,尝试设置TextRank4Keyword对象的analyze的window参数大小,查看输出的关键词有何区别。

(4)请给出jieba工具和TextRank4zh两种获取的关键词的方法的差异。

Profile Image of the Author
Sonder
好想要技术
这是公告标题
这只是一个公告
分类
标签
站点信息
构建平台
GitHub Actions
博客版本
Firefly v6.16.7
文章许可
CC BY-NC-SA 4.0

当前页面没有目录

文章目录

当前页面没有目录