个人项目(词频统计及其效能分析)
1. 博客开头给出自己的基本信息,格式建议如下:
学号:2017*****7212;
姓名:张佳欢;
码云项目仓库:https://gitee.com/zhangjiahuan123456/word_frequency/tree/SE7212
2. 程序分析,对程序中的四个函数做简要说明。要求附上每一段代码及对应的说明。
首先声明编码方式和导入string模块中的punctuation方法
# -*- coding: UTF-8 -*-
from string import punctuation
1.读取文件函数--打开文件读入缓冲区并关闭文件
def process_file(dst): # 读文件到缓冲区 try: # 打开文件 txt = open(dst, "r") except IOError, s: print s return None try: # 读文件到缓冲区 bvffer=txt.read() except: print "Read File Error!" return None txt.close() return bvffer
2.数据处理--去除字符串中的符号将单词分割并读入字典。
def process_buffer(bvffer):if bvffer:word_freq = {}# 下面添加处理缓冲区 bvffer代码,统计每个单词的频率,存放在字典word_freqfor item in bvffer.strip().split():word = item.strip(punctuation + ' ') if word in word_freq.keys(): word_freq[word] += 1 else: word_freq[word] = 1 return word_freq
3.输出Top10结果--遍历字典并输出Top10的单词
def output_result(word_freq):if word_freq:sorted_word_freq = sorted(word_freq.items(), key=lambda v: v[1], reverse=True)for item in sorted_word_freq[:10]: # 输出 Top 10 的单词 print(item)
4.导入argparse库用于解析命令行数据,依次执行函数
if __name__ == "__main__":import argparseparser = argparse.ArgumentParser()parser.add_argument('dst')args = parser.parse_args()dst = args.dstbvffer = process_file(dst)word_freq = process_buffer(bvffer)output_result(word_freq)
在命令中输入python word_freq.py Gone_with_the_wind.txt
运行代码
结果如下,输出了词频Top10的单词和次数:
3. 简单性能分析并改进、提交代码
使用cProfile进行性能分析
python -m cProfile word_freq.py Gone_with_the_wind.txt
测试结果如下图(由于测试数据太多,只列举截图了关键信息,耗时最长,调用最多次数的函数):
:
4. 总结反思
在本次课后作业三词频统计及其效能分析中,效能是一个程序性能的决定性表现,今后要更多的学习python 相关知识,在这次作业中,得到同学们的帮助,很快的解决了问题所在,可见团队重要性。主动学习,争取更高效的完成任务。
转载于:https://www.cnblogs.com/zhangjiahuan/p/10637510.html
个人项目(词频统计及其效能分析)相关推荐
- 词频统计及其效能分析
---恢复内容开始--- 1) 学号:2017*****1027: 姓名:王益鑫: 码云仓库地址:https://gitee.com/shirt----2580/word_frequency: 2) ...
- 第三次作业(词频统计及其效能分析)
博客开头给出自己的基本信息,格式建议如下: 学号2017035107122: 姓名:张炜一 码云地址:https://gitee.com/weiyi1208/word_frequency 调用次数最多 ...
- 结对项目 - 词频统计
目的与要求 代码复审练习 结对练习 编写单元测试 基于作业3的结果,读取一个较小的文本文件A_Tale_of_Two_Cities.txt,统计该文件中的单词的频率,并将统计结果输出到当前目录下的 R ...
- 软件工程之个人项目--词频统计
不得不说对于菜鸟级的我,这是一次心酸的经历啊...自打接到王老师布置的这个任务(个人项目)之后,我心里一直在想着自己要用哪种语言来完成我的任务.以前多多少少写过一些程序的,这又想起了数据库小学期与永哥 ...
- #软工实践-个人项目-词频统计
Github项目地址 https://github.com/pandaeathzr/personal-project PSP表格: PSP2.1 Personal Software Process S ...
- 组合数据类型练习,英文词频统计实例9-21
1.列表实例:由字符串创建一个作业评分列表,做增删改查询统计遍历操作.例如,查询第一个3分的下标,统计1分的同学有多少个,3分的同学有多少个等. >>>score=list('212 ...
- 组合数据类型练习、英语词频统计
字典实例:建立学生学号成绩字典,做增删改查遍历操作. di={} di["001"]=76 di["002"]=87 di["003"]=7 ...
- 组合数据类型练习,英文词频统计实例上(2017.9.22)
字典实例:建立学生学号成绩字典,做增删改查遍历操作. sno=['33号','34号','35号','36号'] grade=[100,90,80,120] d={'33号':100,'34号':90 ...
- 组合数据类型练习,英文词频统计实例上
1.name=['陈楠芸','陈文琪','刘书签','杨必须'] scores=[7,6,6,5] d={'陈楠芸':7,'陈文琪':6,'刘书签':6,'杨必须':5} print(d) #增加 d ...
最新文章
- php postgresql多条,PHPPostgreSQL函数列表 - phpStudy
- Java面试进阶:Dubbo、Zookeeper面试题锦集
- 从memcpy到memmove,内存函数拷贝与内存重叠问题(重点内容)
- 如何理解 RxJS?RxJS的中文API和使用教程
- java Comparable 和 Cloneable接口
- mysql encode 函数_MySQL常用函数
- 网购心脏起搏器存在多达8000个程序漏洞
- 华为VLAN隔离配置
- Linux各个文件夹的作用
- python 企查查爬虫_python爬虫另辟蹊径绕过企查查的登录验证,我太冇财了
- 微信固定金额收款码批量生成
- MySQL默认字符集设置
- 密码学的100个基本概念
- Installation failed due to: ‘-26‘
- fast-reid跑通自己的数据
- Java运算符(1)
- 微信小程序 - 按需注入
- Android 歌词界面实现(继承Scrollview)
- mapreduce-全局排序 -夜幕思年华
- 百度云管家4.6.2 – 最后一个不限速的版本
热门文章
- 机电设备制造VPS系统的作用
- MATLAB一元线性回归
- I.MX6 PHY fixup 调用流程 hacking
- [Line: 197] Ran out of memory allocating 1073741824 bytes with alignment 0 怎样让内存不够的电脑打开UE4.26
- html:iframe标签以及a标签的锚点和制作书签
- SIMD、SSE、AVX指令集
- React Three Fiber动画入门
- 大二暑假实习生的第一次面试
- gh0st 内核代码分析
- mysql查询数据库每张表数据量大小和占用多少空间