1. 博客开头给出自己的基本信息,格式建议如下:
  学号:2017*****7212;
  姓名:张佳欢;
  码云项目仓库:https://gitee.com/zhangjiahuan123456/word_frequency/tree/SE7212
2. 程序分析,对程序中的四个函数做简要说明。要求附上每一段代码及对应的说明。
首先声明编码方式和导入string模块中的punctuation方法

# -*- coding: UTF-8 -*-
from string import punctuation

1.读取文件函数--打开文件读入缓冲区并关闭文件

def process_file(dst):     # 读文件到缓冲区 try: # 打开文件 txt = open(dst, "r") except IOError, s: print s return None try: # 读文件到缓冲区 bvffer=txt.read() except: print "Read File Error!" return None txt.close() return bvffer

2.数据处理--去除字符串中的符号将单词分割并读入字典。

def process_buffer(bvffer):if bvffer:word_freq = {}# 下面添加处理缓冲区 bvffer代码,统计每个单词的频率,存放在字典word_freqfor item in bvffer.strip().split():word = item.strip(punctuation + ' ') if word in word_freq.keys(): word_freq[word] += 1 else: word_freq[word] = 1 return word_freq

3.输出Top10结果--遍历字典并输出Top10的单词

def output_result(word_freq):if word_freq:sorted_word_freq = sorted(word_freq.items(), key=lambda v: v[1], reverse=True)for item in sorted_word_freq[:10]: # 输出 Top 10 的单词 print(item)

4.导入argparse库用于解析命令行数据,依次执行函数

if __name__ == "__main__":import argparseparser = argparse.ArgumentParser()parser.add_argument('dst')args = parser.parse_args()dst = args.dstbvffer = process_file(dst)word_freq = process_buffer(bvffer)output_result(word_freq)

在命令中输入python word_freq.py Gone_with_the_wind.txt运行代码
结果如下,输出了词频Top10的单词和次数:

3. 简单性能分析并改进、提交代码
使用cProfile进行性能分析
python -m cProfile word_freq.py Gone_with_the_wind.txt
测试结果如下图(由于测试数据太多,只列举截图了关键信息,耗时最长,调用最多次数的函数):


:

4. 总结反思

在本次课后作业三词频统计及其效能分析中,效能是一个程序性能的决定性表现,今后要更多的学习python 相关知识,在这次作业中,得到同学们的帮助,很快的解决了问题所在,可见团队重要性。主动学习,争取更高效的完成任务。

转载于:https://www.cnblogs.com/zhangjiahuan/p/10637510.html

个人项目(词频统计及其效能分析)相关推荐

  1. 词频统计及其效能分析

    ---恢复内容开始--- 1) 学号:2017*****1027: 姓名:王益鑫: 码云仓库地址:https://gitee.com/shirt----2580/word_frequency: 2) ...

  2. 第三次作业(词频统计及其效能分析)

    博客开头给出自己的基本信息,格式建议如下: 学号2017035107122: 姓名:张炜一 码云地址:https://gitee.com/weiyi1208/word_frequency 调用次数最多 ...

  3. 结对项目 - 词频统计

    目的与要求 代码复审练习 结对练习 编写单元测试 基于作业3的结果,读取一个较小的文本文件A_Tale_of_Two_Cities.txt,统计该文件中的单词的频率,并将统计结果输出到当前目录下的 R ...

  4. 软件工程之个人项目--词频统计

    不得不说对于菜鸟级的我,这是一次心酸的经历啊...自打接到王老师布置的这个任务(个人项目)之后,我心里一直在想着自己要用哪种语言来完成我的任务.以前多多少少写过一些程序的,这又想起了数据库小学期与永哥 ...

  5. #软工实践-个人项目-词频统计

    Github项目地址 https://github.com/pandaeathzr/personal-project PSP表格: PSP2.1 Personal Software Process S ...

  6. 组合数据类型练习,英文词频统计实例9-21

    1.列表实例:由字符串创建一个作业评分列表,做增删改查询统计遍历操作.例如,查询第一个3分的下标,统计1分的同学有多少个,3分的同学有多少个等. >>>score=list('212 ...

  7. 组合数据类型练习、英语词频统计

    字典实例:建立学生学号成绩字典,做增删改查遍历操作. di={} di["001"]=76 di["002"]=87 di["003"]=7 ...

  8. 组合数据类型练习,英文词频统计实例上(2017.9.22)

    字典实例:建立学生学号成绩字典,做增删改查遍历操作. sno=['33号','34号','35号','36号'] grade=[100,90,80,120] d={'33号':100,'34号':90 ...

  9. 组合数据类型练习,英文词频统计实例上

    1.name=['陈楠芸','陈文琪','刘书签','杨必须'] scores=[7,6,6,5] d={'陈楠芸':7,'陈文琪':6,'刘书签':6,'杨必须':5} print(d) #增加 d ...

最新文章

  1. php postgresql多条,PHPPostgreSQL函数列表 - phpStudy
  2. Java面试进阶:Dubbo、Zookeeper面试题锦集
  3. 从memcpy到memmove,内存函数拷贝与内存重叠问题(重点内容)
  4. 如何理解 RxJS?RxJS的中文API和使用教程
  5. java Comparable 和 Cloneable接口
  6. mysql encode 函数_MySQL常用函数
  7. 网购心脏起搏器存在多达8000个程序漏洞
  8. 华为VLAN隔离配置
  9. Linux各个文件夹的作用
  10. python 企查查爬虫_python爬虫另辟蹊径绕过企查查的登录验证,我太冇财了
  11. 微信固定金额收款码批量生成
  12. MySQL默认字符集设置
  13. 密码学的100个基本概念
  14. Installation failed due to: ‘-26‘
  15. fast-reid跑通自己的数据
  16. Java运算符(1)
  17. 微信小程序 - 按需注入
  18. Android 歌词界面实现(继承Scrollview)
  19. mapreduce-全局排序 -夜幕思年华
  20. 百度云管家4.6.2 – 最后一个不限速的版本

热门文章

  1. 机电设备制造VPS系统的作用
  2. MATLAB一元线性回归
  3. I.MX6 PHY fixup 调用流程 hacking
  4. [Line: 197] Ran out of memory allocating 1073741824 bytes with alignment 0 怎样让内存不够的电脑打开UE4.26
  5. html:iframe标签以及a标签的锚点和制作书签
  6. SIMD、SSE、AVX指令集
  7. React Three Fiber动画入门
  8. 大二暑假实习生的第一次面试
  9. gh0st 内核代码分析
  10. mysql查询数据库每张表数据量大小和占用多少空间