《UCI数据集和源代码》

UCI数据集是一个常用的标准测试数据集,下载地址在

http://www.ics.uci.edu/~mlearn/MLRepository.html

我的主页上也有整理好的一些UCI数据集(arff格式):

http://lamda.nju.edu.cn/yuy/files/download/UCI_arff.zip

在看别人的论文时,别人使用的数据集会给出数据集的出处或下载地址(除非是很机密的数据,例如与国家安全有关)。如果你看的论文没有给出数据集的出处,请立即停止看这篇论文,并且停止看刊发这篇论文的期刊上的所有文章。因为可以断定这些文章质量很差。

关于源代码,网上有很多公开源码的算法包,例如最为著名的Weka,MLC++等。Weka还在不断的更新其算法,下载地址:

http://www.cs.waikato.ac.nz/ml/weka/

很多的机器学习的经典算法都在里面。而且公布源程序,易于修改。

如果作者没有公布源程序,可以到作者主页找找,也可以写信给作者要,一般论文开头都会有作者的email地址。写信的时候要注意要很有礼貌,否则作者,尤其是著名学者,很有可能不会理睬。如果算法简单,可以自己实现。

关于论文的下载,如果能够访问电子图书馆是最好的,很多学校都买了IEEE, Elsevier, Kluwer等,上面的期刊都不错。有一些很好的期刊是免费的,像JAIR和JMLR,分别在:

http://www.cs.washington.edu/research/jair/home.html

http://www.jmlr.org/

如果能访问的免费期刊太少,可以到CiteSeer上搜索(http://citeseer.ist.psu.edu/ ),上面搜集了很多免费论文(但是要注意,论文的质量参差不齐),或者用Googlewww.google.com )搜索。

再嘱咐两点,要做研究,首先要打好基础,例如数学基础和程序设计能力,要学会熟练使用google等搜索引擎,还有一定要看高质量的论文。

《数据挖掘的数据集资源》

大家做数据挖掘研究时,常常为找不到合适的数据而发愁。在KDNuggets上有Datasets栏目,提供一些数据集,网址为:http://www.kdnuggets.com/datasets/

还有另外一个很好的资源网址为:http://kdd.ics.uci.edu/ ,里面包含的数据资源如下(按应用领域划分):

Direct Marketing

KDD CUP 1998 Data

GIS

Forest CoverType

Indexing

Corel Image Features

Pseudo Periodic Synthetic Time Series

Intrusion Detection

KDD CUP 1999 Data

Process Control

Synthetic Control Chart Time Series

Recommendation Systems

Entree Chicago Recommendation Data

Robots

Pioneer-1 Mobile Robot Data

Robot Execution Failures

Sign Language Recognition

Australian Sign Language Data

High-quality Australian Sign Language Data

Text Categorization

20 Newsgroups Data

Reuters-21578 Text Categorization Collection

NSF Research Awards Abstracts 199 0-2003

World Wide Web

Microsoft Anonymous Web Data

MSNBC Anonymous Web Data

Syskill Webert Web Data

转:http://blogger.org.cn/blog/more.asp?name=DMman&id=24043

1、气候监测数据集 http://cdiac.ornl.gov/ftp/ndp026b

2、几个实用的测试数据集下载的网站

http://www.cs.toronto.edu/~roweis/data.html

http://www.cs.toronto.edu/~roweis/data.html

http://kdd.ics.uci.edu/summary.task.type.html

http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-20/www/data/

http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/

http://www.phys.uni.torun.pl/~duch/software.html

在下面的网址可以找到reuters数据集http://www.research.att.com/~lewis/reuters21578.html

以下网址上有各种数据集:

http://kdd.ics.uci.edu/summary.data.type.html

进行文本分类,还有一个数据集是可以用的,即rainbow的数据集

http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html

3、找了很多测试数据集,写论文的同志们肯定需要的,至少能用来检验算法的效果

可能有一些不能访问,但是总有能访问的吧:

UCI收集的机器学习数据集

ftp://pami.sjtu.edu.cn/

http://www.ics.uci.edu/~mlearn//MLRepository.htm

statlib

http://liama.ia.ac.cn/SCILAB/scilabindexgb.htm

http://lib.stat.cmu.edu/

样本数据库

http://kdd.ics.uci.edu/

http://www.ics.uci.edu/~mlearn/MLRepository.html

关于基金的数据挖掘的网站

http://www.gotofund.com/index.asp

http://lans.ece.utexas.edu/~strehl/

reuters数据集

http://www.research.att.com/~lewis/reuters21578.html

各种数据集:

http://kdd.ics.uci.edu/summary.data.type.html

http://www.mlnet.org/cgi-bin/mlnetois.pl/?File=datasets.html

http://lib.stat.cmu.edu/datasets/

http://dctc.sjtu.edu.cn/adaptive/datasets/

http://fimi.cs.helsinki.fi/data/

http://www.almaden.ibm.com/software/quest/Resources/index.shtml

http://miles.cnuce.cnr.it/~palmeri/datam/DCI/

进行文本分类&WEB

http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html

http://www.w3.org/TR/WD-logfile-960221.html

http://www.w3.org/Daemon/User/Config/Logging.html#AccessLog

http://www.w3.org/1998/11/05/WC-workshop/Papers/bala2.html

http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/

http://www.web-caching.com/traces-logs.html

http://www-2.cs.cmu.edu/webkb

http://www.cs.auc.dk/research/DP/tdb/TimeCenter/TimeCenterPublications/TR-75.pdf

http://www.cs.cornell.edu/projects/kddcup/index.html

时间序列数据的网址

http://www.stat.wisc.edu/~reinsel/bjr-data/

apriori算法的测试数据

http://www.almaden.ibm.com/cs/quest/syndata.html

数据生成器的链接

http://www.cse.cuhk.edu.hk/~kdd/data_collection.html

http://www.almaden.ibm.com/cs/quest/syndata.html

关联:

http://flow.dl.sourceforge.net/sourceforge/weka/regression-datasets.jar

http://www.almaden.ibm.com/software/quest/Resources/datasets/syndata.html#assocSynData

WEKA:

http://flow.dl.sourceforge.net/sourceforge/weka/regression-datasets.jar

1。A jarfile containing 37 classification problems, originally obtained from the UCI repository

http://prdownloads.sourceforge.net/weka/datasets-UCI.jar

2。A jarfile containing 37 regression problems, obtained from various sources

http://prdownloads.sourceforge.net/weka/datasets-numeric.jar

3。A jarfile containing 30 regression datasets collected by Luis Torgo

http://prdownloads.sourceforge.net/weka/regression-datasets.jar

癌症基因:

http://www.broad.mit.edu/cgi-bin/cancer/datasets.cgi

金融数据:

http://lisp.vse.cz/pkdd99/Challenge/chall.htm

另一个人提供的

http://www.cs.toronto.edu/~roweis/data.html

http://kdd.ics.uci.edu/summary.task.type.html

http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-20/www/data/

http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/

http://www.phys.uni.torun.pl/~duch/software.html

在下面的网址可以找到reuters数据集

http://www.research.att.com/~lewis/reuters21578.html

以下网址上有各种数据集:

http://kdd.ics.uci.edu/summary.data.type.html

进行文本分类,还有一个数据集是可以用的,即rainbow的数据集

http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html

Download the Financial Data (~17.5M zipped file, ~67M unzipped data)

Download the Medical Data (~2M zipped file, ~6M unzipped data)

http://lisp.vse.cz/pkdd99/Challenge/chall.htm

kdnuggets 相关链接数据集(借花献佛了):

http://www.kdnuggets.com/datasets/index.html

你也可以到http://blogger.org.cn/blog/more.asp?name=idmer&id=24017

察看kdnuggets 数据集资源的详细介绍。

数据挖掘相关比赛以及数据集

2005 University of California data mining contest , predicting bad accounts and their churn date using real-world CRM data, deadline June 30, 2005.

  • ILP 2005 Challenge , on the prediction of functional classes of genes.
  • KDD Cup 2005 , on classifying internet user search queries, deadline July 8.
  • Data Mining Cup 2005 (Chemnitz, Germany) , for students; topic: How data mining can ascertain the risk of loss of payments and reduce this risk.
  • KDD Cup 2004 , focuses on data-mining for a several performance criteria using datasets from bioinformatics and quantum physics.
  • InfoVis 2004 Contest , The History of InfoVis.
  • DATA MINING CUP 2004 (Chemnitz, Germany) , for students.
  • InfoVis 2003 Contest: Visualization and Pair Wise Comparison of Trees , results announced Sep 5, 2003.
  • KDD Cup 2003 , focuses on problems motivated by network mining and the analysis of usage logs.
  • DATA MINING CUP 2003 (Chemnitz, Germany) . The task is to identify spam emails before they reach the user′s mailbox.
  • KDD Cup 2002 , focus on data mining in molecular biology.
  • Student Data Mining Cup (2002) , Chemnitz University and Prudential Systems.

UCI数据集和源代码数据挖掘的数据集资源相关推荐

  1. 转:UCI数据集和源代码数据挖掘的数据集资源

    <UCI数据集和源代码> UCI数据集是一个常用的标准测试数据集,下载地址在 http://www.ics.uci.edu/~mlearn/MLRepository.html 我的主页上也 ...

  2. NBT|45种单细胞轨迹推断方法比较,110个实际数据集和229个合成数据集

    摘要 轨迹推断(Trajectory Inference,TI),是分析从千上万单细胞的组学数据中推断细胞发育轨迹的重要方法,也被称为伪时序分析 (pseudotime analysis),该方法根据 ...

  3. 7G的森林火情数据集,文末附数据集和源代码

    在2020年12月,由北亚利桑那大学等学校开放了一个基于航拍图像的森林火情数据集:FLAME ,该数据集能够用于促进森林火灾的监控报警,帮助消防员和研究人员制定最佳火灾管理策略. 该数据集是由无人机在 ...

  4. 数据挖掘的数据集资源

    转载自:http://www.cnblogs.com/bobomouse/archive/2007/05/26/760513.html 1.气候监测数据集 http://cdiac.ornl.gov/ ...

  5. 视觉答题的方法、数据集和评价指标综述

    A survey of methods, datasets and evaluation metrics for visual question answering 介绍 VQA目前的主要困境 VQA ...

  6. 【NLP】自然语言处理481个公开数据集和基准任务整理分享

    编辑:深度学习与NLP 自然语言处理( Natural Language Processing, NLP)以语言为对象,利用计算机技术来分析.理解和处理自然语言的一门学科,即把计算机作为语言研究的强大 ...

  7. 资源 | 想进行数据科学项目却没有数据集?26个数据集网站汇总

    导读:如果用一个句子总结学习数据科学的本质,那就是: 学习数据科学的最佳方法就是应用数据科学. 如果你是初学者,那么每完成一个项目你的能力就会大大提高.如果你是有经验的数据科学从业者,那么你应该懂这个 ...

  8. 人工智能大数据,公开的海量数据集下载,ImageNet数据集下载,数据挖掘机器学习数据集下载...

    人工智能大数据,公开的海量数据集下载,ImageNet数据集下载,数据挖掘机器学习数据集下载 ImageNet挑战赛中超越人类的计算机视觉系统 微软亚洲研究院视觉计算组基于深度卷积神经网络(CNN)的 ...

  9. 人工智能大数据,公开的海量数据集下载,ImageNet数据集下载,数据挖掘机器学习数据集下载

    人工智能大数据,公开的海量数据集下载,ImageNet数据集下载,数据挖掘机器学习数据集下载 ImageNet挑战赛中超越人类的计算机视觉系统 微软亚洲研究院视觉计算组基于深度卷积神经网络(CNN)的 ...

最新文章

  1. css盒子模型、文档流、相对与绝对定位、浮动与清除模型
  2. Leetcode 40组合总数(回溯)Ⅱ41缺失的第一个正数42接雨水
  3. Bit-Z CEO长顺入围2018中国经济潮流人物
  4. 【国际专场】laravel多用户平台(SaaS, 如淘宝多用户商城)的搭建策略
  5. Java并发编程实战_不愧是领军人物!这种等级的“Java并发编程宝典”谁能撰写?...
  6. 【kafka】kafka 0.10以及1.x版本的kafka topic 分区扩容
  7. Warning: lio_listio returned EAGAIN Performance degradation may be seen
  8. 性能测试指标(重要)
  9. FFmpeg源代码简单分析:av_write_trailer()
  10. PyCharm社区版支持深度学习_在Windows的Ubuntu子系统运行支持CUDA的深度学习代码
  11. python getopt使用_如何使用getopt.getoptpython中的方法?
  12. Linux学习笔记:wc查看文件字节数、字数、行数
  13. 在FTP服务器上搜索指定文件
  14. sqlserver2008清理数据库日志文件
  15. 架构师,你需要了解的git知识都在这里了
  16. guid主分区表损坏如何处理_GUID格式GPT硬盘引导损坏了怎么修复
  17. ggplot2-标度、坐标轴和图例4
  18. 深入浅出matplotlib(99):散点图里自定义标记显示
  19. WeChatPlugin Mac版安装
  20. 方向标 | c++ | 动态规划

热门文章

  1. pxe高效批量网络装机--手把手教学
  2. 8.编写程序,要求如下: 定义名为VolumeArea的抽象类,在其中定义圆周率的值为3.14159,并定义两个抽象方法volume(double r)和area(double r),它们的返回
  3. 无法在已有的 xxxxxxx“上还原文件 zzz。请重新发出 RESTORE 语句,用 WITH REPLACE 来覆盖原先存在的文件
  4. 背景的css代码,CSS网页设计实例:设计制作大背景网页_css
  5. google-glog功能介绍
  6. 区块链浏览器在linux下部署
  7. 《吴恩达深度学习》学习笔记002_神经网络的编程基础(Basics of Neural Network programming)
  8. .h和.c文件的区别到底是什么(精确讲解)
  9. 油气蒸汽发生器行业调研报告 - 市场现状分析与发展前景预测(2021-2027年)
  10. 嵌入式系统常用词汇表