来源:《电脑编程技巧与维护》2017年第05期 作者:黄玉蕾;唐明;
选择字号

基于数据仓库的海量搜索日志分析系统研究

分享到: 分享到QQ空间

针对传统分布式模型在海量日志并行处理时的可扩展性和并行程序编写困难的问题,提出了基于数据仓库的海量搜索日志分析系统架构。利用Hadoop分布式文件系统(HDFS)存储海量搜索日志,并对搜索日志进行清洗处理,采用impala对数据进行高速的处理,将处理后的统计结果导入到数据仓库中,使用Pentaho BI对数据进行多维分析和统计报表。获取了关键词分析、查询频率、热词排行、查询词和时间分布、网站排名、用户统计等6个分析主题。分析结果对于搜索引擎的排序算法和系统优化都有一定的指导意义。(本文共计3页)       [继续阅读本文]

下载阅读本文     订阅本刊
   

相关文章推荐

电脑编程技巧与维护杂志2017年第05期
电脑编程技巧与维护
主办:信息产业商会
出版:电脑编程技巧与维护杂志编辑部
出版周期:月刊
出版地:北京市

本期目录