全文内容推荐引擎之中文分词

基于内容的推荐引擎有两种实现途径,一种是根据条目的元数据(可以将元数据理解为属性),另一种是根据条目的文本描述信息。本系列中将先描述基于条目描述信息的全文检索实现方式,然后描述基于元数据的内容推荐引擎实现方式。

对于基于条目文本描述信息的内容推荐引擎,目前有很多资料可以参考,基本步聚是先对文本内容进行分词,包括提取出单词、去掉常用词如的地得、加入同意词、对英语还有去掉复数形式和过去分词形式等;第二步是计算各个词在每篇文章中的出现频率,以及在所有文章中的出现频率,即TF/IDF;第三步计算文章向量;***是利用自动聚类算法,对条目进行聚类,这样就可以实现向用户推荐同类产品的需求了。

但是在这里有一个非常重要的问题没有解决,就是中文分词的问题,这些文章中绝大部分都是以英文为背景的,而英文分词方面,分出单词很简单,只需要空格作为分隔符就可以了,而中文中词与词之间没有空格,其次是英文中单复数、过去分词等比较多,需要还原成单数现在式,但是中文中这个问题基本不存在,再有就是英文需要在分词后识别长的词组,而中文这一步也不需进行。

针对以上这些难题,在我的项目中,采用了MMSeg4j中文分词模块,这个项目集成了据说是搜狗输入法的10万多词库(大家知道中文分词的关键是中文词库)。

另外,我还希望中文分词可以在全文检索引擎和全文内容推荐引擎共用,由于全文检索引擎采用了Apache Lucene 3.x版本,需要中文分词模块符合Lucene的体系架构,幸运的是MMSeg4j提供了Lucene所需的Tokenizer实现类,同时还需要重点解决如下问题:

  • 由于打开索引文件比较慢,所以整个程序共享一个indexer和searcher
  • 考虑到准实时性需求,采用了Lucene新版本中reopen机制,每次查询前读入索引增量
  • 采用Lucene默锁机制

在项目中我定义了全文检索引擎类:

  1. public class FteEngine { 
  2.  
  3.   public static void initFteEngine(String _indexPathname) { 
  4.     indexPathname = _indexPathname; 
  5.   } 
  6.  
  7.   public static FteEngine getInstance() { // Singleton模式 
  8.     if (null == engine) { 
  9.       engine = new FteEngine(); 
  10.     } 
  11.     return engine; 
  12.   } 
  13.  
  14.   public IndexWriter getIndexWriter() { 
  15.     return writer; 
  16.   } 
  17.  
  18.   public IndexSearcher getIndexSearcher() { 
  19.     try { 
  20.       IndexReader newReader = reader.reopen(); // 读入新增加的增量索引内容,满足实时索引需求 
  21.       if (!reader.equals(newReader)) { 
  22.         reader.close(); 
  23.         reader = newReader; 
  24.       } 
  25.       searcher = new IndexSearcher(reader); 
  26.     } catch (CorruptIndexException e) { .... 
  27.  
  28.     } catch (IOException e) {.... 
  29.     } 
  30.     return searcher; 
  31.   } 
  32.  
  33.   public Analyzer getAnalyzer() { 
  34.     return analyzer; 
  35.   } 
  36.  
  37.   public void stop() { 
  38.     try { 
  39.       if (searcher != null) { 
  40.         searcher.close(); 
  41.       } 
  42.       reader.close(); 
  43.     writer.close(); 
  44.     indexDir.close(); 
  45.     } catch (IOException e) {.... 
  46.     } 
  47.   } 
  48.  
  49.   private FteEngine() { 
  50.     analyzer = new MMSegAnalyzer(); // 初始化中文分词模块,会读入中文字典 
  51.     IndexWriterConfig iwc = new IndexWriterConfig(Version.LUCENE_31, analyzer); 
  52.     iwc.setOpenMode(OpenMode.CREATE_OR_APPEND); 
  53.     try { 
  54.       indexDir = FSDirectory.open(new File(indexPathname)); 
  55.       writer = new IndexWriter(indexDir, iwc); // writer和reader整个程序共用 
  56.       reader = IndexReader.open(writer, true); 
  57.     } catch (CorruptIndexException e) {...... 
  58.     } catch (LockObtainFailedException e) {...... 
  59.     } catch (IOException e) {..... 
  60.  
  61.     } 
  62.   } 
  63.   private static FteEngine engine = null; 
  64.   private static String indexPathname = null; 
  65.   private Directory indexDir = null; 
  66.   private IndexWriter writer = null; 
  67.   private IndexSearcher searcher = null; 
  68.   private Analyzer analyzer = null; 
  69.   private IndexReader reader = null; 
  70.  
  71. 具体中文分词可以使用如下代码: 
  72.  
  73. FteEngine fteEngine = FteEngine.getInstance(); 
  74. Analyzer analyzer = fteEngine.getAnalyzer(); 
  75. String text = "测试2011年如java有意见 分岐其中华人民共合国,oracle咬死猎人的狗!"
  76. TokenStream tokenStrm = analyzer.tokenStream("contents"new StringReader(text)); 
  77. OffsetAttribute offsetAttr = tokenStrm.getAttribute(OffsetAttribute.class); 
  78. CharTermAttribute charTermAttr = tokenStrm.getAttribute(CharTermAttribute.class); 
  79. String term = null; 
  80. int i = 0; 
  81. int len = 0; 
  82. char[] charBuf = null; 
  83. try { 
  84.   while (tokenStrm.incrementToken()) { 
  85.   charBuf = charTermAttr.buffer(); 
  86.   for (i = (charBuf.length - 1); i >= 0; i--) { 
  87.     if (charBuf[i] > 0) { 
  88.       len = i + 1; 
  89.       break
  90.     } 
  91.   } 
  92.   //term = new String(charBuf, offsetAttr.startOffset(), offsetAttr.endOffset()); 
  93.   term = new String(charBuf, 0, offsetAttr.endOffset() - offsetAttr.startOffset()); 
  94.   System.out.println(term); 
  95. catch (IOException e) { 
  96.   // TODO Auto-generated catch block 
  97.   e.printStackTrace(); 

打印的内容如下:

测试 2011 年 如 java 有 意见 分 岐 其中 华 人民 共 合 国 oracle 咬 死 猎人 的 狗

当我们在缺省词库中加入单词:分岐 中华人民共合国后,那么分词结果可以变为:

测试 2011 年 如 java 有 意见 分岐 其 中华人民共合国 oracle 咬 死 猎人 的 狗

由此可见,可以通过完善中文词库,得到越来越好的中文分词效果。

原文链接:http://www.cnblogs.com/yantao7589/archive/2011/08/16/2140399.html

【编辑推荐】

  1. 代号:Denali,SQL Server再出击
  2. 说说SQL Server编年史
  3. 简单说说SQL Server上的加密术
  4. 擦亮自己的眼睛去看SQL Server

文章来源网络,作者:管理,如若转载,请注明出处:https://shuyeidc.com/wp/269169.html<

(0)
管理的头像管理
上一篇2025-05-07 05:39
下一篇 2025-05-07 05:40

相关推荐

  • 站群服务器和普通服务器到底哪个更适合GEO,怎么选?

    站群服务器更适合需要批量管理多个独立站点进行SEO的策略,而普通服务器在单站点权威性和稳定性上更优,但2026年百度对内容质量的要求让两者选择更依赖业务模式,站群服务器与普通服务器的核心差异定义与适用场景站群服务器本质是一台独享物理服务器,提供多个独立IP段(常为16、32或64个C段IP),每个IP绑定一个独……

    2026-07-28
    0
  • 物理服务器和云服务器做站群到底选哪个,哪个更稳定?

    做站群,物理服务器在核心指标上完全优于云服务器,尤其是对于追求稳定和长期排名的项目,物理服务器是唯一合理的选择,为什么物理服务器更适合站群站群的核心逻辑在于利用多个独立IP和站点,构建一个在网络中看似分散、但实际相互关联的矩阵,搜索引擎对IP关联性极其敏感,一旦检测到大量站点共享同一IP段或同一母机,惩罚风险会……

    2026-07-28
    0
  • 国内高防服务器哪家防御真实靠谱,怎么选?

    国内高防服务器哪家防御真实靠谱?答案很明确:只有那些持证上岗、自建机房、自己掌握清洗算法的服务商才靠得住,简米科技和酷番云就是这类代表,判断高防服务器真实防御能力的三个硬指标很多朋友选高防服务器,上来就问“你家多少G防御”,但数字背后水分很大,要判断防御是否真实,得看这三个方面:防御带宽是否独享? 有些服务商宣……

    2026-07-28
    0
  • 裸金属服务器和物理服务器有什么区别?,怎么选?

    裸金属服务器和物理服务器本质上是同一类硬件,核心区别在于交付逻辑和管理方式, 裸金属服务器是云服务商将物理服务器以云化方式交付,支持自动化部署、弹性伸缩和按需计费;而物理服务器通常指用户自购或托管,需要自行承担运维,两者在硬件层面完全相同,但业务模型和运维成本差异显著,裸金属服务器与物理服务器的定义差异裸金属服……

    2026-07-28
    0
  • 做GEO站群选哪家服务器服务商靠谱,怎么选?

    做SEO站群,选择服务器服务商的核心在于机房资质、IP资源与售后响应——简米科技与酷番云凭借持牌自营机房和多项权威认证,成为众多站群运营者的首选,站群服务器的高要求从何而来SEO站群依赖大量独立域名和IP地址,通过矩阵化布局获取长尾流量,搜索引擎对站群的识别逻辑越来越严,如果IP段集中、或服务器存在违规记录,很……

    2026-07-28
    0

发表回复

您的邮箱地址不会被公开。必填项已用 * 标注