include/splitword.class.php

(开头部分) 38KB

这里只显示每个文件的开头 60 行。登录后可以解锁完整代码。

<?php
/**
 * Unicode编码词典的php分词器
 *
 *  1、只适用于php5,必要函数 iconv
 *  2、本程序是使用RMM逆向匹配算法进行分词的,词库需要特别编译,本类里提供了 MakeDict() 方法
 *  3、简单操作流程: SetSource -> StartAnalysis -> Get***Result
 *  4、对主词典使用特殊格式进行编码, 不需要载入词典到内存操作
 *
 * @version        $Id: splitword.class.php 2 11:45 2011-2-14 itplato $
 * @package        DedeCMS.Libraries
 * @copyright      Copyright (c) 2007 - 2010, itplato.
 * @license        http://help.dedecms.com/usersguide/license.html
 * @link           http://www.dedecms.com
 */

//常量定义
define('_SP_', chr(0xFF).chr(0xFE)); 
define('UCS2', 'ucs-2be');
class SplitWord
{
    
    //hash算法选项
    var $mask_value = 0xFFFF;
    
    //输入和输出的字符编码(只允许 utf-8、gbk/gb2312/gb18030、big5 三种类型)  
    var $sourceCharSet = 'utf-8';
    var $targetCharSet = 'utf-8';
    
    //生成的分词结果数据类型 1 为全部, 2为 词典词汇及单个中日韩简繁字符及英文, 3 为词典词汇及英文
    var $resultType = 1;
    
    //句子长度小于这个数值时不拆分,notSplitLen = n(个汉字) * 2 + 1
    var $notSplitLen = 5;
    
    //把英文单词全部转小写
    var $toLower = FALSE;
    
    //使用最大切分模式对二元词进行消岐
    var $differMax = FALSE;
    
    //尝试合并单字
    var $unitWord = TRUE;
    
    //初始化类时直接加载词典
    var $loadInit = TRUE;
    
    //使用热门词优先模式进行消岐
    var $differFreq = FALSE;
    
    //被转换为unicode的源字符串
    var $sourceString = '';
    
    //附加词典
    var $addonDic = array();
    var $addonDicFile = 'data/words_addons.dic';
    
    //主词典 
    var $dicStr = '';
    var $mainDic = array();
后面还有 1075 行代码,解锁后查看完整代码

24 小时内免费解锁 3 个项目,之后 1 积分/个。 规则说明

AI 解读

登录后可用,每次 10 积分,解读结果公开显示在下面。

还没有人解读过这个文件。