include/splitword.class.php
(开头部分) 38KB这里只显示每个文件的开头 60 行。登录后可以解锁完整代码。
<?php
/**
* Unicode编码词典的php分词器
*
* 1、只适用于php5,必要函数 iconv
* 2、本程序是使用RMM逆向匹配算法进行分词的,词库需要特别编译,本类里提供了 MakeDict() 方法
* 3、简单操作流程: SetSource -> StartAnalysis -> Get***Result
* 4、对主词典使用特殊格式进行编码, 不需要载入词典到内存操作
*
* @version $Id: splitword.class.php 2 11:45 2011-2-14 itplato $
* @package DedeCMS.Libraries
* @copyright Copyright (c) 2007 - 2010, itplato.
* @license http://help.dedecms.com/usersguide/license.html
* @link http://www.dedecms.com
*/
//常量定义
define('_SP_', chr(0xFF).chr(0xFE));
define('UCS2', 'ucs-2be');
class SplitWord
{
//hash算法选项
var $mask_value = 0xFFFF;
//输入和输出的字符编码(只允许 utf-8、gbk/gb2312/gb18030、big5 三种类型)
var $sourceCharSet = 'utf-8';
var $targetCharSet = 'utf-8';
//生成的分词结果数据类型 1 为全部, 2为 词典词汇及单个中日韩简繁字符及英文, 3 为词典词汇及英文
var $resultType = 1;
//句子长度小于这个数值时不拆分,notSplitLen = n(个汉字) * 2 + 1
var $notSplitLen = 5;
//把英文单词全部转小写
var $toLower = FALSE;
//使用最大切分模式对二元词进行消岐
var $differMax = FALSE;
//尝试合并单字
var $unitWord = TRUE;
//初始化类时直接加载词典
var $loadInit = TRUE;
//使用热门词优先模式进行消岐
var $differFreq = FALSE;
//被转换为unicode的源字符串
var $sourceString = '';
//附加词典
var $addonDic = array();
var $addonDicFile = 'data/words_addons.dic';
//主词典
var $dicStr = '';
var $mainDic = array();
后面还有 1075 行代码,解锁后查看完整代码
24 小时内免费解锁 3 个项目,之后 1 积分/个。 规则说明
AI 解读
登录后可用,每次 10 积分,解读结果公开显示在下面。
还没有人解读过这个文件。
