html5中文学习网

您的位置: 首页 > cms教程 > 帝国ecms教程 » 正文

织梦DedeCMS v5.7全文检索使用说明(sphinx) 全文检索,sphinx

[ ] 已经帮助:人解决问题

官方网站:http://www.sphinxsearch.com/RerHTML5中文学习网 - HTML5先行者学习网
官方文档:http://www.sphinxsearch.com/docs/RerHTML5中文学习网 - HTML5先行者学习网
中文支持:http://www.coreseek.cn/RerHTML5中文学习网 - HTML5先行者学习网
中文使用手册下载:http://www.coreseek.cn/uploads/pdf/sphinx_doc_zhcn_0.9.pdfRerHTML5中文学习网 - HTML5先行者学习网
中文在线手册:http://www.coreseek.cn/docs/coreseek_3.2-sphinx_0.9.9.htmlRerHTML5中文学习网 - HTML5先行者学习网

1.Windows下安装SphinxRerHTML5中文学习网 - HTML5先行者学习网
1.1.开始前的准备工作RerHTML5中文学习网 - HTML5先行者学习网
先从http://www.coreseek.cn/products/ft_down/下载Coreseek 3.2.13,这里我们就以Windows环境为例:RerHTML5中文学习网 - HTML5先行者学习网
下载后直接解压coreseek-3.2.13-win32.zip,我们这里假设解压到:D:coreseek-3.2.13-win32.这里我们需要简单了解几个目录:RerHTML5中文学习网 - HTML5先行者学习网

[D:coreseek-3.2.13-win32api]API接口目录,其中包括了php,python,ruby等操作实例,其中test_coreseek.php是一个不错的中文检索的例子.RerHTML5中文学习网 - HTML5先行者学习网

[D:****in]应用程序目录,其中包含以下几个文件RerHTML5中文学习网 - HTML5先行者学习网
    * indexer: 用于创建全文索引;RerHTML5中文学习网 - HTML5先行者学习网
    * search: 一个简单的命令行(CLI) 的测试程序,用于测试全文索引;RerHTML5中文学习网 - HTML5先行者学习网
    * searchd: 一个守护进程,其他软件可以通过这个守护进程进行全文检索;RerHTML5中文学习网 - HTML5先行者学习网
    * sphinxapi: 一系列searchd 的客户端API 库,用于流行的Web脚本开发语言(PHP, Python, Perl, Ruby, Java).RerHTML5中文学习网 - HTML5先行者学习网
    * spelldump: 一个简单的命令行工具,用于从 ispell 或 MySpell (OpenOffice内置绑定) 格式的字典中提取词条。当使用 wordforms 时可用这些词条对索引进行定制.RerHTML5中文学习网 - HTML5先行者学习网
    * indextool: 工具程序,用来转储关于索引的多项调试信息。 此工具是从版本Coreseek 3.1(Sphinx 0.9.9-rc2)开始加入的。RerHTML5中文学习网 - HTML5先行者学习网
    * mmseg: 工具程序和库,Coreseek用于提供中文分词和词典处理。RerHTML5中文学习网 - HTML5先行者学习网

[D:****etc]sphinx配置目录RerHTML5中文学习网 - HTML5先行者学习网
[D:****var]sphinx变量&索引&日志存放目录RerHTML5中文学习网 - HTML5先行者学习网

1.2.创建配置文件RerHTML5中文学习网 - HTML5先行者学习网
由于DedeCms使用的是mysql,所以我们需要来配置一个mysql的sphinx模板配置,可以复制csft_mysql.conf改名为:csft_dedecmsv57.conf,例如我们这里仅做文章的全文检索,我们需要做如下配置:RerHTML5中文学习网 - HTML5先行者学习网
先在DedeCMS中创建一个统计表,方法可以在DedeCMS后台[系统]->[SQL命令行工具]中执行下列代码:RerHTML5中文学习网 - HTML5先行者学习网
CREATE TABLE `dede_sphinx` (RerHTML5中文学习网 - HTML5先行者学习网
    `countid` int(11) unsigned NOT NULL,RerHTML5中文学习网 - HTML5先行者学习网
    `maxaid` int(11) unsigned NOT NULL,RerHTML5中文学习网 - HTML5先行者学习网
    PRIMARY KEY (`countid`)RerHTML5中文学习网 - HTML5先行者学习网
) ENGINE=MyISAM DEFAULT CHARSET=gbkRerHTML5中文学习网 - HTML5先行者学习网
这是一个sphinx内容统计表,为了适合数据量较大的情况下分批生成索引而使用的.RerHTML5中文学习网 - HTML5先行者学习网
创建完数据表后,我们对sphinx的配置文件,即csft_dedecmsv57.conf修改,内容如下,其中包含注释:RerHTML5中文学习网 - HTML5先行者学习网
--------------------------------------------------------------------------------------------RerHTML5中文学习网 - HTML5先行者学习网

#源定义RerHTML5中文学习网 - HTML5先行者学习网
source mysqlRerHTML5中文学习网 - HTML5先行者学习网
{RerHTML5中文学习网 - HTML5先行者学习网
    type                    = mysqlRerHTML5中文学习网 - HTML5先行者学习网

    # 数据库服务器基本配置信息RerHTML5中文学习网 - HTML5先行者学习网
    sql_host                = 192.168.0.103RerHTML5中文学习网 - HTML5先行者学习网
    sql_user                = dedev57RerHTML5中文学习网 - HTML5先行者学习网
    sql_pass                = dedecmsRerHTML5中文学习网 - HTML5先行者学习网
    sql_db                  = dedecmsv57gbkRerHTML5中文学习网 - HTML5先行者学习网
    sql_port                = 3306RerHTML5中文学习网 - HTML5先行者学习网
    RerHTML5中文学习网 - HTML5先行者学习网
    # 设定编码,这里我们是gbk编码,如果是utf-8,可以设置:RerHTML5中文学习网 - HTML5先行者学习网
    # sql_query_pre            = SET NAMES utf8RerHTML5中文学习网 - HTML5先行者学习网
    sql_query_pre            = SET NAMES gbkRerHTML5中文学习网 - HTML5先行者学习网
    RerHTML5中文学习网 - HTML5先行者学习网
    # 数据检索增量RerHTML5中文学习网 - HTML5先行者学习网
    sql_range_step = 1000RerHTML5中文学习网 - HTML5先行者学习网
    RerHTML5中文学习网 - HTML5先行者学习网
    #当前最新文档id数RerHTML5中文学习网 - HTML5先行者学习网
    sql_query_pre = REPLACE INTO dede_sphinx SELECT 1, MAX(id) FROM dede_archivesRerHTML5中文学习网 - HTML5先行者学习网
    RerHTML5中文学习网 - HTML5先行者学习网
    #检索条件RerHTML5中文学习网 - HTML5先行者学习网
    sql_query               = SELECT ARC.id,ARC.typeid,ARC.typeid2,ARC.sortrank,ARC.flag,ARC.channel,ARC.ismake,ARC.arcrank,ARC.click,ARC.title,ARC.shorttitle,ARC.color,ARC.writer,ARC.source,ARC.litpic,ARC.pubdate,ARC.senddate,ARC.mtype,ARC.description,ARC.badpost,ARC.goodpost,ARC.scores,ARC.lastpost,ARC.keywords,ARC.mid,ART.body FROM dede_archives AS ARC LEFT JOIN dede_addonarticle AS ART ON ARC.id = ART.aid WHERE ARC.id>=$start AND ARC.id<=$end #sql_query第一列id需为整数RerHTML5中文学习网 - HTML5先行者学习网
    #title、body作为字符串/文本字段,被全文索引RerHTML5中文学习网 - HTML5先行者学习网
    RerHTML5中文学习网 - HTML5先行者学习网
    # 获取当前最大检索idRerHTML5中文学习网 - HTML5先行者学习网
    sql_query_range  = SELECT 1,maxaid FROM dede_sphinx WHERE countid=1RerHTML5中文学习网 - HTML5先行者学习网

                                            RerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_uint             = typeid            #从SQL读取到的值必须为整数RerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_uint            = typeid2RerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_uint            = channelRerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_uint            = clickRerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_uint            = badpostRerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_uint            = goodpostRerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_uint            = scoresRerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_uint            = midRerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_timestamp  = pubdate    #从SQL读取到的值必须为整数,作为时间属性RerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_timestamp  = senddateRerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_timestamp  = lastpostRerHTML5中文学习网 - HTML5先行者学习网

    #命令行查询时,从数据库读取原始数据信息RerHTML5中文学习网 - HTML5先行者学习网
    sql_query_info            = SELECT ARC.*,ART.body FROM dede_archives AS ARC LEFT JOIN dede_addonarticle AS ART ON ARC.id = ART.aid WHERE ARC.id=$id  RerHTML5中文学习网 - HTML5先行者学习网
}RerHTML5中文学习网 - HTML5先行者学习网

source deltaRerHTML5中文学习网 - HTML5先行者学习网
{RerHTML5中文学习网 - HTML5先行者学习网
    type                    = mysqlRerHTML5中文学习网 - HTML5先行者学习网

    # 数据库服务器基本配置信息RerHTML5中文学习网 - HTML5先行者学习网
    sql_host                = 192.168.0.103RerHTML5中文学习网 - HTML5先行者学习网
    sql_user                = dedev57RerHTML5中文学习网 - HTML5先行者学习网
    sql_pass                = dedecmsRerHTML5中文学习网 - HTML5先行者学习网
    sql_db                  = dedecmsv57gbkRerHTML5中文学习网 - HTML5先行者学习网
    sql_port                = 3306RerHTML5中文学习网 - HTML5先行者学习网
    sql_query_pre            = SET NAMES gbkRerHTML5中文学习网 - HTML5先行者学习网

    # 增量索引,从最大id开始RerHTML5中文学习网 - HTML5先行者学习网
    sql_query = SELECT ARC.id,ARC.typeid,ARC.typeid2,ARC.sortrank,ARC.flag,ARC.channel,ARC.ismake,ARC.arcrank,ARC.click,ARC.title,ARC.shorttitle,ARC.color,ARC.writer,ARC.source,ARC.litpic,ARC.pubdate,ARC.senddate,ARC.mtype,ARC.description,ARC.badpost,ARC.goodpost,ARC.scores,ARC.lastpost,ARC.keywords,ARC.mid,ART.body FROM dede_archives AS ARC LEFT JOIN dede_addonarticle AS ART ON ARC.id = ART.aid WHERE ARC.id > ( SELECT maxaid FROM dede_sphinx WHERE countid=1 )RerHTML5中文学习网 - HTML5先行者学习网
    #从SQL读取到的值必须为整数RerHTML5中文学习网 - HTML5先行者学习网
    RerHTML5中文学习网 - HTML5先行者学习网
    sql_query_post = REPLACE INTO dede_sphinx SELECT 1, MAX(id) FROM dede_archivesRerHTML5中文学习网 - HTML5先行者学习网
    RerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_uint             = typeid            RerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_uint            = typeid2RerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_uint            = channelRerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_uint            = clickRerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_uint            = badpostRerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_uint            = goodpostRerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_uint            = scoresRerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_uint            = midRerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_timestamp  = pubdate    #从SQL读取到的值必须为整数,作为时间属性RerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_timestamp  = senddateRerHTML5中文学习网 - HTML5先行者学习网
    sql_attr_timestamp  = lastpostRerHTML5中文学习网 - HTML5先行者学习网

    #命令行查询时,从数据库读取原始数据信息RerHTML5中文学习网 - HTML5先行者学习网
    sql_query_info            = SELECT ARC.*,ART.body FROM dede_archives AS ARC LEFT JOIN dede_addonarticle AS ART ON ARC.id = ART.aid WHERE ARC.id=$id  RerHTML5中文学习网 - HTML5先行者学习网
}RerHTML5中文学习网 - HTML5先行者学习网

#index定义RerHTML5中文学习网 - HTML5先行者学习网
index mysqlRerHTML5中文学习网 - HTML5先行者学习网
{RerHTML5中文学习网 - HTML5先行者学习网
    source            = mysql             #对应的source名称RerHTML5中文学习网 - HTML5先行者学习网
    path            = D:/coreseek-3.2.13-win32/var/data/mysqlRerHTML5中文学习网 - HTML5先行者学习网
    docinfo            = externRerHTML5中文学习网 - HTML5先行者学习网
    mlock            = 0RerHTML5中文学习网 - HTML5先行者学习网
    morphology        = noneRerHTML5中文学习网 - HTML5先行者学习网
    min_word_len        = 1RerHTML5中文学习网 - HTML5先行者学习网
    html_strip                = 0RerHTML5中文学习网 - HTML5先行者学习网
    #charset_dictpath = /usr/local/mmseg3/etc/    #BSD、Linux环境下设置,/符号结尾RerHTML5中文学习网 - HTML5先行者学习网
    charset_dictpath = D:/coreseek-3.2.13-win32/etc/                        #Windows环境下设置,/符号结尾RerHTML5中文学习网 - HTML5先行者学习网
    charset_type        = zh_cn.gbkRerHTML5中文学习网 - HTML5先行者学习网
}RerHTML5中文学习网 - HTML5先行者学习网

index delta : mysqlRerHTML5中文学习网 - HTML5先行者学习网
{RerHTML5中文学习网 - HTML5先行者学习网
    min_word_len        = 1RerHTML5中文学习网 - HTML5先行者学习网
    source = deltaRerHTML5中文学习网 - HTML5先行者学习网
    path            = D:/coreseek-3.2.13-win32/var/data/delta.newRerHTML5中文学习网 - HTML5先行者学习网
}RerHTML5中文学习网 - HTML5先行者学习网

#全局index定义RerHTML5中文学习网 - HTML5先行者学习网
indexerRerHTML5中文学习网 - HTML5先行者学习网
{RerHTML5中文学习网 - HTML5先行者学习网
    mem_limit            = 128MRerHTML5中文学习网 - HTML5先行者学习网
}RerHTML5中文学习网 - HTML5先行者学习网

#searchd服务定义RerHTML5中文学习网 - HTML5先行者学习网
searchdRerHTML5中文学习网 - HTML5先行者学习网
{RerHTML5中文学习网 - HTML5先行者学习网
    listen                  =   9312RerHTML5中文学习网 - HTML5先行者学习网
    read_timeout        = 5RerHTML5中文学习网 - HTML5先行者学习网
    max_children        = 30RerHTML5中文学习网 - HTML5先行者学习网
    max_matches            = 1000RerHTML5中文学习网 - HTML5先行者学习网
    seamless_rotate        = 0RerHTML5中文学习网 - HTML5先行者学习网
    preopen_indexes        = 0RerHTML5中文学习网 - HTML5先行者学习网
    unlink_old            = 1RerHTML5中文学习网 - HTML5先行者学习网
    pid_file = D:/coreseek-3.2.13-win32/var/log/searchd_mysql.pidRerHTML5中文学习网 - HTML5先行者学习网
    log = D:/coreseek-3.2.13-win32/var/log/searchd_mysql.logRerHTML5中文学习网 - HTML5先行者学习网
    query_log = D:/coreseek-3.2.13-win32/var/log/query_mysql.logRerHTML5中文学习网 - HTML5先行者学习网
}RerHTML5中文学习网 - HTML5先行者学习网

-------------------------------------------------------------------------------------------------------RerHTML5中文学习网 - HTML5先行者学习网

1.3.建立索引RerHTML5中文学习网 - HTML5先行者学习网
配置完成后,我们要先建立索引,在开始菜单中打开[运行],输入"cmd",确认后打开命令行.输入下列代码:RerHTML5中文学习网 - HTML5先行者学习网

d:&cd D:coreseek-3.2.13-win32inRerHTML5中文学习网 - HTML5先行者学习网

先切换到sphinx的bin目录,然后再执行:RerHTML5中文学习网 - HTML5先行者学习网

indexer.exe -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.conf mysql --rotateRerHTML5中文学习网 - HTML5先行者学习网

这个时候sphinx开始构建索引,如果数据量比较大,这个时间可能比较长,需要耐心等待(如图1).RerHTML5中文学习网 - HTML5先行者学习网

RerHTML5中文学习网 - HTML5先行者学习网
RerHTML5中文学习网 - HTML5先行者学习网

然后再创建下增量索引,使用下列命令:RerHTML5中文学习网 - HTML5先行者学习网
indexer.exe -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.conf delta --rotateRerHTML5中文学习网 - HTML5先行者学习网

1.4.测试检索是否正常RerHTML5中文学习网 - HTML5先行者学习网
建立完索引之后我们来检测下是否能够正常搜索到匹配内容,可以继续在cmd中输入下列命令:RerHTML5中文学习网 - HTML5先行者学习网

search.exe -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.conf dedecmsRerHTML5中文学习网 - HTML5先行者学习网

如果能够正常返回数据(如图2),则说明已经成功建立索引.RerHTML5中文学习网 - HTML5先行者学习网

RerHTML5中文学习网 - HTML5先行者学习网
RerHTML5中文学习网 - HTML5先行者学习网

2.结合DedeCMS程序使用sphinxRerHTML5中文学习网 - HTML5先行者学习网
2.1.开启sphinx服务RerHTML5中文学习网 - HTML5先行者学习网
在上面的步骤中我们已经成功生成了索引,接下来为了能够使用客户端调用则需要开启sphinx服务.RerHTML5中文学习网 - HTML5先行者学习网
可以直接在cmd中执行:RerHTML5中文学习网 - HTML5先行者学习网
searchd.exe -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.confRerHTML5中文学习网 - HTML5先行者学习网
这样我们就开启了sphinx服务(如图3),我们可以写一个简单的例子进行测试:RerHTML5中文学习网 - HTML5先行者学习网

RerHTML5中文学习网 - HTML5先行者学习网
RerHTML5中文学习网 - HTML5先行者学习网

sphinx_test.phpRerHTML5中文学习网 - HTML5先行者学习网
--------------------------------------------------------------------------------------------------------RerHTML5中文学习网 - HTML5先行者学习网
<?phpRerHTML5中文学习网 - HTML5先行者学习网
set_time_limit(0);RerHTML5中文学习网 - HTML5先行者学习网
require_once (dirname(__FILE__) . "/include/common.inc.php");RerHTML5中文学习网 - HTML5先行者学习网
$sphinx = new SphinxClient;RerHTML5中文学习网 - HTML5先行者学习网

$mode = SPH_MATCH_ANY;            //匹配模式RerHTML5中文学习网 - HTML5先行者学习网
$host = "localhost";            //服务ipRerHTML5中文学习网 - HTML5先行者学习网
$port = 9312;    //服务端口RerHTML5中文学习网 - HTML5先行者学习网
        RerHTML5中文学习网 - HTML5先行者学习网
$sphinx->SetServer($host, $port);RerHTML5中文学习网 - HTML5先行者学习网
$sphinx->SetArrayResult(true);RerHTML5中文学习网 - HTML5先行者学习网
$sphinx->SetMatchMode($mode);RerHTML5中文学习网 - HTML5先行者学习网

$res = $sphinx->Query('织梦内容管理系统');RerHTML5中文学习网 - HTML5先行者学习网

//var_dump($sphinx);RerHTML5中文学习网 - HTML5先行者学习网
//var_dump($res);RerHTML5中文学习网 - HTML5先行者学习网
$total = count($res['matches']);RerHTML5中文学习网 - HTML5先行者学习网
for($i=0; $i < $total; $i++)RerHTML5中文学习网 - HTML5先行者学习网
{RerHTML5中文学习网 - HTML5先行者学习网
    var_dump($res['matches'][$i]);RerHTML5中文学习网 - HTML5先行者学习网
}RerHTML5中文学习网 - HTML5先行者学习网

-----------------------------------------------------------------------------------------------------RerHTML5中文学习网 - HTML5先行者学习网
执行sphinx_test.php,可以看到已经能够正常通信,并且返回了内容.RerHTML5中文学习网 - HTML5先行者学习网

RerHTML5中文学习网 - HTML5先行者学习网
RerHTML5中文学习网 - HTML5先行者学习网

2.2.创建一个DedeSphinx服务RerHTML5中文学习网 - HTML5先行者学习网
上面我们通过searchd.exe开启了服务,但不好的是,我们关闭了cmd窗口就不能继续访问了,解决办法如下:RerHTML5中文学习网 - HTML5先行者学习网
同样切换到bin目录下,执行:RerHTML5中文学习网 - HTML5先行者学习网

searchd.exe --install -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.conf --servicename DedeSphinxRerHTML5中文学习网 - HTML5先行者学习网
这样就在系统中成功创建了一个DedeSphinx服务,无需再打开窗口(如图5).RerHTML5中文学习网 - HTML5先行者学习网

RerHTML5中文学习网 - HTML5先行者学习网
RerHTML5中文学习网 - HTML5先行者学习网

3.更新与维护RerHTML5中文学习网 - HTML5先行者学习网
对于全文检索的索引,我们是需要不定期生成的,如果是数据量比较小,直接使用上述生成索引的命令重建就可以,如果数据量比较大,我们则需要定义的更新全文索引.RerHTML5中文学习网 - HTML5先行者学习网

如果内容更新比较频繁,下列的命令需要每分钟被执行一次(可以创建一个脚本,使用windows计划任务定期执行)RerHTML5中文学习网 - HTML5先行者学习网

生成增量索引:RerHTML5中文学习网 - HTML5先行者学习网

indexer.exe -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.conf delta --rotateRerHTML5中文学习网 - HTML5先行者学习网

当然每一天都需要将增量索引合并到主索引mysql中去,需要执行:RerHTML5中文学习网 - HTML5先行者学习网

indexer.exe -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.conf --merge mysql delta --rotateRerHTML5中文学习网 - HTML5先行者学习网

RerHTML5中文学习网 - HTML5先行者学习网
(责任编辑:)
推荐书籍
推荐资讯
关于HTML5先行者 - 联系我们 - 广告服务 - 友情链接 - 网站地图 - 版权声明 - 人才招聘 - 帮助