概述
MySQL原始内置的全文检索(Full-Text Search)只适用于像英文这些词语之间有天然分隔符(如空格)的自然语言,MySQL5.7.6开始引入ngram full-text parser plugin,采用手动设置词语长度的方式进行人工分词,这可以作为CJK(Chinese、Japanese、Korean)语系全文检索的手段,具体可以参考之前的使用笔记:https://blog.csdn.net/sweeper_freedoman/article/details/82847754。但手动分词最大的局限性在于分词长度完全由参数设置,是一种机械式地文本操作。与ngram同一版本,MySQL同时也引入了MeCab full-text parser plugin。“MeCab”一词取自日语“和布蕪(めかぶ)”,原意是一种深海海藻,由京都大学和日本电信电话株式会社(NTT)共同研究开发,用于将日语解析成有实际意义的词语。例如,MeCab可以将“データベース管理”(“Database Management”)分词(tokenize)为“データベース”(“Database”)和“管理”(“Management”)。除了将文本tokenize成有实际意义的单词,MeCab全文索引通常比ngram索引小,因此MeCab通常查询更快。但与ngram相比,MeCab有个缺点就是可能需要花费更多的时间进行分词。
不同于MySQL的其他插件,使用MeCab需要额外安装配置。如果使用MySQL分发的MeCab包,可以直接配置使用。具体参考官方文档:https://dev.mysql.com/doc/refman/5.7/en/fulltext-search-mecab.html。个人本地是源码安装的MySQL,编译的时候没有加进MeCab的选项,所以没办法只能重新编译安装了一遍MySQL,即cmake的时候带上“-DWITH_MECAB=system”选项。不然最后安装“libpluginmecab.so”的时候会报错文件缺失。
mysql> INSTALL PLUGIN mecab SONAME 'libpluginmecab.so';
ERROR 1126 (HY000): Can't open shared library '/usr/local/mysql/lib/plugin/libpluginmecab.so' (errno: 2 /usr/local/mysql/lib/plugin/libpluginmecab.so: cannot open shared object file: No such file or directory)
安装MeCab包括安装MeCab解析插件和MeCab字典。可以从官网下载源码编译安装:http://taku910.github.io/mecab/#download。本地源码安装MeCab字典时也出现了报错文件缺失。以下是安装记录。
tar -xzv -f mecab-0.996.tar.gz
cd mecab-0.996/ ; ls
./configure
make
make check
make install
cd ..
tar -xzv -f mecab-ipadic-2.7.0-20070801.tar.gz
cd mecab-ipadic-2.7.0-20070801 ; ls
./configure --libdir=/usr/local/lib/libmecab.so.2 --with-charset=utf-8
make
****************************这里报错了****************************
/usr/local/libexec/mecab/mecab-dict-index -d . -o . -f EUC-JP -t utf-8
/usr/local/libexec/mecab/mecab-dict-index: error while loading shared libraries: libmecab.so.2: cannot open shared object file: No such file or directory
Makefile:253: recipe for target 'matrix.bin' failed
make: *** [matrix.bin] Error 127
****************************这里报错了****************************
make clean
test -z "matrix.bin char.bin sys.dic unk.dic" || rm -f matrix.bin char.bin sys.dic unk.dic
ldconfig
./configure --with-charset=utf-8
make
make install
不过因为本地是Ubuntu系统,也可以用apt超级命令简易安装。
apt install mecab
apt install mecab-ipadic
安装完成后可以在终端命令行输入mecab命令测试一下分词情况。以下是本地输入“すもももももももものうち”后的执行输出,这个也是MeCab官网给出的示例。
root@ubuntu:~# mecab
すもももももももものうち
すもも 名詞,一般,*,*,*,*,すもも,スモモ,スモモ
も 助詞,係助詞,*,*,*,*,も,モ,モ
もも 名詞,一般,*,*,*,*,もも,モモ,モモ
も 助詞,係助詞,*,*,*,*,も,モ,モ
もも 名詞,一般,*,*,*,*,もも,モモ,モモ
の 助詞,連体化,*,*,*,*,の,ノ,ノ
うち 名詞,非自立,副詞可能,*,*,*,うち,ウチ,ウチ
EOS
接下来需要修改配置文件,包括MySQL配置文件和MeCab配置文件。
MySQL配置文件需要在[mysqld]选项组中加入MeCab配置文件“mecabrc”的路径(个人本地位于“/etc/mecabrc”)和InnoDB全文检索的最小分词长度。
[mysqld]
# Mecab relevant
loose-mecab-rc-file = /etc/mecabrc
# Fulltext search relevant
innodb_ft_min_token_size=1
MeCab配置文件主要是修改指定MeCab分词用字典,这里是注掉安装默认(注释符为“;”)然后改为“juman-utf8”。
; dicdir = /var/lib/mecab/dic/debian
dicdir = /var/lib/mecab/dic/juman-utf8
配置完成后,重启MySQL服务器,然后连接MySQL安装MySQL MeCab parser plugin。
mysql> INSTALL PLUGIN mecab SONAME 'libpluginmecab.so';
Query OK, 0 rows affected (0.03 sec)
mysql> SHOW PLUGINS;
以下是运行MySQL官方文档的分词示例。
mysql> USE test;
ERROR 1049 (42000): Unknown database 'test'
mysql>
mysql> CREATE DATABASE `test`;
Query OK, 1 row affected (0.00 sec)
mysql> USE test;
Database changed
mysql> CREATE TABLE articles (
-> id INT UNSIGNED AUTO_INCREMENT NOT NULL PRIMARY KEY,
-> title VARCHAR(200),
-> body TEXT,
-> FULLTEXT (title,body) WITH PARSER mecab
-> ) ENGINE=InnoDB CHARACTER SET utf8;
Query OK, 0 rows affected (0.10 sec)
mysql> SET NAMES utf8;
Query OK, 0 rows affected (0.00 sec)
mysql> INSERT INTO articles (title,body) VALUES
-> ('データベース管理','このチュートリアルでは、私はどのようにデータベースを管理する方法を紹介します'),
-> ('データベースアプリケーション開発','データベースアプリケーションを開発することを学ぶ');
Query OK, 2 rows affected (0.07 sec)
Records: 2 Duplicates: 0 Warnings: 0
mysql> SET GLOBAL innodb_ft_aux_table="test/articles";
Query OK, 0 rows affected (0.00 sec)
mysql> SELECT * FROM INFORMATION_SCHEMA.INNODB_FT_INDEX_CACHE ORDER BY doc_id, position;
+--------------------------------------------+--------------+-------------+-----------+--------+----------+
| WORD | FIRST_DOC_ID | LAST_DOC_ID | DOC_COUNT | DOC_ID | POSITION |
+--------------------------------------------+--------------+-------------+-----------+--------+----------+
| データベース | 2 | 2 | 1 | 2 | 0 |
| は | 2 | 2 | 1 | 2 | 9 |
| 管理 | 2 | 2 | 1 | 2 | 18 |
| を | 2 | 3 | 2 | 2 | 21 |
| この | 2 | 2 | 1 | 2 | 25 |
| チュートリアル | 2 | 2 | 1 | 2 | 31 |
| で | 2 | 2 | 1 | 2 | 52 |
| は | 2 | 2 | 1 | 2 | 55 |
| 、 | 2 | 2 | 1 | 2 | 58 |
| 私 | 2 | 2 | 1 | 2 | 61 |
| どのように | 2 | 2 | 1 | 2 | 67 |
| データベース | 2 | 2 | 1 | 2 | 82 |
| 管理 | 2 | 2 | 1 | 2 | 85 |
| を | 2 | 3 | 2 | 2 | 100 |
| する | 2 | 3 | 2 | 2 | 109 |
| 方法 | 2 | 2 | 1 | 2 | 115 |
| 紹介 | 2 | 2 | 1 | 2 | 124 |
| し | 2 | 2 | 1 | 2 | 130 |
| ます | 2 | 2 | 1 | 2 | 133 |
| データベースアプリケーション | 3 | 3 | 1 | 3 | 0 |
| を | 2 | 3 | 2 | 3 | 21 |
| 開発 | 3 | 3 | 1 | 3 | 42 |
| データベースアプリケーション | 3 | 3 | 1 | 3 | 49 |
| 開発 | 3 | 3 | 1 | 3 | 52 |
| を | 2 | 3 | 2 | 3 | 91 |
| する | 2 | 3 | 2 | 3 | 100 |
| こと | 3 | 3 | 1 | 3 | 106 |
| 学ぶ | 3 | 3 | 1 | 3 | 115 |
+--------------------------------------------+--------------+-------------+-----------+--------+----------+
28 rows in set (0.00 sec)
mysql> SELECT COUNT(*) FROM articles WHERE MATCH(title,body) AGAINST('データベース管理' IN NATURAL LANGUAGE MODE);
+----------+
| COUNT(*) |
+----------+
| 1 |
+----------+
1 row in set (0.00 sec)
mysql> SELECT COUNT(*) FROM articles WHERE MATCH(title,body) AGAINST('データベース管理' IN BOOLEAN MODE);
+----------+
| COUNT(*) |
+----------+
| 1 |
+----------+
1 row in set (0.00 sec)
mysql> SELECT COUNT(*) FROM articles WHERE MATCH(title,body) AGAINST('データベース*' IN BOOLEAN MODE);
+----------+
| COUNT(*) |
+----------+
| 2 |
+----------+
1 row in set (0.00 sec)
mysql> SELECT COUNT(*) FROM articles WHERE MATCH(title,body) AGAINST('"データベース管理"' IN BOOLEAN MODE);
+----------+
| COUNT(*) |
+----------+
| 1 |
+----------+
1 row in set (0.00 sec)
最后
以上就是紧张故事为你收集整理的MySQL全文检索fulltext日语解析插件MeCab学习笔记的全部内容,希望文章能够帮你解决MySQL全文检索fulltext日语解析插件MeCab学习笔记所遇到的程序开发问题。
如果觉得靠谱客网站的内容还不错,欢迎将靠谱客网站推荐给程序员好友。
发表评论 取消回复