Python轻量级搜索工具Whoosh的使用

PHP中文网

2023-03-06 帮助38人

本文将简单介绍Python中的一个轻量级搜索工具Whoosh，并给出相应的使用示例代码。

Whoosh简介

Whoosh由Matt Chaput创建，它一开始是一个为Houdini 3D动画软件包的在线文档提供简单、快速的搜索服务工具，之后便慢慢成为一个成熟的搜索解决工具并已开源。

Whoosh纯由Python编写而成，是一个灵活的，方便的，轻量级的搜索引擎工具，现在同时支持Python2、3，其优点如下：

Whoosh纯由Python编写而成，但很快，只需要Python环境即可，不需要编译器；
默认使用 Okapi BM25F排序算法，也支持其他排序算法；
相比于其他搜索引擎，Whoosh会创建更小的index文件；
Whoosh中的index文件编码必须是unicode;
Whoosh可以储存任意的Python对象。

Whoosh的官方介绍网站为:https://whoosh.readthedocs.io/en/latest/intro.html。相比于ElasticSearch或者Solr等成熟的搜索引擎工具，Whoosh显得更轻便，操作更简单，可以考虑在小型的搜索项目中使用。

Index & query

对于熟悉ES的人来说，搜索的两个重要的方面为mapping和query，也就是索引的构建以及查询，背后是复杂的索引储存、query解析以及排序算法等。如果你有ES方面的经验，那么，对于Whoosh是十分容易上手的。

按照笔者的理解以及Whoosh的官方文档，Whoosh的入门使用主要是index以及query。搜索引擎的强大功能之一在于它能够提供全文检索，这依赖于排序算法，比如BM25，也依赖于我们怎样储存字段。因此，index作为名词时，是指字段的索引，index作为动词时，是指建立字段的索引。而query会将我们需要查询的语句，通过排序算法，给出合理的搜索结果。

关于Whoosh的使用，在官文文档中已经给出了详细的说明，笔者在这里只给出一个简单的例子，来说明Whoosh如何能方便地提升我们的搜索体验。

示例代码

数据

本项目的示例数据为poem.csv，下图为该数据集的前十行：

学新通技术网

字段

根据数据集的特征，我们创建四个字段（fields）：title, dynasty, poet, content。创建的代码如下：

# -*- coding: utf-8 -*-
import os
from whoosh.index import create_in
from whoosh.fields import *
from jieba.analyse import ChineseAnalyzer
import json

# 创建schema, stored为True表示能够被检索
schema = Schema(title=TEXT(stored=True, analyzer=ChineseAnalyzer()),
                dynasty=ID(stored=True),
                poet=ID(stored=True),
                content=TEXT(stored=True, analyzer=ChineseAnalyzer())
                )

其中，ID只能为一个单元值，不能分割为若干个词，常用于文件路径、URL、日期、分类；

TEXT文件的文本内容，建立文本的索引并存储，支持词汇搜索；Analyzer选择结巴中文分词器。

创建索引文件

接着，我们需要创建索引文件。我们利用程序先解析poem.csv文件，并将它转化为index，写入到indexdir目录下。Python代码如下：

# 解析poem.csv文件
with open('poem.csv', 'r', encoding='utf-8') as f:
    texts = [_.strip().split(',') for _ in f.readlines() if len(_.strip().split(',')) == 4]

# 存储schema信息至indexdir目录
indexdir = 'indexdir/'
if not os.path.exists(indexdir):
    os.mkdir(indexdir)
ix = create_in(indexdir, schema)

# 按照schema定义信息，增加需要建立索引的文档
writer = ix.writer()
for i in range(1, len(texts)):
    title, dynasty, poet, content = texts[i]
    writer.add_document(title=title, dynasty=dynasty, poet=poet, content=content)
writer.commit()

index创建成功后，会生成indexdir目录，里面含有上述poem.csv数据的各个字段的索引文件。

查询

index创建成功后，我们就利用进行查询。

比如我们想要查询content中含有明月的诗句，可以输入以下代码：

# 创建一个检索器
searcher = ix.searcher()

# 检索content中出现'明月'的文档
results = searcher.find("content", "明月")
print('一共发现%d份文档。' % len(results))
for i in range(min(10, len(results))):
    print(json.dumps(results[i].fields(), ensure_ascii=False))

输出结果如下：

这篇好文章是转载于：学新通技术网

Python轻量级搜索工具Whoosh的使用

Whoosh简介

Index & query

示例代码

数据

字段

创建索引文件

查询

photoshop保存的图片太大微信发不了怎么办

《学习通》视频自动暂停处理方法

Android 11 保存文件到外部存储，并分享文件

word里面弄一个表格后上面的标题会跑到下面怎么办

photoshop扩展功能面板显示灰色怎么办

微信公众号没有声音提示怎么办

excel下划线不显示怎么办

excel打印预览压线压字怎么办

怎样阻止微信小程序自动打开

TikTok加速器哪个好免费的TK加速器推荐