Skip to content

Latest commit

 

History

History
93 lines (23 loc) · 3.04 KB

File metadata and controls

93 lines (23 loc) · 3.04 KB

PostgreSQL 一种高性能中文分词器 - friso

作者

digoal

日期

2020-03-24

标签

PostgreSQL , 分词 , friso


背景

https://github.com/lionsoul2014/friso

Friso是什么?
Friso 是使用 c 语言开发的一款开源的高性能中文分词器,使用流行的mmseg算法实现。完全基于模块化设计和实现,可以很方便的植入其他程序中, 例如:MySQL,PHP,并且提供了php5, php7, ocaml, lua的插件实现。源码无需修改就能在各种平台下编译使用,加载完 20 万的词条,内存占用稳定为 14.5M.

Friso核心功能:
中文分词:mmseg算法 + Friso 独创的优化算法,四种切分模式。
关键字提取:基于textRank算法。
关键短语提取:基于textRank算法。
关键句子提取:基于textRank算法。

您的愿望将传达给PG kernel hacker、数据库厂商等, 帮助提高数据库产品质量和功能, 说不定下一个PG版本就有您提出的功能点. 针对非常好的提议,奖励限量版PG文化衫、纪念品、贴纸、PG热门书籍等,奖品丰富,快来许愿。开不开森.

digoal's wechat