PHP改进计算字符串相似度的函数similar_text()、levenshtein()
2015-01-24信息快讯网
PHP 原生的similar_text()函数、levenshtein()函数对中文汉字支持不好,我自己写了一个,测试使用正常,推荐给大家,如果有什么问题,请留言
similar_text()中文汉字版
<?php //拆分字符串 function split_str($str) { preg_match_all("/./u", $str, $arr); return $arr[0]; } //相似度检测 function similar_text_cn($str1, $str2) { $arr_1 = array_unique(split_str($str1)); $arr_2 = array_unique(split_str($str2)); $similarity = count($arr_2) - count(array_diff($arr_2, $arr_1)); return $similarity; }
levenshtein()中文汉字版
<?php //拆分字符串 function mbStringToArray($string, $encoding = 'UTF-8') { $arrayResult = array(); while ($iLen = mb_strlen($string, $encoding)) { array_push($arrayResult, mb_substr($string, 0, 1, $encoding)); $string = mb_substr($string, 1, $iLen, $encoding); } return $arrayResult; } //编辑距离 function levenshtein_cn($str1, $str2, $costReplace = 1, $encoding = 'UTF-8') { $count_same_letter = 0; $d = array(); $mb_len1 = mb_strlen($str1, $encoding); $mb_len2 = mb_strlen($str2, $encoding); $mb_str1 = mbStringToArray($str1, $encoding); $mb_str2 = mbStringToArray($str2, $encoding); for ($i1 = 0; $i1 <= $mb_len1; $i1++) { $d[$i1] = array(); $d[$i1][0] = $i1; } for ($i2 = 0; $i2 <= $mb_len2; $i2++) { $d[0][$i2] = $i2; } for ($i1 = 1; $i1 <= $mb_len1; $i1++) { for ($i2 = 1; $i2 <= $mb_len2; $i2++) { // $cost = ($str1[$i1 - 1] == $str2[$i2 - 1]) ? 0 : 1; if ($mb_str1[$i1 - 1] === $mb_str2[$i2 - 1]) { $cost = 0; $count_same_letter++; } else { $cost = $costReplace; //替换 } $d[$i1][$i2] = min($d[$i1 - 1][$i2] + 1, //插入 $d[$i1][$i2 - 1] + 1, //删除 $d[$i1 - 1][$i2 - 1] + $cost); } } return $d[$mb_len1][$mb_len2]; //return array('distance' => $d[$mb_len1][$mb_len2], 'count_same_letter' => $count_same_letter); }
最长公共子序列LCS()
<?php //最长公共子序列英文版 function LCS_en($str_1, $str_2) { $len_1 = strlen($str_1); $len_2 = strlen($str_2); $len = $len_1 > $len_2 ? $len_1 : $len_2; $dp = array(); for ($i = 0; $i <= $len; $i++) { $dp[$i] = array(); $dp[$i][0] = 0; $dp[0][$i] = 0; } for ($i = 1; $i <= $len_1; $i++) { for ($j = 1; $j <= $len_2; $j++) { if ($str_1[$i - 1] == $str_2[$j - 1]) { $dp[$i][$j] = $dp[$i - 1][$j - 1] + 1; } else { $dp[$i][$j] = $dp[$i - 1][$j] > $dp[$i][$j - 1] ? $dp[$i - 1][$j] : $dp[$i][$j - 1]; } } } return $dp[$len_1][$len_2]; } //拆分字符串 function mbStringToArray($string, $encoding = 'UTF-8') { $arrayResult = array(); while ($iLen = mb_strlen($string, $encoding)) { array_push($arrayResult, mb_substr($string, 0, 1, $encoding)); $string = mb_substr($string, 1, $iLen, $encoding); } return $arrayResult; } //最长公共子序列中文版 function LCS_cn($str1, $str2, $encoding = 'UTF-8') { $mb_len1 = mb_strlen($str1, $encoding); $mb_len2 = mb_strlen($str2, $encoding); $mb_str1 = mbStringToArray($str1, $encoding); $mb_str2 = mbStringToArray($str2, $encoding); $len = $mb_len1 > $mb_len2 ? $mb_len1 : $mb_len2; $dp = array(); for ($i = 0; $i <= $len; $i++) { $dp[$i] = array(); $dp[$i][0] = 0; $dp[0][$i] = 0; } for ($i = 1; $i <= $mb_len1; $i++) { for ($j = 1; $j <= $mb_len2; $j++) { if ($mb_str1[$i - 1] == $mb_str2[$j - 1]) { $dp[$i][$j] = $dp[$i - 1][$j - 1] + 1; } else { $dp[$i][$j] = $dp[$i - 1][$j] > $dp[$i][$j - 1] ? $dp[$i - 1][$j] : $dp[$i][$j - 1]; } } } return $dp[$mb_len1][$mb_len2]; }
php在linux下检测mysql同步状态的方法
将FCKeditor导入PHP+SMARTY的实现方法
ThinkPHP 404页面的设置方法
THINKPHP内容分页代码分享
ucenter通信原理分析
linux中cd命令使用详解
Zend Guard使用指南及问题处理
PHP中使用CURL获取页面title例子
PHP中使用SimpleXML检查XML文件结构实例
php中$_POST与php://input的区别实例分析
php中fsockopen用法实例
php使用google地图应用实例
php实现监控varnish缓存服务器的状态
php连接oracle数据库及查询数据的方法
为PHP5.4开启Zend OPCode缓存
PHP连接MSSQL时nvarchar字段长度被截断为255的解决方法
腾讯微博提示missing parameter errorcode 102 错误的解决方法
CentOS6.5 编译安装lnmp环境
php提示Failed to write session data错误的解决方法
CI框架学习笔记(二) -入口文件index.php
CI框架学习笔记(一) - 环境安装、基本术语和框架流程
Linux下PHP加速器APC的安装与配置笔记
Linux下安装PHP MSSQL扩展教程
Windows下的PHP安装pear教程
Windows下安装PHP单元测试环境PHPUnit图文教程
自己写的兼容低于PHP 5.5版本的array_column()函数
使用PHPMailer实现邮件发送代码分享
ThinkPHP整合百度Ueditor图文教程
php的ZipArchive类用法实例
php获取textarea的值并处理回车换行的方法
跟我学Laravel之视图 & Response
Linux下安装oracle客户端并配置php5.3
PHP依赖倒置(Dependency Injection)代码实例
php json_encode()函数返回json数据实例代码
PHP5.3安装Zend Guard Loader图文教程
php中json_encode UTF-8中文乱码的更好解决方法
PHP错误Warning: Cannot modify header information - headers already sent by解决方法
PHP中file_get_contents高用法实例
安装ImageMagick出现error while loading shared libraries的解决方法
PHP实现自动登入google play下载app report的方法