本帖最后由 finder 于 2014-12-28 11:24 编辑 8 x0 R' q' F( O
7 |* r1 \ w8 q' m2 n 最近尝试一些伪原创的东西,那么第一步就是要根据策略从一定的数据源抓取信息,然后整合,替换近义词,打乱什么的,6 J8 c6 X, g; x, T- r
做的过程中,发现了一个非常不错的开源的PHP正文提取的开源程序,可以将正文内容提取出来,准确率还不错,尤其是对blog之类的,文章里的图片也没问题
& d; @! F+ L4 ?5 W) f有篇blog对这个介绍的比较详细,我就不在这里赘述了
* r7 R [0 @' J6 z3 D3 X+ d6 }: m" J4 j8 E& i/ {3 U/ O9 u
这里可以看详细的介绍以及DEMO :- http://urlshort.shuaizhu.com/1k2
复制代码 这里你可以输入一个URL进行测试:- http://urlshort.shuaizhu.com/1k3
复制代码 这里你可以直接下载程序安装到本地:- http://urlshort.shuaizhu.com/1k4
复制代码 PS:
6 ?/ V% R0 b1 L, N* E2 V1 b8 {
3 F# n1 g6 A, A% h2 p2013年09月29日17:47:27 补充
5 R) g! B' e, s
, G* ?$ v3 T, u; i3 Z
* P T; T/ ~+ y* O% H& Y7 t3 w {- }) p4 f# t) u! {
我今天发现,这个自带了HTML格式预览和json结构返回2种功能,之前没有仔细读readme,也没仔细看代码
4 V* d: q; p [$ V# m2 K( [( a- e' v
6 b" T3 k9 H" z ^( m, A% P$ R% g7 h) l+ u9 c: g
只需要在调用的url中加上 &type=json 即可以json格式返回提取的正文/标题/url !!!
2 _7 |- y) P6 G' F! V* D3 F8 \3 [! }, m( m7 r: B
4 f s! ^) R7 V, H
|