本帖最后由 finder 于 2014-12-28 11:24 编辑 % @3 Y9 X! e; e2 g( p
$ k% p4 T8 y, Q% g' V* C4 P3 \8 t
最近尝试一些伪原创的东西,那么第一步就是要根据策略从一定的数据源抓取信息,然后整合,替换近义词,打乱什么的,/ Q9 s% v; e" k# n, {! G
做的过程中,发现了一个非常不错的开源的PHP正文提取的开源程序,可以将正文内容提取出来,准确率还不错,尤其是对blog之类的,文章里的图片也没问题
/ \. j6 b# P3 C( p2 L有篇blog对这个介绍的比较详细,我就不在这里赘述了
: y, ?7 B, ~4 [. i3 y
; I2 |0 G9 j% D7 q- e这里可以看详细的介绍以及DEMO :- http://urlshort.shuaizhu.com/1k2
复制代码 这里你可以输入一个URL进行测试:- http://urlshort.shuaizhu.com/1k3
复制代码 这里你可以直接下载程序安装到本地:- http://urlshort.shuaizhu.com/1k4
复制代码 PS:
- q( ]! j# C$ ?% O, }6 ~8 S
2 L' q" S% b: n5 r2013年09月29日17:47:27 补充
) J$ H, x- k! d q, c* C
7 A1 Z8 O: \2 F' |9 ]7 _- O* K9 _2 l* W8 `) _$ _1 B0 _/ i6 i
O& i0 V1 i0 K. u* o+ Y
我今天发现,这个自带了HTML格式预览和json结构返回2种功能,之前没有仔细读readme,也没仔细看代码 ' [7 q; c. M3 x% N
! _1 ]) z+ }6 R4 W+ J% |2 x9 C
& J$ F2 y4 Z" e6 o |5 g- ? l6 _只需要在调用的url中加上 &type=json 即可以json格式返回提取的正文/标题/url !!!
7 @7 F: P+ W( n# q+ ~' i8 O7 }7 E
2 @! Z9 d! t9 g% {
3 c) }2 ?$ d: t0 ~ |