本帖最后由 finder 于 2014-12-28 11:24 编辑
3 f# R' F: _( m& x# w+ z6 I. y$ l7 b& W, }
最近尝试一些伪原创的东西,那么第一步就是要根据策略从一定的数据源抓取信息,然后整合,替换近义词,打乱什么的,; M7 e( A$ x; o" M0 J/ I
做的过程中,发现了一个非常不错的开源的PHP正文提取的开源程序,可以将正文内容提取出来,准确率还不错,尤其是对blog之类的,文章里的图片也没问题" U, C" ~" O/ B, a9 h; Y, N
有篇blog对这个介绍的比较详细,我就不在这里赘述了
8 p& W6 {% i0 r# S. S0 E- _
5 p! S' W. y$ r9 _' N- w U! ]! Q l这里可以看详细的介绍以及DEMO :- http://urlshort.shuaizhu.com/1k2
复制代码 这里你可以输入一个URL进行测试:- http://urlshort.shuaizhu.com/1k3
复制代码 这里你可以直接下载程序安装到本地:- http://urlshort.shuaizhu.com/1k4
复制代码 PS:% h7 h- n! }( n2 T3 [
1 H( o1 ]) h9 j2013年09月29日17:47:27 补充
3 q5 x |3 ?* Z" G6 H; D+ B, B& ~
o5 T; @ ]. s; ] A) [. W; m
+ f w. C) v/ I/ E. W 我今天发现,这个自带了HTML格式预览和json结构返回2种功能,之前没有仔细读readme,也没仔细看代码 : i7 g! g7 D3 m+ Z F& t, }: h8 P M
- m' @0 h4 B' A+ d- t
; u$ s0 Y' j- d! |4 k: C4 ^! p只需要在调用的url中加上 &type=json 即可以json格式返回提取的正文/标题/url !!!
: S% |" V9 n3 Y% ^
" F8 v* \7 M! ?5 k. }2 r
" D0 B# S9 x: z2 z, Z |