java 调用 phantomjs-白红宇

强烈建议你试试无所不能的chatGPT，快点击我

java 调用 phantomjs

阅读量：5130 次

发布时间：2019-06-13

本文共 1969 字，大约阅读时间需要 6 分钟。

2014-11-21 13:55 2034人阅读 (2)

分类：

phantomjs（2）

日前有采集需求，当我把所有的对应页面的链接都拿到手，准备开始根据链接去采集（写爬虫爬取）对应的终端页的时候，发觉用程序获取到的数据根本没有对应的内容，可是我的浏览器看到的内容明明是有的，于是浏览器查看源代码也发觉没有，此时想起该网页应该是ajax加载的。不知道ajax的小朋友可以去学下web开发啦。

采集ajax生成的内容手段不外乎两种。一种是通过http观察加载页面时候的请求，然后我们模仿该请求去得到对应的内容，第二种则是模仿浏览器行为去渲染这个页面得到内容。我在这里决定采用第二种方式，之前一直玩webkit，不过一直要加载页面太浪费资源了，此时了解到有一个好玩的玩意phantomjs，这是个可以用命令行来操作webkit的玩意，然后也可以直接在里面用js的api去操作页面（当然，我这边比较简单就懒得用了）。

完phantomjs之后直接解压就可以使用，然后在path目录加入phantomjs的路径（以便直接在命令行就可以执行phantomjs命令）。

接下来要完成个代码，一个是用phantomjs去获取页面（采用js编写行为），一个是采用java去调用phantomjs来达到获取内容的作用，接下来直接贴代码。

[javascript]

//codes.js

system = require('system')

address = system.args[1];//获得命令行第二个参数接下来会用到

//console.log('Loading a web page');

var page = require('webpage').create();

var url = address;

//console.log(url);

page.open(url, function (status) {

//Page is loaded!

if (status !== 'success') {

console.log('Unable to post!');

} else {

//console.log(page.content);

//var title = page.evaluate(function() {

// return document.title;//示范下如何使用页面的jsapi去操作页面的 www.oicqzone.com

// });

//console.log(title);

console.log(page.content);

}

phantom.exit();

});

上述的js代码估计应该没几个看不懂的。。。

接下来贴java代码！

[java]

import org.apache.commons.io.IOUtils;

import java.io.*;

/**

* Created with IntelliJ IDEA.

* User: lsz

* Date: 14-4-22

* Time: 下午1:17

* utils for http

*/

public class HttpUtils {

public static String getAjaxCotnent(String url) throws IOException {

Runtime rt = Runtime.getRuntime();

Process p = rt.exec("phantomjs.exe c:/phantomjs/codes.js "+url);//这里我的codes.js是保存在c盘下面的phantomjs目录

InputStream is = p.getInputStream();

BufferedReader br = new BufferedReader(new InputStreamReader(is));

StringBuffer sbf = new StringBuffer();

String tmp = "";

while((tmp = br.readLine())!=null){

sbf.append(tmp);

}

//System.out.println(sbf.toString());

return sbf.toString();

}

public static void main(String[] args) throws IOException {

getAjaxCotnent("http://www.oicqzone.com");

}

}

转载于:https://www.cnblogs.com/firstdream/p/5123004.html

你可能感兴趣的文章

Vue_(组件通讯)子组件向父组件传值

STM32单片机使用注意事项

js window.open 参数设置

032. asp.netWeb用户控件之一初识用户控件并为其自定义属性

移动开发平台-应用之星app制作教程

leetcode 459. 重复的子字符串(Repeated Substring Pattern)

springboot No Identifier specified for entity的解决办法

浅谈 unix, linux, ios, android 区别和联系

51nod 1428 活动安排问题 (贪心+优先队列)

Solaris11修改主机名

latex for wordpress(一)

如何在maven工程中加载oracle驱动

Flask 系列之 SQLAlchemy

【Debug】IAR在线调试时报错，Warning: Stack pointer is setup to incorrect alignmentStack，芯片使用STM32F103ZET6...

一句话说清分布式锁，进程锁，线程锁

服务器解析请求的基本原理

[HDU3683 Gomoku]

下一代操作系统与软件

喝酒易醉，品茶养心，人生如梦，品茶悟道，何以解忧？唯有杜康！-- 愿君每日到此一游！

当前时间: 2024-11-18 20:21:20 当前IP: 13.59.183.67 联系邮箱:javaeecc@qq.com Copyright © 2020 - 2022 baihongyu.com 京ICP备2021015314号-2

强烈建议你试试无所不能的CHAT-GPT，快点击我

强烈建议你试试无所不能的CHAT-GPT，快点击我