curl网站开发指南

作者: 阮一峰

日期: 2011年9月 4日

我一向以为,curl只是一个编程用的函数库。

最近才发现,这个命令本身,就是一个无比有用的网站开发工具,请看我整理的它的用法。

===================================

curl网站开发指南

阮一峰 整理

curl是一种命令行工具,作用是发出网络请求,然后得到和提取数据,显示在"标准输出"(stdout)上面。

它支持多种协议,下面举例讲解如何将它用于网站开发。

一、查看网页源码

直接在curl命令后加上网址,就可以看到网页源码。我们以网址www.sina.com为例(选择该网址,主要因为它的网页代码较短):

  $ curl www.sina.com

  <!DOCTYPE HTML PUBLIC "-//IETF//DTD HTML 2.0//EN">
  <html><head>
  <title>301 Moved Permanently</title>
  </head><body>
  <h1>Moved Permanently</h1>
  <p>The document has moved <a href="http://www.sina.com.cn/">here</a>.</p>
  </body></html>

如果要把这个网页保存下来,可以使用`-o`参数,这就相当于使用wget命令了。

  $ curl -o [文件名] www.sina.com

二、自动跳转

有的网址是自动跳转的。使用`-L`参数,curl就会跳转到新的网址。

  $ curl -L www.sina.com

键入上面的命令,结果就自动跳转为www.sina.com.cn。

三、显示头信息

`-i`参数可以显示http response的头信息,连同网页代码一起。

  $ curl -i www.sina.com

  HTTP/1.0 301 Moved Permanently
  Date: Sat, 03 Sep 2011 23:44:10 GMT
  Server: Apache/2.0.54 (Unix)
  Location: http://www.sina.com.cn/
  Cache-Control: max-age=3600
  Expires: Sun, 04 Sep 2011 00:44:10 GMT
  Vary: Accept-Encoding
  Content-Length: 231
  Content-Type: text/html; charset=iso-8859-1
  Age: 3239
  X-Cache: HIT from sh201-9.sina.com.cn
  Connection: close

  <!DOCTYPE HTML PUBLIC "-//IETF//DTD HTML 2.0//EN">
  <html><head>
  <title>301 Moved Permanently</title>
  </head><body>
  <h1>Moved Permanently</h1>
  <p>The document has moved <a href="http://www.sina.com.cn/">here</a>.</p>
  </body></html>

`-I`参数则是只显示http response的头信息。

四、显示通信过程

`-v`参数可以显示一次http通信的整个过程,包括端口连接和http request头信息。

  $ curl -v www.sina.com

  * About to connect() to www.sina.com port 80 (#0)
  * Trying 61.172.201.195... connected
  * Connected to www.sina.com (61.172.201.195) port 80 (#0)
  > GET / HTTP/1.1
  > User-Agent: curl/7.21.3 (i686-pc-linux-gnu) libcurl/7.21.3 OpenSSL/0.9.8o zlib/1.2.3.4 libidn/1.18
  > Host: www.sina.com
  > Accept: */*
  >
  * HTTP 1.0, assume close after body
  < HTTP/1.0 301 Moved Permanently
  < Date: Sun, 04 Sep 2011 00:42:39 GMT
  < Server: Apache/2.0.54 (Unix)
  < Location: http://www.sina.com.cn/
  < Cache-Control: max-age=3600
  < Expires: Sun, 04 Sep 2011 01:42:39 GMT
  < Vary: Accept-Encoding
  < Content-Length: 231
  < Content-Type: text/html; charset=iso-8859-1
  < X-Cache: MISS from sh201-19.sina.com.cn
  < Connection: close
  <
  <!DOCTYPE HTML PUBLIC "-//IETF//DTD HTML 2.0//EN">
  <html><head>
  <title>301 Moved Permanently</title>
  </head><body>
  <h1>Moved Permanently</h1>
  <p>The document has moved <a href="http://www.sina.com.cn/">here</a>.</p>
  </body></html>
  * Closing connection #0

如果你觉得上面的信息还不够,那么下面的命令可以查看更详细的通信过程。

  $ curl --trace output.txt www.sina.com

或者

  $ curl --trace-ascii output.txt www.sina.com

运行后,请打开output.txt文件查看。

五、发送表单信息

发送表单信息有GET和POST两种方法。GET方法相对简单,只要把数据附在网址后面就行。

  $ curl example.com/form.cgi?data=xxx

POST方法必须把数据和网址分开,curl就要用到--data参数。

  $ curl -X POST --data "data=xxx" example.com/form.cgi

如果你的数据没有经过表单编码,还可以让curl为你编码,参数是`--data-urlencode`。

  $ curl -X POST--data-urlencode "date=April 1" example.com/form.cgi

六、HTTP动词

curl默认的HTTP动词是GET,使用`-X`参数可以支持其他动词。

  $ curl -X POST www.example.com

  $ curl -X DELETE www.example.com

七、文件上传

假定文件上传的表单是下面这样:

  <form method="POST" enctype='multipart/form-data' action="upload.cgi">
    <input type=file name=upload>
    <input type=submit name=press value="OK">
  </form>

你可以用curl这样上传文件:

  $ curl --form upload=@localfilename --form press=OK [URL]

八、Referer字段

有时你需要在http request头信息中,提供一个referer字段,表示你是从哪里跳转过来的。

  $ curl --referer http://www.example.com http://www.example.com

九、User Agent字段

这个字段是用来表示客户端的设备信息。服务器有时会根据这个字段,针对不同设备,返回不同格式的网页,比如手机版和桌面版。

iPhone4的User Agent是

  Mozilla/5.0 (iPhone; U; CPU iPhone OS 4_0 like Mac OS X; en-us) AppleWebKit/532.9 (KHTML, like Gecko) Version/4.0.5 Mobile/8A293 Safari/6531.22.7

curl可以这样模拟:

  $ curl --user-agent "[User Agent]" [URL]

十、cookie

使用`--cookie`参数,可以让curl发送cookie。

  $ curl --cookie "name=xxx" www.example.com

至于具体的cookie的值,可以从http response头信息的`Set-Cookie`字段中得到。

`-c cookie-file`可以保存服务器返回的cookie到文件,`-b cookie-file`可以使用这个文件作为cookie信息,进行后续的请求。

  $ curl -c cookies http://example.com
  $ curl -b cookies http://example.com

十一、增加头信息

有时需要在http request之中,自行增加一个头信息。`--header`参数就可以起到这个作用。

  $ curl --header "Content-Type:application/json" http://example.com

十二、HTTP认证

有些网域需要HTTP认证,这时curl需要用到`--user`参数。

  $ curl --user name:password example.com

【参考资料】

  * Using cURL to automate HTTP jobs

  * 教你学用CURL

  * 9 uses for cURL worth knowing

(完)

留言(47条)

刚刚刷新,就看见了,坐下来慢慢看

能有时间研究一些东西多好啊。可惜我等码农被项目的实现,bug修复,测试耗费的机会所有时间。悲。

能否请阮老师开辟一个针对初级用户的建站教程。我自己不懂代码和编程,但是通过运用网上的免费模板也在磕磕绊绊中建了2个网站。在建站过程中,遇到了很多初级问题,比如域名、空间、FTP等,由于身边没有这方面的专业人士,所以只有通过百度来一一解决。
昨天,我又想在网站的名字前面加个ICO标志,但是在百度上搜了很多都不理想。也就是说在IE浏览器可以显示ICO标志,但是在其他浏览器如搜狗浏览器就显示不出来了。

我一直在关注您的博客,学到了很多很有用的知识。所以在这里发一个小小的请求,可能在专业人士看来这很粗浅,但对我等小民非常有帮助。

可否把您在建站中用到的一些简单的技巧和方法分享一下呢,多谢!

引用REN的发言:

昨天,我又想在网站的名字前面加个ICO标志,但是在百度上搜了很多都不理想。也就是说在IE浏览器可以显示ICO标志,但是在其他浏览器如搜狗浏览器就显示不出来了。

favicon.ico 放在网站根目录就行了。

引用xx的发言:

favicon.ico 放在网站根目录就行了。

我放在根目录了啊,但是也看不到哦。在IE里可以看到,但是在搜狗浏览器就看不到了。百度里能搜到的方法我都试了,还是不行。

引用REN的发言:

我放在根目录了啊,但是也看不到哦。在IE里可以看到,但是在搜狗浏览器就看不到了。百度里能搜到的方法我都试了,还是不行。

清理临时文件,删除cookie试试

MV 也要截图放上来,curl 也要从 man 里摘一部分放上来,这经济学博士还是去应聘《电脑爱好者》当编辑吧

引用REN的发言:

昨天,我又想在网站的名字前面加个ICO标志,但是在百度上搜了很多都不理想。

还是不行?试试这里:http://zh.wikipedia.org/wiki/Favicon

引用Platinum的发言:

MV 也要截图放上来,curl 也要从 man 里摘一部分放上来,这经济学博士还是去应聘《电脑爱好者》当编辑吧

别人是在做知识分享,很多人不知道这么高级的用法,您知道了,怎么不见您写出来啊?也用不着您在这里酸溜溜的拿人家世界经济学博士学位说事,感情您还不是博士呢。 知识在于分享。您老是不永远不明白的。请走远些吧。

博主的文章都很不错.值得一看.
请问有没用新浪微博来传播一下.
别说博主不屑这么做.我想博主还不至于这么清高吧.

感谢您的推荐。上次下载了dev c++编译的版本老是编译不成功,就扔在一边了。这次直接下exe了~

> -I参数则是只显示http response的头信息。
严格说不是“只显示”,curl会发出HEAD请求而不是GET。

head里面加入这个代码,然后把ico文件放入images目录下,你懂的

各位朋友推荐的办法俺都试过了,可是还是老样子

引用麦克的发言:

博主的文章都很不错.值得一看.
请问有没用新浪微博来传播一下.
别说博主不屑这么做.我想博主还不至于这么清高吧.

这不是清不清高的问题,而是个人自由的问题。

favicon我也折腾了半天,在后台可以显示,但进入主页就硬是出不来,不知道怎么回事

php-curl这个库也不错,可以作为基础来实现php的多线程

阮兄的文章越来越没有营养了,有点为了写博客而写博客的感觉,希望您能够沉下心来多分享点更有深度多文章

引用Andy的发言:

阮兄的文章越来越没有营养了,有点为了写博客而写博客的感觉,希望您能够沉下心来多分享点更有深度多文章

我看是大家太浮躁了吧,这文章怎么就没有营养了?这些选项你都使用过吗?我是没有都用过。我觉得很有意思。

你想要什么“营养”呢?

我只看到了一群酸溜溜的人,从小白慢慢成长为老鸟后,表现出的对前辈分享基础知识时的各种不屑。

引用cc的发言:

我只看到了一群酸溜溜的人,从小白慢慢成长为老鸟后,表现出的对前辈分享基础知识时的各种不屑。

嗯,不能同意你更多(can't agree you more)

写的非常好.
我还是试着用过telnet模拟这些过程, 比curl还有意思.

喜欢这种简要的文章,就像给某方面的知识做index,在某些可能用到的场合能很快记起来
如果要了解详尽点,也可以通过参考文献过去

从行文排版也能窥得阮兄的代码风格哦,赞啊

请问老师,我怎么用Curl访问https的网站呢?谢谢。。。

这个比较实用,不过curl不是什么时候都好用的!

曾认为,有wget,何必curl。这时候看来,cURL真的有必要

CURL是Linux下很强大的工具,跟wget不本质一样的

引用antonio的发言:

favicon我也折腾了半天,在后台可以显示,但进入主页就硬是出不来,不知道怎么回事

favicon显示不出来可能是因为 MIME TYPE 的问题,可以设置一下.ico的 MIME TYPE

引用keke的发言:

请问老师,我怎么用Curl访问https的网站呢?谢谢。。。

我也想知道看看这个网站的api就是这样 https://stipple.com/api_docs/v1#users

原来curl是这么有用的工具
一直在Window下都没用过
还好装了Git的Bash,试用了一下超级好用

引用Chaos的发言:

favicon显示不出来可能是因为 MIME TYPE 的问题,可以设置一下.ico的 MIME TYPE

favicon.ico这个图片得是16*16像素,否则在IE下显示不出来

好文章,感谢阮老师分享

感谢阮老师, 正在寻找curl教程

引用Platinum的发言:

MV 也要截图放上来,curl 也要从 man 里摘一部分放上来,这经济学博士还是去应聘《电脑爱好者》当编辑吧

说这话是什么心态。。。

简单明了 阮老师一贯的风格,赞~

阮老师,请问一下 curl -X GET -H "Content-Type:application/json" -d '{"contents":{"msg":"hello"}' 这样的写法符合规范吗,php 应该怎样去获取到-d的内容呢?

curl -help

一键搞定!

curl发送POST请求

--------------------------------------
curl -d "" url
curl -X "POST" --data "" url
--------------------------------------

引用Platinum的发言:

MV 也要截图放上来,curl 也要从 man 里摘一部分放上来,这经济学博士还是去应聘《电脑爱好者》当编辑吧

不见得你man些出来。。。

这篇正好配合阮老师的 RESTful API 设计指南,做测试用。
加上 理解 REST 架构,正好是一个 REST 从理论到实践的全家桶。

Hi 阮老师,我在使用curl命令下载图片时,遇见下载下来的图片无法打开(显示损坏,文件大小正确。每次都是这样,和图片地址、图片文件本身无关)。具体命令如下:
curl -p -i -o temp.jpg https://lorempixel.com/1280/320/nature/1/

请问一下阮老师有没有碰到过相同问题?

@stokey:

因为你加了-i选项,把http头部信息写进了图片文件,自然无法打开图片。

为啥我用windows自带的powershell可以执行curl -o thatpage.html http://www.netscape.com/,但是用cmd就会报错:curl (7) Failed to connect to www.netscape.com port 80: Timed out

正好最近学elasticsearch发现需要有一点点curl知识作为前置,在这里找到了快速入门资料,写的很好很清晰。感谢~

引用Andy的发言:

阮兄的文章越来越没有营养了,有点为了写博客而写博客的感觉,希望您能够沉下心来多分享点更有深度多文章

有深度建议去看书,网上资料得特点就是杂乱,有时候找到一个排版清晰,言简意骇得文章都难

引用SR1的发言:

原来curl是这么有用的工具
一直在Window下都没用过
还好装了Git的Bash,试用了一下超级好用

跨越时空,我的window已经可以直接使用curl了

我要发表看法

«-必填

«-必填,不公开

«-我信任你,不会填写广告链接