通过C#语言.net winform框架实现的网络爬虫软件,网页大数据抓取工具。
抓取基金公司详细信息,采集基金持股详细数据,然后进行汇总分析统计
根据淘宝商品链接,抓取该商品的主图(一般有5张主图)和详情图(目前淘宝商品详情基本都是由图片组成)。抓取后,可批量下载所有的主图和详情图,用于借鉴。
用winform通过正则表达式抓取百度新闻、搜狗新闻、360搜索新闻,用于竞争对手监控和本公司舆情监控;本程序可以在服务器设置任务计划,每天服务器自动运行
抓取生物信息工具源码源码描述:源码开发环境是win7,64位,vs2012这是一个国外的生物信息网站,这个代码可以抓取所有的细菌信息http://www.catalogueoflife.org/http://www.catalogueoflife.org/col/browse/classification/抓取的数据自动保存到txt文件里。
FZL抓取网页数据示例源码源码描述:网页信息的获取分为两个阶段:1知道目标网页和相关参数,并获取网页的源码2将获取到的源码抽取出我们需要的信息,并转换成c#对象在Demo中的HttpHelper.cs文件下的类的职责就是设定目标网页地址和相关参数,该类是在网上找到的,据说可以无视cookie、证书等验证,很牛,推荐小伙伴们使用,所以,第一个目标是比较容易能够完成的难点在于第二个目标,我们如何抓取html源码(json数据)中的有效信息并转换成我们需要的c#对象呢?Demo中获取的是json数据,然后用正则抓出了其中的一部分,再转换成一个实体类的列表。Demo中的AsyncRegexHelper是异步的正则匹配帮助类,在使用正则匹配的过程中,经常遇到无限回溯的问题,使用这个帮助类可以异步地执行匹配并且有一个超时时间。现在碰到的问题是正则匹配比较不靠谱,难度较大且不易扩展,目前打算想用HtmlAgilityPack来进行数据的匹配,希望伙伴们能指点下,谢谢大家。
