發表文章

目前顯示的是有「crawl」標籤的文章

using R XML package

R crawl test library ( XML ) library ( stringr ) totalfile = NULL for ( i in 1 : 247 ){ url = paste0 ( "http://www.0933.me/user/40733/share/p/" , i , ".html" ) x = readHTMLList ( url )[[ 3 ]] la = str_locate ( pattern = ".pdf" , x )[ , 1 ] p = str_sub ( x , 1 , la - 1 ) myfile = data.frame ( x = i , y = p ) totalfile = rbind ( totalfile , myfile )} library ( DT ) datatable ( totalfile ) Show 10 entries Search: x y 1 1 并购之路:20个世界500强企业的并购历程_12091959 2 1 圆明园的“记忆遗产”样式房图档635_12802785 3 1 明清吴语词典 4 1 结晶学导论第二版_12612940 5 1 结晶学导论第二版_12612940 6 1 命好不如习惯好_11072931_哈尔滨市:哈尔滨出版社_2002_郭腾尹著_Pg196 7 1 中国近代航运史资料第一辑下册1840-1895A5.1542_80407929 8 1 成人教育心理学_10824248 9 1 中国经济昆虫志第30册膜翅目胡蜂总科_10507895 10 1 洞见世界最富创意的广告公司BBDO_12784681 Showing 1 to 10 of 4,939 entries Share Url share url http://www.0933.me/user/40733/share/p/1.html .

教你不用寫程式也能爬網路上的資料

圖片
要分析資料, 有時候需要用到網路上的資料, 這時就需要爬資料. 爬資料有很多種方式, 一般會用R 或Python 寫爬蟲程式來爬取資料. 今天教大家不用寫程式也能爬網路資料 只要用google sheets 一步就搞定. 如果我們想要知道今天 集中市場前10大進出券商淨買賣超前30名個股是那些, 一般我們都要google 去找, 或上網到某特定網站去點選查找, 如果想要紀錄分析就還要copy paste 的動作, 現在這些通通免了, 只要開啟google sheets 每天最新的資料就自動出現了~~~ 趕快來看怎麼做ㄅ…. 比如: 我們要爬取 https://www.cnyes.com/twstock/idx_main2/0000T.htm 裡的資料 開啟 google sheets 在任一cell內輸入: =IMPORTHTML("https://www.cnyes.com/twstock/idx_main2/0000T.htm","table",2) 輸入完後按enter 就完成了 存檔後, 每天一開啟這個檔案, 甚麼都不用做,最新的資料就自動show 在眼前, 是不是很方便?