Galvenā problēma, lasot csv failus no tīmekļa servera, ir tāda, ka failā izmantotais norobežotājs var nesakrist ar Python izmantoto atdalītāju. Tas var izraisīt kļūdas, mēģinot importēt datus programmā Python.
import csv
import urllib2
response = urllib2.urlopen('http://samplecsvs.s3.amazonaws.com/SalesJan2009.csv')
csv_file = csv.reader(response)
for row in csv_file:
print row
Šis kods importē csv un urllib2 moduļus. Pēc tam tas izmanto urllib2, lai atvērtu vietrādi URL “http://samplecsvs.s3.amazonaws.com/SalesJan2009.csv”. Pēc tam kods izveido mainīgo csv_file, kas ir iestatīts uz funkciju csv.reader, nododot atbildes mainīgo kā argumentu. Pēc tam kods izmanto for cilpu, lai atkārtotu katru csv_faila rindu, un izdrukā katru rindu konsolē.
CSV faili
CSV faili ir ar komatu atdalītu vērtību faili. Tos parasti izmanto datu glabāšanai tabulas formātā. CSV failus var nolasīt, izmantojot Python csv moduli.
Web un CSV padomi
Ir daži padomi darbam ar Web un CSV datiem programmā Python.
Pirmkārt, ir svarīgi saprast, ka ir divi dažādi datu veidi: teksta un binārie dati. Binārie dati sastāv no 1 un 0, savukārt teksta dati ir tikai rakstzīmju virkne.
Strādājot ar binārajiem datiem, ir svarīgi izmantot pareizos rīkus. Piemēram, pandas bibliotēku var izmantot bināro failu lasīšanai un rakstīšanai.
Otrkārt, strādājot ar CSV failiem, ir svarīgi sekot līdzi kolonnu nosaukumiem. Python ir iebūvēta funkcija split (), ko var izmantot, lai sadalītu failu atsevišķās kolonnās.
Visbeidzot, ir arī svarīgi atcerēties, ka CSV faili ir komatatdalītas vērtības (CSV). Tas nozīmē, ka katra kolonna jānorāda atsevišķā rindā.