ato de buscar os seus dados, que podem estar disponíveis em formatos diferentes. Os formatos mais bem aceitos atualmente são .csv, e JSON; pois facilitam muito a manipulação posterior dos dados. Porém nem sempre os seus dados estarão disponíveis em um formato que facilite o seu trabalho. Na maioria das vezes eles estarão em um .pdf ou em uma página .html e por isso você vai precisar de técnicas de crawling e scraping para obter seus dados.
web você geralmente utiliza técnicas de crawling e scraping com ajuda das bibliotecas scrapy e beautifulsoup4. Para a obtenção dos dados a partir de um documento não convencional você acaba fazendo um parser utilizando padrões e regex, mas isso é bem chato e demorado. E é para resolver esse problema que vem um pacote chamado rows. Ele serve para a conversão da maioria dos formatos não convencionais para um .csv
n i c f o i u m n a v i o d e passageiros britânico operado pela White Star Line e foi pensado para ser o navio mais luxuoso e mais seguro de sua época, gerando lendas que era supostamente “inafundável". Em 15 de Abril de 1912 , o Titanic afundou depois de colidir com um iceberg, matando 1502 dos seus 2224 passageiros e equipe.
treino (train.csv) - conjunto de teste (test.csv) Em um problema de análise e ciência dos dados você sempre divide o seu conjunto total em conjunto de treino e conjunto de teste. Isso é feito para que o seu modelo não seja enviesado e não acabe decorando dados.
Utilizando só if’s e else’s vocês vão aprender a entender os dados e a manipulá- los diante a sua necessidade, antes que possamos passar para o data science de fato.
preciso ler os dados um a um para entendê-los, mas você precisa de um contexto para a sua predição. Como era aquela época? Qual o método de evasão de acidentes desse porte? Quais c a r a c t e r í s t i c a s d o s s e u s d a d o s s ã o relevantes para o problema?