Papers every data engineer should read
List · 9 items

Papers every data engineer should read

Caio AndradeCaio Andrade · 1 like
9 items
ListAcademic Papers · Entertainment

Papers every data engineer should read

Caio Andrade
@algoritmocaio
9Items
1Likes

Não é lista de faculdade, é boteco mesmo: paper bom é tipo gol de placa, você reconhece de longe. Separei aqui os artigos que mudaram minha visão de dados, do jeito que eu conto pra galera na mesa depois do jazz em Botafogo. Cada um tem seu momento, tipo drink certo pra ocasião certa. Bora ler com calma e sem pressa, que ciência boa não se lê de goleada.

The list

Rank
Papers every data engineer should read — 9 items
NameCommentTítuloAutores/AnoÁrea
1MapReduce: Simplified Data Processing on Large ClustersEsse é o Pelé dos papers de Big Data. Todo pipeline moderno tem uma pitada disso, mesmo que você nem saiba. Leitura obrigatória, tipo aquele gin tônica clássico que nunca decepciona.MapReduce: Simplified Data Processing on Large ClustersDean & Ghemawat, 2004Processamento distribuído
2The Google File SystemExplica o esqueleto por trás de meio Hadoop que a gente usa até hoje. Denso, mas vale o esforço, tipo aquela pelada no aterro debaixo de sol quente: cansa, mas você sai melhor.The Google File SystemGhemawat, Gobioff & Leung, 2003Armazenamento distribuído
3A Relational Model of Data for Large Shared Data BanksO avô de todo SQL que você escreve hoje. Ninguém lembra o nome do zagueiro que inventou a zona, mas todo time usa. É isso aqui, só que pra tabela.A Relational Model of Data for Large Shared Data BanksCodd, 1970Banco de dados
4Bigtable: A Distributed Storage System for Structured DataSe você usa HBase ou Cassandra, tá bebendo dessa fonte sem saber. Curto, direto, sem enrolação. Tipo um bom chope: simples e cumpre a função.Bigtable: A Distributed Storage System for Structured DataChang et al., 2006NoSQL
5Kafka: a Distributed Messaging System for Log ProcessingTodo pipeline de dados moderno que se preze tem um Kafka rodando no meio. Esse paper é o manual de instrução do camisa 10 do streaming.Kafka: a Distributed Messaging System for Log ProcessingKreps, Narkhede & Rao, 2011Streaming de dados
6Dynamo: Amazon's Highly Available Key-value StoreEnsina como manter o sistema de pé mesmo quando um pedaço cai, tipo time que perde o titular e ainda vence de virada. Leitura essencial pra quem gosta de dormir tranquilo com sistema em produção.Dynamo: Amazon's Highly Available Key-value StoreDeCandia et al., 2007Sistemas distribuídos
7Attention Is All You NeedO paper que botou o Transformer em campo e mudou o jogo de vez. Hoje é raiz de quase todo modelo de IA que você usa. Tipo aquela jogada que virou padrão em todo time depois.Attention Is All You NeedVaswani et al., 2017Machine Learning
8The Log-Structured Merge-Tree (LSM-Tree)Se seu banco escreve rápido, provavelmente tem um LSM-Tree trabalhando por baixo dos panos. Técnico, mas fundamental. Não é o drink mais bonito do cardápio, mas segura a resenha toda.The Log-Structured Merge-Tree (LSM-Tree)O'Neil et al., 1996Estruturas de dados
9Random ForestsSimples, robusto e funciona bem quase sempre, tipo aquele lateral raça que não brilha mas nunca te deixa na mão. Ótimo ponto de partida antes de sair testando modelo mais complicado por aí.Random ForestsBreiman, 2001Machine Learning