1 MapReduce: Simplified Data Processing on Large Clusters | Esse é o Pelé dos papers de Big Data. Todo pipeline moderno tem uma pitada disso, mesmo que você nem saiba. Leitura obrigatória, tipo aquele gin tônica clássico que nunca decepciona. | MapReduce: Simplified Data Processing on Large Clusters | Dean & Ghemawat, 2004 | Processamento distribuído |
|---|
2 The Google File System | Explica o esqueleto por trás de meio Hadoop que a gente usa até hoje. Denso, mas vale o esforço, tipo aquela pelada no aterro debaixo de sol quente: cansa, mas você sai melhor. | The Google File System | Ghemawat, Gobioff & Leung, 2003 | Armazenamento distribuído |
|---|
3 A Relational Model of Data for Large Shared Data Banks | O avô de todo SQL que você escreve hoje. Ninguém lembra o nome do zagueiro que inventou a zona, mas todo time usa. É isso aqui, só que pra tabela. | A Relational Model of Data for Large Shared Data Banks | Codd, 1970 | Banco de dados |
|---|
4 Bigtable: A Distributed Storage System for Structured Data | Se você usa HBase ou Cassandra, tá bebendo dessa fonte sem saber. Curto, direto, sem enrolação. Tipo um bom chope: simples e cumpre a função. | Bigtable: A Distributed Storage System for Structured Data | Chang et al., 2006 | NoSQL |
|---|
5 Kafka: a Distributed Messaging System for Log Processing | Todo pipeline de dados moderno que se preze tem um Kafka rodando no meio. Esse paper é o manual de instrução do camisa 10 do streaming. | Kafka: a Distributed Messaging System for Log Processing | Kreps, Narkhede & Rao, 2011 | Streaming de dados |
|---|
6 Dynamo: Amazon's Highly Available Key-value Store | Ensina como manter o sistema de pé mesmo quando um pedaço cai, tipo time que perde o titular e ainda vence de virada. Leitura essencial pra quem gosta de dormir tranquilo com sistema em produção. | Dynamo: Amazon's Highly Available Key-value Store | DeCandia et al., 2007 | Sistemas distribuídos |
|---|
7 Attention Is All You Need | O paper que botou o Transformer em campo e mudou o jogo de vez. Hoje é raiz de quase todo modelo de IA que você usa. Tipo aquela jogada que virou padrão em todo time depois. | Attention Is All You Need | Vaswani et al., 2017 | Machine Learning |
|---|
8 The Log-Structured Merge-Tree (LSM-Tree) | Se seu banco escreve rápido, provavelmente tem um LSM-Tree trabalhando por baixo dos panos. Técnico, mas fundamental. Não é o drink mais bonito do cardápio, mas segura a resenha toda. | The Log-Structured Merge-Tree (LSM-Tree) | O'Neil et al., 1996 | Estruturas de dados |
|---|
9 Random Forests | Simples, robusto e funciona bem quase sempre, tipo aquele lateral raça que não brilha mas nunca te deixa na mão. Ótimo ponto de partida antes de sair testando modelo mais complicado por aí. | Random Forests | Breiman, 2001 | Machine Learning |
|---|