1 Attention Is All You Need | 2017 | Vaswani et al. | Deep learning / NLP | Introduz o Transformer usando só mecanismos de atenção, sem recorrência ou convoluções. | Virou a base de quase todo modelo grande de linguagem, de tradução a chatbots. | Penso nele sempre que alguém fala de embeddings, context window ou fine-tune de modelo grande. | Alta se você nunca viu atenção; média se já tá acostumado com redes neurais. | Tipo aquele técnico que chega mudando o esquema tático do time inteiro e depois parece óbvio que tinha que ser assim. |
|---|
2 The Google File System | 2003 | Ghemawat, Gobioff, Leung | Sistemas distribuídos / armazenamento | Descrever um sistema de arquivos distribuído tolerante a falhas, otimizado pra arquivos grandes e workloads de leitura/gravação sequencial. | Inspirou HDFS e boa parte do jeito moderno de pensar data lake em escala absurda. | Toda vez que mexo com cluster de dados grande, lembro que por trás ainda tem um “GFS espiritual” cuidando dos blocos. | Média, bem escrita e mais conceitual que cheia de fórmula. | É tipo ver o desenho tático da seleção de 2002 e reconhecer metade dos padrões que os times copiam até hoje. |
|---|
3 MapReduce: Simplified Data Processing on Large Clusters | 2004 | Dean, Ghemawat | Processamento distribuído | Abstrair processamento massivo em dois passos, map e reduce, escondendo a complexidade de paralelismo e falhas. | Virou base conceitual pra Hadoop e pro jeito batch de pensar ETL em big data. | Mesmo escrevendo Spark ou SQL, ainda raciocino em termos de mapeia, baralha, agrega. | Baixa pra média; exemplos claros, mas tem bastante detalhe de infra. | Esse é aquele 4-4-2 clássico que talvez você nem use mais puro, mas ensinou o que é ocupar espaço no campo. |
|---|
4 The Unix Time-Sharing System | 1974 | Ritchie, Thompson | Sistemas operacionais | Apresenta a filosofia do Unix, com processos leves, sistema de arquivos simples e ferramentas que se combinam. | Me fez entender por que até hoje muita ferramenta de dados respira esse jeitão Unix de “faça uma coisa bem e componha”. | Sempre que encadeio comandos em shell ou monto pipelines simples em vez de mega-monolitos. | Média; linguagem antiga, mas ideias bem diretas. | É como rever videotape em preto e branco de um clássico no Maraca e perceber que muita jogada atual nasceu ali. |
|---|
5 Datalog and Recursive Query Processing | anos 1980 (artigos clássicos vários) | Bancilhon, Maier, Ullman e outros | Bancos de dados / lógica | Usar uma linguagem lógica declarativa (Datalog) pra definir consultas recursivas em bancos de dados relacionais. | Abre a cabeça pra ver SQL e engines de consulta como sistemas lógicos, não só tabelas e joins. | Ajuda quando penso em grafos, lineage de dados e regras de negócio complexas em cima de SQL. | Alta se você não curte notação lógica; recompensa depois que engrena. | Esse é o estudioso do time, aquele volante que arma o jogo em silêncio e ninguém valoriza até sair machucado. |
|---|
6 A Few Useful Things to Know about Machine Learning | 2012 | Pedro Domingos | Machine learning prático | Resumo honesto de armadilhas, vieses e truques práticos pra quem aplica ML no mundo real. | É o textão que eu queria ter lido antes de sair tacando modelo em produção sem entender direito generalização. | Lembro dele sempre que vejo overfitting, leakage ou feature engineering meio suspeito em projeto. | Baixa; escrito num tom quase de conversa, bem direto. | É o veterano do rachão que te chama no canto e fala: “irmão, você é bom, mas olha aqui esses erros de novato”. |
|---|
7 The Elements of Statistical Learning | 2001 (1ª ed.) | Hastie, Tibshirani, Friedman | Estatística / aprendizado estatístico | Livro-padrão que estrutura modelos estatísticos clássicos e modernos num framework unificado. | Serve de mapa mental pra quase tudo de modelagem supervisionada e regularização que uso até hoje. | Ajuda a lembrar o porquê matemático por trás de escolhas de modelo em vez de só copiar receita de blog. | Alta; bastante equação, mas com boas intuições gráficas. | É aquele manual tático gigante que ninguém lê de cabo a rabo, mas todo mundo consulta antes de jogo decisivo. |
|---|
8 DoWhy: A Python Library for Causal Inference | 2019 (artigo de apresentação) | Sharma, Kiciman, Ranganath, Shanmugam | Inferência causal / engenharia de dados | Mostra uma biblioteca que operacionaliza modelos causais explícitos, de DAGs a estimação e checagens de robustez. | Tira causalidade do mundo só teórico e coloca perto do workflow de dados que a gente realmente usa. | Serve de inspiração pra pensar em experimento, A/B test e efeito de campanha além do velho correlação não é causa. | Média; precisa de base mínima de causalidade, mas o foco é bem prático. | É como trocar aquele chute de fora da área aleatório por jogada ensaiada: mais trabalho, mas muito mais confiável. |
|---|
9 The Data Lakehouse: Building the Next Generation of Data Platforms | 2021 | Armbrust et al. | Arquitetura de plataformas de dados | Defende o conceito de lakehouse, unindo flexibilidade de data lake com governança de data warehouse. | Ajuda a organizar o caos entre tabelão em bucket barato e modelo bem pensado pra BI. | Direto lembro dele quando alguém sugere jogar tudo num parquet sem metadado nenhum e chamar de “plataforma moderna”. | Média; ainda é artigo acadêmico, mas focado em arquitetura conceitual. | É o técnico que tenta juntar a molecada habilidosa da base com os veteranos organizados, fazendo o elenco funcionar junto. |
|---|