Artigos que me moldaram
List · 9 items

Artigos que me moldaram

Rafael MonteRafael Monte · 3 likes
9 items
ListAcademic Papers · Entertainment

Artigos que me moldaram

Rafael Monte
@rafacorrida10
9Items
3Likes

Lista bem carioca dos papers que mais mexeram com a minha cabeça de engenheiro de dados: tem aprendizado profundo, causalidade, sistemas distribuídos e até umas paradas que mudaram como eu vejo futebol e cidade. Em vez de parecer TCC, tentei resumir cada um como se fosse resenha de fim de pelada, daquele jeito que a gente passa do xG pra filosofia em dois parágrafos. Bora fuçar e ver qual deles te dá vontade de abrir o PDF hoje?

The list

Rank
Artigos que me moldaram — 9 items
NameAnoAutores principaisÁreaPrincipal ideiaPor que é importanteAplicação no dia a diaDificuldade de leituraMinha vibe
1Attention Is All You Need2017Vaswani et al.Deep learning / NLPIntroduz o Transformer usando só mecanismos de atenção, sem recorrência ou convoluções.Virou a base de quase todo modelo grande de linguagem, de tradução a chatbots.Penso nele sempre que alguém fala de embeddings, context window ou fine-tune de modelo grande.Alta se você nunca viu atenção; média se já tá acostumado com redes neurais.Tipo aquele técnico que chega mudando o esquema tático do time inteiro e depois parece óbvio que tinha que ser assim.
2The Google File System2003Ghemawat, Gobioff, LeungSistemas distribuídos / armazenamentoDescrever um sistema de arquivos distribuído tolerante a falhas, otimizado pra arquivos grandes e workloads de leitura/gravação sequencial.Inspirou HDFS e boa parte do jeito moderno de pensar data lake em escala absurda.Toda vez que mexo com cluster de dados grande, lembro que por trás ainda tem um “GFS espiritual” cuidando dos blocos.Média, bem escrita e mais conceitual que cheia de fórmula.É tipo ver o desenho tático da seleção de 2002 e reconhecer metade dos padrões que os times copiam até hoje.
3MapReduce: Simplified Data Processing on Large Clusters2004Dean, GhemawatProcessamento distribuídoAbstrair processamento massivo em dois passos, map e reduce, escondendo a complexidade de paralelismo e falhas.Virou base conceitual pra Hadoop e pro jeito batch de pensar ETL em big data.Mesmo escrevendo Spark ou SQL, ainda raciocino em termos de mapeia, baralha, agrega.Baixa pra média; exemplos claros, mas tem bastante detalhe de infra.Esse é aquele 4-4-2 clássico que talvez você nem use mais puro, mas ensinou o que é ocupar espaço no campo.
4The Unix Time-Sharing System1974Ritchie, ThompsonSistemas operacionaisApresenta a filosofia do Unix, com processos leves, sistema de arquivos simples e ferramentas que se combinam.Me fez entender por que até hoje muita ferramenta de dados respira esse jeitão Unix de “faça uma coisa bem e componha”.Sempre que encadeio comandos em shell ou monto pipelines simples em vez de mega-monolitos.Média; linguagem antiga, mas ideias bem diretas.É como rever videotape em preto e branco de um clássico no Maraca e perceber que muita jogada atual nasceu ali.
5Datalog and Recursive Query Processinganos 1980 (artigos clássicos vários)Bancilhon, Maier, Ullman e outrosBancos de dados / lógicaUsar uma linguagem lógica declarativa (Datalog) pra definir consultas recursivas em bancos de dados relacionais.Abre a cabeça pra ver SQL e engines de consulta como sistemas lógicos, não só tabelas e joins.Ajuda quando penso em grafos, lineage de dados e regras de negócio complexas em cima de SQL.Alta se você não curte notação lógica; recompensa depois que engrena.Esse é o estudioso do time, aquele volante que arma o jogo em silêncio e ninguém valoriza até sair machucado.
6A Few Useful Things to Know about Machine Learning2012Pedro DomingosMachine learning práticoResumo honesto de armadilhas, vieses e truques práticos pra quem aplica ML no mundo real.É o textão que eu queria ter lido antes de sair tacando modelo em produção sem entender direito generalização.Lembro dele sempre que vejo overfitting, leakage ou feature engineering meio suspeito em projeto.Baixa; escrito num tom quase de conversa, bem direto.É o veterano do rachão que te chama no canto e fala: “irmão, você é bom, mas olha aqui esses erros de novato”.
7The Elements of Statistical Learning2001 (1ª ed.)Hastie, Tibshirani, FriedmanEstatística / aprendizado estatísticoLivro-padrão que estrutura modelos estatísticos clássicos e modernos num framework unificado.Serve de mapa mental pra quase tudo de modelagem supervisionada e regularização que uso até hoje.Ajuda a lembrar o porquê matemático por trás de escolhas de modelo em vez de só copiar receita de blog.Alta; bastante equação, mas com boas intuições gráficas.É aquele manual tático gigante que ninguém lê de cabo a rabo, mas todo mundo consulta antes de jogo decisivo.
8DoWhy: A Python Library for Causal Inference2019 (artigo de apresentação)Sharma, Kiciman, Ranganath, ShanmugamInferência causal / engenharia de dadosMostra uma biblioteca que operacionaliza modelos causais explícitos, de DAGs a estimação e checagens de robustez.Tira causalidade do mundo só teórico e coloca perto do workflow de dados que a gente realmente usa.Serve de inspiração pra pensar em experimento, A/B test e efeito de campanha além do velho correlação não é causa.Média; precisa de base mínima de causalidade, mas o foco é bem prático.É como trocar aquele chute de fora da área aleatório por jogada ensaiada: mais trabalho, mas muito mais confiável.
9The Data Lakehouse: Building the Next Generation of Data Platforms2021Armbrust et al.Arquitetura de plataformas de dadosDefende o conceito de lakehouse, unindo flexibilidade de data lake com governança de data warehouse.Ajuda a organizar o caos entre tabelão em bucket barato e modelo bem pensado pra BI.Direto lembro dele quando alguém sugere jogar tudo num parquet sem metadado nenhum e chamar de “plataforma moderna”.Média; ainda é artigo acadêmico, mas focado em arquitetura conceitual.É o técnico que tenta juntar a molecada habilidosa da base com os veteranos organizados, fazendo o elenco funcionar junto.