Processamento de Linguagem Natural na Prática
Linguagem é o dado mais abundante que existe — e o menos estruturado. Aprender a trabalhar com texto de forma programática exige tanto rigor técnico quanto sensibilidade para o que as palavras realmente significam em contexto. Este curso parte dessa tensão e constrói ferramentas reais a partir dela.
O que este curso cobre de fato
Antes de qualquer modelo, é preciso entender como o texto se comporta: encoding, normalização, segmentação por idioma, tratamento de ambiguidade. O curso dedica os primeiros dois módulos exclusivamente a isso — porque ignorar essa etapa é a causa mais comum de modelos que falham em produção.
- Pré-processamento com NLTK e spaCy — limpeza, tokenização e lematização para português
- Representações vetoriais: TF-IDF, Word2Vec, FastText e embeddings contextuais
- Classificação de texto com scikit-learn e ajuste fino de modelos BERT multilíngues
- Reconhecimento de entidades nomeadas (NER) e análise de dependências sintáticas
Os exercícios usam conjuntos de dados reais — avaliações de produtos, notícias, conversas de suporte. Nenhum dataset artificial. O objetivo é que o participante consiga adaptar o código para o próprio contexto profissional ao terminar cada módulo. Saiba mais em nossa página de programa.
Como as aulas são estruturadas
- Cada aula começa com um problema específico — não com teoria abstrata
- O código é executado ao vivo, com erros reais e debugging visível
- Cada módulo termina com um exercício aplicado a dados fornecidos pelo próprio participante
- Revisão assíncrona disponível — as gravações ficam acessíveis por 12 meses
- Fórum de dúvidas monitorado por instrutores, não por moderadores automáticos
Quem está à frente do programa
Beatriz Tavares
Linguística ComputacionalPesquisadora com foco em análise de sentimentos para português brasileiro e espanhol rioplatense.
Ondřej Vašíček
Engenharia de MLDesenvolvedor especializado em pipelines de PLN para produção — trabalhou com sistemas multilíngues em escala.