Aprenda a tratar, representar e modelar textos com métodos clássicos e modernos de NLP.
Nesse módulo você irá aprender os fundamentos de PLN, preparar e normalizar textos (tokenização, stop-words, stemming e lemmatization), dominar RegEx no Python, representar texto (BoW, N-grams e colocações) e aplicar tudo em um desafio final com relatório.
Vamos criar um sistema de Information Extraction usando Python e a biblioteca re aplicando os conceitos vistos em aula.
Vamos avaliar o que você aprendeu até agora. Bora lá?
Neste módulo, partimos das representações clássicas em PLN e geramos dados estruturados para modelos. Exploramos o TF-IDF na classificação, mergulhamos no pós-tagging para desambiguação, aplicamos NER para extrair entidades e finalizamos com Hidden Markov Models, compreendendo suas tabelas e o algoritmo de Viterbi.
Construir um pipeline de Processamento de Linguagem Natural para classificar o sentimento de notícias e extrair entidades estratégicas (Artistas, Gravadoras e Festivais). **Objetivo:** Aplicar técnicas de análise linguística e vetorização estatística para transformar textos não estruturados em insights estruturados sobre a indústria fonográfica.
Vamos avaliar o nosso conhecimento?
Neste módulo, mergulhamos nos algoritmos supervisionados de Machine Learning para NLP. Aprenderemos desde seus fundamentos, passando pela aplicação prática de Naive Bayes, Regressão Logística e SVM, até a avaliação robusta de modelos com métricas, pipelines e tunagem de hiperparâmetros, preparando-nos para classificar textos com confiança.
Construir um pipeline de Processamento de Linguagem Natural para classificar o sentimento de críticas cinematográficas e interpretar os fatores lineares que determinam a recepção de um filme.
Vamos avaliar o que você aprendeu até agora. Bora lá?
Neste módulo, vamos mergulhar no aprendizado não-supervisionado, partindo da necessidade de trabalhar sem rótulos em textos. Exploraremos o clustering com K-Means e DBSCAN, a modelagem de tópicos com LDA, e a redução de dimensionalidade com PCA e t-SNE, aprendendo a preparar dados, implementar algoritmos, avaliar resultados e construir pipelines eficazes.
Vamos construir um pipeline de PLN para identificar automaticamente temas recorrentes em avaliações textuais em português aplicando os conceitos vistos em aula.
Vamos avaliar o que você aprendeu até agora. Bora lá?