Construir um pipeline de Processamento de Linguagem Natural para classificar o sentimento de críticas cinematográficas e interpretar os fatores lineares que determinam a recepção de um filme.
Estrutura, regras e requisitos do projeto
No mercado de entretenimento e plataformas de streaming, monitorar de forma automatizada a recepção do público em relação a filmes e séries é um diferencial estratégico indispensável. Seu objetivo é processar revisões textuais do dataset público imdb-reviews-pt-br.csv para classificar automaticamente se a crítica é Positiva ou Negativa, além de mapear quais palavras possuem maior peso estatístico para influenciar a decisão de cada algoritmo.
O projeto deverá cobrir as seguintes frentes técnicas:
| Etapa Técnica | Sub-etapa / Algoritmo | Descrição |
|---|---|---|
| Análise Linguística | Remoção de Ruído e Stopwords | Filtrar pontuações, padronizar o texto em minúsculas e remover as stopwords da língua portuguesa. |
| Vetorização | TF-IDF / CountVectorizer | Representar as revisões numericamente, comparando ou ajustando os limites de dimensionalidade do vocabulário. |
| Validação Robusta | Stratified K-Fold | Implementar validação cruzada para garantir a estabilidade e a generalização real de cada arquitetura testada. |
| Otimização | GridSearchCV | Encontrar os melhores hiperparâmetros (como o alpha do Naive Bayes ou o C dos modelos lineares). |
| Modelagem | Benchmarking de Classificadores | Treinar e contrastar diretamente 3 algoritmos clássicos de ML: MultinomialNB, LogisticRegression e LinearSVC. |
Utilize bibliotecas de processamento textual (como nltk ou spaCy) para realizar a limpeza inicial do corpus.
Monte a estrutura de modelagem utilizando a classe Pipeline do scikit-learn para encapsular as etapas de engenharia de atributos e classificação.
MultinomialNB, LogisticRegression e LinearSVC). Aplique o GridSearchCV integrado com uma validação cruzada estratificada para mapear o melhor conjunto de hiperparâmetros de cada um.fit) deve ocorrer estritamente dentro dos folds de treino gerenciados pelo Pipeline para impedir o vazamento de dados (Data Leakage).Após coletar as métricas calculadas pelo processo de busca e validação cruzada:
F1-Score médio obtido no treinamento de cada um dos 3 modelos, adicionando as linhas de erro (yerr) baseadas no desvio padrão dos folds para validar a estabilidade estatística das arquiteturas.ConfusionMatrixDisplay, analisando os erros de Falsos Positivos e Falsos Negativos cometidos por cada abordagem.Aproveitando a transparência e as propriedades geométricas do modelo de margem suave treinado:
• Extraia os pesos dos coeficientes (coef_) diretamente do modelo LinearSVC ajustado e mapeie-os de volta ao vocabulário gerado pelo vetorizador. Crie um gráfico de barras horizontais espelhado para identificar quais termos atuam como vetores determinantes para cada classe. Exiba o "Top 10" de palavras com maior coeficiente positivo (w > 0, que empurram a fronteira de decisão em direção à classe Positiva) e o "Top 10" de palavras com maior coeficiente negativo (w < 0, que puxam a decisão em direção à classe Negativa).
LINK DATASET: https://www.kaggle.com/datasets/anairamcosta/imdb-reviews-pt-br-csv
No mercado de entretenimento e plataformas de streaming, monitorar de forma automatizada a recepção do público em relação a filmes e séries é um diferencial estratégico indispensável. Seu objetivo é processar revisões textuais do dataset público imdb-reviews-pt-br.csv para classificar automaticamente se a crítica é Positiva ou Negativa, além de mapear quais palavras possuem maior peso estatístico para influenciar a decisão de cada algoritmo.
O projeto deverá cobrir as seguintes frentes técnicas:
| Etapa Técnica | Sub-etapa / Algoritmo | Descrição |
|---|---|---|
| Análise Linguística | Remoção de Ruído e Stopwords | Filtrar pontuações, padronizar o texto em minúsculas e remover as stopwords da língua portuguesa. |
| Vetorização | TF-IDF / CountVectorizer | Representar as revisões numericamente, comparando ou ajustando os limites de dimensionalidade do vocabulário. |
| Validação Robusta | Stratified K-Fold | Implementar validação cruzada para garantir a estabilidade e a generalização real de cada arquitetura testada. |
| Otimização | GridSearchCV | Encontrar os melhores hiperparâmetros (como o alpha do Naive Bayes ou o C dos modelos lineares). |
| Modelagem | Benchmarking de Classificadores | Treinar e contrastar diretamente 3 algoritmos clássicos de ML: MultinomialNB, LogisticRegression e LinearSVC. |
Utilize bibliotecas de processamento textual (como nltk ou spaCy) para realizar a limpeza inicial do corpus.
Monte a estrutura de modelagem utilizando a classe Pipeline do scikit-learn para encapsular as etapas de engenharia de atributos e classificação.
MultinomialNB, LogisticRegression e LinearSVC). Aplique o GridSearchCV integrado com uma validação cruzada estratificada para mapear o melhor conjunto de hiperparâmetros de cada um.fit) deve ocorrer estritamente dentro dos folds de treino gerenciados pelo Pipeline para impedir o vazamento de dados (Data Leakage).Após coletar as métricas calculadas pelo processo de busca e validação cruzada:
F1-Score médio obtido no treinamento de cada um dos 3 modelos, adicionando as linhas de erro (yerr) baseadas no desvio padrão dos folds para validar a estabilidade estatística das arquiteturas.ConfusionMatrixDisplay, analisando os erros de Falsos Positivos e Falsos Negativos cometidos por cada abordagem.Aproveitando a transparência e as propriedades geométricas do modelo de margem suave treinado:
• Extraia os pesos dos coeficientes (coef_) diretamente do modelo LinearSVC ajustado e mapeie-os de volta ao vocabulário gerado pelo vetorizador. Crie um gráfico de barras horizontais espelhado para identificar quais termos atuam como vetores determinantes para cada classe. Exiba o "Top 10" de palavras com maior coeficiente positivo (w > 0, que empurram a fronteira de decisão em direção à classe Positiva) e o "Top 10" de palavras com maior coeficiente negativo (w < 0, que puxam a decisão em direção à classe Negativa).
LINK DATASET: https://www.kaggle.com/datasets/anairamcosta/imdb-reviews-pt-br-csv
Confira os resultados esperados do projeto

Envie o projeto para ver a resolução
Ao enviar seu projeto, você poderá conferir os resultados esperados