{"id":17559834,"url":"https://github.com/aranzadata/moviereviewclassifier","last_synced_at":"2026-05-05T05:36:12.124Z","repository":{"id":258710816,"uuid":"871376763","full_name":"aranzadata/MovieReviewClassifier","owner":"aranzadata","description":"Modelo de análisis de sentimientos basado en BERT para 45,000 reseñas de películas, logrando una puntuación F1 de 0.88 al aprovechar técnicas avanzadas de preprocesamiento de texto con NLTK y SpaCy","archived":false,"fork":false,"pushed_at":"2024-10-18T20:35:59.000Z","size":2851,"stargazers_count":0,"open_issues_count":0,"forks_count":0,"subscribers_count":1,"default_branch":"main","last_synced_at":"2025-03-29T10:14:47.838Z","etag":null,"topics":["bert-embeddings","nltk","spacy"],"latest_commit_sha":null,"homepage":"","language":"Jupyter Notebook","has_issues":true,"has_wiki":null,"has_pages":null,"mirror_url":null,"source_name":null,"license":null,"status":null,"scm":"git","pull_requests_enabled":true,"icon_url":"https://github.com/aranzadata.png","metadata":{"files":{"readme":"README.md","changelog":null,"contributing":null,"funding":null,"license":null,"code_of_conduct":null,"threat_model":null,"audit":null,"citation":null,"codeowners":null,"security":null,"support":null,"governance":null,"roadmap":null,"authors":null,"dei":null,"publiccode":null,"codemeta":null}},"created_at":"2024-10-11T20:48:10.000Z","updated_at":"2024-10-18T20:36:03.000Z","dependencies_parsed_at":"2024-10-20T08:39:08.488Z","dependency_job_id":"41debc41-f788-4ffe-ba3c-19da30335ed0","html_url":"https://github.com/aranzadata/MovieReviewClassifier","commit_stats":null,"previous_names":["aranzadata/moviereviewclassifier"],"tags_count":0,"template":false,"template_full_name":null,"repository_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/aranzadata%2FMovieReviewClassifier","tags_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/aranzadata%2FMovieReviewClassifier/tags","releases_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/aranzadata%2FMovieReviewClassifier/releases","manifests_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/aranzadata%2FMovieReviewClassifier/manifests","owner_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners/aranzadata","download_url":"https://codeload.github.com/aranzadata/MovieReviewClassifier/tar.gz/refs/heads/main","host":{"name":"GitHub","url":"https://github.com","kind":"github","repositories_count":246168109,"owners_count":20734390,"icon_url":"https://github.com/github.png","version":null,"created_at":"2022-05-30T11:31:42.601Z","updated_at":"2022-07-04T15:15:14.044Z","host_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub","repositories_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories","repository_names_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repository_names","owners_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners"}},"keywords":["bert-embeddings","nltk","spacy"],"created_at":"2024-10-21T11:07:29.008Z","updated_at":"2026-05-05T05:36:07.309Z","avatar_url":"https://github.com/aranzadata.png","language":"Jupyter Notebook","funding_links":[],"categories":[],"sub_categories":[],"readme":"# Movie_Review_Clasifier\n\nFilm Junky Union, una nueva comunidad vanguardista para los aficionados de las películas clásicas, está desarrollando un sistema para filtrar y categorizar reseñas de películas. El objetivo es entrenar un modelo para detectar las críticas negativas de forma automática. Para lograrlo, se utiliza un conjunto de datos de reseñas de películas de IMDB con leyendas de polaridad para construir un modelo para clasificar las reseñas positivas y negativas.\n\nSe experimentó con tres tipos de clasificadores: Regresión Logística, Descenso de Gradiente y K Vecinos cercanos. Se utilizaron las librerías Nature Language Toolkit, spaCy para encontrar palabras vacías. También se observa el efecto de realizar lemmatización. Para cada una de estas opciones se realiza una bolsa de palabras y vectorización con IF_IDF.\n\nDe todos los modelos se encontró que el de Regresión Logística con librería NLTK y sin lematización fue el que mejores resultados obtuvo, con un score f1 en el conjunto de prueba de 0.88. Este mismo modelo con la librería spaCy y con lemmatización no mejoró significativamente los resultados.\n\nPor otro lado el clasificador con Descenso de Gradiente obtuvo las segundas mejores métricas, y estas probablemente pueden mejorar haciendo una búsqueda de hiperparámetros. Nuevamente la lematización no mejoró significativamente las métricas.\n\nPara el clasificador de K Vecinos Cercanos se realizó una búsqueda de parámetros para el número de vecinos cercanos. Las predicciones para este modelo tuvieron menor exactitud, pero mostraron la mejor consistencia.\n","project_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Faranzadata%2Fmoviereviewclassifier","html_url":"https://awesome.ecosyste.ms/projects/github.com%2Faranzadata%2Fmoviereviewclassifier","lists_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Faranzadata%2Fmoviereviewclassifier/lists"}