{"id":15159693,"url":"https://github.com/gattopandacorno/bigdata","last_synced_at":"2026-03-15T04:02:48.930Z","repository":{"id":239902987,"uuid":"800939337","full_name":"Gattopandacorno/bigData","owner":"Gattopandacorno","description":"Graph data science project","archived":false,"fork":false,"pushed_at":"2024-07-06T08:32:42.000Z","size":2766,"stargazers_count":0,"open_issues_count":0,"forks_count":0,"subscribers_count":1,"default_branch":"master","last_synced_at":"2024-10-29T23:43:42.358Z","etag":null,"topics":["docker-compose","gds","jupyter-notebook","neo4j"],"latest_commit_sha":null,"homepage":"","language":"Jupyter Notebook","has_issues":true,"has_wiki":null,"has_pages":null,"mirror_url":null,"source_name":null,"license":null,"status":null,"scm":"git","pull_requests_enabled":true,"icon_url":"https://github.com/Gattopandacorno.png","metadata":{"files":{"readme":"README.md","changelog":null,"contributing":null,"funding":null,"license":null,"code_of_conduct":null,"threat_model":null,"audit":null,"citation":null,"codeowners":null,"security":null,"support":null,"governance":null,"roadmap":null,"authors":null,"dei":null,"publiccode":null,"codemeta":null}},"created_at":"2024-05-15T09:38:15.000Z","updated_at":"2024-07-06T08:32:39.000Z","dependencies_parsed_at":"2024-05-19T19:42:02.708Z","dependency_job_id":"c53da970-85df-4f4e-a484-d10afd7c4658","html_url":"https://github.com/Gattopandacorno/bigData","commit_stats":{"total_commits":41,"total_committers":2,"mean_commits":20.5,"dds":"0.12195121951219512","last_synced_commit":"e04b772692e960244e293b1aeb8911c6c6a0b27f"},"previous_names":["gattopandacorno/bigdata"],"tags_count":0,"template":false,"template_full_name":null,"repository_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/Gattopandacorno%2FbigData","tags_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/Gattopandacorno%2FbigData/tags","releases_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/Gattopandacorno%2FbigData/releases","manifests_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/Gattopandacorno%2FbigData/manifests","owner_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners/Gattopandacorno","download_url":"https://codeload.github.com/Gattopandacorno/bigData/tar.gz/refs/heads/master","host":{"name":"GitHub","url":"https://github.com","kind":"github","repositories_count":242060738,"owners_count":20065588,"icon_url":"https://github.com/github.png","version":null,"created_at":"2022-05-30T11:31:42.601Z","updated_at":"2022-07-04T15:15:14.044Z","host_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub","repositories_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories","repository_names_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repository_names","owners_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners"}},"keywords":["docker-compose","gds","jupyter-notebook","neo4j"],"created_at":"2024-09-26T21:41:31.739Z","updated_at":"2025-10-09T07:14:59.464Z","avatar_url":"https://github.com/Gattopandacorno.png","language":"Jupyter Notebook","funding_links":[],"categories":[],"sub_categories":[],"readme":"## COME USARE IL PROGETTO\n\nLo scopo del progetto e' quello di guidare l'utente:\n1. nella creazione del database neo4j (con docker-compose) e tramite il dataset instagram di kaggle\n2. fare un'analisi dei dati e provare a rispondere alle research question\n\nSi dovra' quindi seguire le istruzioni date dai commenti del notebook come una sorta di \"guida\". \nNel caso in cui si voglia provare direttamente sul browser di neo4j le varie call (load csv, match,...) ci si puo' accedere come indicato sul notebook dopo aver avviato il docker container. \nPer scrivere le varie call basta copiare il testo dentro i s.run(''' '''); ad esempio in `s.run('''match (a) return a''')` bisogna copiare solo `match (a) return a`.\n\nPer quanto riguarda l'installazione delle dipendenze python è stato usato `poetry` ma pyproject.toml viene letto anche dal comando `pip`.\nPrima di installarle ricordarsi di creare l'ambiente virtuale nel caso in cui si scelga di usare `pip`:\n```bash\npython -m venv .venv\nsource .venv/bin/activate\n```\nSi riportano i due modi per installare le dipendenze:\n1. ```bash \n    poetry install\n2. ``` bash\n    python -m pip install requests\nSe si sta utilizzando un IDE come visual studio code l'ambiente virtuale che dovra' poi essere usato per il notebook viene detectato di default e non dovrebbero essere necessari ulteriori passaggi. \nSe si notano errori per quanto riguarda l'import delle dipendenze python si controlli il virtual env o l'env selezionato per l'interprete python.\nNel caso in cui ci fossero dubbi sul fatto che l'ambiente virtuale sia stato attivato si puo' controllare con \n```bash\npoetry env use python\n```\no con il comando\n```bash\nwhich python\n```\n\n**NB**: I comandi devono essere ovviamente lanciati da terminale nella cartella principale contenente pyproject.toml .\n\n**NB**: Si puo' saltare il passaggio di download del dataset. Questo è reso possibile dal fatto che esistono gia' unzippati i file .csv necessari.\n\n## CARTELLA DATA\n\nLa cartella data contiene 8 file csv che serviranno per la costruzione del grafo:\n* `comments.csv`; elenco dei commenti fatti da un certo utente sotto un post\n* `follows.csv`; relazioni di quale utente segue quale\n* `likes.csv`; relazioni dei like di un utente ad un post\n* `photo_tags.csv`; relazioni di un tag su un post\n* `photos.csv`; le foto uploadate da un certo utente\n* `tags.csv`; i tag scritti \n* `users.csv`; gli utenti della piattaforma  \n* `test.csv`; nel primo commit github è stato pubblicato anche questo mini test\nusato appunto per capire dove vengano salvati i file sul container. Potrebbe sparire in altre versioni del codice.\n\nDopo aver lanciato il comando di docker questa cartella viene oscurata a qualsiasi utente che non sia neo4j e root. Si può riportare alle permission di una cartella consultabile anche da un altro utente con il comando:\n```bash\nsudo chmod 755 -R data  \n```\ndove 755 sono i permessi assegnati e -R estende la modifica anche ai file nella cartella.\nIn quanto non utile consultarne i file si sconsiglia di usare il comando, nel caso dovesse servire consultare prima la [documentazione](https://linux.die.net/man/1/chmod) per capire anche come meglio assegnare le permission.\nSi ricorda inoltre che non è mai una buona prassi assegnare 777 in quanto non è sicuro.\n\n## CARTELLA MEDIA\nIn essa vengono salvate tulle le immagini che serviranno come corredo ai commenti markdown del notebook; ad esempio per la spiegazione dello schema del grafo.\n\n## REFERENCE PER EVENTUALI PROBLEMATICHE\n\n* [dataset kaggle](https://www.kaggle.com/datasets/bhanupratapbiswas/instgram) \n* [documentazione GDS](https://neo4j.com/docs/graph-data-science/current/)\n* [documentazione docker-compose](https://docs.docker.com/compose/)\n* [documentazione apoc core e apoc extended](https://neo4j.com/labs/apoc/)","project_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Fgattopandacorno%2Fbigdata","html_url":"https://awesome.ecosyste.ms/projects/github.com%2Fgattopandacorno%2Fbigdata","lists_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Fgattopandacorno%2Fbigdata/lists"}