{"id":22549965,"url":"https://github.com/muhfaridansutariya/text-extraction-from-image","last_synced_at":"2026-04-17T13:32:42.988Z","repository":{"id":64246157,"uuid":"573738762","full_name":"MuhFaridanSutariya/text-extraction-from-image","owner":"MuhFaridanSutariya","description":null,"archived":false,"fork":false,"pushed_at":"2022-12-05T07:22:26.000Z","size":616,"stargazers_count":0,"open_issues_count":0,"forks_count":0,"subscribers_count":1,"default_branch":"master","last_synced_at":"2025-10-28T18:46:24.585Z","etag":null,"topics":["flask","tesseract-ocr"],"latest_commit_sha":null,"homepage":"","language":"Jupyter Notebook","has_issues":true,"has_wiki":null,"has_pages":null,"mirror_url":null,"source_name":null,"license":null,"status":null,"scm":"git","pull_requests_enabled":true,"icon_url":"https://github.com/MuhFaridanSutariya.png","metadata":{"files":{"readme":"README.md","changelog":null,"contributing":null,"funding":null,"license":null,"code_of_conduct":null,"threat_model":null,"audit":null,"citation":null,"codeowners":null,"security":null,"support":null}},"created_at":"2022-12-03T09:18:46.000Z","updated_at":"2024-06-01T03:37:07.000Z","dependencies_parsed_at":"2022-12-05T13:08:48.838Z","dependency_job_id":null,"html_url":"https://github.com/MuhFaridanSutariya/text-extraction-from-image","commit_stats":null,"previous_names":[],"tags_count":0,"template":false,"template_full_name":null,"purl":"pkg:github/MuhFaridanSutariya/text-extraction-from-image","repository_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/MuhFaridanSutariya%2Ftext-extraction-from-image","tags_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/MuhFaridanSutariya%2Ftext-extraction-from-image/tags","releases_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/MuhFaridanSutariya%2Ftext-extraction-from-image/releases","manifests_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/MuhFaridanSutariya%2Ftext-extraction-from-image/manifests","owner_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners/MuhFaridanSutariya","download_url":"https://codeload.github.com/MuhFaridanSutariya/text-extraction-from-image/tar.gz/refs/heads/master","sbom_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/MuhFaridanSutariya%2Ftext-extraction-from-image/sbom","scorecard":null,"host":{"name":"GitHub","url":"https://github.com","kind":"github","repositories_count":286080680,"owners_count":31931404,"icon_url":"https://github.com/github.png","version":null,"created_at":"2022-05-30T11:31:42.601Z","updated_at":"2026-04-17T12:37:54.787Z","status":"ssl_error","status_checked_at":"2026-04-17T12:37:25.095Z","response_time":62,"last_error":"SSL_read: unexpected eof while reading","robots_txt_status":"success","robots_txt_updated_at":"2025-07-24T06:49:26.215Z","robots_txt_url":"https://github.com/robots.txt","online":false,"can_crawl_api":true,"host_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub","repositories_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories","repository_names_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repository_names","owners_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners"}},"keywords":["flask","tesseract-ocr"],"created_at":"2024-12-07T16:10:32.313Z","updated_at":"2026-04-17T13:32:42.952Z","avatar_url":"https://github.com/MuhFaridanSutariya.png","language":"Jupyter Notebook","funding_links":[],"categories":[],"sub_categories":[],"readme":"# Aplikasi pembaca teks pada gambar\n\n![image](https://user-images.githubusercontent.com/88027268/205564653-589e8e1e-52b2-4a64-b630-35a5686a2abe.png)\n\nGambar 1. Tampilan awal aplikasi\n\n## Proyek overview\n\nSebuah proyek yang dibuat untuk dapat memudahkan manusia dalam pengambilan teks dari sebuah gambar secara cepat dan tepat dengan mengimplementasikan teknik *Optical Character Recognition* atau ekstraksi teks dari sebuah gambar. proyek ini masih dapat dikembangkan dengan menggunakan teknologi canggih seperti salah satunya adalah *BERT*. Aplikasi ini telah dilakukan deployment ke sebuah website menggunakan teknologi *flask*.\n\n## Teknologi yang digunakan\n\n- opencv\n- pytesseract\n- tesseract\n- numpy\n- Flask\n- Pillow\n\n\n## Langkah-langkah untuk menjalankan aplikasi ini:\n-\tClone repository ini atau melakukan download manual.\n- Buka command prompt atau miniconda lalu masuk ke path yang dimana pada path tersebut dapat mencari file *app.py* secara langsung.\n- Buat environment pada path tersebut - conda create -name \u003cenvironment name\u003e\n- Activate environment pada path tersebut sesuai dengan environment yang telah dibuat sebelumnya - conda activate \u003cenvironment name\u003e\n- Install tesseract sesuai dengan operasi sistem yang dimiliki - https://github.com/UB-Mannheim/tesseract/wiki\n- Dapat memindahkan hasil installan ke path yang sesuai. Default path setelah didownload: C:\\ProgramFiles\\Tesseract-OCR\n- Setelah itu dapat menambahkan environment variable sesuai dengan path installer. Seperti gambar dibawah:\n\n![image](https://user-images.githubusercontent.com/88027268/205570664-84705e5b-2e89-43ae-be63-d575abc56fd6.png)\n\nGambar 2. Tampilan menambahkan environment variable\n\n- pytesseract.pytesseract.tesseract_cmd = r'C:\\ProgramFiles\\Tesseract-OCR\\tesseract.exe' Ganti sesuai dengan path yang telah diinstall sebelumnya pada file *views.py* dari folder *app*.\n- Gunakan command berikut untuk melakukan install dependencies yang dibutuhkan - python -m pip install -r requirements.txt\n- Jalankan aplikasi yang telah dibuat dengan command berikut - python app.py\nSetelah berjalan dengan baik maka dapat copas link tersebut ke browser. contoh: http://127.0.0.1:5000/ \n- Telah disediakan sample gambar yang dapat dilakukan ujicoba pada aplikasi tersebut.\n\n## Kesimpulan:\nDimulai dengan mempelajari cara menginstall tesseract yang digunakan untuk ekstraksi teks. Selanjutnya mengambil gambar dan mengekstrak teks dari gambar itu. Mendapatkan pelajaran yang penting yaitu bahwa perlu menggunakan fungsi transformasi gambar tertentu dari OpenCV untuk mengekstraksi teks dari gambar yang kompleks.\n  \n## Reference:\n- [(Blog medium yang ditulis oleh Simón Cerda, 2021)](https://medium.com/@simsagues/document-information-extraction-using-ocr-and-nlp-2c3caa5a7720)\n- [(Margot Mieskes dan Stefan Schmunk, 2019)](https://paperswithcode.com/paper/ocr-quality-and-nlp-preprocessing)\n","project_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Fmuhfaridansutariya%2Ftext-extraction-from-image","html_url":"https://awesome.ecosyste.ms/projects/github.com%2Fmuhfaridansutariya%2Ftext-extraction-from-image","lists_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Fmuhfaridansutariya%2Ftext-extraction-from-image/lists"}