{"id":15195555,"url":"https://github.com/sagartr/fake-email-detector-using-machine-learning-","last_synced_at":"2026-02-11T18:02:12.255Z","repository":{"id":250537349,"uuid":"834754702","full_name":"SAGARTR/FAKE-EMAIL-DETECTOR-USING-MACHINE-LEARNING-","owner":"SAGARTR","description":"Developed a spam detection model using logistic regression, achieving high accuracy by  leveraging TF-IDF vectorization and label encoding techniques.","archived":false,"fork":false,"pushed_at":"2024-07-28T09:11:12.000Z","size":247,"stargazers_count":0,"open_issues_count":0,"forks_count":1,"subscribers_count":1,"default_branch":"main","last_synced_at":"2025-03-02T04:28:51.851Z","etag":null,"topics":["csv","email-phishing","ipynb-jupyter-notebook","python"],"latest_commit_sha":null,"homepage":"","language":"Jupyter Notebook","has_issues":true,"has_wiki":null,"has_pages":null,"mirror_url":null,"source_name":null,"license":null,"status":null,"scm":"git","pull_requests_enabled":true,"icon_url":"https://github.com/SAGARTR.png","metadata":{"files":{"readme":"README.md","changelog":null,"contributing":null,"funding":null,"license":null,"code_of_conduct":null,"threat_model":null,"audit":null,"citation":null,"codeowners":null,"security":null,"support":null,"governance":null,"roadmap":null,"authors":null,"dei":null,"publiccode":null,"codemeta":null}},"created_at":"2024-07-28T09:02:10.000Z","updated_at":"2024-07-28T09:31:45.000Z","dependencies_parsed_at":null,"dependency_job_id":"e0465ce0-0e4f-454e-83ce-32ca08654d6d","html_url":"https://github.com/SAGARTR/FAKE-EMAIL-DETECTOR-USING-MACHINE-LEARNING-","commit_stats":null,"previous_names":["sagartr/fake-email-detector-using-machine-learning-"],"tags_count":0,"template":false,"template_full_name":null,"purl":"pkg:github/SAGARTR/FAKE-EMAIL-DETECTOR-USING-MACHINE-LEARNING-","repository_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/SAGARTR%2FFAKE-EMAIL-DETECTOR-USING-MACHINE-LEARNING-","tags_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/SAGARTR%2FFAKE-EMAIL-DETECTOR-USING-MACHINE-LEARNING-/tags","releases_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/SAGARTR%2FFAKE-EMAIL-DETECTOR-USING-MACHINE-LEARNING-/releases","manifests_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/SAGARTR%2FFAKE-EMAIL-DETECTOR-USING-MACHINE-LEARNING-/manifests","owner_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners/SAGARTR","download_url":"https://codeload.github.com/SAGARTR/FAKE-EMAIL-DETECTOR-USING-MACHINE-LEARNING-/tar.gz/refs/heads/main","sbom_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/SAGARTR%2FFAKE-EMAIL-DETECTOR-USING-MACHINE-LEARNING-/sbom","scorecard":null,"host":{"name":"GitHub","url":"https://github.com","kind":"github","repositories_count":271628166,"owners_count":24792821,"icon_url":"https://github.com/github.png","version":null,"created_at":"2022-05-30T11:31:42.601Z","updated_at":"2022-07-04T15:15:14.044Z","status":"online","status_checked_at":"2025-08-22T02:00:08.480Z","response_time":65,"last_error":null,"robots_txt_status":"success","robots_txt_updated_at":"2025-07-24T06:49:26.215Z","robots_txt_url":"https://github.com/robots.txt","online":true,"can_crawl_api":true,"host_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub","repositories_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories","repository_names_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repository_names","owners_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners"}},"keywords":["csv","email-phishing","ipynb-jupyter-notebook","python"],"created_at":"2024-09-27T23:41:21.879Z","updated_at":"2026-02-11T18:02:07.214Z","avatar_url":"https://github.com/SAGARTR.png","language":"Jupyter Notebook","funding_links":[],"categories":[],"sub_categories":[],"readme":"# FAKE-EMAIL-DETECTOR-USING-MACHINE-LEARNING-\nDeveloped a spam detection model using logistic regression, achieving high accuracy by  leveraging TF-IDF vectorization and label encoding techniques.\n\n\n\nPhishing detection is critical in cyber security to identify and mitigate fraudulent activities. This practical implementation demonstrates the use of Logistic Regression, a supervised learning algorithm, to classify emails as spam or ham (legitimate).\n\nKey Components of Practical Implementation:\n\n1. Loading the Dataset: The dataset is loaded using `pandas`. We assume the dataset `mail_data.csv` contains email messages categorized as 'spam' or 'ham'.\n\n   import pandas as pd\n   df = pd.read_csv('mail_data.csv')\n   print(df.head())\n\n2. Handling Missing Values: Replace any missing values in the dataset with empty strings.\n\n   data = df.where((pd.notnull(df)), '')\n\n3. Data Inspection: Inspect the dataset to understand its structure and size.\n\n   print(data.info())\n   print(data.shape)\n   \n4. Label Encoding: Convert the 'Category' column to numerical values where 'spam' is 0 and 'ham' is 1.\n\n   data.loc[data['Category'] == 'spam', 'category'] = 0\n   data.loc[data['Category'] == 'ham', 'category'] = 1\n\n5. Extracting Features and Labels: Separate the message content and the labels.\n\n   X = data['Message']\n   Y = data['Category']\n\n6. Splitting the Dataset: Split the dataset into training and testing sets (80% training, 20% testing).\n\n   from sklearn.model_selection import train_test_split\n   X_train, X_test, Y_train, Y_test = train_test_split(X, Y, test_size=0.2, random_state=3)\n\n7. TF-IDF Vectorization: Transform the text data into numerical features using TfidfVectorizer.\n\n   from sklearn.feature_extraction.text import TfidfVectorizer\n   feature_extraction = TfidfVectorizer(min_df=1, stop_words='english', lowercase=True)\n   X_train_features = feature_extraction.fit_transform(X_train)\n   X_test_features = feature_extraction.transform(X_test)\n\n8. Label Encoding: Encode the target labels as numerical values.\n\n   from sklearn.preprocessing import LabelEncoder\n   label_encoder = LabelEncoder()\n   Y_train_encoded = label_encoder.fit_transform(Y_train)\n   Y_test_encoded = label_encoder.transform(Y_test)\n\n9. Training the Model: Train the Logistic Regression model on the training data.\n\n   from sklearn.linear_model import LogisticRegression\n   model = LogisticRegression()\n   model.fit(X_train_features, Y_train_encoded)\n\n10. Accuracy on Training Data: Evaluate the model's accuracy on the training data.\n\n    from sklearn.metrics import accuracy_score\n    prediction_on_training_data = model.predict(X_train_features)\n    accuracy_on_training_data = accuracy_score(Y_train_encoded, prediction_on_training_data)\n    print('Accuracy on training data:', accuracy_on_training_data)\n\n11. Accuracy on Testing Data: Evaluate the model's accuracy on the testing data.\n\n    prediction_on_test_data = model.predict(X_test_features)\n    accuracy_on_test_data = accuracy_score(Y_test_encoded, prediction_on_test_data)\n    print('Accuracy on testing data:', accuracy_on_test_data)\n\n12. Predicting New Data: Predict the category of a new email message.\n\n    input_your_mail = [\"Your input email message here\"]\n    input_data_features = feature_extraction.transform(input_your_mail)\n    prediction = model.predict(input_data_features)\n    print(prediction)\n","project_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Fsagartr%2Ffake-email-detector-using-machine-learning-","html_url":"https://awesome.ecosyste.ms/projects/github.com%2Fsagartr%2Ffake-email-detector-using-machine-learning-","lists_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Fsagartr%2Ffake-email-detector-using-machine-learning-/lists"}