{"id":21723585,"url":"https://github.com/chrismuir/anagrams","last_synced_at":"2025-03-20T22:20:35.270Z","repository":{"id":101313176,"uuid":"121981274","full_name":"ChrisMuir/anagrams","owner":"ChrisMuir","description":"R pkg for detecting anagrams","archived":false,"fork":false,"pushed_at":"2018-10-10T12:27:07.000Z","size":344,"stargazers_count":1,"open_issues_count":1,"forks_count":0,"subscribers_count":2,"default_branch":"master","last_synced_at":"2025-01-25T19:09:47.141Z","etag":null,"topics":["anagram","anagrams","rcpp","rstats"],"latest_commit_sha":null,"homepage":"","language":"C++","has_issues":true,"has_wiki":null,"has_pages":null,"mirror_url":null,"source_name":null,"license":null,"status":null,"scm":"git","pull_requests_enabled":true,"icon_url":"https://github.com/ChrisMuir.png","metadata":{"files":{"readme":"README.Rmd","changelog":null,"contributing":null,"funding":null,"license":null,"code_of_conduct":null,"threat_model":null,"audit":null,"citation":null,"codeowners":null,"security":null,"support":null,"governance":null,"roadmap":null,"authors":null,"dei":null,"publiccode":null,"codemeta":null}},"created_at":"2018-02-18T19:05:09.000Z","updated_at":"2018-10-10T12:27:08.000Z","dependencies_parsed_at":"2023-09-21T08:33:32.432Z","dependency_job_id":null,"html_url":"https://github.com/ChrisMuir/anagrams","commit_stats":null,"previous_names":[],"tags_count":0,"template":false,"template_full_name":null,"repository_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/ChrisMuir%2Fanagrams","tags_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/ChrisMuir%2Fanagrams/tags","releases_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/ChrisMuir%2Fanagrams/releases","manifests_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/ChrisMuir%2Fanagrams/manifests","owner_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners/ChrisMuir","download_url":"https://codeload.github.com/ChrisMuir/anagrams/tar.gz/refs/heads/master","host":{"name":"GitHub","url":"https://github.com","kind":"github","repositories_count":244700644,"owners_count":20495578,"icon_url":"https://github.com/github.png","version":null,"created_at":"2022-05-30T11:31:42.601Z","updated_at":"2022-07-04T15:15:14.044Z","host_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub","repositories_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories","repository_names_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repository_names","owners_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners"}},"keywords":["anagram","anagrams","rcpp","rstats"],"created_at":"2024-11-26T02:40:29.865Z","updated_at":"2025-03-20T22:20:35.244Z","avatar_url":"https://github.com/ChrisMuir.png","language":"C++","funding_links":[],"categories":[],"sub_categories":[],"readme":"---\noutput: \n  github_document: default\n  html_document: default\n---\n\n\u003c!-- README.md is generated from README.Rmd. Please edit that file --\u003e\n\n```{r, echo = FALSE}\nknitr::opts_chunk$set(\n  collapse = TRUE,\n  comment = \"#\u003e\"\n)\n```\n\n```{r message=FALSE, warning=FALSE, error=FALSE, include=FALSE}\noptions(width = 120)\n```\n\n# anagrams\n\n[![Travis-CI Build Status](https://travis-ci.org/ChrisMuir/anagrams.svg?branch=master)](https://travis-ci.org/ChrisMuir/anagrams)\n\n`anagrams` is a super simple R package providing a function for comparing character vectors and determining if strings are [anagrams](https://en.wikipedia.org/wiki/Anagram) of one another. The project was inspired by [this](http://www.programmingr.com/content/simple-anagram-finder-using-r/) blog post on finding anagrams in R. The package uses C++ and [Rcpp](https://CRAN.R-project.org/package=Rcpp) for speed.\n\nIf you're interested in anagrams and R, be sure to check out [Romain Francois'](https://github.com/romainfrancois) package [anagram](https://github.com/romainfrancois/anagram) (and h/t to Romain for [pointing out](https://twitter.com/romain_francois/status/972754279164514304) some bottle-necks in my cpp code).\n\nAlso, thank you to [Mark van der Loo](https://github.com/markvanderloo) for pointing out that the [stringdist](https://github.com/markvanderloo/stringdist) package can be used to concisely determine same-length anagrams (and it's faster than the base R function I defined below!) I included the `stringdist` solution in the benchmarks below.\n\n## Installation\n\nInstall from github with:\n```{r eval = FALSE}\n# install.packages(\"devtools\")\ndevtools::install_github(\"ChrisMuir/anagrams\")\n```\n\n## Example Usage\n\nThe exported function `is_anagram` takes as input a string and a character vector, and looks for anagrams of the string in the character vector.\n\n```{r}\nlibrary(anagrams)\n\n# Test for anagrams that are the same length as the input string.\nis_anagram(\"stac\", c(\"cats are great\", \"tacs\", \"frogs\", \"cats\", \"ts\"))\n\n# Use arg \"value\" to return the values that are anagrams.\nis_anagram(\"stac\", c(\"cats are great\", \"tacs\", \"frogs\", \"cats\", \"ts\"), value = TRUE)\n\n# Set arg \"any_len\" to TRUE to test for anagrams that are any length (either same length or sub-string).\nis_anagram(\"stac\", c(\"cats are great\", \"tacs\", \"frogs\", \"cats\", \"ts\"), any_len = TRUE)\n\n# Use arg \"ignore_spaces\" to make anagram searching insensitive to spaces.\nis_anagram(\"s t a c\", c(\"cats are great\", \"t acs\", \"frogs\", \"ca   ts\", \"ts\"), ignore_spaces = TRUE)\n\n# Use arg \"ignore_case\" to make anagram searching insensitive to lower/upper case.\nis_anagram(\"STAc\", c(\"catS are great\", \"tacs\", \"frogs\", \"CaTS\", \"ts\"), ignore_case = TRUE)\n```\n\n## Benchmarks\n\nLet's create a simple, base R version of `is_anagram` that searches for same-length anagrams, and compare speeds.\n```{r}\nr_is_anagram \u003c- function(string, terms) {\n  out \u003c- rep(FALSE, length(terms))\n  terms_to_insp \u003c- which(nchar(terms) == nchar(string))\n  if (length(terms_to_insp) == 0) {\n    return(out)\n  }\n  \n  string_spl \u003c- unlist(strsplit(string, \"\", fixed = TRUE), FALSE, FALSE)\n  str_counts \u003c- vapply(string_spl, function(x) sum(string_spl == x), integer(1))\n  terms_spl \u003c- strsplit(terms, \"\", fixed = TRUE)\n  \n  out[terms_to_insp] \u003c- vapply(terms_spl[terms_to_insp], function(x) {\n    anagram \u003c- TRUE\n    for (char in string_spl) {\n      if (str_counts[char] != sum(x == char)) {\n        anagram \u003c- FALSE\n        break\n      }\n    }\n    anagram\n  }, logical(1), USE.NAMES = FALSE)\n  \n  out\n}\n\n# Test to make sure its output is identical to that of pkg function is_anagram.\nidentical(\n  r_is_anagram(\"stac\", c(\"cats are great\", \"tacs\", \"frogs\", \"cats\", \"ts\")), \n  is_anagram(\"stac\", c(\"cats are great\", \"tacs\", \"frogs\", \"cats\", \"ts\"))\n)\n```\nAnd for completeness, here is a similar function that uses `stringdist::stringdist()` to find same-length anagrams.\n```{r}\nlibrary(stringdist)\n\nsd_is_anagram \u003c- function(string, terms) {\n  out \u003c- rep(FALSE, length(terms))\n  terms_to_insp \u003c- which(nchar(terms) == nchar(string))\n  if (length(terms_to_insp) == 0) {\n    return(out)\n  }\n  \n  out[terms_to_insp] \u003c- stringdist(string, terms[terms_to_insp], method=\"qgram\", q=1) == 0\n  \n  out\n}\n\n# Test to make sure its output is identical to that of pkg function is_anagram.\nidentical(\n  sd_is_anagram(\"stac\", c(\"cats are great\", \"tacs\", \"frogs\", \"cats\", \"ts\")), \n  is_anagram(\"stac\", c(\"cats are great\", \"tacs\", \"frogs\", \"cats\", \"ts\"))\n)\n```\n\nNow we'll compare speeds.\n\n```{r message=FALSE, warning=FALSE, error=FALSE}\nlibrary(microbenchmark)\nlibrary(stringi)\n\n\n# Test in which each element is shorter than the input string.\n\ntest_vect \u003c- stringi::stri_rand_strings(100000, 3)\nmicrobenchmark(\n  anagrams_pkg = is_anagram(\"cats\", test_vect), \n  stringdist_pkg = sd_is_anagram(\"cats\", test_vect), \n  base_r = r_is_anagram(\"cats\", test_vect)\n) -\u003e mb\n\nprint(mb)\n\nautoplot.microbenchmark(mb)\n\n\n# Test in which each element is the same length as the input string.\n\ntest_vect \u003c- stringi::stri_rand_strings(100000, 4)\nmicrobenchmark(\n  anagrams_pkg = is_anagram(\"cats\", test_vect), \n  stringdist_pkg = sd_is_anagram(\"cats\", test_vect), \n  base_r = r_is_anagram(\"cats\", test_vect)\n) -\u003e mb\n\nprint(mb)\n\nautoplot.microbenchmark(mb)\n\n\n# Test in which each element is an anagram of the input string.\n\ntest_vect \u003c- rep(\"tacs\", 100000)\nmicrobenchmark(\n  anagrams_pkg = is_anagram(\"cats\", test_vect), \n  stringdist_pkg = sd_is_anagram(\"cats\", test_vect), \n  base_r = r_is_anagram(\"cats\", test_vect)\n) -\u003e mb\n\nprint(mb)\n\nautoplot.microbenchmark(mb)\n\n\n# Test in which each element is a string with length between two and six chars.\n\ntest_vect \u003c- stringi::stri_rand_strings(100000, 2:6)\nmicrobenchmark(\n  anagrams_pkg = is_anagram(\"cats\", test_vect), \n  stringdist_pkg = sd_is_anagram(\"cats\", test_vect), \n  base_r = r_is_anagram(\"cats\", test_vect)\n) -\u003e mb\n\nprint(mb)\n\nautoplot.microbenchmark(mb)\n\n\n# Test in which each element is a long string (nchar == 1000).\n\ntest_str \u003c- stringi::stri_rand_strings(1, 1000)\ntest_vect \u003c- stringi::stri_rand_strings(100000, 1000)\nmicrobenchmark(\n  anagrams_pkg = is_anagram(test_str, test_vect), \n  stringdist_pkg = sd_is_anagram(test_str, test_vect), \n  base_r = r_is_anagram(test_str, test_vect)\n) -\u003e mb\n\nprint(mb)\n\nautoplot.microbenchmark(mb)\n```\n","project_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Fchrismuir%2Fanagrams","html_url":"https://awesome.ecosyste.ms/projects/github.com%2Fchrismuir%2Fanagrams","lists_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Fchrismuir%2Fanagrams/lists"}