{"as_of":"2026-08-08T23:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:14644c78684a6a992d92982e5edfa7057581413238edb8a47df139c896572ee8","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:56:45.919746Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.16868/citation-record","integrity":"/paper/2505.16868/integrity","json":"/paper/2505.16868/citation-record.json","paper":"/paper/2505.16868"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:53.518078Z","title":null,"venue":null,"work_id":"28929c9f-cc69-4589-8aa7-7ef52bb107d0","year":2002},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:40.732995Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:46f4f6e014d09bfdb1d54359aefd5bf93a8d1017d2bff9d08c26c40996149c68","observation_id":"fb1ca4a8-9723-42c3-a201-cce50e45c2b7","resolution":{"observed_at":"2026-08-07T14:56:53.598816Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:53.227267Z","title":"An awkward disparity between BLEU/RIBES scores and human judgements in machine translation","venue":null,"work_id":"389c8c04-8256-4fd5-a34a-b35ba9be6c6d","year":2015},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:40.813720Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:97b2a0828bbc561892afb5e1ba3e4360ecd627942b9ee2d698efb90df89581b3","observation_id":"0156cc44-19ec-44c7-940b-1662bb841aaf","resolution":{"observed_at":"2026-08-07T14:56:53.378184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:52.967030Z","title":"METEOR: An automatic metric for MT evaluation with improved correlation with human judgments","venue":null,"work_id":"5d75c26c-949c-45fd-846d-bb76d15820ab","year":2005},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:40.920925Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:6bc1bdc9a26d8db9a5e81fc4b7b855afd2ac8c8510156cb0f280606c513b4786","observation_id":"c4150d97-819e-4845-9aaf-13846d41016b","resolution":{"observed_at":"2026-08-07T14:56:53.114813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:52.696675Z","title":"A study of translation edit rate with targeted human annotation","venue":null,"work_id":"bda609b5-f30d-49f2-a0a4-8c2aace2eb49","year":2006},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.000492Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:5ed7bf0989d1b31b3dbe0011fbe20985f1047859ca74420ca50c5e3afcd86639","observation_id":"bb282389-3dcd-4731-9c10-a63a2318367b","resolution":{"observed_at":"2026-08-07T14:56:52.849174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:52.492232Z","title":"chrF: character n -gram F-score for automatic MT evaluation","venue":null,"work_id":"1ab8f0c1-067b-47db-ba7e-dee722ddc9ca","year":2015},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.108401Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:affe60f760bea24864b257237e20835c2b581c91362459a1df3ebb6700c6dfbb","observation_id":"585289e0-bb35-4ec9-81ae-36141b49a028","resolution":{"observed_at":"2026-08-07T14:56:52.584017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09025","last_updated":"2020-10-19T14:10:10Z","snapshot_observed_at":"2026-08-04T14:24:24.611946Z","submitted_at":"2020-09-18T18:54:15Z","title":"COMET: A Neural Framework for MT Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09025","snapshot_observed_at":"2026-08-07T14:56:41.199975Z","title":"C., & Lavie, A","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.199975Z"},"links":{"cited_paper":"/paper/2009.09025","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:8c878cfaa928cc1b2111f7de9d87cdebf00e0e0022ab3eab398a669503addb75","observation_id":"e6ea1fe1-48fa-4e29-9ab5-29f925f3497f","resolution":{"observed_at":"2026-08-07T14:56:41.199975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:52.310585Z","title":null,"venue":null,"work_id":"188c1447-285a-4e72-a15b-d183e7e077b6","year":2022},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.284404Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:7caf6294cdfe81acf9ddcda0ea4625dc81e5b9aefcdd2a86aa5deff1cf35fe17","observation_id":"1ebcd9e6-1d42-4f66-ad66-bf03338a7f47","resolution":{"observed_at":"2026-08-07T14:56:52.396246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-07T14:56:41.422461Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.422461Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:e3be2cdefdfaa1de991f9c0059780b14c30c6f029fbfb52809dcb3404c998941","observation_id":"58ae7b42-df44-452a-afe3-5a15d57f399f","resolution":{"observed_at":"2026-08-07T14:56:41.422461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-07-06T04:28:16.222296Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-07T14:56:41.529877Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.529877Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:77ad7d835a7ab2e19da3903453587bc0c47aa9b483f3989c9db1a5eeb0febb77","observation_id":"d5bd4a5b-0163-4bf4-8052-2839630a70dc","resolution":{"observed_at":"2026-08-07T14:56:41.529877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:52.096873Z","title":"K., & Patra, B","venue":null,"work_id":"c49bbdb0-0ee3-4629-ab64-8c604d6806d4","year":2023},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.618807Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:2d0353c2282393a9a19af1aabd5f8eb0771844a51c565d737e440cf9edbc0873","observation_id":"1f70bd03-c8ea-47fa-9067-88fc3f01d8a4","resolution":{"observed_at":"2026-08-07T14:56:52.194389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:51.790470Z","title":"B., Panda, D., Mishra, T","venue":null,"work_id":"46034984-7b54-49a8-9ab8-40251eb8cb16","year":2024},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.707611Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:b8331ada66b3df07e82fce2f0022c00b1b0afc190ba42d9ad695448dcc2cc3c4","observation_id":"4ef9b725-680d-4f7a-a34d-beb3d2db41b6","resolution":{"observed_at":"2026-08-07T14:56:51.927502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:51.494689Z","title":"B., Biradar, A., Mishra, T","venue":null,"work_id":"40be723e-ee6d-44c2-b1e2-928a7ce7ef21","year":2022},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.803355Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:872cc4a1254b7052fa7fa459c0ca3e4bb2cfa9d1e02a83084130359070929222","observation_id":"551d8edb-cb64-4d4c-b150-1f71133c0996","resolution":{"observed_at":"2026-08-07T14:56:51.655445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08144","last_updated":"2016-10-08T19:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-26T19:59:55Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08144","snapshot_observed_at":"2026-08-07T14:56:41.907403Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.907403Z"},"links":{"cited_paper":"/paper/1609.08144","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:7b36304be0afab60b81aa67235f7f3d030329c74c1a0d44f77081646924b3c9a","observation_id":"1afd84be-9fb9-4b5d-9950-761ae9f6e73a","resolution":{"observed_at":"2026-08-07T14:56:41.907403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:51.208423Z","title":null,"venue":null,"work_id":"535061e0-9e99-46f1-a5bf-a4b331d9681e","year":1990},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.987662Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:7f8bd6979001e11f4965aa1624ea113f805c924af4dbe9742e2379698ffc4d2e","observation_id":"49cb7729-eb5b-446c-831a-5860104c1ea3","resolution":{"observed_at":"2026-08-07T14:56:51.339239Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:50.989710Z","title":null,"venue":null,"work_id":"ed44857a-0e22-4af2-bb2c-b36b3bf39807","year":2011},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:42.083468Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:a0a0861fe7b6e4995e6fc8da34e3b76860ac83bba6ecf7c211dcdeb5438dcdc7","observation_id":"9dc1623c-3682-40d0-a077-31310bb4604f","resolution":{"observed_at":"2026-08-07T14:56:51.076132Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:50.744057Z","title":"Statistical machine translation","venue":null,"work_id":"5a9ff7d7-e838-4bb1-b532-7964909986d7","year":2008},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:42.166468Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:095f10ae7cb1b34667490cf3d2a19ffdcb319ca594e0a15f4406a2cc6ada0f0f","observation_id":"69713da9-d7fc-4d45-9cc8-78893e6d380e","resolution":{"observed_at":"2026-08-07T14:56:50.872502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-07-06T03:53:10.336430Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-07T14:56:42.262089Z","title":"Neural machine translation by jointly learning to align and translate","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:42.262089Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:932674f607227f78e75297ab2df6397d2c6a884d1952a73edfc413ac95cfa3f3","observation_id":"3bc8e54e-839f-4145-94cc-aecdce8c0b3f","resolution":{"observed_at":"2026-08-07T14:56:42.262089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:50.460303Z","title":null,"venue":null,"work_id":"495f1943-abe3-4cc4-af29-a9206922a568","year":2017},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:42.366538Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:6dc16708799fa309ab506ffaeaa1a45b10613c0d6c07cc5534125426d6135458","observation_id":"d9debab4-e691-4772-88d1-ae86f1796e02","resolution":{"observed_at":"2026-08-07T14:56:50.602641Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.00089","last_updated":"2019-07-02T16:44:03Z","snapshot_observed_at":"2026-08-08T09:58:12.452888Z","submitted_at":"2019-02-28T22:26:12Z","title":"Massively Multilingual Neural Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.00089","snapshot_observed_at":"2026-08-07T14:56:42.479881Z","title":"Massively multilingual neural machine translation","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:42.479881Z"},"links":{"cited_paper":"/paper/1903.00089","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:97ccfe0b679a1fb8652ce5b0e1a6b7cede697d74d02ff5e3ec94e5d1d930e284","observation_id":"1606030e-d832-4f04-ac59-f19e4594868e","resolution":{"observed_at":"2026-08-07T14:56:42.479881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:50.219317Z","title":null,"venue":null,"work_id":"d35ae430-d975-4f70-a989-cde4789f514f","year":2019},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:42.572397Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:5d7a69604d9136282a1dc57eee7b8aebf1de28080cba114abb36d53c2a67f0cb","observation_id":"f6626084-c8ea-48df-9bdd-a08cb8a77682","resolution":{"observed_at":"2026-08-07T14:56:50.349360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06226","last_updated":"2018-08-19T16:49:06Z","snapshot_observed_at":"2026-07-06T06:56:20.935388Z","submitted_at":"2018-08-19T16:49:06Z","title":"SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06226","snapshot_observed_at":"2026-08-07T14:56:42.668489Z","title":"Sentencepiece: A simple and language independent subword tokenizer and detokenizer for neural text processing","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:42.668489Z"},"links":{"cited_paper":"/paper/1808.06226","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:9f33eb39aabff91fd836e2d4b3215052967cbd647f70ec7a4ea471226259c325","observation_id":"b1c26973-80a4-4afe-bd67-e6ecc1701507","resolution":{"observed_at":"2026-08-07T14:56:42.668489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.04290","last_updated":"2017-01-16T13:55:01Z","snapshot_observed_at":"2026-07-06T05:26:19.801141Z","submitted_at":"2017-01-16T13:55:01Z","title":"Machine Translation Approaches and Survey for Indian Languages","version":1},"cited_work":{"arxiv_id":"1701.04290","doi":null,"metadata_source":"pith","pith_arxiv_id":"1701.04290","snapshot_observed_at":"2026-08-07T14:56:46.483687Z","title":"Machine Translation Approaches and Survey for Indian Languages","venue":"cs.CL","work_id":"9c4b0b22-57c0-4d8e-b441-e497eb90b426","year":2017},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:42.801331Z"},"links":{"cited_paper":"/paper/1701.04290","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:660047737929f8efd11940112ca2007ef520d9525be7d4b8b25f30b6654294c2","observation_id":"ba047e57-4187-44eb-8d9a-ebeefb80b38f","resolution":{"observed_at":"2026-08-07T14:56:46.539097Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:49.968282Z","title":null,"venue":null,"work_id":"4f364289-1441-42a2-934e-11bf1852792b","year":2023},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:42.917746Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:8267e25836a601148fa88dac340bc50e05113edcfb469aa81bdddbeda93b750d","observation_id":"d6f7ee31-1969-458a-9ec1-855f6315827b","resolution":{"observed_at":"2026-08-07T14:56:50.100829Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:49.767202Z","title":"Morphology: Indian languages and European languages","venue":null,"work_id":"ee2da297-7ff5-432f-8855-bc7aa38cb3dd","year":2013},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:43.049181Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:13efd2d35f85cd23fadeef524d49636b7e00caa452ebd54cfa12bc69a409750c","observation_id":"9fcba593-8f1d-4005-ac65-798d9aa798f5","resolution":{"observed_at":"2026-08-07T14:56:49.850961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15524","last_updated":"2021-10-05T22:18:32Z","snapshot_observed_at":"2026-08-06T22:19:44.625305Z","submitted_at":"2020-12-31T10:01:29Z","title":"Fast WordPiece Tokenization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15524","snapshot_observed_at":"2026-08-07T14:56:43.166127Z","title":"Fast wordpiece tokenization","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:43.166127Z"},"links":{"cited_paper":"/paper/2012.15524","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:e3cd6e6932925a9a5e107a95d085c839777e28ac193cbeb1248626ebe86cac64","observation_id":"17b62402-c801-424e-a09b-fefe4788404e","resolution":{"observed_at":"2026-08-07T14:56:43.166127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:49.516296Z","title":"NLTK documentation","venue":null,"work_id":"83b831e2-89a5-44a4-a4ee-0ac2ccb9252e","year":2008},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:43.332058Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:23965d45405882da1401cc8a963a0067c402eb409f308634ccc6246f0e734cbc","observation_id":"2edf3d60-c5b2-4672-90bd-c34226b1aa9b","resolution":{"observed_at":"2026-08-07T14:56:49.659129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:49.279578Z","title":"D., Tetreault, J., & Stent, A","venue":null,"work_id":"af5ea136-8eac-4e74-96c4-35cde145d363","year":2015},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:43.492695Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:86dd954c0eff9cff49bb3892974fbfe08b870680f4450b304e87c10f9445c106","observation_id":"24fd864b-8ebd-421d-bc1b-768dec29dbe0","resolution":{"observed_at":"2026-08-07T14:56:49.424184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10508","last_updated":"2021-12-20T13:04:18Z","snapshot_observed_at":"2026-07-06T12:20:36.165718Z","submitted_at":"2021-12-20T13:04:18Z","title":"Between words and characters: A Brief History of Open-Vocabulary Modeling and Tokenization in NLP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10508","snapshot_observed_at":"2026-08-07T14:56:43.616119Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:43.616119Z"},"links":{"cited_paper":"/paper/2112.10508","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:bcf0540d9cb7c5c26b8cf74667d61b40e3c1c21cf2b444ed5cf569b33bef5811","observation_id":"4f013cee-8e99-4990-b05f-77b42f49ad0b","resolution":{"observed_at":"2026-08-07T14:56:43.616119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.04586","last_updated":"2015-11-14T17:36:43Z","snapshot_observed_at":"2026-07-06T04:36:29.145286Z","submitted_at":"2015-11-14T17:36:43Z","title":"Character-based Neural Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.04586","snapshot_observed_at":"2026-08-07T14:56:43.749854Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:43.749854Z"},"links":{"cited_paper":"/paper/1511.04586","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:87a03bb0d02a1b205f0fd31b5fe72faeeb6e4b2f96b5003790b4599356f3244a","observation_id":"30e5eb63-3725-4b29-b9a2-43d52bfbc586","resolution":{"observed_at":"2026-08-07T14:56:43.749854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02534","last_updated":"2020-10-06T07:20:41Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T07:20:41Z","title":"An Empirical Study of Tokenization Strategies for Various Korean NLP Tasks","version":1},"cited_work":{"arxiv_id":"2010.02534","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.02534","snapshot_observed_at":"2026-08-07T14:56:46.274565Z","title":"An Empirical Study of Tokenization Strategies for Various Korean NLP Tasks","venue":"cs.CL","work_id":"ee75cd2d-f871-442c-bb91-de98f50f0922","year":2020},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:43.850716Z"},"links":{"cited_paper":"/paper/2010.02534","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:55994c230a0bdd0aeec014e6abca94c68950e346f171e5a3c4e582d608b9f34b","observation_id":"7a1c699a-9b42-4830-9f31-bba3923be6ca","resolution":{"observed_at":"2026-08-07T14:56:46.375650Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.13267","last_updated":"2020-05-01T18:54:20Z","snapshot_observed_at":"2026-08-02T07:25:01.310491Z","submitted_at":"2019-10-29T13:42:56Z","title":"BPE-Dropout: Simple and Effective Subword Regularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.13267","snapshot_observed_at":"2026-08-07T14:56:44.126108Z","title":"BPE -dropout: Simple and effective subword regularization","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:44.126108Z"},"links":{"cited_paper":"/paper/1910.13267","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:a46c4137a2321242c9711dfb973d8e0430e40d993a325bf47a3053174aa1e378","observation_id":"299d4fb3-4312-4b58-bcb0-72b75f872f79","resolution":{"observed_at":"2026-08-07T14:56:44.126108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.03720","last_updated":"2020-10-05T17:35:44Z","snapshot_observed_at":"2026-07-06T09:10:48.901105Z","submitted_at":"2020-04-07T21:21:06Z","title":"Byte Pair Encoding is Suboptimal for Language Model Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.03720","snapshot_observed_at":"2026-08-07T14:56:44.277726Z","title":"Byte pair encoding is suboptimal for language model pretraining","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:44.277726Z"},"links":{"cited_paper":"/paper/2004.03720","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:48c97e5dba61ddfc42e1b00f27cf29d7def33c1516c52b3e31074f5b3f02a1e4","observation_id":"2354ad57-c2db-4543-93a7-5f74cd55ecca","resolution":{"observed_at":"2026-08-07T14:56:44.277726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07349","last_updated":"2022-03-08T11:52:08Z","snapshot_observed_at":"2026-07-06T11:19:00.383610Z","submitted_at":"2021-06-01T15:17:45Z","title":"Using Integrated Gradients and Constituency Parse Trees to explain Linguistic Acceptability learnt by BERT","version":2},"cited_work":{"arxiv_id":"2106.07349","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.07349","snapshot_observed_at":"2026-08-07T14:56:46.067062Z","title":"Using Integrated Gradients and Constituency Parse Trees to explain Linguistic Acceptability learnt by BERT","venue":"cs.CL","work_id":"b8906b3a-060b-48e5-b8e0-e4035e1ff0a0","year":2021},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:44.384852Z"},"links":{"cited_paper":"/paper/2106.07349","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:695a69234b96e6df5163c0ea41063c9ce93877ceaa1ab06ad0aa0b8983b9f372","observation_id":"13c3f9df-408b-40e9-a3e0-c357cbb5ea39","resolution":{"observed_at":"2026-08-07T14:56:46.136522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:49.091246Z","title":"HAN: hierarchical association network for computing semantic relatedness","venue":null,"work_id":"44a9029f-a86e-45e4-9e5a-784392288f27","year":2018},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:44.559715Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:c5531de4524884a28d1f6037be9b0ca99681159543016c34119a33f3f2a2f39d","observation_id":"8aa51c85-b120-41dd-bf41-a894350007cd","resolution":{"observed_at":"2026-08-07T14:56:49.182855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:48.871062Z","title":"Meaningless yet meaningful: Morphology grounded subword- level NMT","venue":null,"work_id":"5a2bec71-f8df-4da4-8145-2a99117f95cc","year":2018},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:44.716253Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:a4a9f32669fbc4522fa48bdf581d507b2bdab28605c165e6bafeb3a8b5664661","observation_id":"afe603d7-9c9b-432d-bd6d-c39ba4577c88","resolution":{"observed_at":"2026-08-07T14:56:48.952378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:48.626005Z","title":null,"venue":null,"work_id":"0996d128-fa5a-44c8-9b9d-9ac74e80efaa","year":null},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:44.805572Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:cdbd297406ff8d20e75bd8d9328f8130d405063d6b26b3ba1d06d78e8a864441","observation_id":"73ad5378-3fce-4a90-b788-46f1acddc5e2","resolution":{"observed_at":"2026-08-07T14:56:48.737339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T14:56:44.948945Z","title":"W., Lee, K., & Toutanova, K","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:44.948945Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:d5a8c2d3ca3cb2518d626200567deb990b5e5a5b13b36d20c9815bdbf018a43c","observation_id":"6b3376c9-85a7-4743-917c-d9eeb2bbc44e","resolution":{"observed_at":"2026-08-07T14:56:44.948945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:48.450220Z","title":"AI as the next GPT: a Political -Economy Perspective","venue":null,"work_id":"63c2432a-3585-43a0-8299-161a865b6732","year":2018},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:45.049589Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:4eacdcc4a2ccb10fae410176cb656d53e3086460d60284d745b3169cee65d352","observation_id":"fa1e4781-9d82-4b9a-bd61-c3bb47ad0cab","resolution":{"observed_at":"2026-08-07T14:56:48.544357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:48.242881Z","title":null,"venue":null,"work_id":"88ab24ae-3beb-4d4f-babd-efd5609d71c0","year":2017},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:45.152504Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:03dbb028194db813919b49c56f686e97c79a3aba44845519fbb7e0c1031f1ac0","observation_id":"5da2293b-5724-472f-a723-ab5bc8ff582d","resolution":{"observed_at":"2026-08-07T14:56:48.346280Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01038","last_updated":"2019-04-01T18:05:02Z","snapshot_observed_at":"2026-08-06T00:26:50.886840Z","submitted_at":"2019-04-01T18:05:02Z","title":"fairseq: A Fast, Extensible Toolkit for Sequence Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01038","snapshot_observed_at":"2026-08-07T14:56:45.244129Z","title":null,"venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:45.244129Z"},"links":{"cited_paper":"/paper/1904.01038","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:175cc105d94254e3af3e55d36716d52d1f8f8ff8c8bce5489c5bcd0e02c0b17c","observation_id":"f6f2050a-1697-458d-b091-17fafffa61ad","resolution":{"observed_at":"2026-08-07T14:56:45.244129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:47.991388Z","title":null,"venue":null,"work_id":"105b4c56-99cc-49c2-919c-e3c1db97d685","year":2020},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:45.360960Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:62f04c1b6ab74cf3fdec4a56e90a63a83869ceb79e54c83d5fbad4a69fa40f5a","observation_id":"e8ee23cc-5c85-42ad-8818-fc4235c0b593","resolution":{"observed_at":"2026-08-07T14:56:48.099408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:47.680458Z","title":null,"venue":null,"work_id":"79d6c659-4623-4844-a4b7-219bcbe5017f","year":2007},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:45.437018Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:2c4f3ace1b5f6680c0952d34d63ec5de25892fe685b5f9dd21521ba9f2513e36","observation_id":"6914086e-43ac-4199-9df7-1636f4fdc64b","resolution":{"observed_at":"2026-08-07T14:56:47.821428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:47.444470Z","title":"Moses-Statistical Machine Translation System","venue":null,"work_id":"49b77e1d-f0db-4dc8-a56c-f49ff5bb8c31","year":2010},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:45.548671Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:277f69964795384bf693f10d54ef5fb14fe084a89435e055a6d6e270b782f2e2","observation_id":"717053e7-a5b4-48d7-9fce-a8e9a5f59f03","resolution":{"observed_at":"2026-08-07T14:56:47.538867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T14:56:45.645407Z","title":"P ., & Ba, J","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:45.645407Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:6df96af1249e212de2121da88551a0f488ab41cd1e7d1dd6a3208f24d7ba1c62","observation_id":"1bf3a788-d361-49cf-be01-6b13ca1437e3","resolution":{"observed_at":"2026-08-07T14:56:45.645407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:47.257881Z","title":"Post, A call for clarity in reporting BLEU scores, in Proceedings of the Third Conference on Machine Translation: Research Papers","venue":null,"work_id":"ecf08c65-c611-45a7-ad51-39ef3aa50153","year":2018},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:45.739641Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:c22e37cfd2099183d745686bfc4f7c451d1815d4449928e1210288e04dd53f3b","observation_id":"68133417-a204-4aac-a1cf-e6726cb1a396","resolution":{"observed_at":"2026-08-07T14:56:47.359452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:46.933357Z","title":null,"venue":null,"work_id":"305b4979-7365-49fa-8a20-85d687cfc62b","year":2020},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:45.830297Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:07ed391eaab2a582f2e5dbf3ff4756dd66fcc14268843840ab81adf1153ecee0","observation_id":"a80c834e-7b5d-484e-8ecf-b16e383ec87a","resolution":{"observed_at":"2026-08-07T14:56:47.089618Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:46.728943Z","title":"B., Choudhury, S., Mishra, T","venue":null,"work_id":"33d79738-90fb-4c73-b842-6184f4f10156","year":2025},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:45.919746Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:1bfc9958d37174e4e3ddddce98757825a91af6c80af7a015a32cba17e35a5a49","observation_id":"fff5327f-622b-4c4d-8999-9b0fc0d45680","resolution":{"observed_at":"2026-08-07T14:56:46.811586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":27,"verified_exact":2,"verified_fuzzy":17},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2505.16868."}