{"as_of":"2026-08-07T15:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e6906263e3228b12c1b22d904807ead247d7c141e5cc55fe0f76c04593d3826f","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:35:44.562542Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.07824/citation-record","integrity":"/paper/2507.07824/integrity","json":"/paper/2507.07824/citation-record.json","paper":"/paper/2507.07824"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.414116Z","title":"Do all languages cost the same? tokenization in the era of commercial language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.414116Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:55544a07464f8717438364291cce26d4434a7dac55282258957a8ca4a3a67e32","observation_id":"77f33ca5-ac96-401e-bcd2-7dc775b95995","resolution":{"observed_at":"2026-08-06T18:35:44.414116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.419221Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.419221Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:a7152c17bab4276d44b8216d1d05fecad97331722450c18cfa01870d764142ee","observation_id":"c0ec52fd-c846-4712-a59d-ba7485d6131d","resolution":{"observed_at":"2026-08-06T18:35:44.419221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:45.082197Z","title":"F., Della-Pietra, S","venue":null,"work_id":"f535efa3-7fd6-40b6-a88f-934697cb7a5c","year":1993},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.424228Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:b53649b55aa2f673b7e2147693e02a862f05cf2be4e1022caf7c983cc70c936b","observation_id":"c245d5f8-f3c1-4ebf-9d18-c209eee0b1f3","resolution":{"observed_at":"2026-08-06T18:35:45.086897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:45.065829Z","title":"and Gildea, D","venue":null,"work_id":"107e0603-00f0-4e3e-bd7e-726e970cf1c2","year":2009},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.428765Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:af18388d32a491171eb33920fd45ce3afb07b4b8023e686f19fe99e07e114c90","observation_id":"214d5a65-0d0a-422e-9db2-5db2ca7ec439","resolution":{"observed_at":"2026-08-06T18:35:45.070376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.coling-main.378","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.735853Z","title":"Bilingual subword segmentation for neural machine translation","venue":null,"work_id":"ceb95f74-8f14-44e6-bc76-9f6a91c9ae38","year":2020},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.433757Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:1bbb1bfd8d01f967d184dc02c161efc6aae82983d08d0cc4507560d0460e761b","observation_id":"1d9f4ebb-be58-4a70-9ca1-ec0eebed4b2a","resolution":{"observed_at":"2026-08-06T18:35:44.741472Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:45.048500Z","title":"and Neubig, G","venue":null,"work_id":"4a7ade0b-7031-4f03-a5ed-5cb7ccf3182a","year":2021},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.439497Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:3b480f17f5ebe0f622b0ea35125bf852ecb5c84cf428b10c1bec1a4fff06cf7a","observation_id":"dcf4f5e6-da66-4b00-b4a9-83dd15f92d57","resolution":{"observed_at":"2026-08-06T18:35:45.053862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:45.033737Z","title":null,"venue":null,"work_id":"a5f24eda-284a-4fd9-8178-7fa051c6a976","year":2013},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.444591Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:5bc46ace121dc58f6a25847c05f9ab18097582b0b1a36c7478f08367e670fea5","observation_id":"404e8589-a896-4f62-9b0b-2032ad944587","resolution":{"observed_at":"2026-08-06T18:35:45.038191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:45.018151Z","title":"Beyond literal token overlap: Token alignability for multilinguality","venue":null,"work_id":"6468f1a2-8f48-4690-87a9-8b11b40596df","year":2025},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.448841Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:6c79eadeb1e91cbeae0c183f33bd0a2e33c9bf3631190155b1d9617ed293cfc8","observation_id":"66a952df-1706-40f5-b815-ed49da267573","resolution":{"observed_at":"2026-08-06T18:35:45.023443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.453373Z","title":"The state and fate of linguistic diversity and inclusion in the NLP world","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.453373Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:f4e76f3709c05d5a7bf18463c06b707e125abb99d1b755336f6da220d68c3eec","observation_id":"276acd2e-72af-4633-882e-c661f88495cb","resolution":{"observed_at":"2026-08-06T18:35:44.453373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:45.002827Z","title":null,"venue":null,"work_id":"7eeb8960-002e-4891-906e-54c3bb367d71","year":2018},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.457758Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:b4ed17cb1eb0ab51378bbed7a55c21b347a6e881ff7d726b4c4067abebcfcdd1","observation_id":"c8b25ad3-8890-4910-85d3-930965c088a9","resolution":{"observed_at":"2026-08-06T18:35:45.007365Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.462215Z","title":"Subword regularization: Improving neural network translation models with multiple subword candidates","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.462215Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:d0094aca6aacf78b65c50463a56d49d4710fa1b0ee3e9786503d91b88962e323","observation_id":"104eb6a3-2c41-427f-bcca-2142750e42a1","resolution":{"observed_at":"2026-08-06T18:35:44.462215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.988145Z","title":"and Fraser, A","venue":null,"work_id":"f3f1f220-3652-4c2c-800b-a4755136cfe3","year":2021},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.466444Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:f53aba63d12cc628ca82439a8f7951da625a587c0d410c1d87e75613697bf8d3","observation_id":"8e576d87-52e5-4f1c-8f53-f258c86fc470","resolution":{"observed_at":"2026-08-06T18:35:44.992392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.421","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.697901Z","title":"and Helcl, J","venue":null,"work_id":"a90e9515-2ea2-4f2b-bd49-006cd3c0d8d5","year":2024},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.474029Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:19c0d93416047045cc5534e73e29e345f8ad668e08464ddc49f3b296b77c37d1","observation_id":"7d48bc60-255f-4c9b-96e7-59f6277e529e","resolution":{"observed_at":"2026-08-06T18:35:44.703806Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.478471Z","title":"Tokenization impacts multilingual language modeling: Assessing vocabulary allocation and overlap across languages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.478471Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:615a1e156d1c3c15998cf930affaae66a65c9cbf944d32945153acb1d484b2cc","observation_id":"51fb6002-29ca-41f8-859a-392575ab6711","resolution":{"observed_at":"2026-08-06T18:35:44.478471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.483452Z","title":"WECHSEL : Effective initialization of subword embeddings for cross-lingual transfer of monolingual language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.483452Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:c2c8f9e796be4b9d78882a4de7dc01380e108759560c693290cc56897377e074","observation_id":"9f61a3ec-f325-4bd5-ac86-9cf12dbc240c","resolution":{"observed_at":"2026-08-06T18:35:44.483452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-06T18:35:44.488511Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.488511Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:9c3c67c8508be8aa5c7a2755d7ee76be0fc877803291c3c5ecea0d1af6511e7b","observation_id":"d5700e42-f094-4b92-bf54-2cde7530d9cc","resolution":{"observed_at":"2026-08-06T18:35:44.488511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.971989Z","title":"and Tiedemann, J","venue":null,"work_id":"157b51fe-dc00-4417-b76f-648ac898e925","year":2016},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.493537Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:f9ba7b7d97c65f532ecf380b82659579ad5e2e149788b4429dfd84ac6ffb7b58","observation_id":"875828a4-f630-4df6-8355-c065c47909c7","resolution":{"observed_at":"2026-08-06T18:35:44.976947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.497932Z","title":"Bleu: a Method for Automatic Evaluation of Machine Translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.497932Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:10df1c8f39c97fd117a7f0c332937f663f4c034bb696a3caf7ffd29028b18964","observation_id":"22083a4d-4dde-4c6a-8c77-f23e0616f09d","resolution":{"observed_at":"2026-08-06T18:35:44.497932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.955110Z","title":"Language Model Tokenizers Introduce Unfairness Between Languages","venue":null,"work_id":"9c3711c8-b536-4303-8b10-0063dc417bda","year":2023},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.502188Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:f411b2789569d3c80d7dd3d3c7e6b3dc235d5daf04713a7810b97cbfd74c19c4","observation_id":"c66bfc7a-f612-472e-89ff-d201b26e7cc8","resolution":{"observed_at":"2026-08-06T18:35:44.960471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.506406Z","title":"How multilingual is multilingual BERT ? In Korhonen, A., Traum, D., and M \\`a rquez, L","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.506406Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:2fc5cb0873a2f3ae17151148011139dec56d066252b8e92a0adde1c907bfc81b","observation_id":"c4060262-5718-436e-ba8a-0be7214a3df2","resolution":{"observed_at":"2026-08-06T18:35:44.506406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.511081Z","title":"A call for clarity in reporting BLEU scores","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.511081Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:a69cb1bcee1701c9ecef3d4d017298b75e67a81d5809cb44ce20abdd6a4307bb","observation_id":"d298363c-ce56-40f3-868a-575b745537f2","resolution":{"observed_at":"2026-08-06T18:35:44.511081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.939727Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"ba546311-5467-402b-9498-938ebd780b79","year":2019},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.515339Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:63114734994c7d2d0ebc01af429e7c1fc99ff1bb9881c940a2e7580fab8085a8","observation_id":"5fa5563b-b172-4b29-96a3-2fc1dbeb3c5a","resolution":{"observed_at":"2026-08-06T18:35:44.944507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.519581Z","title":"C., and Lavie, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.519581Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:a5f15d03d156a3ed4d70668255dbec3e456fb846c4cfc9f3f8a90dabd710e8fd","observation_id":"9c0ae07a-b9d7-4497-acd9-a27346c868f9","resolution":{"observed_at":"2026-08-06T18:35:44.519581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03477","last_updated":"2023-10-05T11:45:29Z","snapshot_observed_at":"2026-08-06T07:20:50.725480Z","submitted_at":"2023-10-05T11:45:29Z","title":"Tik-to-Tok: Translating Language Models One Token at a Time: An Embedding Initialization Strategy for Efficient Language Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03477","snapshot_observed_at":"2026-08-06T18:35:44.523916Z","title":"Tik-to- Tok : Translating Language Models One Token at a Time : An Embedding Initialization Strategy for Efficient Language Adaptation , October 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.523916Z"},"links":{"cited_paper":"/paper/2310.03477","citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:d357a8b99d333bc2e5b092f4e5b0caae6d369e84b7c8b412164a114f2186a9d8","observation_id":"a8665cf7-5cfd-4b4a-929e-248b00747615","resolution":{"observed_at":"2026-08-06T18:35:44.523916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04303","last_updated":"2024-08-08T08:37:28Z","snapshot_observed_at":"2026-08-06T21:53:25.432282Z","submitted_at":"2024-08-08T08:37:28Z","title":"Trans-Tokenization and Cross-lingual Vocabulary Transfers: Language Adaptation of LLMs for Low-Resource NLP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04303","snapshot_observed_at":"2026-08-06T18:35:44.528703Z","title":"Trans- Tokenization and Cross -lingual Vocabulary Transfers : Language Adaptation of LLMs for Low - Resource NLP , August 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.528703Z"},"links":{"cited_paper":"/paper/2408.04303","citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:5a65b7d56aceb98994a09c54bd432ecea045df8f07b1c8d8c876133e52049cad","observation_id":"4d79e9c4-25fe-4109-b931-7409933b5139","resolution":{"observed_at":"2026-08-06T18:35:44.528703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.533454Z","title":"How Good is Your Tokenizer ? On the Monolingual Performance of Multilingual Language Models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.533454Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:abc164db673c4b5c17653c077ba526801a72945dbc082be4303a7ec1e8115f9a","observation_id":"7bb0fe1d-d9b0-45db-95ca-30cfd322eb58","resolution":{"observed_at":"2026-08-06T18:35:44.533454Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.923191Z","title":"W., Reddy, V., Zhang, H., Alameddine, A., Uzan, O., Pinter, Y., and Tanner, C","venue":null,"work_id":"e4c4dfbc-b7de-4c6c-9f5d-e4eac7bff7de","year":2024},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.538629Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:0241a6c4f6a4dfddaa7d66aeb9c004a67697f4fb8ba0ba3b54e3f34e1046a86b","observation_id":"8df6990b-ccaf-428f-8535-be850487643d","resolution":{"observed_at":"2026-08-06T18:35:44.928832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.542993Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.542993Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:6125126b9ed792a336d725965734bfb27223e63f0af8d5bb226e60e4a1904559","observation_id":"41589531-8b84-4d7b-945a-ea26408c880e","resolution":{"observed_at":"2026-08-06T18:35:44.542993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.907904Z","title":"N., Kaiser, ., and Polosukhin, I","venue":null,"work_id":"5c379876-c43a-4269-b90e-ca75b9c9bd71","year":2017},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.548767Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:9cb9323f4592ec04286fa85ca796d9bd99007e6eb0a248f7ace2ed2f265c0fce","observation_id":"457187fc-0531-45c3-883e-f8340b0676e3","resolution":{"observed_at":"2026-08-06T18:35:44.912397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/w19-5441","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.892430Z","title":"The U niversity of H elsinki submission to the WMT 19 parallel corpus filtering task","venue":null,"work_id":"05c5db0e-da77-42cf-a2a3-cda90e272905","year":2019},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.553635Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:67e7d7aaadb95fd9d2dbaca84e49d993ec78489e875cbfd31f0b948ec85826b1","observation_id":"b25b0c18-afce-4873-96ec-1c3513c7fb28","resolution":{"observed_at":"2026-08-06T18:35:44.897215Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.557893Z","title":"Vocabulary learning via optimal transport for neural machine translation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.557893Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:7cc3f3e08ff0c54b827011e3fb1c84769b22011bbb8c0d289b0e794f0c9add96","observation_id":"84b8d306-3a99-4b72-a2fc-cd6d3be95d2a","resolution":{"observed_at":"2026-08-06T18:35:44.557893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.562542Z","title":"Tokenization and the Noiseless Channel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.562542Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:92e3adbc8b87578aa16be1d7209749985bc6d6b49bd7697b6ba3ae0bb14aaa6a","observation_id":"ff2a1ee5-93e3-4856-ae44-ed3d73095443","resolution":{"observed_at":"2026-08-06T18:35:44.562542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T09:47:58.559790Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":3,"verified_fuzzy":10},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2507.07824."}