{"as_of":"2026-08-09T09:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fe3e1fb78d03346c9deb6d26d9029566b0f8d9b0a5759acd344d78fd901d9553","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T21:22:42.436125Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16117/citation-record","integrity":"/paper/2607.16117/integrity","json":"/paper/2607.16117/citation-record.json","paper":"/paper/2607.16117"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:36.763206Z","title":"Alabi, Yanke Mao, Haonan Gao, and En-Shiun Annie Lee","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:36.763206Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:385651ef9d7c1f085ca9edc2d3f8fc529557353f60aac709cf7db0492abbe84c","observation_id":"4afdfa54-f88a-46e0-9a15-bcbed05c5422","resolution":{"observed_at":"2026-08-01T21:22:36.763206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:36.812325Z","title":"Do all languages cost the same? tokenization in the era of commercial language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:36.812325Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:cce23ef2d347c9bb73c14eac4f423b03ee281ef4a408b51e23b9959e2fe87e01","observation_id":"7ebeb8e9-7f88-4a7f-b891-d2444363f441","resolution":{"observed_at":"2026-08-01T21:22:36.812325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:36.902178Z","title":"Massively multilingual sentence embeddings for zero-shot cross-lingual transfer and beyond","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:36.902178Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:c21a0884cd0d1984fffa0d54e6af1e91046a88feb27d1c40d83882f29b44ef60","observation_id":"690b540f-d575-476a-8e7d-c6a90a6cc88c","resolution":{"observed_at":"2026-08-01T21:22:36.902178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00894","last_updated":"2025-02-02T20:06:39Z","snapshot_observed_at":"2026-07-06T20:29:50.870827Z","submitted_at":"2025-02-02T20:06:39Z","title":"MorphBPE: A Morpho-Aware Tokenizer Bridging Linguistic Complexity for Efficient LLM Training Across Morphologies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00894","snapshot_observed_at":"2026-08-01T21:22:36.983051Z","title":"Morphbpe: A morpho-aware tokenizer bridging linguistic complexity for efficient llm training across morphologies, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:36.983051Z"},"links":{"cited_paper":"/paper/2502.00894","citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:452902bd6d69cc1eeca135f36c1bfb23b5e243b730441f84d49b6a5d531f00d1","observation_id":"89d56c74-8406-4bfb-a1c7-5fb00e869092","resolution":{"observed_at":"2026-08-01T21:22:36.983051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-01T21:22:37.066132Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:37.066132Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:af42ef7bf11a05247dcdca51a3de61f33384ff0caeaab9946a12600f1d2271b1","observation_id":"d9a50f12-f94e-496d-a3b0-c902f0c676c2","resolution":{"observed_at":"2026-08-01T21:22:37.066132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10579-014-9287-y","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A massively parallel corpus: the bible in 100 languages","venue":"Language Resources and Evaluation","work_id":"97d93c16-b1d1-4078-a263-656ef38923d7","year":2015},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:37.209113Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:78d20858d45236ee508a531f7fc90c21f1ccf12f0e89af15bf5e11b9c95e373b","observation_id":"1db98461-7eb8-4595-bc6f-c35a2a4aa943","resolution":{"observed_at":"2026-08-01T21:23:49.821748Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:37.281928Z","title":"Clark, Dan Garrette, Iulia Turc, and John Wieting","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:37.281928Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:ae44f82181f14b3c6f1608326dd8e7b794be0bf7c61c58d70ad67b1d1ddf646d","observation_id":"56cfdd58-8a93-49ce-9d91-b3cb70c42225","resolution":{"observed_at":"2026-08-01T21:22:37.281928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:37.384422Z","title":"BERT : Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:37.384422Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:784f08f414a1536553ae0ca49eba7114459fbec7c76eb590442cc4e227147cb4","observation_id":"1c1471e1-2942-487b-a3f8-870c9090db12","resolution":{"observed_at":"2026-08-01T21:22:37.384422Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:37.479630Z","title":"Multiscale byte language models -- a hierarchical architecture for causal million-length sequence modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:37.479630Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:193efb0edc228fa0c2ed59f89b2938adfc369a5d9675ec2d8592de4b26079c6e","observation_id":"f84267cb-b37d-44e6-a32e-f03f760090f7","resolution":{"observed_at":"2026-08-01T21:22:37.479630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:37.572373Z","title":"O mer Veysel C a g atan, Akash Kundu, Martin Bernstorff, Shitao Xiao, Akshita Sukhlecha, Bhavish Pahwa, Rafa Po \\'s wiata, Kranthi Kiran GV, Shawon Ashraf, Daniel Auras, Bj \\","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:37.572373Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:404b42cf36c49d2fd2a666a5d48bd01b29b64203cd4045e0756cc7294551a35e","observation_id":"af455e76-ba7b-4c17-a00b-03e5f6650175","resolution":{"observed_at":"2026-08-01T21:22:37.572373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-01T21:22:37.680542Z","title":"Glm-5: from vibe coding to agentic engineering, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:37.680542Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:a2fca572f35fc1f237e08e9fe261b76c5c919ed5456295069e5855827643a9a6","observation_id":"9b48849d-5b01-4662-8309-4b87b91a1977","resolution":{"observed_at":"2026-08-01T21:22:37.680542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-01T21:22:37.776856Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:37.776856Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:9132053a7413ae84e3000c4731f5dfdbc3fb50766d477f50dc4a9ed72ab199e9","observation_id":"3c9eeacf-439a-4216-9443-06f56ccc44ce","resolution":{"observed_at":"2026-08-01T21:22:37.776856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:37.864150Z","title":"Bitext mining using distilled sentence representations for low-resource languages","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:37.864150Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:a508b829ac0f0953eea7b6327807410741d1a02d34b26315f87af2f988dfae06","observation_id":"57a89f98-0c42-4bb8-affa-5c4801d5e21e","resolution":{"observed_at":"2026-08-01T21:22:37.864150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:37.939070Z","title":"HTML Bible Index -- Ukrainian","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:37.939070Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:c742ad77f14d570e0b62c876be011a6bcc239d2833d741c388761a581e3b03a8","observation_id":"66cc1f93-437d-4249-a7c2-cc3e3cfc178e","resolution":{"observed_at":"2026-08-01T21:22:37.939070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:38.019718Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:38.019718Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:9aac645944336ac8ff861c1654c4484f163801d888e5beadbeb0006dd50b6fb8","observation_id":"4e885ffe-ebd8-4dfa-812c-11fbb4ae657e","resolution":{"observed_at":"2026-08-01T21:22:38.019718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:38.087203Z","title":"Ticls: Tightly coupled language text spotter","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:38.087203Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:ad17aa209e34c69cb0c8cd40ae267d2f1dfeb906603480cf73a0110aba50e969","observation_id":"51b4d924-55d4-48cf-a363-b90deaada197","resolution":{"observed_at":"2026-08-01T21:22:38.087203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:38.175841Z","title":"Lotz, Ingo Ziegler, Phillip Rust, and Desmond Elliott","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:38.175841Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:f2094ba0993742bdcb2ba0613a1670b3768a95bf6ddcd006a17bd1515da5bea6","observation_id":"91cc27fb-f243-4255-b5ae-5eb7e8441060","resolution":{"observed_at":"2026-08-01T21:22:38.175841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:38.269022Z","title":"Supervised contrastive learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:38.269022Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:6d14dc33e02925b9291b34328c942a7f71748d1e6da20c4fabdde0d9cc145faa","observation_id":"471917f3-ca0e-4399-8062-c12b98fd00ba","resolution":{"observed_at":"2026-08-01T21:22:38.269022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:38.363007Z","title":"Ocr-free document understanding transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:38.363007Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:f5e86cea768d66d2d33fd8321f048e5dc374af14c01661a83c95af73e144e58c","observation_id":"b4e2f324-9862-4c83-bdeb-5478d9520292","resolution":{"observed_at":"2026-08-01T21:22:38.363007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:38.463697Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:38.463697Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:bb403ca57734214a211f679eea5c3bcaeabf32046a2d4e74cb456c29c3dced89","observation_id":"ab8c803d-d344-4aa5-a89c-107a7c3ec915","resolution":{"observed_at":"2026-08-01T21:22:38.463697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:38.628112Z","title":"E uroparl: A parallel corpus for statistical machine translation","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:38.628112Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:b65f52249bb623b2f0efc702c336cb6df19b13cd85bdd7962ad1b4265a470a0d","observation_id":"c89ecd3e-30f7-4298-baeb-c123b5584fa9","resolution":{"observed_at":"2026-08-01T21:22:38.628112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:38.779807Z","title":"Subword regularization: Improving neural network translation models with multiple subword candidates","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:38.779807Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:4897e91d5a5b7aa5c576b4b1cbb399d4e42e3b807a1af8a443b5efdf587707ca","observation_id":"b48456d1-f3bd-4221-b18a-c26cb4e44827","resolution":{"observed_at":"2026-08-01T21:22:38.779807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:38.914733Z","title":"S entence P iece: A simple and language independent subword tokenizer and detokenizer for neural text processing","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:38.914733Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:271ac4df9acca45fa52f76ab8251d417df1410c89f5a645e0f92e1ffdb63cb80","observation_id":"7ba85ef0-8e0b-4cd5-bbe4-627f9a986fef","resolution":{"observed_at":"2026-08-01T21:22:38.914733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:38.983778Z","title":"P ix2 S truct: Screenshot parsing as pretraining for visual language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:38.983778Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:ef8f23c130305c21f5e1dbafb18d080d847621cabdb9bf17a5bcb921df5fb7ab","observation_id":"493f913f-00d2-4540-b3bc-2b1c2c5420a3","resolution":{"observed_at":"2026-08-01T21:22:38.983778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:39.135595Z","title":"Trocr: transformer-based optical character recognition with pre-trained models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:39.135595Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:bba4f7b07255567ead2ab6ff630c90622f2b8406da8e92065270e262a0d067e9","observation_id":"dedbb092-5bd6-4977-9bf3-ec1232f7e99f","resolution":{"observed_at":"2026-08-01T21:22:39.135595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:39.275565Z","title":"Tokenization impacts multilingual language modeling: Assessing vocabulary allocation and overlap across languages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:39.275565Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:51e69bf28949d66138f8d93ee6a38dc9ac0ce754b0fd8bc3b570b38af4d3b616","observation_id":"de52aea0-b594-4c14-b241-c165b657feee","resolution":{"observed_at":"2026-08-01T21:22:39.275565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.900","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Character-aware models improve visual text rendering","venue":null,"work_id":"4d4b03d3-9527-4401-a02f-dae4c459bc8f","year":2023},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:39.449884Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:e63736b5340c1e949d1106c3d661805b81c48ac12f12270d95932f7db6374079","observation_id":"ac2178cf-71ee-42c3-82be-3dd35c4887e3","resolution":{"observed_at":"2026-08-01T21:23:49.478668Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-73226-3_21","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Glyph-byt5: A customized text encoder for accurate visual text rendering","venue":"Lecture notes in computer science","work_id":"82536e16-a5e4-4f84-a2ec-da7e134c9517","year":2024},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:39.605288Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:ca91c28106183e02fe7c97966331bc848579faa7a66417a212e43821de6871c4","observation_id":"1de230ae-c90c-4808-848b-05ba9dfb49e1","resolution":{"observed_at":"2026-08-01T21:23:49.345965Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:39.790370Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:39.790370Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:d170fac1995e2a8ebf23067c6b94658e7afc25976d73678a02b0bb834b83240e","observation_id":"cae33c4a-309e-4b18-8237-aa5ce9036c2f","resolution":{"observed_at":"2026-08-01T21:22:39.790370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:39.929199Z","title":"Beyond fertility: STRR as a metric for multilingual tokenization evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:39.929199Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:b1eb16f80e8835adf16cc57d7e0322a9cd5c40fab7508b8c45a0c5c9929ee9da","observation_id":"7152fbb3-9129-4a9b-971d-25084ce08c86","resolution":{"observed_at":"2026-08-01T21:22:39.929199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:40.053631Z","title":"Hierarchical autoregressive transformers: Combining byte- and word-level processing for robust, adaptable language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:40.053631Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:f8f9d2798bdf6888a9bd1d57f8f4dd027360ca660c663444d67dc70b511d59b9","observation_id":"4fac4be3-b216-46be-81f3-7fa56dff9d7a","resolution":{"observed_at":"2026-08-01T21:22:40.053631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-01T21:22:40.189860Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:40.189860Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:d54599f8bc3ffc06e5c7c50f5a8cdd05f605471b50159e91815d0e7e380ca1d1","observation_id":"664c8bad-32ff-47e9-ab49-1e76f9ff9703","resolution":{"observed_at":"2026-08-01T21:22:40.189860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:40.322457Z","title":"Byte latent transformer: Patches scale better than tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:40.322457Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:9e1b4c94b0ba57be7b2a40115af713f0adb20235fe3c0a23cac6ec275703d244","observation_id":"aefc44b6-41f4-4a9f-b909-64291cf33feb","resolution":{"observed_at":"2026-08-01T21:22:40.322457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:40.485573Z","title":"Language model tokenizers introduce unfairness between languages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:40.485573Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:709fd83d5c55fab3beecbccb6318fabbdde419af6e6150f7a489f02d897cf9d3","observation_id":"46aa5a51-013f-4128-b092-16f4a6a767c0","resolution":{"observed_at":"2026-08-01T21:22:40.485573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:40.573849Z","title":"Language Models are Unsupervised Multitask Learners , 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:40.573849Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:7793dd7e96d6e64ffcc19c22ea047b5d4e68381b7890ef2cad574fed018dbec3","observation_id":"1990d8bf-9dc6-4202-9278-839befd4f4fe","resolution":{"observed_at":"2026-08-01T21:22:40.573849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:40.652257Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:40.652257Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:3691051b8a7907b23137f3c2b22e371bad53f6bdbe8d8599c07cd4b19c59a7e9","observation_id":"6e76818f-677f-4f88-aa77-f5dbdd3cfe6b","resolution":{"observed_at":"2026-08-01T21:22:40.652257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:40.764452Z","title":"When every token counts: Optimal segmentation for low-resource language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:40.764452Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:69fdc2d83c747fb43ced7dfb08b552b3d7a36e6c5686be0a4580b799db0e74ca","observation_id":"4122f4c8-1c4b-47c0-93ea-8717ca75631b","resolution":{"observed_at":"2026-08-01T21:22:40.764452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:40.866372Z","title":"Making monolingual sentence embeddings multilingual using knowledge distillation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:40.866372Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:9444cc08256931aa8179c348368fc2d6af1f3cdb1c76c39efc690d6aa594714e","observation_id":"fbd82c04-164b-4c27-a563-ae7bf0763a07","resolution":{"observed_at":"2026-08-01T21:22:40.866372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:40.965157Z","title":"How good is your tokenizer? on the monolingual performance of multilingual language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:40.965157Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:27e78b284c204d19f849e9ad610a49468ba621f5075bbc6f6cb7d851d0d399cb","observation_id":"708f2e87-c438-477a-a744-7abc754436c6","resolution":{"observed_at":"2026-08-01T21:22:40.965157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:41.052936Z","title":"Lotz, Emanuele Bugliarello, Elizabeth Salesky, Miryam de Lhoneux, and Desmond Elliott","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.052936Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:1fdf5634d8b39129c9e3b3fbbe0155b1a6336957b9a939848d0fe9c9b92ac8e1","observation_id":"e93f06ce-3a4d-43f8-893d-0a810a01ee8b","resolution":{"observed_at":"2026-08-01T21:22:41.052936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:41.122188Z","title":"Robust open-vocabulary translation from visual text representations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.122188Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:70bb19e5bccbd0906ad4e7559be0f797b7b206ce6d76797126a61bb60dd923e3","observation_id":"e818e859-dcd0-4289-8205-6ec2795292d9","resolution":{"observed_at":"2026-08-01T21:22:41.122188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:41.193745Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.193745Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:185331a3e379db9eb0d9c513bee4b6685c654023325f188cc72206a3d0bafcf9","observation_id":"1365610e-2bd3-485b-a54e-c061e205b892","resolution":{"observed_at":"2026-08-01T21:22:41.193745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:41.268227Z","title":"Dropout: A simple way to prevent neural networks from overfitting","venue":null,"work_id":null,"year":1929},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.268227Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:e818f32352206b8d9a49b96bdde0af337b25f761f7913dc6a6c58c918f72e872","observation_id":"3e0a7752-7c68-436e-908b-176d6a0ff37c","resolution":{"observed_at":"2026-08-01T21:22:41.268227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:41.340888Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.340888Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:4b875239584fb1a99d6089e1aa000902601806cce61185a0e0a36a4ead003a6d","observation_id":"c9fffd0b-2f2a-4b62-9e69-cd84c0bacdff","resolution":{"observed_at":"2026-08-01T21:22:41.340888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:41.408834Z","title":"Tran, Sebastian Ruder, Jai Gupta, Hyung Won Chung, Dara Bahri, Zhen Qin, Simon Baumgartner, Cong Yu, and Donald Metzler","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.408834Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:37a9204464acf33ec5b093ea09d572a60923e6283e56046c9741e2e369de2244","observation_id":"acfe7422-013c-4cc1-9c27-d9272676e2dc","resolution":{"observed_at":"2026-08-01T21:22:41.408834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-01T21:22:41.479804Z","title":"Representation learning with contrastive predictive coding, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.479804Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:44d400f2958f35843d3a5eaecf05b32b37c19110c0ca04375320919dbfa1653f","observation_id":"29f73f0c-4deb-4a60-9613-bf83de9ab48c","resolution":{"observed_at":"2026-08-01T21:22:41.479804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:41.567529Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.567529Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:6cc1b8111ee9f1d7ef0bfc51525d51787e60ca40e678a74aa701f6a0d89ab2b1","observation_id":"617299bd-5135-4124-9555-716636fe1476","resolution":{"observed_at":"2026-08-01T21:22:41.567529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:41.668392Z","title":"Error patterns in historical ocr: A comparative analysis of trocr and a vision-language model, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.668392Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:adbfe06c5fc8f4cab0a65f2a0f905970455f7b4b350fbaf2c1227fc2e6516b07","observation_id":"11952a5d-fd7e-4996-987c-c84521da349f","resolution":{"observed_at":"2026-08-01T21:22:41.668392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:41.767793Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.767793Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:655c969a6ed0e965aee679e0998caa6ff50caf9baec89c131cde07330eb6653b","observation_id":"2b1bc23a-7e06-44ad-ad71-17b0b215c266","resolution":{"observed_at":"2026-08-01T21:22:41.767793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:41.836533Z","title":"The Holy Bible international: Text and audio bibles","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.836533Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:2024163e9750dbbf31477027301e5eb43d7ff81e0db7e06f213aa0bfcdff5a6e","observation_id":"0f8bf97d-6fe7-460e-892e-9b1b9dbaa99f","resolution":{"observed_at":"2026-08-01T21:22:41.836533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:41.913579Z","title":"On layer normalization in the transformer architecture","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.913579Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:943a7c40a1933248177b1b421309a951c6a8c5b4929924545ae7bc1fe4d121d8","observation_id":"708009d9-68af-40ca-b455-d605ac09cc3d","resolution":{"observed_at":"2026-08-01T21:22:41.913579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:41.984457Z","title":"B y T 5: Towards a token-free future with pre-trained byte-to-byte models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.984457Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:6758341196de111688e242612366fd01b1697794b74ef890bb570b3c67df3192","observation_id":"478fbc81-65c8-4675-8d82-87983efe1de8","resolution":{"observed_at":"2026-08-01T21:22:41.984457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T21:22:42.054784Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:42.054784Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:6b5257814d885e39334173edfbd8686e655842dd27339877a764e28193d03762","observation_id":"298aecb2-20e4-4f5e-b979-36255ca1d114","resolution":{"observed_at":"2026-08-01T21:22:42.054784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:42.124243Z","title":"Megabyte: Predicting million-byte sequences with multiscale transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:42.124243Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:d4faed7c457130dc87e357978f08c3dab4b502ea1b76e60f8404089d101d43a8","observation_id":"53396375-1549-4551-9fa7-5bac8d3560ea","resolution":{"observed_at":"2026-08-01T21:22:42.124243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:42.199436Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:42.199436Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:3e4bf15de9ed3755d559fdba8a3182fb7da64d5c615b3cec30c083b10c237a65","observation_id":"2c442f75-bb28-49ac-a844-8fb21ebba32d","resolution":{"observed_at":"2026-08-01T21:22:42.199436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:42.285016Z","title":"Root mean square layer normalization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:42.285016Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:4ff4c50d89560177361dace2c6119a549610aa6a5f8115362537b52315435a3b","observation_id":"072e5444-8eeb-43ff-90a2-3b30afa727cb","resolution":{"observed_at":"2026-08-01T21:22:42.285016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:42.357323Z","title":"MIRACL : A multilingual retrieval dataset covering 18 diverse languages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:42.357323Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:9772a0bd285ceb9f3b0b8f31c93419cdd1264b1488cd8d153a8acae694a8eb2b","observation_id":"5b5aa7f9-d62b-4d8d-8579-5c62997a6ba5","resolution":{"observed_at":"2026-08-01T21:22:42.357323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:42.436125Z","title":"The U nited N ations parallel corpus v1.0","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:42.436125Z"},"links":{"citing_paper":"/paper/2607.16117"},"observation_digest":"sha256:4e59bc75a5dd7c03fddd651ad2d0b7d4734d33c41f89fc2a365c61d7e3521880","observation_id":"d1798f42-01cd-43cb-938c-cf700bd193e7","resolution":{"observed_at":"2026-08-01T21:22:42.436125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16117","last_updated":"2026-07-17T16:55:27Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T21:47:36.733560Z","submitted_at":"2026-07-17T16:55:27Z","title":"Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2607.16117."}