{"as_of":"2026-08-08T05:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eaa6efb4f7ca716594a0625ff373f8823549c2b582651376a7e8220c270b91a0","coverage":[{"denominator":119,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:18:14.155802Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.03101/citation-record","integrity":"/paper/2506.03101/integrity","json":"/paper/2506.03101/citation-record.json","paper":"/paper/2506.03101"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T11:18:05.003786Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.003786Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:ebf5a762b8df86442d99b5291377b18b4a05a22fde092537d223a6d2c371cadc","observation_id":"4f722f28-c588-4ea1-950f-547f3c326203","resolution":{"observed_at":"2026-08-07T11:18:05.003786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.061663Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.061663Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:77645880bd01fd027bf99079b2ddee4f5ec5ff204d9ca6fd8e140f66f95e430f","observation_id":"b33c2e22-7b59-485b-97a4-970b83a69d0c","resolution":{"observed_at":"2026-08-07T11:18:05.061663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.136662Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.136662Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:bd23ceca738dc994fa9257a7b236094cd10de58ebb6638c96c71bc2fce2aa690","observation_id":"6b84f0e6-ca3c-46d3-a69b-ef1de24f82cd","resolution":{"observed_at":"2026-08-07T11:18:05.136662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.209178Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.209178Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:bfe04aa0944f3708e2bceac65963b45fdb9f71f3a3fb8ce29c4b1c549cee52db","observation_id":"b178247d-d95c-41e0-a57b-cc475475cbd5","resolution":{"observed_at":"2026-08-07T11:18:05.209178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16867","snapshot_observed_at":"2026-08-07T11:18:05.279695Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.279695Z"},"links":{"cited_paper":"/paper/2311.16867","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:b182f520dcd1025be27a8f8bd9682eabd3d9c052a007937d97844ddc61e3e258","observation_id":"4b57c19f-79f2-40ff-abf3-b710a1690ea0","resolution":{"observed_at":"2026-08-07T11:18:05.279695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.358249Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.358249Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:dad36dd59a8f424250642fd46bf9e8e74252525bd261ba824a4e44e2011ce48f","observation_id":"d22059dd-b857-48db-89f9-3e3cc66bb6e2","resolution":{"observed_at":"2026-08-07T11:18:05.358249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.433759Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.433759Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:7ce98e2899c321650798614666c8865095552b5eae22841067f0f37542c5a8b9","observation_id":"53c51576-d05d-4ed2-b1d8-d63319849633","resolution":{"observed_at":"2026-08-07T11:18:05.433759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14619","last_updated":"2024-05-02T00:30:57Z","snapshot_observed_at":"2026-07-06T18:04:04.541434Z","submitted_at":"2024-04-22T23:12:03Z","title":"OpenELM: An Efficient Language Model Family with Open Training and Inference Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14619","snapshot_observed_at":"2026-08-07T11:18:05.514145Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.514145Z"},"links":{"cited_paper":"/paper/2404.14619","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:85467354a2fa7dd3b5b683a81d94f23e9a47d0d449a43181cec0f31ffc0dd05b","observation_id":"a885699d-6d29-48a5-8fc5-59fb12c13d4b","resolution":{"observed_at":"2026-08-07T11:18:05.514145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-07T11:18:05.550641Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.550641Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:41f335c20ffa28a74480e1d48bcca9a8a671904ea8fcedea5ca56a49cb8852f6","observation_id":"d70730f7-07e1-4b9b-b1ed-d81742a704a3","resolution":{"observed_at":"2026-08-07T11:18:05.550641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T11:18:05.607712Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.607712Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:0bf65dc6244165d4b1adbcedc6272b003692b4f09b8ae0916879eb8076612c02","observation_id":"46960b5e-09f2-494b-8a6e-7152598fdfab","resolution":{"observed_at":"2026-08-07T11:18:05.607712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.679240Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.679240Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:180d6da040fdc2b41803cf7cd2a4e904d719ddbf124bb69f396b7cc2e6ffb900","observation_id":"dde45e0d-36f7-44a4-ad88-3fa111912b88","resolution":{"observed_at":"2026-08-07T11:18:05.679240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.729950Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.729950Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:b36a5a23fc504ba30e208e6b20c0cef041e0f2fe6e779b2ff8c1ba0cd295db60","observation_id":"ab01704a-4a6e-444e-af04-57be7b472536","resolution":{"observed_at":"2026-08-07T11:18:05.729950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.800509Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.800509Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:98b1ed97f2cfd80e3dd00c34bdb0b1a01456894dde5e4fea1c0bb4448ec5d7d2","observation_id":"aa07b61f-506e-4618-89e3-3c3826277049","resolution":{"observed_at":"2026-08-07T11:18:05.800509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10102","last_updated":"2024-05-15T00:57:23Z","snapshot_observed_at":"2026-07-06T18:00:34.983732Z","submitted_at":"2024-04-15T19:19:56Z","title":"Chinchilla Scaling: A replication attempt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10102","snapshot_observed_at":"2026-08-07T11:18:05.875330Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.875330Z"},"links":{"cited_paper":"/paper/2404.10102","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:156686670c143f1f639c9e2f5517bdcd1a11f3d2529458c5c3e0359351e29920","observation_id":"448cd705-652d-45d9-b596-7f5c2e36200b","resolution":{"observed_at":"2026-08-07T11:18:05.875330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.936291Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.936291Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:da2b78c25784e9ac6fea86575896cb3e4fd6c10c4dc02c1a843a45645e223c72","observation_id":"9c4bd12c-c541-4c4d-9a21-76d4f330225b","resolution":{"observed_at":"2026-08-07T11:18:05.936291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-07T11:18:05.968985Z","title":"Rush, Stella Biderman, Albert Webson, Pawan Sasanka Ammanamanchi, Thomas Wang, Benoît Sagot, Niklas Muennighoff, and 374 others","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.968985Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:59b5f68c90cc0b6e9490a2389532ab3cb46d2e03bbaddf46401fa8909df24a10","observation_id":"0149b0bf-4c0a-4bd0-9936-5e2e08580923","resolution":{"observed_at":"2026-08-07T11:18:05.968985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.054844Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.054844Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:bffb4b2a6f162a894b0e6ae5d7b0c812eba3c86fa95e9b4907f25bfcef2f0966","observation_id":"d79e9ac7-37d0-43c3-8417-38586b3c2da6","resolution":{"observed_at":"2026-08-07T11:18:06.054844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.058538Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.058538Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:178fafd0a612f31ea2c2b4fe36b79f61abd7aaa10df7fd882816e65ac4246b95","observation_id":"50a0f69a-d54b-4836-9c0c-9f54318c78dd","resolution":{"observed_at":"2026-08-07T11:18:06.058538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.067253Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.067253Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:2c3dbfe086a2933155972e79b51c1acccd3fb51c74ab75f25dcaadcbdfdbbc9d","observation_id":"09e85320-1a8c-474f-98a4-740dbe500ff3","resolution":{"observed_at":"2026-08-07T11:18:06.067253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.210566Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.210566Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:ac266a7680778e541b8157921a22df270e07e20faba07d8784087cd21a740ae6","observation_id":"dea69fa7-c750-47c6-93ff-850aa9ed5ae7","resolution":{"observed_at":"2026-08-07T11:18:06.210566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.292149Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.292149Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:629c774bdbf97e205b5700b2bf32abd0b74372c6ebb62e4a069c22f00b65a67c","observation_id":"ee80d871-165b-4cd4-a525-c9c56e777a3b","resolution":{"observed_at":"2026-08-07T11:18:06.292149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.346314Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.346314Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:4f40aa6d6c9d683a665edd5cdaed1c557fd927e1160da1b9a1b0def886778ae8","observation_id":"0de0b97c-c426-4e07-943c-2cae86d409dc","resolution":{"observed_at":"2026-08-07T11:18:06.346314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.433622Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.433622Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:054374d169a7be05c62d610c6ecf8affd07a244510df36a54cc3f5586c8260d3","observation_id":"eb9776f5-a857-474e-ad5e-4aaac5fd26e8","resolution":{"observed_at":"2026-08-07T11:18:06.433622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.589336Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.589336Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:c6acdbdb57c30e8658f35d31ad42df7abda75fe21c4448504ab9b9688de3bd47","observation_id":"bcb5c067-917d-4255-8f3f-ec76470f3756","resolution":{"observed_at":"2026-08-07T11:18:06.589336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-06T08:05:35.311510Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-07T11:18:06.732776Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.732776Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:9acc71d32d0ff8785194dd445456252932507087d346c3670a5475b348b30ad9","observation_id":"d86143a8-bdfb-4831-97fb-d07dbb9eb522","resolution":{"observed_at":"2026-08-07T11:18:06.732776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11840","last_updated":"2025-06-02T19:33:41Z","snapshot_observed_at":"2026-07-06T19:34:01.458836Z","submitted_at":"2024-10-15T17:59:10Z","title":"A Hitchhiker's Guide to Scaling Law Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11840","snapshot_observed_at":"2026-08-07T11:18:06.831760Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.831760Z"},"links":{"cited_paper":"/paper/2410.11840","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:1b7a6bb2be5210eccdc4c2ecc611b33bb87da069cf8aa3e4a029367c9eea45ac","observation_id":"31b97626-9971-4b1b-bffd-8f987e8ec9d2","resolution":{"observed_at":"2026-08-07T11:18:06.831760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.916815Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.916815Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:e34367df6b9e77f97c070980d604c998c30d71f35477642ba944b083c320b971","observation_id":"7769dd7f-7cb4-4d82-96b1-04622c85d705","resolution":{"observed_at":"2026-08-07T11:18:06.916815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.005116Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.005116Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:72384a1b0aa02180080fc245f57f4ccb5571279521a422f27252af9c535f0de6","observation_id":"ae2273cd-051d-4ffc-968a-f1289b1e3178","resolution":{"observed_at":"2026-08-07T11:18:07.005116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T11:18:07.088585Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.088585Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:ea20795f0aa3076a70f64b650bee03542cd3f83d0297ab6b5a97fe91a2c0ec94","observation_id":"cb58c326-6ced-42a6-8b67-f3632272032d","resolution":{"observed_at":"2026-08-07T11:18:07.088585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.189595Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.189595Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:75698fd749313516171ca95d2e2f182f21d3ae56611b9d96622791160389a018","observation_id":"f6f21d32-fe7a-4c3c-953e-a1e89e3f0656","resolution":{"observed_at":"2026-08-07T11:18:07.189595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.286069Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.286069Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:255d979d3ef3bfcbdd6c617835b0d4bf765975d86cd85474edca430c0bbf3ab2","observation_id":"38d5cd2f-64f2-4e65-b054-3fdbe7eab680","resolution":{"observed_at":"2026-08-07T11:18:07.286069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.355507Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.355507Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:db48f0684e4d879bf8e652f7a6cd4f96195b783a92719c76ef272fbd376af76c","observation_id":"283c60c0-de6d-422a-9e2b-c6c208bc049c","resolution":{"observed_at":"2026-08-07T11:18:07.355507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-24337-0_38","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:18.355123Z","title":null,"venue":null,"work_id":"08e59959-6153-4cc2-94e1-e37523d71a36","year":2019},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.493609Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:badee5cc8f57a4ce966c1dbfac2b6f0b47a62b07b6516040634b185ed1ac153f","observation_id":"ba6986bc-c4ec-4fe3-9bf5-bac6bd6cfae2","resolution":{"observed_at":"2026-08-07T11:18:18.458667Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:18:07.585016Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.585016Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:70143e2d8be7db6da69643ddb681fa418274456f4dbc2eb7d629d4b63609a822","observation_id":"9d1afc3f-0469-4889-90eb-125cc9da77e2","resolution":{"observed_at":"2026-08-07T11:18:07.585016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.666603Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.666603Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:61b725766b2f6ca1b6363a73a2de1302402923fd3a0771f663e59d821a136e47","observation_id":"5206d088-e72a-4e59-9318-231358ea5e69","resolution":{"observed_at":"2026-08-07T11:18:07.666603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.751641Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.751641Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:acd4023e33c7b1b7519bf580fe34736628d61a4a16b08a9a8546f709fc9b7608","observation_id":"26d23ea1-5964-4fbd-ab4b-6c5c7a9e0c61","resolution":{"observed_at":"2026-08-07T11:18:07.751641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.823668Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.823668Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:919e6df1f0feecb5ab77ce36e9f4ab0fd11dd4732df87e1b02e8155dfbb70dcb","observation_id":"4cad5739-2bff-4ec8-904e-273ed7626e81","resolution":{"observed_at":"2026-08-07T11:18:07.823668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.892507Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.892507Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:a27095b6309930e81a3326996f3a621455cf0e45c5cea3946238d258469a273a","observation_id":"15685760-aede-48b8-bb82-a339cfb8a4a8","resolution":{"observed_at":"2026-08-07T11:18:07.892507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d18-1029","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:18.150917Z","title":null,"venue":null,"work_id":"820284af-223d-4da8-ba90-bf8d52935d72","year":2018},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.974551Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:b24e52ab03900201f8e420bfeae1106b8b4ea1ee663fa3fed9cdb5f8c916ab9d","observation_id":"74911a81-cadd-4554-a25f-d92b95090825","resolution":{"observed_at":"2026-08-07T11:18:18.252141Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:08.036387Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:08.036387Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:e8fff6a98fdd911b80d9630429b91ebd1a16aa39d81009957c6a35b7278e3c73","observation_id":"da5d1d79-2ee2-44fe-bd74-f25bcff46402","resolution":{"observed_at":"2026-08-07T11:18:08.036387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:08.117686Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:08.117686Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:35b99d6c776ff4761ddd2ade6d820718bfaadc2bb638e2fdc0c9dcc643a8477d","observation_id":"c55b8ebf-fe9a-44b8-9552-f7ac219781b0","resolution":{"observed_at":"2026-08-07T11:18:08.117686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-94-015-9273-4_9","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:17.915159Z","title":null,"venue":null,"work_id":"a9c7fac1-4f87-4648-93dc-3fec8080f63f","year":1999},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:08.247627Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:64c2208973acd822625f9da59b0d212c3070b4b30600f46a5ea77584737ed460","observation_id":"740cdedb-83ad-472f-888d-0dc4fe9cf351","resolution":{"observed_at":"2026-08-07T11:18:17.988894Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:08.342932Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:08.342932Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:1f61ebd65701747f328ea6adc8274ce6c67ae3854da973fec7329d0188f8be0a","observation_id":"e44f1d44-8dfb-4867-bbe1-483cc4b8146c","resolution":{"observed_at":"2026-08-07T11:18:08.342932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-07T11:18:08.440449Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:08.440449Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:05de854e5858d0a234c53bd6b9330a958678de285de85eeecb923b415293e2df","observation_id":"63a22720-bf90-40fc-b953-dd5df9d4ee02","resolution":{"observed_at":"2026-08-07T11:18:08.440449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:08.561372Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:08.561372Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:69c38437a4ba00de327be7265ecd241ab8b997741ec5524d70d46e5ec96f2d42","observation_id":"5c9278dd-a2de-4a63-ad11-1a1676bbd6c8","resolution":{"observed_at":"2026-08-07T11:18:08.561372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:08.675351Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:08.675351Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:a4e5b21da9d03c85dff2f958915d7982fc1f538cd848800c5d1bde6bc192fb4e","observation_id":"a6914ab0-9bcb-4dd9-bbdf-8dde1acaac99","resolution":{"observed_at":"2026-08-07T11:18:08.675351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:08.791173Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:08.791173Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:fea7dcd2d3fecf778d69f55257b83cb0e1743cbfbf8ec1a332b97501d727f176","observation_id":"52c2e28f-c152-4e4a-9c41-6b3bf3b4912f","resolution":{"observed_at":"2026-08-07T11:18:08.791173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:08.882270Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:08.882270Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:812d89f510570456cccbd3428cfe4c29d012d09ba41aef21770c254b7a981803","observation_id":"24caf797-10b0-4587-9305-4a66b7c9515c","resolution":{"observed_at":"2026-08-07T11:18:08.882270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:08.980622Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:08.980622Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:7a792e1a9d40143e93b4bd2dafd63fd3752dcb4748245bab1e219c7e8cf2eb87","observation_id":"565c93fb-a92d-438a-9a1d-c3905e22582e","resolution":{"observed_at":"2026-08-07T11:18:08.980622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T11:18:09.106642Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:09.106642Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:ca8fa56dbe97c28985ba4af41cb220444aaf3f50fdec6f0bc78e22fcbd7a945a","observation_id":"e25dc7b8-e07c-4fbf-87f7-50d5a27dbb91","resolution":{"observed_at":"2026-08-07T11:18:09.106642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:09.225849Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:09.225849Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:736c479e5a01c84b378a525a95238774889acdebb9db668a7a311b61dac133ac","observation_id":"8f0de661-2f62-465a-982a-d27d765933e6","resolution":{"observed_at":"2026-08-07T11:18:09.225849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T11:18:09.372380Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:09.372380Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:668fe8f752f30ee5af274e58069dbacdddcf6408a5bd9d15a864c7d205d8617f","observation_id":"319d5dd3-d24c-4af6-8023-647eb87e158d","resolution":{"observed_at":"2026-08-07T11:18:09.372380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:09.484927Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:09.484927Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:7d86571e9be64e863f6aeba77859c79d8e6f9afa7a6dc02351958378f1dcaa0f","observation_id":"8b502fea-09fe-4b0c-ae30-f4ebc6a4dcbf","resolution":{"observed_at":"2026-08-07T11:18:09.484927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:09.591834Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:09.591834Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:b6f3942941f8734a33c5de00b01dadd0ead095407d92597a68d601b95e99bf82","observation_id":"00090f23-7f6b-4275-bc0e-af616f420ff9","resolution":{"observed_at":"2026-08-07T11:18:09.591834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:09.689848Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:09.689848Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:abdf2f884914e87f229bd0415962bdfc32c409836633108a83b5d4abf2959300","observation_id":"3cf2ae28-bdf9-4405-b793-a4c57564b18a","resolution":{"observed_at":"2026-08-07T11:18:09.689848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:09.787713Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:09.787713Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:9e32a9f2f8b7cfc037742d23223e15d7cb90a021dd76dedb9e858c19c48a3f15","observation_id":"7fe6aad3-7e27-4d94-871d-0a2900370592","resolution":{"observed_at":"2026-08-07T11:18:09.787713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:09.895410Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:09.895410Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:8b7c99ac28e97424b6b2d30e29a5165a2e28715a7a8d8e516656e99b1f338379","observation_id":"ab06eed3-e6c9-43e3-9696-2e31176b49f5","resolution":{"observed_at":"2026-08-07T11:18:09.895410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.findings-emnlp.54","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:17.644228Z","title":null,"venue":null,"work_id":"b72c6bac-e3b2-4505-a2db-12753cd14a6b","year":2022},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:09.987544Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:d80c9649fb1ce98f9521a9edb9f14bf52fec9a7cd932749d43d407859c558107","observation_id":"a6943edd-5246-483c-a5f0-183314b689c6","resolution":{"observed_at":"2026-08-07T11:18:17.734264Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:10.068738Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.068738Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:f0cadd5ec6a18f469701b253437cfbd0f48fb66b5b14355ed2fe6a4fec05afb5","observation_id":"e8cd2a43-6669-4255-ac03-3b6dc1feda00","resolution":{"observed_at":"2026-08-07T11:18:10.068738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05463","last_updated":"2023-09-11T14:01:45Z","snapshot_observed_at":"2026-08-02T22:47:03.212781Z","submitted_at":"2023-09-11T14:01:45Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05463","snapshot_observed_at":"2026-08-07T11:18:10.145613Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.145613Z"},"links":{"cited_paper":"/paper/2309.05463","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:837c0f5ea4f2de77de3c4dd1ec4d23633896d05a941c61c43ff8f0d76e765c93","observation_id":"8d2abf67-cb9e-4412-8cee-d854bf49b495","resolution":{"observed_at":"2026-08-07T11:18:10.145613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:10.256134Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.256134Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:2a3cfa9d363342829c2bb484cf39d62f6c0cf2be69949597231c93dfcb67bd18","observation_id":"e230d674-e1cc-4504-84f8-5f03ea259358","resolution":{"observed_at":"2026-08-07T11:18:10.256134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T11:18:10.369296Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.369296Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:6713a62696283ea9da194b5674078b5f1949d34a25253d0f7973e785cc47c374","observation_id":"4a290e74-e832-4dc5-b9bb-bc142b51dc30","resolution":{"observed_at":"2026-08-07T11:18:10.369296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:10.479679Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.479679Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:a9059380ea1990cb1d7fc506e7054dd49ff43da87d665e226c5230934f065caf","observation_id":"6ecbbf51-9fd6-48d2-abd0-8e4c18719ba1","resolution":{"observed_at":"2026-08-07T11:18:10.479679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:10.561782Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.561782Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:b3bdc539ce217ad682019414fe35f47243ef4af771d47beccbea67b5a313fd63","observation_id":"31ce1af2-af14-454f-8f8f-83a10cf34168","resolution":{"observed_at":"2026-08-07T11:18:10.561782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:10.668349Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.668349Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:e33da23a9ddc6d6fd3cd196b0e882b6ec7f406750979dd3e1f7277f19401de20","observation_id":"bebf1104-eb83-4e40-9812-f0a6f533e587","resolution":{"observed_at":"2026-08-07T11:18:10.668349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-07T11:18:10.760594Z","title":"Singh, Rylan Schaeffer, Andrew Poulton, Sanmi Koyejo, Pontus Stenetorp, Sharan Narang, and Dieuwke Hupkes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.760594Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:8cc5c6d4630262f0cafe0c9e31fc82d55e14dc31860a35c5b408e50735ac3c00","observation_id":"5238fcf6-3d49-42d7-95d7-957763d3bf49","resolution":{"observed_at":"2026-08-07T11:18:10.760594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16235","last_updated":"2024-09-24T16:51:36Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T16:51:36Z","title":"EuroLLM: Multilingual Language Models for Europe","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16235","snapshot_observed_at":"2026-08-07T11:18:10.846695Z","title":"Guerreiro, Ricardo Rei, Duarte M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.846695Z"},"links":{"cited_paper":"/paper/2409.16235","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:0787630af52c96b5a15dc4cbc70cf45cc573a35277baee8b5ebc99d9d537b297","observation_id":"540dc138-6d8f-400e-b5f5-07af25a2348c","resolution":{"observed_at":"2026-08-07T11:18:10.846695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14619","last_updated":"2024-05-02T00:30:57Z","snapshot_observed_at":"2026-07-06T18:04:04.541434Z","submitted_at":"2024-04-22T23:12:03Z","title":"OpenELM: An Efficient Language Model Family with Open Training and Inference Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14619","snapshot_observed_at":"2026-08-07T11:18:10.936438Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.936438Z"},"links":{"cited_paper":"/paper/2404.14619","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:3b1bdd4c8ca4a5fc2b7b0ffbb8c9de27d6446d064563c2533d52a4a7504414d1","observation_id":"bfa69431-9363-4bd4-b25d-0489ac2f9b6f","resolution":{"observed_at":"2026-08-07T11:18:10.936438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10508","last_updated":"2021-12-20T13:04:18Z","snapshot_observed_at":"2026-07-06T12:20:36.165718Z","submitted_at":"2021-12-20T13:04:18Z","title":"Between words and characters: A Brief History of Open-Vocabulary Modeling and Tokenization in NLP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10508","snapshot_observed_at":"2026-08-07T11:18:11.036474Z","title":"Mielke, Zaid Alyafeai, Elizabeth Salesky, Colin Raffel, Manan Dey, Matthias Gallé, Arun Raja, Chenglei Si, Wilson Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:11.036474Z"},"links":{"cited_paper":"/paper/2112.10508","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:2ccb3a9a369a6d5d03636c99d1dae3ad852af4b2bea87ed2dccfe0f830fcafd0","observation_id":"1f1860a8-eae6-4cc5-b178-70030171147b","resolution":{"observed_at":"2026-08-07T11:18:11.036474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1371/journal.pone.0147073","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:17.430004Z","title":null,"venue":null,"work_id":"670881ee-c3af-4630-8052-cd9d46846947","year":2016},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:11.112991Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:b59bd1cabe1a0639f15f7987c4a24bdb9a5964cddfd1266733868dd4ec64b9ad","observation_id":"73f5ce08-3ac2-48b4-beaa-405c1d880c4f","resolution":{"observed_at":"2026-08-07T11:18:17.499233Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:11.209487Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:11.209487Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:63a58bd5659e417c6ba129db0ea83117d1c63e17f0b8922a3743affdcb37bc30","observation_id":"359e57fe-4196-460a-adcc-612268ad0af8","resolution":{"observed_at":"2026-08-07T11:18:11.209487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:11.280660Z","title":"Cohen, and Mirella Lapata","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:11.280660Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:41642df2a7f8c8fcf5f820865a3107ff1023018fe89de93e846e9ab50e4f0f53","observation_id":"fc4f68f0-f8a2-42ea-bd7d-817258cdd395","resolution":{"observed_at":"2026-08-07T11:18:11.280660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:11.367081Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:11.367081Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:0f41f2fa260c63bbf9b870d21765b06a3227ce1b366ca9ebb401e1d6b1894060","observation_id":"21b50d60-b4ff-4870-9cb1-45d6fbacc392","resolution":{"observed_at":"2026-08-07T11:18:11.367081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:11.463249Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:11.463249Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:e8ed613bb9983872208db8c7a0d87d93a9e0feb4c621d9015b42cd25f92062dc","observation_id":"6cf5af2f-124d-4960-abf0-5f5c303fc6b5","resolution":{"observed_at":"2026-08-07T11:18:11.463249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:11.661232Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:11.661232Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:7f5f47cd99368a64a83361fd3e6a81fd09e327d17df438c88d6f0e8666b626c1","observation_id":"3d0884be-3e9b-49a5-89ea-c6b1bc45d5d2","resolution":{"observed_at":"2026-08-07T11:18:11.661232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:11.805599Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:11.805599Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:43e744ba94f9d063f98137fe94fa1dd9678a5330dd59863be7563997545160a7","observation_id":"b6d973b2-7966-418d-bc12-7115fd51a42d","resolution":{"observed_at":"2026-08-07T11:18:11.805599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:11.932518Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:11.932518Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:bb85061ec5db63557e8d91e08321d4d0e0a8bdface407cf7eb4b7028a89339b8","observation_id":"0ae96064-5f7d-4959-8f02-bc3fd4eabfed","resolution":{"observed_at":"2026-08-07T11:18:11.932518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.033622Z","title":"Piantadosi","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.033622Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:9dbdd0deb3e16ae080a72d29291e5c305cb5cc252faeeb02e787e45060df0f8e","observation_id":"26fa3877-586e-4652-8c59-1cb7928bc5e4","resolution":{"observed_at":"2026-08-07T11:18:12.033622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.183114Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.183114Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:e1fd454aa9451bf6ca923ab1060aba0b657a6f58ce993eae0c8644f1385033eb","observation_id":"9d2c61dd-a140-432e-879d-f32c93683d5b","resolution":{"observed_at":"2026-08-07T11:18:12.183114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.258769Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.258769Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:3febb49f477cc65edb8f5e9c04b7421310cc3d032320d9e2581ac1b5f5f772e0","observation_id":"3ebb3c47-936a-42ee-bb09-488a0d7d3e0b","resolution":{"observed_at":"2026-08-07T11:18:12.258769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.413526Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.413526Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:fe0c769c503c2b763278c9dbd917d54945b4c475c63f143545c0efb5a1dc81c5","observation_id":"937aa1cb-69c9-4a93-95f9-15293de41560","resolution":{"observed_at":"2026-08-07T11:18:12.413526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.561226Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.561226Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:6f9517e9e959721336524dd901d56912ed2fbe6ce31cc80736cd56925c20534f","observation_id":"d9b3bb16-4262-4e2b-b92a-9aba614bce3b","resolution":{"observed_at":"2026-08-07T11:18:12.561226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.632455Z","title":"Lotz, Emanuele Bugliarello, Elizabeth Salesky, Miryam de Lhoneux, and Desmond Elliott","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.632455Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:874549e83ef6720d803e2b59be70f5d8d4d21b5d97e12ea6cf1cf330b21bc3c5","observation_id":"ae30daef-99fc-4d8d-a055-e266d800569c","resolution":{"observed_at":"2026-08-07T11:18:12.632455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.695399Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.695399Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:010d1baf0b4a4cc53d8f62d16bacaa2192a27158af63fb7826be7e49cc740aae","observation_id":"a365935b-c168-4afa-8a0a-48007419994e","resolution":{"observed_at":"2026-08-07T11:18:12.695399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.764203Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.764203Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:cb348f13584a9375f38865515db1f322c814a1ac32b48201523fd29bce7d17f9","observation_id":"9627f0f7-968b-455b-a339-0e5c5a63250b","resolution":{"observed_at":"2026-08-07T11:18:12.764203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.845798Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.845798Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:517f6a6f08820eb737f27c1abdee53f94c40297ce7b2b0abbe518c16af9e5ec5","observation_id":"2b06034d-63d7-4b84-a4c5-23f6180324ee","resolution":{"observed_at":"2026-08-07T11:18:12.845798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.896255Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.896255Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:2a7b7a071ba947e2423053eb1803a1e52dbecc1c0521691ed6b32344ee0f2a8d","observation_id":"52deed35-d3df-4ac0-b813-0ed484c08f11","resolution":{"observed_at":"2026-08-07T11:18:12.896255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.947600Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.947600Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:ccbf12dac4a43ca492f8fe39f16e7c8a5e4659fe9c9e24063a52a4b29bcce872","observation_id":"b4346a01-bb6f-4b4a-8594-f175d1180668","resolution":{"observed_at":"2026-08-07T11:18:12.947600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:13.032957Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.032957Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:54f44ad6eb2ec8a0f18eee4f5e7dccf2e697c5eec81cb1ce1423a098aaad79ce","observation_id":"c3b2e0b9-5bb3-4061-bf0f-e5084cc5207b","resolution":{"observed_at":"2026-08-07T11:18:13.032957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:13.126730Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.126730Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:e5d87f5b310eafe5b44edd5fc721bdfcd05d36041436693f99e5ae49d11b8ff9","observation_id":"157e39f0-044c-4f50-8206-b17679b21e52","resolution":{"observed_at":"2026-08-07T11:18:13.126730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:13.229601Z","title":null,"venue":null,"work_id":null,"year":1948},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.229601Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:188b2560150c4edc353beac2514f91047a56f7bab4e944c2d9e0a06227f6e04d","observation_id":"ff192319-338f-4b77-b107-51e05a8d64ba","resolution":{"observed_at":"2026-08-07T11:18:13.229601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T11:18:13.316578Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.316578Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:99e721f0d448e247a47c9995b496680fea4100952328425cf9f9424772ac9662","observation_id":"6288b364-35b9-47af-a6bd-1f54380af221","resolution":{"observed_at":"2026-08-07T11:18:13.316578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14780","last_updated":"2023-04-28T11:40:48Z","snapshot_observed_at":"2026-07-06T15:21:12.034373Z","submitted_at":"2023-04-28T11:40:48Z","title":"Training and Evaluation of a Multilingual Tokenizer for GPT-SW3","version":1},"cited_work":{"arxiv_id":"2304.14780","doi":"10.48550/arxiv.2304.14780","metadata_source":"pith","pith_arxiv_id":"2304.14780","snapshot_observed_at":"2026-08-07T18:16:16.850658Z","title":"Training and Evaluation of a Multilingual Tokenizer for GPT-SW3","venue":"cs.CL","work_id":"39e6ea91-5073-4821-9c64-47881bc5eae3","year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.420166Z"},"links":{"cited_paper":"/paper/2304.14780","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:c4a826b94fcd94e1f2a914bed3a9f241467a0c39a936d818e6c53e996609f971","observation_id":"66597624-627e-4980-bbd1-62be5e071e4c","resolution":{"observed_at":"2026-08-07T11:18:17.225577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-eacl.128","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:16.952661Z","title":null,"venue":null,"work_id":"81179dee-0581-4237-833b-966a675df425","year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.506836Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:32bf9c917fca32408803104d7f484c403459842226620be9021eef0ccecf855a","observation_id":"cff0d630-19eb-4d4c-a31f-49bc8c2a0299","resolution":{"observed_at":"2026-08-07T11:18:16.997488Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:13.575370Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.575370Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:05b42494f38696c33754da6f68688092f8b7a2b1f8484f8883f4a42cd4cb41aa","observation_id":"a9a9e660-378f-46fd-9522-9896d2781b27","resolution":{"observed_at":"2026-08-07T11:18:13.575370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16903","last_updated":"2025-07-25T05:09:17Z","snapshot_observed_at":"2026-07-06T17:09:10.513197Z","submitted_at":"2023-12-28T08:53:27Z","title":"Spike No More: Stabilizing the Pre-training of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16903","snapshot_observed_at":"2026-08-07T11:18:13.667569Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.667569Z"},"links":{"cited_paper":"/paper/2312.16903","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:2dab069c5df44f569c347e53cb10ebf66e9cc2247816c1b13d229f10ad904b35","observation_id":"6184a1d1-ae4a-47ff-ae75-e7bbb2156631","resolution":{"observed_at":"2026-08-07T11:18:13.667569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:13.751835Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.751835Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:3d9b652e5b1ffe132ce0e50525ec3bbcbf3b1e25e513345487a1c7098ed5b0eb","observation_id":"30f482d7-3ba4-4b5f-8646-0b21723ac92a","resolution":{"observed_at":"2026-08-07T11:18:13.751835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:13.817233Z","title":"Tran, Xavier Garcia, Jason Wei, Xuezhi Wang, Hyung Won Chung, Dara Bahri, Tal Schuster, Steven Zheng, Denny Zhou, Neil Houlsby, and Donald Metzler","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.817233Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:59ab4fd955c8af9edacbe6cf60e7ebc414c792ad8f440308e54857bf8be1b200","observation_id":"06a37afa-c99d-4ce0-9d38-5c48ecc72ae6","resolution":{"observed_at":"2026-08-07T11:18:13.817233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T11:18:13.951819Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.951819Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:8d961f460deedc6430631020c12854079e417cc3c8332f7fa63870e0f23cf6c7","observation_id":"18775b14-1548-48d7-b1c9-fbff31dac10b","resolution":{"observed_at":"2026-08-07T11:18:13.951819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T11:18:14.155802Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:14.155802Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:1ea72848d01da05876256d73c5699338d5ca1daef47d0b0c2c9285ea25aab3d3","observation_id":"4a2ceeba-c8bd-4043-8243-a873666a5673","resolution":{"observed_at":"2026-08-07T11:18:14.155802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":93,"verified_exact":7,"verified_fuzzy":0},"total_outbound_references":119},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 119 outbound references and 0 inbound Pith citation observations for arXiv:2506.03101."}