{"as_of":"2026-08-08T07:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:72fcdd1c0d0e6c75589e639b3520d136d94e1909e79321f0feabaaedb7a4f9a8","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:19:15.885007Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.18674/citation-record","integrity":"/paper/2506.18674/integrity","json":"/paper/2506.18674/citation-record.json","paper":"/paper/2506.18674"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:19:17.172797Z","title":"https://allenai.org/","venue":null,"work_id":"8a3b7ad6-f76e-4c02-ac2c-6944994603b4","year":2025},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-06T23:13:17.444822Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:14.640456Z"},"links":{"citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:1381628532f277717639293ab503017aac3fa51ff0448134df39c1ac0031b3a5","observation_id":"725f6711-9b46-4f34-b203-63df23ab2765","resolution":{"observed_at":"2026-08-06T23:19:17.302133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:19:16.974469Z","title":"Accessed: 2024-06-08","venue":null,"work_id":"8354807b-f91b-4db9-afdb-07c958abeab4","year":2024},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-06T23:13:17.444822Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:14.785714Z"},"links":{"citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:f28917e0e66e5b3a13f2f727dde56ff0bdc0739676eb685d8f4128880dd68ca7","observation_id":"95586cea-cfea-4675-9341-53c8a8900702","resolution":{"observed_at":"2026-08-06T23:19:17.076164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-06T23:19:14.869810Z","title":"arXiv preprint arXiv:2401.02954","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-06T23:13:17.444822Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:14.869810Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:ed1635db6ce9f80ba0068bb9f6f03acc786d8e68483692373add75127319a9e8","observation_id":"ed8f7381-cfaf-4990-9304-42eb9b4ac645","resolution":{"observed_at":"2026-08-06T23:19:14.869810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:19:16.307284Z","title":"https://huggingface","venue":null,"work_id":"af28d045-6eb2-4a29-92b5-78b6c73cfc99","year":2025},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-06T23:13:17.444822Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:15.296021Z"},"links":{"citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:558848b5ae147df73323005a68b81517afb9fdd27d01bf233bb6bb6ce17e4f00","observation_id":"0f8b2201-94f5-481a-b4fd-b4565cd64973","resolution":{"observed_at":"2026-08-06T23:19:16.429621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15613","last_updated":"2021-06-01T18:17:59Z","snapshot_observed_at":"2026-07-06T10:29:01.682011Z","submitted_at":"2020-12-31T14:11:00Z","title":"How Good is Your Tokenizer? On the Monolingual Performance of Multilingual Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15613","snapshot_observed_at":"2026-08-06T23:19:15.359114Z","title":"Preprint, arXiv:2012.15613","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-06T23:13:17.444822Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:15.359114Z"},"links":{"cited_paper":"/paper/2012.15613","citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:e9ae633eb8561d7a1a9df10988024f1adbe49773bf020c548ffb9ba37924fdbb","observation_id":"4bd3b149-c04f-4bea-a3c6-e77e24d1dd7c","resolution":{"observed_at":"2026-08-06T23:19:15.359114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20306","last_updated":"2024-03-29T17:22:48Z","snapshot_observed_at":"2026-07-06T17:53:11.000124Z","submitted_at":"2024-03-29T17:22:48Z","title":"Towards Greener LLMs: Bringing Energy-Efficiency to the Forefront of LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20306","snapshot_observed_at":"2026-08-06T23:19:15.550305Z","title":"arXiv preprint arXiv:2403.20306","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-06T23:13:17.444822Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:15.550305Z"},"links":{"cited_paper":"/paper/2403.20306","citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:542dc6b945b69377bc2e5f3288af339b9f3d1b72112d1460ae87da2c8a7c162b","observation_id":"0e2288a8-c6bb-474d-80dc-8905e470c649","resolution":{"observed_at":"2026-08-06T23:19:15.550305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-06T23:19:15.802586Z","title":"Preprint, arXiv:2211.05100","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-06T23:13:17.444822Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:15.802586Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:02b4ffeb4490bf5c5d4ee64416f2ba0633e5c9155511d5a18d6411795b18a0f9","observation_id":"b6552b5f-5d64-46e9-9c13-6d3acd288c70","resolution":{"observed_at":"2026-08-06T23:19:15.802586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11998","last_updated":"2024-03-10T19:34:57Z","snapshot_observed_at":"2026-07-06T16:21:45.588487Z","submitted_at":"2023-09-21T12:13:55Z","title":"LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11998","snapshot_observed_at":"2026-08-06T23:19:15.885007Z","title":"Preprint, arXiv:2309.11998","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-06T23:13:17.444822Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:15.885007Z"},"links":{"cited_paper":"/paper/2309.11998","citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:cdc6c10afd4b3fbc60c483bb83af7de81cbc9b4050e21c83170baa9499ee432d","observation_id":"da335835-1b20-4270-b1cf-b13241b3ddce","resolution":{"observed_at":"2026-08-06T23:19:15.885007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.03341","last_updated":"2019-12-05T19:29:29Z","snapshot_observed_at":"2026-08-03T11:51:31.815148Z","submitted_at":"2019-09-07T21:29:46Z","title":"Neural Machine Translation with Byte-Level Subwords","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.03341","snapshot_observed_at":"2026-08-06T23:19:15.667006Z","title":"Preprint, arXiv:1909.03341","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-06T23:13:17.444822Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:15.667006Z"},"links":{"cited_paper":"/paper/1909.03341","citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:a8bac53576a09e9f393b694649251c341f531df37f6ca69bce8a3d2a7130a369","observation_id":"4341cc1e-cde5-4471-a04b-606ce150088b","resolution":{"observed_at":"2026-08-06T23:19:15.667006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:19:16.721454Z","title":"https://pile.eleuther.ai/","venue":null,"work_id":"79a3725e-d6ef-4ead-99b5-9c1741071a0b","year":2025},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-06T23:13:17.444822Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:14.959868Z"},"links":{"citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:f22ceaae86423c6ec4e557e7159ecbe2565b8aa7f23423040ea7d6dab99502f6","observation_id":"04343bb5-875a-4885-925b-9b6921216121","resolution":{"observed_at":"2026-08-06T23:19:16.814416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10508","last_updated":"2021-12-20T13:04:18Z","snapshot_observed_at":"2026-07-06T12:20:36.165718Z","submitted_at":"2021-12-20T13:04:18Z","title":"Between words and characters: A Brief History of Open-Vocabulary Modeling and Tokenization in NLP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10508","snapshot_observed_at":"2026-08-06T23:19:15.192201Z","title":"arXiv preprint arXiv:2112.10508","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-06T23:13:17.444822Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:15.192201Z"},"links":{"cited_paper":"/paper/2112.10508","citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:05df39d7500461aef6c6ca024d9200cf7cdc093b2e8c5e35213a08e4c332e42c","observation_id":"c4f9ba5f-e3f0-4321-a224-fd5e3daa375c","resolution":{"observed_at":"2026-08-06T23:19:15.192201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:19:16.141873Z","title":"In 2023 IEEE High Performance Extreme Computing Conference (HPEC), pages 1–9","venue":null,"work_id":"e8f9bece-7a2c-4f04-acf8-c71b5a7c6f9c","year":2023},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-06T23:13:17.444822Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:15.459801Z"},"links":{"citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:bbe09336e217bbaae49c0cdadd97434347bf06ec4fdead8c10f82130672ea7c5","observation_id":"be4c696a-12d2-40ed-935d-ebe6b5a460a2","resolution":{"observed_at":"2026-08-06T23:19:16.191426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:19:17.403659Z","title":"Associa- tion for Computational Linguistics","venue":null,"work_id":"8bdd2414-d832-4c80-bb03-33103bf534cf","year":2024},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-06T23:13:17.444822Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:14.564604Z"},"links":{"citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:a47f03f7aecd628d5b7d2d773bf4be27d85d3c778b28c0cca381194096a6c148","observation_id":"72344704-6d8c-46f2-b5e6-1b11d0c1550e","resolution":{"observed_at":"2026-08-06T23:19:17.538945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:19:16.542687Z","title":"https://www.demandsage.com/chatbot-statistics/","venue":null,"work_id":"ba33c211-b57e-4de7-9826-627596efba42","year":2025},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-06T23:13:17.444822Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:15.082079Z"},"links":{"citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:e1bde222da9b50f0be947c00c9ac56fb09030a7ca68e9389d30fd62441e14eea","observation_id":"d8ac7d09-d05a-4675-9bc9-932cf9f107f6","resolution":{"observed_at":"2026-08-06T23:19:16.614492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T23:13:17.444822Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2506.18674."}