{"as_of":"2026-08-14T22:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:846ffee5b9d994984a9f42e7b13270b6f21f8933e79497b4f70cb28d4f2dfea9","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:28:06.392006Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.10690/citation-record","integrity":"/paper/2608.10690/integrity","json":"/paper/2608.10690/citation-record.json","paper":"/paper/2608.10690"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-12T19:28:06.215455Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.215455Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:557712b57d474d096cf4f55dc9729c155d94e085f5b29bab868f0375e800ab93","observation_id":"012eaf92-8656-4503-98c6-0966231182ec","resolution":{"observed_at":"2026-08-12T19:28:06.215455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-12T19:28:06.221458Z","title":"arXiv preprint arXiv:2412.19437 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.221458Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:bbbb740bd2711c6af34c47bf0fa679c80b4c918f44c2e24745ea13a2b2cd985b","observation_id":"4c2a09ae-48ac-4dbf-8b6b-daed11715a7b","resolution":{"observed_at":"2026-08-12T19:28:06.221458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-12T19:28:06.225751Z","title":"arXiv preprint arXiv:2601.03267 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.225751Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:a56ff8a2756460b2351c4f026ec22eebf6d02ddf69aa8095b3beeff9113bd1a8","observation_id":"d42844c9-3fa6-4d02-8a75-fa5cc71d36b6","resolution":{"observed_at":"2026-08-12T19:28:06.225751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12941","last_updated":"2023-10-19T17:39:02Z","snapshot_observed_at":"2026-08-13T05:45:11.765043Z","submitted_at":"2023-10-19T17:39:02Z","title":"The Foundation Model Transparency Index","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12941","snapshot_observed_at":"2026-08-12T19:28:06.229712Z","title":"arXiv preprint arXiv:2310.12941 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.229712Z"},"links":{"cited_paper":"/paper/2310.12941","citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:972ad2f64cfb5e4853bfecfc8ba5c27a7c1a9f47688283249f7a3739d8eb92da","observation_id":"cd2d7794-2f1c-45f0-97e4-553be7d2cd77","resolution":{"observed_at":"2026-08-12T19:28:06.229712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.812858Z","title":"Nature Machine Intelligence , volume=","venue":null,"work_id":"15fff958-d398-4900-8ba4-1ffbe0b3d183","year":2024},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.233541Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:6ca9324a61416dcc8e5c0ab30801d6f28a25dcc45cec49a2157d71bb092b62c3","observation_id":"1be55aac-4baa-4d4c-9df6-aab11447b286","resolution":{"observed_at":"2026-08-12T19:28:06.816474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04244","last_updated":"2024-06-06T16:41:39Z","snapshot_observed_at":"2026-07-30T15:43:06.151242Z","submitted_at":"2024-06-06T16:41:39Z","title":"Benchmark Data Contamination of Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04244","snapshot_observed_at":"2026-08-12T19:28:06.237200Z","title":"arXiv preprint arXiv:2406.04244 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.237200Z"},"links":{"cited_paper":"/paper/2406.04244","citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:0a592d89024f8061ea196ccf2999e9328185f0a32f9a2a5969d8e3b31e5eab6f","observation_id":"cf0778d1-311d-449b-80df-303a37121d92","resolution":{"observed_at":"2026-08-12T19:28:06.237200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.241208Z","title":"30th USENIX security symposium (USENIX Security 21) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.241208Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:90d844ca841ddc0f5f491beb7a7775bc9fa107afaf8dca82b8032c13c8e642f2","observation_id":"c7e7cd59-9006-427e-ab1f-4f100353bb51","resolution":{"observed_at":"2026-08-12T19:28:06.241208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.244838Z","title":"The Eleventh International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.244838Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:9b317bc5c582273d4d054eb1c172b1cb3ee283998b123cc489bc1d49d1735778","observation_id":"ec3c8b5a-98b6-43ba-ab4f-236d697d3975","resolution":{"observed_at":"2026-08-12T19:28:06.244838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04850","last_updated":"2023-11-11T05:11:18Z","snapshot_observed_at":"2026-08-13T05:29:41.829205Z","submitted_at":"2023-11-08T17:35:20Z","title":"Rethinking Benchmark and Contamination for Language Models with Rephrased Samples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04850","snapshot_observed_at":"2026-08-12T19:28:06.247862Z","title":"arXiv preprint arXiv:2311.04850 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.247862Z"},"links":{"cited_paper":"/paper/2311.04850","citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:2c8e5bc1cff0b09d0d3a0762db88b1ab394f809c5e747f4d8bf9c1e5d035110f","observation_id":"b58d0bba-0fb2-4354-b304-3f047d534dc5","resolution":{"observed_at":"2026-08-12T19:28:06.247862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.790266Z","title":"Proceedings of the 54th annual meeting of the association for computational linguistics (volume 1: long papers) , pages=","venue":null,"work_id":"85ccad18-e75a-4c04-b45a-b49b920b520e","year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.251441Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:d3c7db864e0fd5c9b1192f1a62d5ce3e30585e0da0b1fdf702a6fdc5c0227d68","observation_id":"bcf9bf46-d52a-4c46-8246-d37d1ae5c428","resolution":{"observed_at":"2026-08-12T19:28:06.794010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08144","last_updated":"2016-10-08T19:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-26T19:59:55Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08144","snapshot_observed_at":"2026-08-12T19:28:06.254813Z","title":"arXiv preprint arXiv:1609.08144 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.254813Z"},"links":{"cited_paper":"/paper/1609.08144","citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:eb1ccdc0ad328421ec8a68b55b4832cb89c0a9bf60529af5c8d2a4d9ca529f89","observation_id":"22846832-b61d-4526-bf16-71c8769dfff3","resolution":{"observed_at":"2026-08-12T19:28:06.254813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.779896Z","title":"Proceedings of the 2021 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":"bd47ae15-bdc6-4045-a7a3-e899b2beae27","year":2021},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.258234Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:af10a1d653af496761c841ff0230cf785cd2955bfaa6054e59d8ff928c913670","observation_id":"01021e09-36d0-45d6-b472-818ff43efdf3","resolution":{"observed_at":"2026-08-12T19:28:06.783376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.262160Z","title":"Proceedings of the 2018 conference on empirical methods in natural language processing: System demonstrations , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.262160Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:3341b298c93cfb8a2c3d04f90b65306b27dfac0d770a9871d4c197d3a9788504","observation_id":"b46a7414-17c2-4809-8287-c5c7defa247e","resolution":{"observed_at":"2026-08-12T19:28:06.262160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.762842Z","title":"Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"591f8972-d414-4ff5-b7d0-394dd2e06205","year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.266486Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:20293c447f677b7e8d5e3258f8c9f7c41b4de64983779f5e80e23a437d20244d","observation_id":"0b0ddcac-3fbc-4273-bd03-8e0cb7498dca","resolution":{"observed_at":"2026-08-12T19:28:06.766687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01035","last_updated":"2024-02-07T10:51:11Z","snapshot_observed_at":"2026-08-13T04:28:50.593476Z","submitted_at":"2024-02-01T21:49:34Z","title":"Getting the most out of your tokenizer for pre-training and domain adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01035","snapshot_observed_at":"2026-08-12T19:28:06.270689Z","title":"arXiv preprint arXiv:2402.01035 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.270689Z"},"links":{"cited_paper":"/paper/2402.01035","citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:2fa8d93da5ea50d0b35d411dfd2aa28ae2efbeafbec7de9264f263aec6ecd1c1","observation_id":"5dda6768-f88b-4041-9e7a-81538b2da8e6","resolution":{"observed_at":"2026-08-12T19:28:06.270689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20273","last_updated":"2025-06-16T16:51:10Z","snapshot_observed_at":"2026-08-07T17:42:18.488112Z","submitted_at":"2025-02-27T17:01:23Z","title":"How Much is Enough? The Diminishing Returns of Tokenization Training Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20273","snapshot_observed_at":"2026-08-12T19:28:06.275291Z","title":"arXiv preprint arXiv:2502.20273 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.275291Z"},"links":{"cited_paper":"/paper/2502.20273","citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:c6113cb5d78203027830d40178dfc341164893e07ecb232c6155a439c66b01b8","observation_id":"3b13a136-421b-4168-bf88-dcbeaf2da91c","resolution":{"observed_at":"2026-08-12T19:28:06.275291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.753014Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"fd1e99f2-1dc6-430e-9242-d25cd143ce64","year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.279225Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:b319a4a6c39321044d30fb4d6e1b36528e5a8a02053976621dfcd0cd2a7bb92f","observation_id":"1ccf05e1-f08f-4cf8-8485-4e4119498ce5","resolution":{"observed_at":"2026-08-12T19:28:06.756296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.283356Z","title":"Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.283356Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:5602403e32134fffab923688f2a20af434af5a0b1739797165f63783f924a670","observation_id":"9193f99b-d9d9-4316-8faf-cfcbe10d2c95","resolution":{"observed_at":"2026-08-12T19:28:06.283356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.287124Z","title":"Proceedings of the ACM on Software Engineering , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.287124Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:0896be7d8a3c9b015e92a2040bf633d8a26e83122bf9ad35f0dbe6bf1504aba3","observation_id":"75f16074-db7f-4a78-9c56-8c9106a968b0","resolution":{"observed_at":"2026-08-12T19:28:06.287124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.730654Z","title":"2024 IEEE International Conference on Big Data (BigData) , pages=","venue":null,"work_id":"1bb97631-286b-4415-bb37-02c783aa62f6","year":2024},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.290710Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:16a50a9f37e14c79471e1bb8c7b7ca418a408a1c7629c5639f74ffcd220f9350","observation_id":"e33f952f-baee-4c1d-957b-56d92a1ec0d6","resolution":{"observed_at":"2026-08-12T19:28:06.734311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.719397Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"a91e47ed-976a-47f8-8e1b-8dcd9e566a52","year":2025},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.294598Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:5ab8c043a025240b14dd5e1975991ddce51dc11b3d7fb43dc4a7695338fdf1fc","observation_id":"8a9bf458-98d8-4458-b64f-14ab3fe0cf8e","resolution":{"observed_at":"2026-08-12T19:28:06.723424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.298232Z","title":"Psychonomic bulletin & review , volume=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.298232Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:7e8ae349e641c2de5b3cbf39654bc28a0de8ca98e8772caf92e18bcf96f3eec4","observation_id":"a3a158af-bcd7-4a61-b847-757020f2f831","resolution":{"observed_at":"2026-08-12T19:28:06.298232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.703291Z","title":"Proceedings of the 2021 conference of the North American chapter of the association for computational linguistics: Human language technologies , pages=","venue":null,"work_id":"ea2ecb3d-59cc-48d7-b1d7-a25765d3fa34","year":2021},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.302019Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:dbc58c186f689fe8d70e97ee560f9da279c05ebba15b6b14bcc3776a255b64d1","observation_id":"558798e2-043c-4c93-a7a8-3b87f4e10480","resolution":{"observed_at":"2026-08-12T19:28:06.706760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.304878Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.304878Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:43f9b8bfdd14a48d4f8b7eb17a2e0e9b7d542089ae9a0c35be06ea0a4e358ad0","observation_id":"a9761bda-03bc-4b07-bf9b-0bdd04fcb82b","resolution":{"observed_at":"2026-08-12T19:28:06.304878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04556","last_updated":"2025-02-25T17:31:36Z","snapshot_observed_at":"2026-08-12T22:49:45.485885Z","submitted_at":"2024-09-06T18:33:38Z","title":"How Does Code Pretraining Affect Language Model Task Performance?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04556","snapshot_observed_at":"2026-08-12T19:28:06.308321Z","title":"arXiv preprint arXiv:2409.04556 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.308321Z"},"links":{"cited_paper":"/paper/2409.04556","citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:aa9b638be34d993b01fb0fb391d0f0643f19542a2e1c80dc0fecc7ae23291578","observation_id":"53165c4b-6132-4969-ae8c-517aa021b344","resolution":{"observed_at":"2026-08-12T19:28:06.308321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.312085Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.312085Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:ca28f0358b6300e8215b04f48131dfda200f81623c3739f5a3018f91645e4e1d","observation_id":"9d6b8dc6-0068-4aab-b223-de35058e119c","resolution":{"observed_at":"2026-08-12T19:28:06.312085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T19:28:06.315153Z","title":"arXiv preprint arXiv:2309.16609 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.315153Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:a28cc23265972de411e46867c1d1320a6ddaca8b74f66a5790af1f830f9b8410","observation_id":"16852d1d-a1b6-4c7b-a947-227c02c6c4db","resolution":{"observed_at":"2026-08-12T19:28:06.315153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-14T19:47:04.330126Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-12T19:28:06.319251Z","title":"arXiv preprint arXiv:2401.02954 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.319251Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:585f85b83712c08bf5ff605cba1c478240a0ed3e47c3e21de4d11b240c86f73c","observation_id":"3aaf9426-0bae-40c6-8e52-522b790c3418","resolution":{"observed_at":"2026-08-12T19:28:06.319251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.324634Z","title":"2018 , publisher=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.324634Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:a939cca64a32da2a08ddc57b1ffbc4453384912423a56874f93cbf8414e77900","observation_id":"3e720504-6e51-4f6b-a740-ef526502d51f","resolution":{"observed_at":"2026-08-12T19:28:06.324634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.675027Z","title":"2009 , publisher=","venue":null,"work_id":"5d2bd913-8767-40d8-a85e-41d97d73a9d6","year":2009},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.329253Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:9ee962a25139ed3eaceeba9f1325a34166b8bee90c0a1b9ba43ebc1edb63f205","observation_id":"544e3aa7-4a8a-436c-86d1-2085ab899121","resolution":{"observed_at":"2026-08-12T19:28:06.678433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.664224Z","title":"Proceedings of the 58th annual meeting of the association for computational linguistics , pages=","venue":null,"work_id":"375efb93-a105-4050-a592-39cf0d4f4f62","year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.333585Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:f9f894417787631c93f5b8649c22ba316299bf5966c73a27dcc5f1ac35a12dbb","observation_id":"350fef07-2faa-46e4-992d-a27f636c3bd2","resolution":{"observed_at":"2026-08-12T19:28:06.668003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.337806Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.337806Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:5e62e70b30caf558f4c4ec5e355350a235a5384659a61dcbf04d730091668cb2","observation_id":"efbbc8c5-cbd1-4dbd-913e-c931f2a98499","resolution":{"observed_at":"2026-08-12T19:28:06.337806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.644348Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":"8777b58b-23ef-4d48-b69b-c975620142a5","year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.341449Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:4e657913c4bcaf53f05bccf3782b8d75ee2b1b2ae39de01e7e7dca8f9e892529","observation_id":"95691485-2c95-4a87-b80a-173daab824ba","resolution":{"observed_at":"2026-08-12T19:28:06.648584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.346577Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.346577Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:f74b475ed342cb5e1665a980546f2e5a425888f5a6f3b63c3bbde83f7f3c1f38","observation_id":"9ac0c81f-a378-4f2d-aa3b-a8f59dd8f173","resolution":{"observed_at":"2026-08-12T19:28:06.346577Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.349801Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.349801Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:f757b7b3b1d62c06eaf0a2fc287c4dd9a05e174a4d4a99de3362b950592d95df","observation_id":"4a35e66b-dd5b-40f5-bb74-8709e7f69435","resolution":{"observed_at":"2026-08-12T19:28:06.349801Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.353473Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.353473Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:6b124a5425cd8b2b647c528b1701fcf815624accf8cafb6e437a0ebb6cf05e89","observation_id":"8977282a-c7bf-41dd-9849-668de2340ae5","resolution":{"observed_at":"2026-08-12T19:28:06.353473Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.357040Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.357040Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:8d5cf2f52dafc2eda121770fcfd05844a2dd7bb33c8cc7d08103e5569cec50ce","observation_id":"e583769b-88d6-4930-9d7d-db0ab22bf1bf","resolution":{"observed_at":"2026-08-12T19:28:06.357040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02737","last_updated":"2025-02-04T21:43:16Z","snapshot_observed_at":"2026-08-14T05:03:05.661970Z","submitted_at":"2025-02-04T21:43:16Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02737","snapshot_observed_at":"2026-08-12T19:28:06.360327Z","title":"arXiv preprint arXiv:2502.02737 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.360327Z"},"links":{"cited_paper":"/paper/2502.02737","citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:f377c3c7b7a1ee69ecfad275ebfc265a23026dac41bf3ba9a3a924cf3e5c6ee0","observation_id":"dc510246-5c4b-4f34-9e89-31d0d6dc7c24","resolution":{"observed_at":"2026-08-12T19:28:06.360327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.364310Z","title":"Proceedings of the IEEE international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.364310Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:72075bbb28cce81c6a3c4f0dc3fe0f52afd88dd632bf33e78e21fd3c16ec6ee2","observation_id":"8f74ac97-63ba-4cef-b4bc-d981af8ef7f1","resolution":{"observed_at":"2026-08-12T19:28:06.364310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.367704Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.367704Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:27e8ed9d8085e48cd14e166f1cd7d89db2608af98c95ec302936d646893273f1","observation_id":"49e4f4ef-331b-4ff4-aab1-6aa10f3e6a29","resolution":{"observed_at":"2026-08-12T19:28:06.367704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.596077Z","title":"Boca Raton, FL, USA: CRC , year=","venue":null,"work_id":"3dee95a9-e05b-4445-8101-0b08ffc821ae","year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.371155Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:01bd6f49e26eed7b1ef0f151596bd7aa65df42aa2fe994412d706d9b228e267d","observation_id":"815aa0ce-108d-4662-a7f5-d139d11e630b","resolution":{"observed_at":"2026-08-12T19:28:06.599618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.585652Z","title":null,"venue":null,"work_id":"0cfab1c6-943a-4f6b-bfbe-e5204f7624cd","year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.374817Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:63033a15e2768de2f5d93fa287caa6400309d126ac898bf84fcb99770be1f321","observation_id":"61d4fa6f-d313-4353-9dd0-a1efaac039cc","resolution":{"observed_at":"2026-08-12T19:28:06.589570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.378305Z","title":"Proceedings of the 58th annual meeting of the association for computational linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.378305Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:4a4c3afbc06d309e3343f9797f9c187ac4a34348202271700d8b3bf4c141f507","observation_id":"bcaa3044-5456-4454-b848-739005647fc0","resolution":{"observed_at":"2026-08-12T19:28:06.378305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-12T19:28:06.381651Z","title":"arXiv preprint arXiv:2203.15556 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.381651Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:68c1e288159ec444ce51f297d699d4be349c8f056501a4344fa301ff6714e2fb","observation_id":"fae175c7-4087-4013-bf60-d2ca255f90b5","resolution":{"observed_at":"2026-08-12T19:28:06.381651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.385153Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.385153Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:99e25c2ad3a489c25fa55726206feee8e5f0ca4942db4a156fde92e422597313","observation_id":"2b843f5b-3364-465c-b9b4-91a5102cdd9e","resolution":{"observed_at":"2026-08-12T19:28:06.385153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T19:28:06.388635Z","title":"arXiv preprint arXiv:2307.09288 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.388635Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:3ceac1f06f2fc4e596baba4dab8f64022074610cb321b49ce633bfa8352ed86e","observation_id":"15027af2-09c5-4c52-a2d3-75fa9a69fdb2","resolution":{"observed_at":"2026-08-12T19:28:06.388635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:06.392006Z","title":"Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T19:28:06.392006Z"},"links":{"citing_paper":"/paper/2608.10690"},"observation_digest":"sha256:1e4e7afbbbc7311cdc8bd10ae3be8ccc6e6a1357f36a1fc07a42c2c756c32cb6","observation_id":"da8f3511-e0f1-427a-a0e9-056f66f171fd","resolution":{"observed_at":"2026-08-12T19:28:06.392006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.10690","last_updated":"2026-08-11T09:14:25Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T22:10:56.172759Z","submitted_at":"2026-08-11T09:14:25Z","title":"Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":3,"unresolved":32,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2608.10690."}