{"as_of":"2026-08-08T05:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9fa06d7a78e3e017861ac4f27f7fbe188b1142f22c0f8083c06b8f09fca57402","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:19:17.012836Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.16323/citation-record","integrity":"/paper/2507.16323/integrity","json":"/paper/2507.16323/citation-record.json","paper":"/paper/2507.16323"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7910.17791","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:17.298690Z","title":"A new algorithm for data compression","venue":null,"work_id":"87376890-f570-46c1-b574-259c48a15667","year":1994},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.918735Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:b2261f8a2b66ebf9c6ede5bcc2ff5ca72dbcd32cc0ef3c19186fd91b0d54c3f7","observation_id":"5ebcf8dc-70f1-4854-b083-3987f5d9a141","resolution":{"observed_at":"2026-08-06T15:19:17.302442Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-07-06T04:28:16.222296Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-06T15:19:16.922411Z","title":"Neural Machine Translation of Rare Words with Subword Units","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.922411Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:52ff68f60b5f08b455d7e640b97162b24f9f257b9c7858dd7528d0b229216dcf","observation_id":"186c0948-d305-433c-97e0-694897ad8467","resolution":{"observed_at":"2026-08-06T15:19:16.922411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T15:19:16.925226Z","title":"The Llama 3 Herd of Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.925226Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:4915161edb5608c33c1acf4c1852c42916c1365c97bb4faf527771f364259542","observation_id":"270fd262-2d24-4068-a12c-90dcd69305b1","resolution":{"observed_at":"2026-08-06T15:19:16.925226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:16.928045Z","title":"Gemma 2: Improv- ing Open Language Models at a Practical Size","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.928045Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:993186343129b83ea778eb4125f3fbda9c81d95fd58978f5a09840b5afda3d6a","observation_id":"7261426e-2a4c-4606-9029-5c0cc507b9ef","resolution":{"observed_at":"2026-08-06T15:19:16.928045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:16.931347Z","title":"Do all languages cost the same? tokenization in the era of commercial language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.931347Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:c30e5d39a6763578f49cf4ea773c56b2ca54c25ead316d6ccd1d0b269444e79c","observation_id":"5e0db424-262a-4df7-a490-4d1d5b4a2c45","resolution":{"observed_at":"2026-08-06T15:19:16.931347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16149","last_updated":"2023-09-29T11:51:51Z","snapshot_observed_at":"2026-08-07T22:55:07.648371Z","submitted_at":"2023-08-30T17:07:17Z","title":"Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16149","snapshot_observed_at":"2026-08-06T15:19:16.934493Z","title":"Jais and jais-chat: Arabic-centric foundation and instruction-tuned open generative large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.934493Z"},"links":{"cited_paper":"/paper/2308.16149","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:ea0ecb18dd280c0382b13da76a0d033821a695ffce5d137e7c1b4ff08b764c7e","observation_id":"c8c8da7a-cc3c-4150-8d43-ae6a796e6743","resolution":{"observed_at":"2026-08-06T15:19:16.934493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:17.345855Z","title":"Language model tokenizers introduce unfairness between languages","venue":null,"work_id":"f498ebe3-acb0-46c5-a0dd-149af515d2ad","year":2023},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.937949Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:c2f1faf2f5cd6ea39ad8c2f787b776e56929912746453cd497fddafc886c7d1a","observation_id":"5c3ac7fe-313c-4a4d-82a4-ae89033ee9eb","resolution":{"observed_at":"2026-08-06T15:19:17.348538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07185","last_updated":"2023-05-19T21:09:11Z","snapshot_observed_at":"2026-08-03T05:17:47.917141Z","submitted_at":"2023-05-12T00:55:41Z","title":"MEGABYTE: Predicting Million-byte Sequences with Multiscale Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07185","snapshot_observed_at":"2026-08-06T15:19:16.940215Z","title":"MEGABYTE: Predicting Million-byte Sequences with Multiscale Transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.940215Z"},"links":{"cited_paper":"/paper/2305.07185","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:5879a97f85c0702bc103a662ab1d18854418ea9af8d421fc265749e0651e54f1","observation_id":"f7c98384-9b4d-475c-b113-1333c85bd11e","resolution":{"observed_at":"2026-08-06T15:19:16.940215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-06T17:12:17.931581Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-06T15:19:16.943166Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.943166Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:82cd5a851dc07b782c5cd3050460078b291262aba1f46a25729a5c0391dcb282","observation_id":"245cef04-c4a6-4041-b171-e7fca218e328","resolution":{"observed_at":"2026-08-06T15:19:16.943166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.11193","last_updated":"2022-06-08T09:10:07Z","snapshot_observed_at":"2026-07-06T11:41:25.488952Z","submitted_at":"2021-08-25T11:48:05Z","title":"Models In a Spelling Bee: Language Models Implicitly Learn the Character Composition of Tokens","version":2},"cited_work":{"arxiv_id":"2108.11193","doi":"10.48550/arxiv.2108.11193","metadata_source":"pith","pith_arxiv_id":"2108.11193","snapshot_observed_at":"2026-08-06T18:16:30.548575Z","title":"Models In a Spelling Bee: Language Models Implicitly Learn the Character Composition of Tokens","venue":"cs.CL","work_id":"a7aa9648-3bcd-43bf-b51d-bfee36e401a8","year":2021},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.945692Z"},"links":{"cited_paper":"/paper/2108.11193","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:0469807d3a97ba91de6dc1cfbb12de0a2c88e567a9dcaae69f155ae3ed698ff6","observation_id":"0cb5616c-25cc-486e-aac7-191873976f6d","resolution":{"observed_at":"2026-08-06T15:19:17.186769Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02608","last_updated":"2022-06-06T13:27:26Z","snapshot_observed_at":"2026-07-06T13:17:51.474784Z","submitted_at":"2022-06-06T13:27:26Z","title":"What do tokens know about their characters and how do they know it?","version":1},"cited_work":{"arxiv_id":"2206.02608","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.02608","snapshot_observed_at":"2026-08-06T15:19:17.231673Z","title":"What do tokens know about their characters and how do they know it?","venue":"cs.CL","work_id":"a816b9a8-0e09-453a-bc87-679fbbc5ca9b","year":2022},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.948956Z"},"links":{"cited_paper":"/paper/2206.02608","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:2c6decc57d46c17b3dc2d9f3770f8d3bf1fee1898c6195c3ccb821b72074e753","observation_id":"9192d1c9-37cf-4b15-b38a-64929256038e","resolution":{"observed_at":"2026-08-06T15:19:17.234460Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T15:19:16.951711Z","title":"Training Verifiers to Solve Math Word Problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.951711Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:df8ef0723990f31214cf8b3eaf754190f9f1257ffee24aae5051ae3e2c936b63","observation_id":"97039f1e-3c11-485f-ac59-9ddf20a39391","resolution":{"observed_at":"2026-08-06T15:19:16.951711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.03340","last_updated":"2015-11-19T15:43:23Z","snapshot_observed_at":"2026-07-06T04:20:30.054789Z","submitted_at":"2015-06-10T14:54:39Z","title":"Teaching Machines to Read and Comprehend","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.03340","snapshot_observed_at":"2026-08-06T15:19:16.954054Z","title":"Teaching Machines to Read and Comprehend","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.954054Z"},"links":{"cited_paper":"/paper/1506.03340","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:4c70a62e2fd909ed38b5d5f979765147adc2d026050ebb7ecb1820cc275a4b54","observation_id":"3c03c5fc-4e5b-4ccf-a9a2-469a1174ba39","resolution":{"observed_at":"2026-08-06T15:19:16.954054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08351","last_updated":"2023-09-15T12:20:00Z","snapshot_observed_at":"2026-07-06T16:18:57.440736Z","submitted_at":"2023-09-15T12:20:00Z","title":"Headless Language Models: Learning without Predicting with Contrastive Weight Tying","version":1},"cited_work":{"arxiv_id":"2309.08351","doi":"10.48550/arxiv.2309.08351","metadata_source":"pith","pith_arxiv_id":"2309.08351","snapshot_observed_at":"2026-08-06T18:16:30.548575Z","title":"Headless Language Models: Learning without Predicting with Contrastive Weight Tying","venue":"cs.CL","work_id":"17d140e3-2d02-4866-bbd8-95b6694f0955","year":2023},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.956368Z"},"links":{"cited_paper":"/paper/2309.08351","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:8009bbd1e50728dc95856f82312a136d7229ac4ed9b64634444f2b7eea9c6b3b","observation_id":"1326b273-1c82-4c7d-a75f-6deb4246d885","resolution":{"observed_at":"2026-08-06T15:19:17.162960Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-06T15:19:16.958966Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.958966Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:f8b43dc72308b9fbd190a3f22de51d75f727b2e9c568fa23a50ce66c3313dd7e","observation_id":"7144c661-b181-4a4d-86bb-7b1d37f95d2a","resolution":{"observed_at":"2026-08-06T15:19:16.958966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-06T15:19:16.961408Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.961408Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:ffb2d8c0a777af7fa38fa8bc9ff96a05ef7ff0fe5bce6b5eb3fd90209680e8b8","observation_id":"6da07750-1c17-4ac1-a0a1-5da691814834","resolution":{"observed_at":"2026-08-06T15:19:16.961408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-06T15:19:16.964358Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.964358Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:4dccb1c4b7f5b13b19d0dcf91d67b8f10873811873fb8fdffb630b664bb24547","observation_id":"8a199f57-e1fd-403e-bf94-d32da6b3a2ba","resolution":{"observed_at":"2026-08-06T15:19:16.964358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:17.338615Z","title":"Efficient vocabulary reduction for small language models","venue":null,"work_id":"18fb4b03-ee65-4906-9500-db0288a3a91b","year":2025},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.966931Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:a9cffa23c54c708d37a257ec1934ddde0ed9c301931e0f7b7cd23cab9bf996b1","observation_id":"a2572573-efdc-481f-aa99-3d907ebf5d58","resolution":{"observed_at":"2026-08-06T15:19:17.341045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19223","last_updated":"2025-01-07T16:20:17Z","snapshot_observed_at":"2026-08-04T14:41:33.050098Z","submitted_at":"2024-06-27T14:49:08Z","title":"T-FREE: Subword Tokenizer-Free Generative LLMs via Sparse Representations for Memory-Efficient Embeddings","version":2},"cited_work":{"arxiv_id":"2406.19223","doi":"10.48550/arxiv.2406.19223","metadata_source":"pith","pith_arxiv_id":"2406.19223","snapshot_observed_at":"2026-08-06T18:16:30.548575Z","title":"T-FREE: Subword Tokenizer-Free Generative LLMs via Sparse Representations for Memory-Efficient Embeddings","venue":"cs.CL","work_id":"5cbf50e3-8a40-4895-baea-a44650339caa","year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.969137Z"},"links":{"cited_paper":"/paper/2406.19223","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:aa1f6395c897bb1591821985a702c0be71e789587ca41dcbae899abc821d8392","observation_id":"167698e1-f1d5-43b3-919a-c46c3cced097","resolution":{"observed_at":"2026-08-06T15:19:17.131959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14856","last_updated":"2025-03-11T08:54:55Z","snapshot_observed_at":"2026-08-07T18:00:57.897767Z","submitted_at":"2025-02-20T18:58:10Z","title":"FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14856","snapshot_observed_at":"2026-08-06T15:19:16.971760Z","title":"FR-Spec: Accelerating Large-V ocabulary Language Models via Frequency-Ranked Speculative Sampling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.971760Z"},"links":{"cited_paper":"/paper/2502.14856","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:e29c38125bc48db97654572819c5b3bbc6b648a42c4fe7152171faa0fc8ec849","observation_id":"04412551-b22f-4a0b-8434-2f666041544b","resolution":{"observed_at":"2026-08-06T15:19:16.971760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06371","last_updated":"2024-11-10T06:39:10Z","snapshot_observed_at":"2026-07-06T19:48:00.661234Z","submitted_at":"2024-11-10T06:39:10Z","title":"LLM Vocabulary Compression for Low-Compute Environments","version":1},"cited_work":{"arxiv_id":"2411.06371","doi":"10.48550/arxiv.2411.06371","metadata_source":"pith","pith_arxiv_id":"2411.06371","snapshot_observed_at":"2026-08-06T18:16:30.548575Z","title":"LLM Vocabulary Compression for Low-Compute Environments","venue":"cs.CL","work_id":"17a725f8-cb60-4c0f-bae9-3c5805ca1a54","year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.974995Z"},"links":{"cited_paper":"/paper/2411.06371","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:7b61899f41b88b0f2955ab692c3d74598eb64131d119ef92910b50c0d4fecb8f","observation_id":"7fab0aa4-c7af-4c6a-abf5-cffd343c0568","resolution":{"observed_at":"2026-08-06T15:19:17.114501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:16.977758Z","title":"Fast V ocabulary Transfer for Language Model Compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.977758Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:983b78db232a45c07847884f3c1cff00547e0965f0da54eed44c6128a7b0422b","observation_id":"3c850fcb-1bc5-4df0-9620-536487f792ae","resolution":{"observed_at":"2026-08-06T15:19:16.977758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08708","last_updated":"2025-03-25T13:30:00Z","snapshot_observed_at":"2026-08-01T04:04:18.267768Z","submitted_at":"2023-09-15T19:00:00Z","title":"Vocabulary-level Memory Efficiency for Language Model Fine-tuning","version":2},"cited_work":{"arxiv_id":"2309.08708","doi":"10.48550/arxiv.2309.08708","metadata_source":"pith","pith_arxiv_id":"2309.08708","snapshot_observed_at":"2026-08-06T18:16:30.548575Z","title":"Vocabulary-level Memory Efficiency for Language Model Fine-tuning","venue":"cs.CL","work_id":"788dfac2-e62f-49b7-ba5f-80016c4e6d18","year":2023},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.980301Z"},"links":{"cited_paper":"/paper/2309.08708","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:86e6843eed97ff18575613c60d402b751bb1dfded3eed85026c9848e33f31836","observation_id":"33cc0c51-4968-4207-9c29-89d452e39af1","resolution":{"observed_at":"2026-08-06T15:19:17.099342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04309","last_updated":"2017-06-19T16:33:04Z","snapshot_observed_at":"2026-07-06T05:10:48.516101Z","submitted_at":"2016-09-14T15:15:08Z","title":"Efficient softmax approximation for GPUs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04309","snapshot_observed_at":"2026-08-06T15:19:16.982992Z","title":"Efficient softmax approximation for GPUs","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.982992Z"},"links":{"cited_paper":"/paper/1609.04309","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:238f659a2a51cef6a0fb95f2192751fdeb6e917929856080d981e5a7fdef3845","observation_id":"29f02703-7b4f-4211-bcfe-ce376e4cd92f","resolution":{"observed_at":"2026-08-06T15:19:16.982992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.09301","last_updated":"2021-03-16T20:04:09Z","snapshot_observed_at":"2026-08-04T06:25:10.115531Z","submitted_at":"2021-03-16T20:04:09Z","title":"Softermax: Hardware/Software Co-Design of an Efficient Softmax for Transformers","version":1},"cited_work":{"arxiv_id":"2103.09301","doi":"10.48550/arxiv.2103.09301","metadata_source":"pith","pith_arxiv_id":"2103.09301","snapshot_observed_at":"2026-08-06T18:16:30.548575Z","title":"Softermax: Hardware/Software Co-Design of an Efficient Softmax for Transformers","venue":"cs.AR","work_id":"e520ac58-0b3d-4a9f-bc32-40944716aad4","year":2021},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.986067Z"},"links":{"cited_paper":"/paper/2103.09301","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:a06d71436c0ddc6ec45ee2322ff3a9cd5d722375814cfa19b21b4ae4f67917cc","observation_id":"3c189951-7a1c-414b-81d8-caf044f6a757","resolution":{"observed_at":"2026-08-06T15:19:17.081790Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:17.331249Z","title":"Baharav, Ryan Kang, Colin Sullivan, Mo Tiwari, Eric Luxenberg, David Tse, and Mert Pilanci","venue":null,"work_id":"75d9321d-849c-4807-bfcb-d34ebe32f09b","year":null},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.989283Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:bbc8a39a2b3cc8d4ee81f3024f6758304c2e75cf0fa8c1ebd3f601cb3b45f6f3","observation_id":"27ef0d46-9eba-4202-b173-f7a08e14c87e","resolution":{"observed_at":"2026-08-06T15:19:17.333809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19737","last_updated":"2024-04-30T17:33:57Z","snapshot_observed_at":"2026-08-03T23:22:09.849239Z","submitted_at":"2024-04-30T17:33:57Z","title":"Better & Faster Large Language Models via Multi-token Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19737","snapshot_observed_at":"2026-08-06T15:19:16.994757Z","title":"Better & Faster Large Language Models via Multi-token Prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.994757Z"},"links":{"cited_paper":"/paper/2404.19737","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:f4c707933e6331d4d1a9261865a5c0425561aeaf383667612b77b5c71aa0d0b6","observation_id":"95158648-9b5a-422d-ae41-9f01732ae97f","resolution":{"observed_at":"2026-08-06T15:19:16.994757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-06T15:19:16.997333Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.997333Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:62ae0c66d2654b937feb3b95e24d56f7d243d0e157e1492bac599f863b6bc380","observation_id":"df19124a-1058-4bb8-8244-87eca278ffcb","resolution":{"observed_at":"2026-08-06T15:19:16.997333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.12777","last_updated":"2020-10-24T04:49:15Z","snapshot_observed_at":"2026-07-06T10:08:08.004416Z","submitted_at":"2020-10-24T04:49:15Z","title":"Improving Multilingual Models with Language-Clustered Vocabularies","version":1},"cited_work":{"arxiv_id":"2010.12777","doi":"10.48550/arxiv.2010.12777","metadata_source":"pith","pith_arxiv_id":"2010.12777","snapshot_observed_at":"2026-08-06T18:16:30.548575Z","title":"Improving Multilingual Models with Language-Clustered Vocabularies","venue":"cs.CL","work_id":"ee59da73-a030-4c6d-b300-9040f035eafc","year":2020},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:17.000545Z"},"links":{"cited_paper":"/paper/2010.12777","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:5e9fdf75efe8dc540685832814de63fcba7d58a5e6e65ccfd5a2ceece4912335","observation_id":"ce70b2e4-cfa9-400a-86c1-3b9912224178","resolution":{"observed_at":"2026-08-06T15:19:17.056539Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13626","last_updated":"2022-03-08T02:18:51Z","snapshot_observed_at":"2026-08-08T00:04:26.808792Z","submitted_at":"2021-05-28T07:03:22Z","title":"ByT5: Towards a token-free future with pre-trained byte-to-byte models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13626","snapshot_observed_at":"2026-08-06T15:19:17.002827Z","title":"ByT5: Towards a token-free future with pre-trained byte-to-byte models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:17.002827Z"},"links":{"cited_paper":"/paper/2105.13626","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:bcb927344cd8fd8b49882ee34d49335216fd884fbaeaccfa98ab0240b1b0924b","observation_id":"9535f0fe-a3e9-452d-9c20-9fa2f60d2380","resolution":{"observed_at":"2026-08-06T15:19:17.002827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:17.005211Z","title":"Clark, Dan Garrette, Iulia Turc, and John Wieting","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:17.005211Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:d9020ef2d0caa4e6bb824797e55c59b3baf3567c5fe56b9ed836fe93681d0f29","observation_id":"c058ad57-4d09-4a1e-b962-1e36c8def3ec","resolution":{"observed_at":"2026-08-06T15:19:17.005211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:17.316021Z","title":"Decoupled Weight Decay Regularization","venue":null,"work_id":"d3df338a-ad0d-4686-8075-7c29e0309f1f","year":null},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:17.007608Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:1590cacb7974b465c6af230d14ded493b69bbc08b1c48fe44c3faac32d105b1e","observation_id":"d340e217-b17a-47d7-9b39-0580177e4155","resolution":{"observed_at":"2026-08-06T15:19:17.318960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:17.307121Z","title":"All models are trained on a single GPU: smaller models on Nvidia L40S, and larger models on Nvidia A100","venue":null,"work_id":"241d9ed5-596e-4221-bd86-9b78d3029106","year":null},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:17.012836Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:c3d92b73a9229ed4ccab569a845ce90ef43fdde6a97232d3ab30e962df1eec99","observation_id":"e7cccba9-6784-417d-af24-624aab0e5b2a","resolution":{"observed_at":"2026-08-06T15:19:17.309902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T15:19:17.010080Z","title":"A Appendix Accuracy over various token lengths In Section 5.2, we analyze the accuracy of models with varying number of character-level heads across different token lengths","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:17.010080Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:fccff07bdc9c34d6984eeb98e21a0507289a54dc0e31f15211b83d9709a0d38b","observation_id":"d179371d-a7c4-4021-bad6-9b35891e93ca","resolution":{"observed_at":"2026-08-06T15:19:17.010080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:17.324338Z","title":null,"venue":null,"work_id":"2e87fb37-b27e-4a39-a7fa-a3305bca34d1","year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.992044Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:a7695d1481ecb5e876db2ffffba70010dc7c088ad5e922becbd6ac07fded046f","observation_id":"ea75a3c5-db19-4383-bcfe-3ed4949d5877","resolution":{"observed_at":"2026-08-06T15:19:17.326714Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T01:51:16.109812Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":21,"verified_exact":7,"verified_fuzzy":5},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2507.16323."}