{"as_of":"2026-08-20T10:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dc014b77b10a050c10b887a0e40ab5248cb407ac81b92acfcfc7c3b667481da3","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:45:39.195688Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":44,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:33:18.628297Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T03:47:48.461365Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-11T11:45:54.470359Z","title":"Preprint, arXiv:2412.09871","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15210","last_updated":"2024-12-19T18:59:46Z","snapshot_observed_at":"2026-08-11T16:11:24.480400Z","submitted_at":"2024-12-19T18:59:46Z","title":"Tokenisation is NP-Complete","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T11:45:54.470359Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2412.15210"},"observation_digest":"sha256:d2f91de3fbe8780973116bdf1b52f10b90b7a4ef8669b25d711c1f3cdcdb6a8d","observation_id":"8a56eef1-ae4b-46b4-907c-c68d04da976d","resolution":{"observed_at":"2026-08-11T11:45:54.470359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-10T22:17:22.531753Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02393","last_updated":"2025-03-05T13:19:16Z","snapshot_observed_at":"2026-08-15T19:11:58.402067Z","submitted_at":"2025-01-04T22:30:21Z","title":"Graph-Aware Isomorphic Attention for Adaptive Dynamics in Transformers","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T22:17:22.531753Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2501.02393"},"observation_digest":"sha256:5671980e2dfd57a4938bf6d6a35c366a2d2fba24340d13913c9932471c4c8b5d","observation_id":"4326a6ca-de80-49ce-a5ac-fd0fff6d75e1","resolution":{"observed_at":"2026-08-10T22:17:22.531753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-10T05:28:04.841086Z","title":"Byte latent transformer: Patches scale better than tokens, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16975","last_updated":"2025-05-23T08:32:07Z","snapshot_observed_at":"2026-08-16T10:44:18.951863Z","submitted_at":"2025-01-28T14:15:42Z","title":"Over-Tokenized Transformer: Vocabulary is Generally Worth Scaling","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T05:28:04.841086Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2501.16975"},"observation_digest":"sha256:29dd6e0149f650604b7da72ff5a033bc0c923ad80ca96eb58cc5c9dacab33690","observation_id":"126eaf8b-4455-492c-9284-6290608b28d0","resolution":{"observed_at":"2026-08-10T05:28:04.841086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-09T18:11:46.540034Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00677","last_updated":"2025-02-02T05:28:17Z","snapshot_observed_at":"2026-08-19T03:38:35.030780Z","submitted_at":"2025-02-02T05:28:17Z","title":"LLM-based event log analysis techniques: A survey","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:46.540034Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2502.00677"},"observation_digest":"sha256:9c9a60964bf427a97e3f3d546c0d5894f653de99f6d851a6c8057d2363be62af","observation_id":"3d88bde0-ea82-48b9-b831-7338928bc81f","resolution":{"observed_at":"2026-08-09T18:11:46.540034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-09T05:22:33.078204Z","title":"Byte latent transformer: Patches scale better than tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03275","last_updated":"2025-09-01T18:25:38Z","snapshot_observed_at":"2026-08-13T02:33:47.410604Z","submitted_at":"2025-02-05T15:33:00Z","title":"Token Assorted: Mixing Latent and Text Tokens for Improved Language Model Reasoning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T05:22:33.078204Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2502.03275"},"observation_digest":"sha256:69776a5e115fbc8b73d23c5bf49ed88847abf467ba36cbafce876426b2dca8b8","observation_id":"c8b92a72-72c2-4424-bec4-17a25157877c","resolution":{"observed_at":"2026-08-09T05:22:33.078204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-09T10:16:49.163383Z","title":"Byte latent transformer: Patches scale better than tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03499","last_updated":"2025-02-05T09:20:52Z","snapshot_observed_at":"2026-08-15T12:14:19.347538Z","submitted_at":"2025-02-05T09:20:52Z","title":"Omni-DNA: A Unified Genomic Foundation Model for Cross-Modal and Multi-Task Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T10:16:49.163383Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2502.03499"},"observation_digest":"sha256:8cd406317a0e09135dc76019ff90e582f2b75b0a275f8d9a1ccdb0e78d7ae158","observation_id":"5bb9f469-f237-4676-8224-e6cc4e59f5f3","resolution":{"observed_at":"2026-08-09T10:16:49.163383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-07T22:10:15.898992Z","title":"Byte latent transformer: Patches scale better than tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09287","last_updated":"2025-02-13T13:01:46Z","snapshot_observed_at":"2026-08-18T09:02:51.260792Z","submitted_at":"2025-02-13T13:01:46Z","title":"An Uncertainty Principle for Linear Recurrent Neural Networks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:15.898992Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2502.09287"},"observation_digest":"sha256:42df712ef0cb60bea26979ab19aa6348de6f4fd861c80c7650db328d2be99c08","observation_id":"21f1b5c5-f89a-4c3c-a615-48294aef94ca","resolution":{"observed_at":"2026-08-07T22:10:15.898992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-15T23:33:18.628297Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06291","last_updated":"2025-05-07T13:32:31Z","snapshot_observed_at":"2026-08-18T20:46:46.374235Z","submitted_at":"2025-05-07T13:32:31Z","title":"ALFEE: Adaptive Large Foundation Model for EEG Representation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T23:33:18.628297Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2505.06291"},"observation_digest":"sha256:2e0c3ac215ed8f7a5c312fa684166c4b4b7e4937c2849230ee35f808e6f2673a","observation_id":"ca9a8266-a026-4ed1-be69-2768a92a6298","resolution":{"observed_at":"2026-08-15T23:33:18.628297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-15T20:26:17.509395Z","title":"Byte latent transformer: Patches scale better than tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13573","last_updated":"2025-05-19T13:52:57Z","snapshot_observed_at":"2026-08-16T12:34:00.898900Z","submitted_at":"2025-05-19T13:52:57Z","title":"FreeMesh: Boosting Mesh Generation with Coordinates Merging","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:26:17.509395Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2505.13573"},"observation_digest":"sha256:817244f6e2bd9e43fedfa814dfdecbe109a56818c4a84be5ea38f28950803fe8","observation_id":"5a162554-a44c-43b1-b0a0-d211fd6668d2","resolution":{"observed_at":"2026-08-15T20:26:17.509395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-07T14:46:32.255302Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17784","last_updated":"2025-05-23T11:56:48Z","snapshot_observed_at":"2026-08-19T11:05:25.860514Z","submitted_at":"2025-05-23T11:56:48Z","title":"EXECUTE: A Multilingual Benchmark for LLM Token Understanding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:46:32.255302Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2505.17784"},"observation_digest":"sha256:c12d1e703b39257446bc7d81eab8f9cfde5ff354dc3694e287793dd032333117","observation_id":"4f9c47a7-419b-464e-a43d-3d6ef8f0130a","resolution":{"observed_at":"2026-08-07T14:46:32.255302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-07T12:35:27.989485Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24561","last_updated":"2025-05-30T13:16:08Z","snapshot_observed_at":"2026-08-12T15:49:15.982660Z","submitted_at":"2025-05-30T13:16:08Z","title":"Improving Language and Modality Transfer in Translation by Character-level Modeling","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:27.989485Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2505.24561"},"observation_digest":"sha256:eb98d08d15fbd3c8e5beda1864e0b2621f545c3f16cdfe2542d6981c7e4b9b97","observation_id":"48674664-e288-4d0f-a3a2-a70e1a776f46","resolution":{"observed_at":"2026-08-07T12:35:27.989485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-07T11:36:02.623401Z","title":"Byte latent transformer: Patches scale better than tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01933","last_updated":"2025-07-10T17:55:35Z","snapshot_observed_at":"2026-08-15T12:04:30.297870Z","submitted_at":"2025-06-02T17:53:09Z","title":"E3D-Bench: A Benchmark for End-to-End 3D Geometric Foundation Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:02.623401Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2506.01933"},"observation_digest":"sha256:425aeeb9fbe19316e877026275e9522021ae16ee2775a10443d8ca78e892b735","observation_id":"4a1085e6-f3aa-4d90-8b7f-dc8d684d1442","resolution":{"observed_at":"2026-08-07T11:36:02.623401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":"2412.09871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-07-11T03:47:48.461365Z","title":"arXiv preprint arXiv:2412.09871 , year=","venue":"cs.CL","work_id":"e1462084-176b-4aab-aa7e-ec8788bdc32f","year":2024},"citing_paper":{"arxiv_id":"2506.14123","last_updated":"2026-05-07T07:43:36Z","snapshot_observed_at":"2026-08-11T17:02:54.244928Z","submitted_at":"2025-06-17T02:37:04Z","title":"Sampling from Your Language Model One Byte at a Time","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-19T09:52:20.923710Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2506.14123"},"observation_digest":"sha256:3947afe3eca730bd5c67872c2d1eac9f56b867cbb33be60e158b8be06905acfd","observation_id":"435b1c62-d240-45d8-be4e-5163e52aa492","resolution":{"observed_at":"2026-05-19T09:53:02.099512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-15T19:56:40.676381Z","title":"Byte latent transformer: Patches scale better than tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14761","last_updated":"2025-06-17T17:55:11Z","snapshot_observed_at":"2026-08-15T19:44:59.254691Z","submitted_at":"2025-06-17T17:55:11Z","title":"From Bytes to Ideas: Language Modeling with Autoregressive U-Nets","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T19:56:40.676381Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2506.14761"},"observation_digest":"sha256:e1c940aa35ecb4f604c24a7fc8dc891d0df9bebe8f3edac45db8386b37be7009","observation_id":"13953cd7-5da7-420e-bdb4-4ca577edf254","resolution":{"observed_at":"2026-08-15T19:56:40.676381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-15T19:34:23.741958Z","title":"Byte latent transformer: Patches scale better than tokens.arXiv preprint arXiv:2412.09871,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15889","last_updated":"2025-06-18T21:25:55Z","snapshot_observed_at":"2026-08-15T19:27:31.421035Z","submitted_at":"2025-06-18T21:25:55Z","title":"Entropy-Driven Pre-Tokenization for Byte-Pair Encoding","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:23.741958Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2506.15889"},"observation_digest":"sha256:cf0d95feec9f3a81c1287419621b491dd99a127850ef9d28757e75244f787fac","observation_id":"42ade3c6-115f-48e0-99a6-2e3a237063e1","resolution":{"observed_at":"2026-08-15T19:34:23.741958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-06T23:20:54.053549Z","title":"Byte latent transformer: P atches scale better than tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18639","last_updated":"2025-06-23T13:42:00Z","snapshot_observed_at":"2026-08-13T14:50:10.660536Z","submitted_at":"2025-06-23T13:42:00Z","title":"ByteSpan: Information-Driven Subword Tokenisation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:54.053549Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2506.18639"},"observation_digest":"sha256:0b9b455e95d6d04e01d40e03ebc08fdc29b81654de7dd6ef1408f8f0ea76e774","observation_id":"1db18ae7-1465-44d1-bff7-ba515ca024bd","resolution":{"observed_at":"2026-08-06T23:20:54.053549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-06T22:40:55.730794Z","title":"Byte Latent Transformer : Patches Scale Better Than Tokens , December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21103","last_updated":"2025-06-26T09:01:19Z","snapshot_observed_at":"2026-08-16T04:38:55.236993Z","submitted_at":"2025-06-26T09:01:19Z","title":"Learning to Skip the Middle Layers of Transformers","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T22:40:55.730794Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2506.21103"},"observation_digest":"sha256:fdf880049e67e55da04b120aee66ff6e4a2763eff8ede47ebfce5be219d705eb","observation_id":"2a6722b8-8bcf-42d5-ba56-645dc9e209fc","resolution":{"observed_at":"2026-08-06T22:40:55.730794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-06T21:36:46.494957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23762","last_updated":"2025-06-30T12:09:29Z","snapshot_observed_at":"2026-08-18T21:24:26.814763Z","submitted_at":"2025-06-30T12:09:29Z","title":"Software Engineering for Large Language Models: Research Status, Challenges and the Road Ahead","version":1},"reference_index":280,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:46.494957Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2506.23762"},"observation_digest":"sha256:9b50e39c058580a914017ceef6b08e0e8fb341aa3963bf882dcf9097a42191b3","observation_id":"baca7f72-cda5-452d-9c71-b893ffbde6cf","resolution":{"observed_at":"2026-08-06T21:36:46.494957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-06T20:42:36.683346Z","title":"Byte latent transformer: Patches scale better than tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-17T19:50:10.817332Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:36.683346Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:0555e55fe1c9fc4a5facd7c6f9e14b48034c10ba5fa59252aeb1ad23cc17df0c","observation_id":"62add196-6752-4877-bae9-35fb7daa884e","resolution":{"observed_at":"2026-08-06T20:42:36.683346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-06T18:34:02.209101Z","title":"Byte Latent Transformer: Patches Scale Better than Tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-19T09:43:53.193377Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:02.209101Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:aec53349e691a60af286b2fd601eaedc90e32826122d3e4afdc21fb398ad42bd","observation_id":"8e67bcc0-2611-495d-9d96-e7291394e431","resolution":{"observed_at":"2026-08-06T18:34:02.209101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":"2412.09871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-07-11T03:47:48.461365Z","title":"arXiv preprint arXiv:2412.09871 , year=","venue":"cs.CL","work_id":"e1462084-176b-4aab-aa7e-ec8788bdc32f","year":2024},"citing_paper":{"arxiv_id":"2507.12720","last_updated":"2026-05-13T15:04:08Z","snapshot_observed_at":"2026-08-16T02:20:15.498517Z","submitted_at":"2025-07-17T01:55:41Z","title":"FLEXITOKENS: Flexible Tokenization for Evolving Language Models","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T05:10:19.093601Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2507.12720"},"observation_digest":"sha256:3b19de9dc9f63e1225ffaaa06fdc85241d50a915393f62dc9ff6a2e377a4d4e6","observation_id":"13ab9f17-58fd-4f22-91c6-1c85f375d120","resolution":{"observed_at":"2026-05-19T05:12:05.199207Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-06T16:45:34.701858Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-13T17:54:27.632509Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:34.701858Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:427891275b41a2b4231bdd29b3e24254d8a18c5c72c1a3560513045e71633e3b","observation_id":"b6c96cd5-26b4-46c5-a8f7-55e1c4d53548","resolution":{"observed_at":"2026-08-06T16:45:34.701858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-06T15:19:16.943166Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.943166Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:67cb12da9686efab7a1865dbd0cd1fca6a5b7a0f31860efc2543f5ee796f47ee","observation_id":"245cef04-c4a6-4041-b171-e7fca218e328","resolution":{"observed_at":"2026-08-06T15:19:16.943166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-05T14:59:36.545581Z","title":"arXiv:2412.09871","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20665","last_updated":"2025-08-28T11:15:44Z","snapshot_observed_at":"2026-08-13T15:48:15.526573Z","submitted_at":"2025-08-28T11:15:44Z","title":"Amadeus: Autoregressive Model with Bidirectional Attribute Modelling for Symbolic Music","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:59:36.545581Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2508.20665"},"observation_digest":"sha256:057d59313fd536cde1506a8deaf40e5cf99250f4370b8a398ff67c53f7bac8fc","observation_id":"38465e18-0e65-420d-a0d2-dcc00bdde284","resolution":{"observed_at":"2026-08-05T14:59:36.545581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":"2412.09871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-07-11T03:47:48.461365Z","title":"arXiv preprint arXiv:2412.09871 , year=","venue":"cs.CL","work_id":"e1462084-176b-4aab-aa7e-ec8788bdc32f","year":2024},"citing_paper":{"arxiv_id":"2510.04800","last_updated":"2026-04-21T13:16:20Z","snapshot_observed_at":"2026-08-12T17:48:16.385812Z","submitted_at":"2025-10-06T13:30:07Z","title":"Hybrid Architectures for Language Models: Systematic Analysis and Design Insights","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T10:18:04.431436Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2510.04800"},"observation_digest":"sha256:26b26f8b5d1fed060821cd2ab62212669695ef8b458f21cf17045faae32a0140","observation_id":"a868451e-b1a5-421b-aa4e-550ebee901fb","resolution":{"observed_at":"2026-05-18T10:21:15.070824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":"2412.09871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-07-11T03:47:48.461365Z","title":"arXiv preprint arXiv:2412.09871 , year=","venue":"cs.CL","work_id":"e1462084-176b-4aab-aa7e-ec8788bdc32f","year":2024},"citing_paper":{"arxiv_id":"2603.06351","last_updated":"2026-05-07T16:40:07Z","snapshot_observed_at":"2026-08-11T15:47:08.117539Z","submitted_at":"2026-03-06T14:59:11Z","title":"DC-DiT: Adaptive Compute and Elastic Inference for Visual Generation via Dynamic Chunking","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T15:10:00.146694Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2603.06351"},"observation_digest":"sha256:687979a277923917f412ee4c8e550b371d14a56a1736b7ed04d73e88461eb3f9","observation_id":"800d5deb-5edf-4a87-b26e-47a6a5381726","resolution":{"observed_at":"2026-05-15T15:10:05.833399Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":"2412.09871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-07-11T03:47:48.461365Z","title":"arXiv preprint arXiv:2412.09871 , year=","venue":"cs.CL","work_id":"e1462084-176b-4aab-aa7e-ec8788bdc32f","year":2024},"citing_paper":{"arxiv_id":"2605.00253","last_updated":"2026-04-30T21:35:08Z","snapshot_observed_at":"2026-08-12T12:39:44.844584Z","submitted_at":"2026-04-30T21:35:08Z","title":"Lost in State Space: Probing Frozen Mamba Representations","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-09T19:57:22.493681Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2605.00253"},"observation_digest":"sha256:2cc00f07b6c5db8fb5161db71f88e42e535f19d5258f9a6e9bbc723f7e8cb85b","observation_id":"91b7b0a1-0333-4256-9c9d-5b51041eeb5e","resolution":{"observed_at":"2026-05-11T15:26:13.005369Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":"2412.09871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-07-11T03:47:48.461365Z","title":"arXiv preprint arXiv:2412.09871 , year=","venue":"cs.CL","work_id":"e1462084-176b-4aab-aa7e-ec8788bdc32f","year":2024},"citing_paper":{"arxiv_id":"2605.09630","last_updated":"2026-05-10T16:18:22Z","snapshot_observed_at":"2026-08-14T10:03:16.402043Z","submitted_at":"2026-05-10T16:18:22Z","title":"Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-12T04:05:28.713898Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2605.09630"},"observation_digest":"sha256:1748273dd03934c38962479d263ece6eef92dc6089003ba75d6a3b71601751f4","observation_id":"53a577bf-b816-4a10-ad63-442b74c0309b","resolution":{"observed_at":"2026-05-12T06:36:29.184901Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":"2412.09871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-07-11T03:47:48.461365Z","title":"arXiv preprint arXiv:2412.09871 , year=","venue":"cs.CL","work_id":"e1462084-176b-4aab-aa7e-ec8788bdc32f","year":2024},"citing_paper":{"arxiv_id":"2605.11829","last_updated":"2026-05-12T09:17:43Z","snapshot_observed_at":"2026-08-17T01:20:05.514257Z","submitted_at":"2026-05-12T09:17:43Z","title":"Bin Latent Transformer (BiLT): A shift-invariant autoencoder for calibration-free spectral unmixing of turbid media","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T05:10:58.035490Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2605.11829"},"observation_digest":"sha256:bcbba4d7e412141d4f36624deeaf079de8f793f0c6a853a51ab794a9b06d5dc2","observation_id":"7df2ea19-0fd7-49aa-9205-13bf95949310","resolution":{"observed_at":"2026-05-13T05:12:17.583602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":"2412.09871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-07-11T03:47:48.461365Z","title":"arXiv preprint arXiv:2412.09871 , year=","venue":"cs.CL","work_id":"e1462084-176b-4aab-aa7e-ec8788bdc32f","year":2024},"citing_paper":{"arxiv_id":"2605.21070","last_updated":"2026-05-20T11:56:15Z","snapshot_observed_at":"2026-08-15T23:56:17.773250Z","submitted_at":"2026-05-20T11:56:15Z","title":"Towards Understanding Self-Pretraining for Sequence Classification","version":1},"reference_index":181,"source":"arxiv_source","source_observed_at":"2026-05-21T05:29:58.809024Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2605.21070"},"observation_digest":"sha256:1385c1f2e42dc0ea6d71a22120a67e0e6b5958385d260daa1f8ce6ae267d982c","observation_id":"b84543b0-8be2-479c-9859-cf5a6484eceb","resolution":{"observed_at":"2026-05-21T05:33:58.896749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":"2412.09871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-07-11T03:47:48.461365Z","title":"arXiv preprint arXiv:2412.09871 , year=","venue":"cs.CL","work_id":"e1462084-176b-4aab-aa7e-ec8788bdc32f","year":2024},"citing_paper":{"arxiv_id":"2605.29459","last_updated":"2026-05-28T06:53:18Z","snapshot_observed_at":"2026-08-14T18:12:28.921097Z","submitted_at":"2026-05-28T06:53:18Z","title":"Kronecker Embeddings: Byte-Level Structured Token Representations for Parameter-Efficient Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:25.019889Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2605.29459"},"observation_digest":"sha256:7ae354dba2698bacd0601d29fb774e22f75521b899667a410c9d62ae8bc97c82","observation_id":"ba6156fc-1975-4c98-86fe-078c7e3ebb5c","resolution":{"observed_at":"2026-06-29T07:53:13.401957Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":"2412.09871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-07-11T03:47:48.461365Z","title":"arXiv preprint arXiv:2412.09871 , year=","venue":"cs.CL","work_id":"e1462084-176b-4aab-aa7e-ec8788bdc32f","year":2024},"citing_paper":{"arxiv_id":"2606.02834","last_updated":"2026-06-01T19:56:02Z","snapshot_observed_at":"2026-08-18T22:05:52.030100Z","submitted_at":"2026-06-01T19:56:02Z","title":"Large Byte Model: Teaching Language Models About Compiled Code","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T13:47:15.984105Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2606.02834"},"observation_digest":"sha256:a8ff15ba5000bcb1a8cc70cb0943f8ff689d001103a9e2f0b8a4fbe5198d1a93","observation_id":"3c62183c-42a5-4164-9825-5951dd2d4e5b","resolution":{"observed_at":"2026-07-01T23:56:24.019070Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":"2412.09871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-07-11T03:47:48.461365Z","title":"arXiv preprint arXiv:2412.09871 , year=","venue":"cs.CL","work_id":"e1462084-176b-4aab-aa7e-ec8788bdc32f","year":2024},"citing_paper":{"arxiv_id":"2606.04171","last_updated":"2026-06-02T19:35:44Z","snapshot_observed_at":"2026-08-15T16:10:38.192280Z","submitted_at":"2026-06-02T19:35:44Z","title":"MimeLens: Position-Agnostic Content-Type Detection for Binary Fragments","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T09:13:26.501298Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2606.04171"},"observation_digest":"sha256:d09ece61771690dbbd7368384ae31c1b080951cce0fe2327b37b5ccd9ffb1408","observation_id":"beafb45c-a498-40d1-a858-65063d412e83","resolution":{"observed_at":"2026-07-02T04:26:35.422286Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":"2412.09871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-07-11T03:47:48.461365Z","title":"arXiv preprint arXiv:2412.09871 , year=","venue":"cs.CL","work_id":"e1462084-176b-4aab-aa7e-ec8788bdc32f","year":2024},"citing_paper":{"arxiv_id":"2606.14122","last_updated":"2026-06-25T06:23:33Z","snapshot_observed_at":"2026-08-14T15:38:29.966935Z","submitted_at":"2026-06-12T05:03:55Z","title":"Beyond Perplexity: UTF-8 Validity in Byte-aware Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T05:15:07.811143Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2606.14122"},"observation_digest":"sha256:c074a79b9743b2e1e53c0c0e41caa98e6d92fa30d18ec0f7084c2d41dd4847f7","observation_id":"9283bf06-bb4d-4426-a496-a5bb87b54656","resolution":{"observed_at":"2026-06-27T05:20:35.905563Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":"2412.09871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-07-11T03:47:48.461365Z","title":"arXiv preprint arXiv:2412.09871 , year=","venue":"cs.CL","work_id":"e1462084-176b-4aab-aa7e-ec8788bdc32f","year":2024},"citing_paper":{"arxiv_id":"2606.19172","last_updated":"2026-06-17T15:15:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-17T15:15:19Z","title":"User as Engram: Internalizing Per-User Memory as Local Parametric Edits","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-26T20:37:01.382431Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2606.19172"},"observation_digest":"sha256:5124fdfbac494d013969adae5a8c21099fab3e5c9856de3392118dc7b15dedf8","observation_id":"22acbaf7-26c8-4e4d-93bd-f5e7789f4c1e","resolution":{"observed_at":"2026-07-04T01:09:19.466162Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":"2412.09871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-07-11T03:47:48.461365Z","title":"arXiv preprint arXiv:2412.09871 , year=","venue":"cs.CL","work_id":"e1462084-176b-4aab-aa7e-ec8788bdc32f","year":2024},"citing_paper":{"arxiv_id":"2606.20587","last_updated":"2026-05-14T20:52:34Z","snapshot_observed_at":"2026-08-09T15:35:41.782482Z","submitted_at":"2026-05-14T20:52:34Z","title":"Protocol-Aware Tokenization and Architecture Co-Design for Wireless Packet Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T19:23:59.334530Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2606.20587"},"observation_digest":"sha256:952e04cfdfdeda692089bdd31417c09b9b21f2be4a8e56e50352f29615768e48","observation_id":"3b81a4b1-4169-4196-acf0-2eccc0eae93e","resolution":{"observed_at":"2026-06-30T19:25:00.475146Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":"2412.09871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-07-11T03:47:48.461365Z","title":"arXiv preprint arXiv:2412.09871 , year=","venue":"cs.CL","work_id":"e1462084-176b-4aab-aa7e-ec8788bdc32f","year":2024},"citing_paper":{"arxiv_id":"2606.20993","last_updated":"2026-06-18T23:50:54Z","snapshot_observed_at":"2026-08-05T09:19:18.829577Z","submitted_at":"2026-06-18T23:50:54Z","title":"Phonemes to the Rescue: Multilingual Tokenization Based on International Phonetic Alphabet","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-26T16:53:25.556222Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2606.20993"},"observation_digest":"sha256:d387dc7d14f21fd6f44873dd80b289626fc0b5e7f4ec1df4176f7cf2aa847fc0","observation_id":"9cc5f5e6-a47f-4b00-8cf0-083dd64b678e","resolution":{"observed_at":"2026-07-04T04:39:34.623582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":"2412.09871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-07-11T03:47:48.461365Z","title":"arXiv preprint arXiv:2412.09871 , year=","venue":"cs.CL","work_id":"e1462084-176b-4aab-aa7e-ec8788bdc32f","year":2024},"citing_paper":{"arxiv_id":"2606.27550","last_updated":"2026-06-25T20:54:27Z","snapshot_observed_at":"2026-08-15T17:47:58.613698Z","submitted_at":"2026-06-25T20:54:27Z","title":"EntMTP: Accelerating LLM Inference with Entropy Guided Multi Token Prediction","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-29T01:51:42.113800Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2606.27550"},"observation_digest":"sha256:7ba78c4cbc8b47919c7b743d1f33019ca45f20931cbcf61ee58996da97f6851c","observation_id":"2cdd0554-5906-4ba3-933a-f63d452445c0","resolution":{"observed_at":"2026-07-01T18:35:59.085284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":"2412.09871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-07-11T03:47:48.461365Z","title":"arXiv preprint arXiv:2412.09871 , year=","venue":"cs.CL","work_id":"e1462084-176b-4aab-aa7e-ec8788bdc32f","year":2024},"citing_paper":{"arxiv_id":"2606.28929","last_updated":"2026-06-27T14:03:47Z","snapshot_observed_at":"2026-08-19T15:35:08.319197Z","submitted_at":"2026-06-27T14:03:47Z","title":"Cybersecurity is the True Frontier for Generative AI Success or Failure","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-30T09:46:06.726675Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2606.28929"},"observation_digest":"sha256:5489bdd641b22d65f6fd8456deb3f51c2b8d916f9efc43b74d2edb9d97dc4f73","observation_id":"13391aad-58d9-4548-a284-6bc4e487ded6","resolution":{"observed_at":"2026-06-30T09:54:35.389902Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":"2412.09871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-07-11T03:47:48.461365Z","title":"arXiv preprint arXiv:2412.09871 , year=","venue":"cs.CL","work_id":"e1462084-176b-4aab-aa7e-ec8788bdc32f","year":2024},"citing_paper":{"arxiv_id":"2607.02087","last_updated":"2026-07-10T20:58:05Z","snapshot_observed_at":"2026-08-13T13:40:51.349383Z","submitted_at":"2026-07-02T12:27:54Z","title":"SUNTA: Hierarchical Video Prediction with Surprise-based Chunking","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-03T13:20:21.237349Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2607.02087"},"observation_digest":"sha256:e6b514f7458a610834302cf8188a583dcc518df5a9e640fbd670bf482122c1dd","observation_id":"c451fb12-4662-40ad-9d8e-929f82ac05e3","resolution":{"observed_at":"2026-07-03T13:28:18.347271Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-07-14T16:42:04.979573Z","title":"Byte latent transformer: Patches scale better than tokens, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02087","last_updated":"2026-07-10T20:58:05Z","snapshot_observed_at":"2026-08-13T13:40:51.349383Z","submitted_at":"2026-07-02T12:27:54Z","title":"SUNTA: Hierarchical Video Prediction with Surprise-based Chunking","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T16:42:04.979573Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2607.02087"},"observation_digest":"sha256:e76fe2a9719212cb9522ed23b8de9ace5645c07a74cacaccf031142b6131f179","observation_id":"8755bc1c-bb44-4e9b-a4f2-7bf298987e22","resolution":{"observed_at":"2026-07-14T16:42:04.979573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":"2412.09871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-07-11T03:47:48.461365Z","title":"arXiv preprint arXiv:2412.09871 , year=","venue":"cs.CL","work_id":"e1462084-176b-4aab-aa7e-ec8788bdc32f","year":2024},"citing_paper":{"arxiv_id":"2607.05691","last_updated":"2026-07-06T23:16:51Z","snapshot_observed_at":"2026-08-07T16:26:53.142666Z","submitted_at":"2026-07-06T23:16:51Z","title":"Where to cut, how deep: BPE and Unigram-LM on chemistry SMILES","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T03:42:21.307552Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2607.05691"},"observation_digest":"sha256:ba80e1f5ab37293f3c3deb604df4f21640ebcff679c9b377726ddbc786701e91","observation_id":"05d66f14-9838-4e25-9a40-c438a24c5c58","resolution":{"observed_at":"2026-07-11T03:47:48.485819Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-01T05:09:56.046733Z","title":"Byte latent transformer: Patches scale better than tokens.arXiv preprint arXiv:2412.09871, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:56.046733Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:9de757b4aeaf2873a82fd7ea16d57a02e28198cfdd22adbed74e0c3740d792e3","observation_id":"0799d3ef-482e-4656-ad44-e5616d0dca69","resolution":{"observed_at":"2026-08-01T05:09:56.046733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-08T11:50:27.271301Z","title":"arXiv preprint arXiv:2412.09871 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05510","last_updated":"2026-08-06T01:23:51Z","snapshot_observed_at":"2026-08-19T09:22:16.265635Z","submitted_at":"2026-08-06T01:23:51Z","title":"Different Perturbations, Different Mechanisms: Understanding Continued Pre-training for Zero-Shot Dialect Robustness","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:27.271301Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2608.05510"},"observation_digest":"sha256:25e20e372c916b5ce5e602fd96da0a84f4d3b82bd879aa25ffbbe68c982da2fe","observation_id":"9d6c47de-2dd6-444f-a2bb-d543f28ab848","resolution":{"observed_at":"2026-08-08T11:50:27.271301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.09871/citation-record","integrity":"/paper/2412.09871/integrity","json":"/paper/2412.09871/citation-record.json","paper":"/paper/2412.09871"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.066549Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.066549Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:084b4e53d5a8b5a2197ee3d822caa23abfeb906768597f5818a77b0992158440","observation_id":"1d369c27-aa05-4d61-af2b-cfa6d1fbc0a6","resolution":{"observed_at":"2026-08-11T16:45:39.066549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.573212Z","title":"Character-level language modeling with deeper self-attention","venue":null,"work_id":"61856441-cdbd-4238-88e4-7c171b764733","year":2019},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.070566Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:5103900859534d70e81e9b83224d3e9cfa3115baadbbd082005f04148fc8b922","observation_id":"693a9cad-1457-40e7-a424-220f9a8df050","resolution":{"observed_at":"2026-08-11T16:45:39.576723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.073285Z","title":"Program synthesis with large language models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.073285Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:8968b75fafa3c4cb1368751eba29a56c1b03bc7b4e0d1dba8a5abcdfdec0b7e1","observation_id":"cba0e444-0c7b-49fd-9f14-e15af1736dcf","resolution":{"observed_at":"2026-08-11T16:45:39.073285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.561413Z","title":"Learning to rank with (a lot of) word features","venue":null,"work_id":"3d959549-400d-497c-887f-c39901a469c9","year":2010},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.076082Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:4e4b99b09493a007d9ebf1220c45647ddfca6b3e5dc66b48476a51118f5f393d","observation_id":"90c30d31-d107-4ede-8a6b-85e9ee2efc52","resolution":{"observed_at":"2026-08-11T16:45:39.564162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.553203Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":"28aeae35-88c1-4d5d-b575-4183fe41357a","year":2020},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.078669Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:c8871b283f3ef000f734cf25184fdf000ecb09455e3348a04069518ab05c7876","observation_id":"cf52b182-05b7-4f9d-ad8b-e0ead61a17f0","resolution":{"observed_at":"2026-08-11T16:45:39.556081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.545446Z","title":"Transformer flops, 2023","venue":null,"work_id":"096c6dda-1f31-4b86-8fdc-d7cb063adc10","year":2023},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.081180Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:a96621cc69b1ab1ca3b32918d7f111494b9255e3521c60d7ada34238d54a148e","observation_id":"a8fe8fa5-940d-4194-9c0c-affa3b7d8ae8","resolution":{"observed_at":"2026-08-11T16:45:39.548252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.083672Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.083672Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:c3cf32cb90c9bcc98c557069b1654fa2f79cdb94252bdfd9f3bc98c46a9418b7","observation_id":"5b7afab3-5a82-4bb1-81d1-6e72a14c32a8","resolution":{"observed_at":"2026-08-11T16:45:39.083672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10322","last_updated":"2019-08-27T16:53:59Z","snapshot_observed_at":"2026-08-18T17:24:52.266922Z","submitted_at":"2019-08-27T16:53:59Z","title":"Bridging the Gap for Tokenizer-Free Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10322","snapshot_observed_at":"2026-08-11T16:45:39.086335Z","title":"Bridging the gap for tokenizer-free language models","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.086335Z"},"links":{"cited_paper":"/paper/1908.10322","citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:7ace5ca72a1351bfa673adfe5c202354646bd5edbe21ed6cd3d47b2512cf6ecf","observation_id":"9dc9a6f5-578e-466b-ac02-96b8bbde30ce","resolution":{"observed_at":"2026-08-11T16:45:39.086335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.530769Z","title":"Hierarchical multiscale recurrent neural networks","venue":null,"work_id":"1bb61cd2-a211-4259-b21c-d0e117277698","year":2019},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.089300Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:dc0c4110b9c6ab8db05bca64140a2d6baedbfce61f3f9f7123e255c26c76c735","observation_id":"ce895d6c-f361-463f-bf89-011fb947120d","resolution":{"observed_at":"2026-08-11T16:45:39.533922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.521696Z","title":"Canine: Pre-training an efficient tokenization-free encoder for language representation","venue":null,"work_id":"cd4550c7-7757-4c98-80fd-5882f80ce42d","year":2022},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.091884Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:adab7a5f476f08f0633fbe04291198c40aaf6f01c32de19a2de4aad4d205fa01","observation_id":"4b746304-68f1-4a60-ae44-b8c384b897fe","resolution":{"observed_at":"2026-08-11T16:45:39.525024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.512607Z","title":"Think you have solved question answering? T ry ARC , the AI2 reasoning challenge","venue":null,"work_id":"2afeac4d-4662-46d3-9fb9-a38cee35aecb","year":2018},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.094435Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:7b80ce8375e347ce8eca944ecfcbae0fad1b3d5498a00c1bb5a62fa0ad840cf3","observation_id":"0cdafcf7-2570-430d-b90b-f30140e021a5","resolution":{"observed_at":"2026-08-11T16:45:39.515856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.504359Z","title":"Getting the most out of your tokenizer for pre-training and domain adaptation","venue":null,"work_id":"a7abb7a4-b894-432e-9896-96391d186941","year":2024},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.097106Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:ebec03608b803a268c7f770b71372efe4cf545065635d3928fee281d78b309ce","observation_id":"14bcd589-c480-4199-b336-ab787b060119","resolution":{"observed_at":"2026-08-11T16:45:39.507372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.496137Z","title":"Flash A ttention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":"284d3701-c09f-4e5b-a2da-df9e7d64c384","year":2022},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.099631Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:5564862c1b777455e27c7bc8fb132aa18eb36f3dab0a816a64506f305504b484","observation_id":"b386dd3b-498c-4a71-b9c8-81d30089216d","resolution":{"observed_at":"2026-08-11T16:45:39.499152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.102056Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.102056Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:42f4d45b351516eb8938ce441590d051f7e3b498aadfa696c69c54659a7fea4e","observation_id":"4fe1d1f3-2faa-48e1-a66e-9903e32e0482","resolution":{"observed_at":"2026-08-11T16:45:39.102056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.484189Z","title":"CUTE : Measuring llms' understanding of their tokens","venue":null,"work_id":"2ae54410-5c3a-44c1-ac3c-0529f2fe419f","year":2024},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.104591Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:0e21633eb57643331a1199c9cae80d7ee15f35393f3534317368084265e65035","observation_id":"b8f49ea3-17dc-469a-a24c-c31278ade781","resolution":{"observed_at":"2026-08-11T16:45:39.487022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.477118Z","title":"CharacterBERT : Reconciling elmo and bert for word-level open-vocabulary representations from characters","venue":null,"work_id":"2f62e9f7-45f1-4042-9d48-b581fff87a17","year":2020},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.107175Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:9e12d0c5dd91f9311ff53d097486a0a5d0fe1e5637aa3a8d4cd875a5b12df0bd","observation_id":"b5acf611-f4dc-492a-94e7-45bb832d4937","resolution":{"observed_at":"2026-08-11T16:45:39.479824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.109546Z","title":"A new algorithm for data compression","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.109546Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:9ec33490511a8625d1d5a0bdda3f10470acee684ec131fe1f18cea108b1875bf","observation_id":"87143f23-eccb-4df1-88fb-bde3c2bab50c","resolution":{"observed_at":"2026-08-11T16:45:39.109546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.112003Z","title":"The F lores-101 evaluation benchmark for low-resource and multilingual machine translation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.112003Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:b7ac2e476782a9392675fb88da1c96126944b882ec9fc12f3745479a76aa1bf6","observation_id":"d71886da-cd17-4312-820e-719cd3150153","resolution":{"observed_at":"2026-08-11T16:45:39.112003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.465671Z","title":"Generating sequences with recurrent neural networks","venue":null,"work_id":"cf397e21-72d5-445b-b07c-f4e33767dc7b","year":2013},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.114610Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:c6eebb8025e32f1390f53e872cd670129db6a9ba569eb7fa9ab390db02e230a4","observation_id":"db7ffea0-0c71-4771-85c2-a2db1606698b","resolution":{"observed_at":"2026-08-11T16:45:39.468438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.458883Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":"6cb7c7e6-6b7d-4db3-b572-fbcabf03b936","year":2023},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.117348Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:151cb3b437a5ad0b59a8a30df7bf49ba137d2ac750acf61b08e361eb5e889fb3","observation_id":"5aa62707-6ff5-45ed-9ee7-81a236097e48","resolution":{"observed_at":"2026-08-11T16:45:39.461482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.451650Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":"e8f8e783-0c97-40e4-b021-dd238685cefe","year":2020},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.119792Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:308c81ac2c53f1cc7d20472bb7b4a12ad8c5b61621cfa075b052df973fd000eb","observation_id":"72238b77-86f6-45d8-9856-b16fe44bfff0","resolution":{"observed_at":"2026-08-11T16:45:39.454497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.444038Z","title":"Training compute-optimal large language models","venue":null,"work_id":"6f885f20-6764-47da-a8e0-bda025acfe7f","year":2022},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.122183Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:fe00513701e3fb44e777e84e7c8e99264b245c542f51a4fb4e2ee45f6c411243","observation_id":"380e68d6-1f27-4146-87f7-dfdc9a458a85","resolution":{"observed_at":"2026-08-11T16:45:39.446929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.436932Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":"278b346d-1442-4d8e-bfc6-0b55fb4e265f","year":2021},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.124668Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:0cec63416a2c1a8360d4c71409acc5db61c86271e8b0007c6ddd7ef73da25cce","observation_id":"5f0a86ce-4196-445b-8f88-ee07e797f445","resolution":{"observed_at":"2026-08-11T16:45:39.439623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.429654Z","title":"Neural machine translation in linear time","venue":null,"work_id":"050e7f23-1975-4c27-87e6-4868505ee93f","year":2016},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.127112Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:8d8199a716a4ef204349da70e22fb92468237dbd2edc1dee3d0bc1d8d9adb847","observation_id":"3c809974-f515-4f4d-8744-5d2a407f73f5","resolution":{"observed_at":"2026-08-11T16:45:39.432361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.422372Z","title":"Scaling laws for neural language models","venue":null,"work_id":"3d9ca267-2846-481d-a0ef-4f7fe1f998ed","year":2020},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.129455Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:1551f74624542d440dc255385fa9deba787d00080b2015a30c3bf6e6cc319828","observation_id":"967658ef-d4ac-4249-af3a-a6d12550dd46","resolution":{"observed_at":"2026-08-11T16:45:39.425103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.414768Z","title":"Byte-level machine reading across morphologically varied languages","venue":null,"work_id":"6d15db31-ecce-4da3-ae14-a13622b326a8","year":2018},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.132151Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:f19a9bb790d3ee8b7b502e27b949f0ccc35c5f91b34c0c73a3690b513aadfee2","observation_id":"7e24b8f0-ff74-4360-8cf5-7b865c2555ea","resolution":{"observed_at":"2026-08-11T16:45:39.417857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.407145Z","title":"Character-aware neural language models","venue":null,"work_id":"d8e38e55-918d-4eef-b706-4253c1a344fe","year":2016},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.134608Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:f1461fe441d29c10e9f97a6066f438b98cc2635fc8a1302406a3be4133ce281e","observation_id":"b0f522bc-7e01-4e2f-b88b-5a0b38957714","resolution":{"observed_at":"2026-08-11T16:45:39.410015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.399769Z","title":"Training llms over neurally compressed text","venue":null,"work_id":"0ea76cb1-6a1e-49d5-9582-872f227e6dce","year":2024},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.137715Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:71a64cc811868f126c74a553f3a84e30309019757a1ff2ebe95e83efde05bfd6","observation_id":"730d1e14-8232-447a-bc9a-711598e7c305","resolution":{"observed_at":"2026-08-11T16:45:39.402581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.391901Z","title":"Datacomp-lm: In search of the next generation of training sets for language models","venue":null,"work_id":"29d43721-eeec-42c0-a6e5-5a76c5a425e7","year":2024},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.140167Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:a6505ce5d7e8335b9a7b51489da13582a667e39add0aa32459a8fc76a1fca78a","observation_id":"d2ad2aee-659e-4ee8-939f-55047a6d918b","resolution":{"observed_at":"2026-08-11T16:45:39.395059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.384054Z","title":"Xlm-v: Overcoming the vocabulary bottleneck in multilingual masked language models","venue":null,"work_id":"e6287a67-5bf3-4e44-abe2-e782337cb1dc","year":2023},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.142636Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:172cc13453c3b0c957b762d37b012398d24c13a4e98cfc9b1882d0dd3c8b5dbe","observation_id":"f9ff057d-ea1f-4852-b6a7-90c101f4d4dc","resolution":{"observed_at":"2026-08-11T16:45:39.387107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.376239Z","title":"Myte: Morphology-driven byte encoding for better and fairer multilingual language modeling","venue":null,"work_id":"fda6423e-37c2-497d-8ad4-d3dc3d3521a3","year":2024},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.145173Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:d95b6fe5a020597d9b36eb1f74b2c7b6cad487b3fc2ca7bca73541a39d44dd52","observation_id":"2293348e-1ad8-4bbd-8279-5515acc108ed","resolution":{"observed_at":"2026-08-11T16:45:39.379218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.147564Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.147564Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:175b364ed8de58c5e9271e6ec739d911818efe6b1b23b33e1b6e7a9d746e2be4","observation_id":"7f0076ab-9dc7-4f70-b862-4e8ee5c97ee2","resolution":{"observed_at":"2026-08-11T16:45:39.147564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.363912Z","title":"Subword language modeling with neural networks","venue":null,"work_id":"5f560990-379b-4cbd-a484-7ee798728ebf","year":2012},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.150084Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:c34a6b0600240e1d8fa5060385beed9067b112752a06d7d01ec9e6e3ac49e78b","observation_id":"9fa05016-eeb1-4dca-b62f-f56c836db36c","resolution":{"observed_at":"2026-08-11T16:45:39.367133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.356085Z","title":"Hierarchical transformers are more efficient language models","venue":null,"work_id":"f2097759-1ae4-4164-9684-10202d255289","year":2022},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.152669Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:bbf1595e16182c26a37682e2367c72272f3aa166490f5a2bd69d67a7a678b103","observation_id":"fbb644b8-3b75-4b2a-ab6f-c2cc47dc369a","resolution":{"observed_at":"2026-08-11T16:45:39.359075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.348157Z","title":"Efficient transformers with dynamic token pooling","venue":null,"work_id":"90778f1a-d590-49e3-830e-fe6fc5a03f81","year":2023},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.155111Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:342a0be250414c3cfc76693d2099699cd9dd2c00fd23ceb4b732246a08897b69","observation_id":"4fe4ac8f-66a5-4b9c-93c9-a9984becc668","resolution":{"observed_at":"2026-08-11T16:45:39.351233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.340411Z","title":"Language model tokenizers introduce unfairness between languages","venue":null,"work_id":"09801a3f-9df7-4117-a87d-855df32f482f","year":2024},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.157626Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:24162c1c253925a977bf02881d0715cf0a0f89768c7ce19ab95c8411915cf566","observation_id":"485d1b9b-f9a8-4122-bcfd-8a7eb38910f2","resolution":{"observed_at":"2026-08-11T16:45:39.343278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.160221Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.160221Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:afc3b32b13e5add1b9116e2426a51ceec8924a5b9282c3ca2e77c5edffbc93eb","observation_id":"ca3519ec-3e35-427d-934c-578e910b3fb3","resolution":{"observed_at":"2026-08-11T16:45:39.160221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.328560Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":"bf9adb43-da9a-4d95-ac41-f021ae96a58c","year":2016},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.162593Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:2840c0af90ba1be5e181269b34d98b760a15e3f69bbc3f442ed37a2003a991d8","observation_id":"cbcbaada-7741-4cfa-8d9b-b774b8062ec3","resolution":{"observed_at":"2026-08-11T16:45:39.331347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.321092Z","title":"GLU variants improve transformer","venue":null,"work_id":"5019f31d-f897-4adf-9378-87b7c679e23e","year":2020},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.165075Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:266ef358ea741a4d144862aef598cc94ffe8e0b66c70e43fcacd39df03334226","observation_id":"510b83f9-51a5-4cda-8cda-0c8543e7a90a","resolution":{"observed_at":"2026-08-11T16:45:39.323938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.313408Z","title":"Spacebyte: Towards deleting tokenization from large language modeling","venue":null,"work_id":"43468732-de4e-4a91-bf1a-359cb11c62c2","year":2024},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.167400Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:b345f531e9483f4bd6a605801f0b3641090b81512ad0bffa417c6d08b5b3fb89","observation_id":"e1a77165-4065-4ff2-baaf-771e5db04329","resolution":{"observed_at":"2026-08-11T16:45:39.316186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.306116Z","title":"RoFormer : Enhanced transformer with rotary position embedding","venue":null,"work_id":"2667d20f-2ad5-42a2-8ed2-734d573791ee","year":2021},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.169797Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:47b330ee633cec8de000ee686b1f9aaf51c061349f0bcbe1bff006fc6607d839","observation_id":"17801808-54a4-4813-85f8-185c26876ab7","resolution":{"observed_at":"2026-08-11T16:45:39.308897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.298612Z","title":"Generating text with recurrent neural networks","venue":null,"work_id":"2a6d549a-27c5-479c-942f-1f0e444fb6e3","year":2011},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.172076Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:dabdc1bd6cd241c3e9e1e67f525b2fd92b94122fb198e3b045756772d073e253","observation_id":"caf19b92-2190-4463-b62f-5ade5d799632","resolution":{"observed_at":"2026-08-11T16:45:39.301286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.291158Z","title":"Phonologybench: Evaluating phonological skills of large language models","venue":null,"work_id":"f2b91613-ef71-4b4d-a06b-9352f1cc1e60","year":2024},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.174368Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:8eea5a605e5d8818a73a7078b025b76f2cb64f8adede462140cf6d0457248f59","observation_id":"270c9470-2275-4a8f-b6d5-999758b15a60","resolution":{"observed_at":"2026-08-11T16:45:39.293961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.283074Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":"472a9f06-6798-4177-acf7-4cb67cea5265","year":2023},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.176790Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:8a9be60f9a8e1d3b46b50155ef622bd29701f3974c1a2e66b2cde43e7148ddf2","observation_id":"3ca97346-4abe-4d7b-8636-46d0eecc1035","resolution":{"observed_at":"2026-08-11T16:45:39.286302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.179025Z","title":"Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.179025Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:6faf9c16d934121c42ebcce9e819674b218763d8de644872b0214c4b663bb36a","observation_id":"5a9268c6-dc49-4989-a1ab-829d708d70fc","resolution":{"observed_at":"2026-08-11T16:45:39.179025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.271334Z","title":"Mambabyte: Token-free selective state space model","venue":null,"work_id":"a3c119bc-3b38-48c4-ba68-15537d30bee9","year":2024},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.181129Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:7b7014f0f8f505dc3d4586e22eabde75528e79a4969eaae8a8956cc2fb6613ac","observation_id":"d045f22b-b877-4600-8092-1d1e512f0f5f","resolution":{"observed_at":"2026-08-11T16:45:39.274226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.263410Z","title":"Effective long-context scaling of foundation models","venue":null,"work_id":"0bdcde27-d9b1-474f-a741-4c8c0639db8d","year":2024},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.183492Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:b552642c0e70cb15fc9bee00ccfc7623c0dbdb5f9e6ca44eb23b6c1d5beca884","observation_id":"d0a1bb76-62f3-451a-ab6a-9d47929cc9a8","resolution":{"observed_at":"2026-08-11T16:45:39.266582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.185967Z","title":"Byt5: Towards a token-free future with pre-trained byte-to-byte models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.185967Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:008d22f38ce77408c58617cb0a9462bd43120fa80b2fa8b73f33c22afc2d44f6","observation_id":"5a8c4775-7903-4985-a682-18a2366f5f28","resolution":{"observed_at":"2026-08-11T16:45:39.185967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.251535Z","title":"Megabyte: Predicting million-byte sequences with multiscale transformers","venue":null,"work_id":"2b38efad-8c23-475d-93df-5c3db14c9a75","year":2023},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.188323Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:8bb6121443813ee7fff328bb5b73861e176f40e3d3aff20d99e33c26389aef6c","observation_id":"48951ae3-14b0-4eb1-b4c8-d616b85b24eb","resolution":{"observed_at":"2026-08-11T16:45:39.254543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.242815Z","title":"Hellaswag: Can a machine really finish your sentence? arXiv, 2019","venue":null,"work_id":"b02239f8-9fc7-4379-bafd-aa97d3b4c8f6","year":2019},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.190818Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:73e1857e0fc32b26b8ba3e442e85e604afc1cfc116166b27d41dd5208b48e98e","observation_id":"a695aa24-681d-451a-8939-add0cd7362bf","resolution":{"observed_at":"2026-08-11T16:45:39.246521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.235062Z","title":"Root mean square layer normalization","venue":null,"work_id":"85237f45-d1de-4a0a-ae59-9120cf2ae84d","year":2019},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.193182Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:6c60d15ade289a4ceadb4b877616c24c9b7375d8a7369165904e853264407840","observation_id":"fdbcdc63-6a07-4fc5-8fe5-83cbfe55d578","resolution":{"observed_at":"2026-08-11T16:45:39.237864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:39.224523Z","title":"Character-level convolutional networks for text classification","venue":null,"work_id":"d6e25ff4-7037-438d-a2d5-c2adf1e410a7","year":2015},"citing_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:39.195688Z"},"links":{"citing_paper":"/paper/2412.09871"},"observation_digest":"sha256:c85beabc8cd6691e98384ff4a084d337e01bd3922569a24ae16e8fc1032f6506","observation_id":"7d0a80c5-90c5-4e1b-9c44-a43cfab602d5","resolution":{"observed_at":"2026-08-11T16:45:39.229061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":41},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 44 inbound Pith citation observations for arXiv:2412.09871."}