{"as_of":"2026-08-13T21:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1aea4b7a49f83d239ed211437ff7b332ec180be54aaf3acaeeffffcef99ebb32","coverage":[{"denominator":122,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:34:03.437070Z","state":"measured"},{"denominator":120,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":120,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:13:07.268239Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-08-03T23:33:56.393190Z","title":"Dynamic chunking for end-to-end hierarchical sequence modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:56.393190Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:a2fdea4a7814121094d421a7e7b9eee485b1e6f7fdcc1deb11bbcf9dd56d435e","observation_id":"5e9d73fa-dc57-4337-abf8-ef5c8045dbe2","resolution":{"observed_at":"2026-08-03T23:33:56.393190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2507.07955","doi":"10.48550/arxiv.2507.07955","metadata_source":"pith","pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hwang, B","venue":"cs.LG","work_id":"2c24205d-e043-4482-800c-bb7d2d61ad6c","year":2025},"citing_paper":{"arxiv_id":"2602.20981","last_updated":"2026-04-15T06:35:46Z","snapshot_observed_at":"2026-08-12T20:51:57.046648Z","submitted_at":"2026-02-24T15:01:39Z","title":"Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T19:53:18.200223Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2602.20981"},"observation_digest":"sha256:699db1eb94c1fe0deb150523aa1a07330ea6277ed00acf8fe2881dccbb6b317b","observation_id":"49fcb3f2-d1bc-4798-8921-dc7ac1e05bbf","resolution":{"observed_at":"2026-05-15T19:56:33.512371Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2507.07955","doi":"10.48550/arxiv.2507.07955","metadata_source":"pith","pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hwang, B","venue":"cs.LG","work_id":"2c24205d-e043-4482-800c-bb7d2d61ad6c","year":2025},"citing_paper":{"arxiv_id":"2603.06351","last_updated":"2026-05-07T16:40:07Z","snapshot_observed_at":"2026-08-11T15:47:08.117539Z","submitted_at":"2026-03-06T14:59:11Z","title":"DC-DiT: Adaptive Compute and Elastic Inference for Visual Generation via Dynamic Chunking","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T15:10:00.146694Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2603.06351"},"observation_digest":"sha256:6f6e6005d46669dd2eecf4f2a748a9cbf50ead03b502afc05f7927c795f58389","observation_id":"5899afe0-5110-4023-a469-40044df65f91","resolution":{"observed_at":"2026-05-15T15:10:05.845619Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2507.07955","doi":"10.48550/arxiv.2507.07955","metadata_source":"pith","pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hwang, B","venue":"cs.LG","work_id":"2c24205d-e043-4482-800c-bb7d2d61ad6c","year":2025},"citing_paper":{"arxiv_id":"2604.27263","last_updated":"2026-05-14T11:02:51Z","snapshot_observed_at":"2026-07-06T23:12:47.745700Z","submitted_at":"2026-04-29T23:29:08Z","title":"Decoupling the Benefits of Subword Tokenization for Language Model Training via Byte-level Simulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-07T10:05:24.009460Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2604.27263"},"observation_digest":"sha256:544e5de5eca5bb720ea8777d4e704d457aba01e2e6b97aaa01f5266e216250c4","observation_id":"d9cafcc0-c48c-41db-a64a-994ca215c93f","resolution":{"observed_at":"2026-05-12T09:41:25.784360Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2507.07955","doi":"10.48550/arxiv.2507.07955","metadata_source":"pith","pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hwang, B","venue":"cs.LG","work_id":"2c24205d-e043-4482-800c-bb7d2d61ad6c","year":2025},"citing_paper":{"arxiv_id":"2604.27263","last_updated":"2026-05-14T11:02:51Z","snapshot_observed_at":"2026-07-06T23:12:47.745700Z","submitted_at":"2026-04-29T23:29:08Z","title":"Decoupling the Benefits of Subword Tokenization for Language Model Training via Byte-level Simulation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:22.362262Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2604.27263"},"observation_digest":"sha256:2d5425250e9bcc90b062c583b76c1103e7e9925cbb640c3461c9223b34c0043a","observation_id":"74b88ba2-9ef0-42a5-b689-f285331c22d7","resolution":{"observed_at":"2026-05-15T06:59:49.180626Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2507.07955","doi":"10.48550/arxiv.2507.07955","metadata_source":"pith","pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hwang, B","venue":"cs.LG","work_id":"2c24205d-e043-4482-800c-bb7d2d61ad6c","year":2025},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-08-12T20:56:41.268178Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T14:20:34.452801Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:7335a6c5b979cf559985bd40fbeef32bd85585440d5cbdca54f2178c6f20ace6","observation_id":"f91640eb-0bdd-47e0-9e68-d53a6e209cff","resolution":{"observed_at":"2026-05-11T18:41:11.466350Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2507.07955","doi":"10.48550/arxiv.2507.07955","metadata_source":"pith","pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hwang, B","venue":"cs.LG","work_id":"2c24205d-e043-4482-800c-bb7d2d61ad6c","year":2025},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-08-12T20:56:41.268178Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:1e555d861e32aaff4dace08c0913b642971a397ae5e343f1815a1b177ac4d084","observation_id":"68a00469-4c6f-486a-9f23-033449813713","resolution":{"observed_at":"2026-05-13T06:02:21.965287Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2507.07955","doi":"10.48550/arxiv.2507.07955","metadata_source":"pith","pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hwang, B","venue":"cs.LG","work_id":"2c24205d-e043-4482-800c-bb7d2d61ad6c","year":2025},"citing_paper":{"arxiv_id":"2605.06546","last_updated":"2026-05-19T10:02:00Z","snapshot_observed_at":"2026-08-12T06:16:30.429696Z","submitted_at":"2026-05-07T16:41:37Z","title":"Efficient Pre-Training with Token Superposition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T10:09:56.187089Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2605.06546"},"observation_digest":"sha256:9d79cf1c374ed910036f40d74f5951e98386da12a852d7693fe6d802f1eec89d","observation_id":"b29f30cb-3a3b-4380-b678-75054d02b7b5","resolution":{"observed_at":"2026-05-11T20:11:09.496813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2507.07955","doi":"10.48550/arxiv.2507.07955","metadata_source":"pith","pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hwang, B","venue":"cs.LG","work_id":"2c24205d-e043-4482-800c-bb7d2d61ad6c","year":2025},"citing_paper":{"arxiv_id":"2605.06546","last_updated":"2026-05-19T10:02:00Z","snapshot_observed_at":"2026-08-12T06:16:30.429696Z","submitted_at":"2026-05-07T16:41:37Z","title":"Efficient Pre-Training with Token Superposition","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T22:54:12.913665Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2605.06546"},"observation_digest":"sha256:fe142bdf35758c32d572570e3dc3c7c0723d9e93b6888cebd7e29e73196653d4","observation_id":"87283113-8577-4712-aabd-af393c309a18","resolution":{"observed_at":"2026-05-20T22:59:11.977886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2507.07955","doi":"10.48550/arxiv.2507.07955","metadata_source":"pith","pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hwang, B","venue":"cs.LG","work_id":"2c24205d-e043-4482-800c-bb7d2d61ad6c","year":2025},"citing_paper":{"arxiv_id":"2605.09630","last_updated":"2026-05-10T16:18:22Z","snapshot_observed_at":"2026-07-31T18:27:32.630942Z","submitted_at":"2026-05-10T16:18:22Z","title":"Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-12T04:05:28.713898Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2605.09630"},"observation_digest":"sha256:d3c6c0a129bc4ed6d30e7c034f7e3cf6dc5731c1295d608acb2ee946237f7817","observation_id":"c9d4a8af-d64c-413b-9b18-497755608a41","resolution":{"observed_at":"2026-05-12T06:36:28.977825Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2507.07955","doi":"10.48550/arxiv.2507.07955","metadata_source":"pith","pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hwang, B","venue":"cs.LG","work_id":"2c24205d-e043-4482-800c-bb7d2d61ad6c","year":2025},"citing_paper":{"arxiv_id":"2605.12928","last_updated":"2026-05-13T03:03:30Z","snapshot_observed_at":"2026-08-11T09:41:54.259420Z","submitted_at":"2026-05-13T03:03:30Z","title":"The Efficiency Gap in Byte Modeling","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-14T19:43:57.229794Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2605.12928"},"observation_digest":"sha256:7aa56f8dd867b1ece6c536b60825cba70737ccf74054b3cccdfb2c4be9c50d65","observation_id":"5bc22454-e234-4525-85da-dc34b3bb6d6e","resolution":{"observed_at":"2026-05-14T19:47:53.733960Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2507.07955","doi":"10.48550/arxiv.2507.07955","metadata_source":"pith","pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hwang, B","venue":"cs.LG","work_id":"2c24205d-e043-4482-800c-bb7d2d61ad6c","year":2025},"citing_paper":{"arxiv_id":"2606.04552","last_updated":"2026-08-04T19:23:40Z","snapshot_observed_at":"2026-08-09T18:20:54.257903Z","submitted_at":"2026-06-03T07:38:17Z","title":"LDARNet: DNA Adaptive Representation Network with Learnable Tokenization for Genomic Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T06:17:32.321128Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2606.04552"},"observation_digest":"sha256:ddb0710efc160a0264e7b24ab2e0681ba3ff28d077248e339ca90d732bb724e2","observation_id":"3ee531fb-19cc-4ae6-b67a-0ee47e57543a","resolution":{"observed_at":"2026-07-02T08:16:47.443536Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2507.07955","doi":"10.48550/arxiv.2507.07955","metadata_source":"pith","pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hwang, B","venue":"cs.LG","work_id":"2c24205d-e043-4482-800c-bb7d2d61ad6c","year":2025},"citing_paper":{"arxiv_id":"2606.08204","last_updated":"2026-06-06T14:43:30Z","snapshot_observed_at":"2026-08-09T15:47:58.133300Z","submitted_at":"2026-06-06T14:43:30Z","title":"Neural Field Tokenizations with Hierarchy and Spatial Locality Priors","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T20:16:26.467398Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2606.08204"},"observation_digest":"sha256:39a1b31f151602ec031478b10928bdbfb079c756ae77c91431627313eeb28844","observation_id":"c7f77a73-d715-4759-b19d-fbc14e568886","resolution":{"observed_at":"2026-07-02T20:47:22.508154Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2507.07955","doi":"10.48550/arxiv.2507.07955","metadata_source":"pith","pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hwang, B","venue":"cs.LG","work_id":"2c24205d-e043-4482-800c-bb7d2d61ad6c","year":2025},"citing_paper":{"arxiv_id":"2606.27320","last_updated":"2026-06-25T17:33:09Z","snapshot_observed_at":"2026-08-03T01:51:36.685656Z","submitted_at":"2026-06-25T17:33:09Z","title":"Elastic Time: Dynamic Frame Rate Bottlenecks for Neural Audio Coding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T02:08:02.803410Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2606.27320"},"observation_digest":"sha256:f67b85c5802fc7a3fc966717306a70b195951861e777e8915b6f08055a951ebd","observation_id":"08a2fec7-5dfb-4c9e-a825-5daf0b3c6d3e","resolution":{"observed_at":"2026-07-04T14:59:54.991327Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2507.07955","doi":"10.48550/arxiv.2507.07955","metadata_source":"pith","pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hwang, B","venue":"cs.LG","work_id":"2c24205d-e043-4482-800c-bb7d2d61ad6c","year":2025},"citing_paper":{"arxiv_id":"2606.28057","last_updated":"2026-06-26T13:03:29Z","snapshot_observed_at":"2026-08-13T10:06:24.387011Z","submitted_at":"2026-06-26T13:03:29Z","title":"MultiHashFormer: Hash-based Generative Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-29T04:13:05.082903Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2606.28057"},"observation_digest":"sha256:0c375aa0af2d67e3681f543777dd2df84dadd621fae98d2457b5364c6fb9f0e6","observation_id":"6494aeb3-e400-411d-b703-6b0bf216e61e","resolution":{"observed_at":"2026-06-29T04:23:05.527666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2507.07955","doi":"10.48550/arxiv.2507.07955","metadata_source":"pith","pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hwang, B","venue":"cs.LG","work_id":"2c24205d-e043-4482-800c-bb7d2d61ad6c","year":2025},"citing_paper":{"arxiv_id":"2607.02087","last_updated":"2026-07-10T20:58:05Z","snapshot_observed_at":"2026-08-13T13:40:51.349383Z","submitted_at":"2026-07-02T12:27:54Z","title":"SUNTA: Hierarchical Video Prediction with Surprise-based Chunking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-03T13:20:21.237349Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2607.02087"},"observation_digest":"sha256:d414ad36dfe808d84369cf943716a1d4beb655e9b7373f9834c5713eeb0c87db","observation_id":"a535243d-3c9b-471b-9c68-70963dd010cd","resolution":{"observed_at":"2026-07-03T13:28:18.363810Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-07-14T16:42:04.979573Z","title":"Dynamic chunking for end-to-end hierarchical sequence modeling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02087","last_updated":"2026-07-10T20:58:05Z","snapshot_observed_at":"2026-08-13T13:40:51.349383Z","submitted_at":"2026-07-02T12:27:54Z","title":"SUNTA: Hierarchical Video Prediction with Surprise-based Chunking","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T16:42:04.979573Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2607.02087"},"observation_digest":"sha256:6f04d2708355e6e160e80fe0807d6d8db0b19dbd99be391023a6ff04aef323cc","observation_id":"e3f2a25c-dfcc-4bc8-ade2-d8fda8275414","resolution":{"observed_at":"2026-07-14T16:42:04.979573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2507.07955","doi":"10.48550/arxiv.2507.07955","metadata_source":"pith","pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hwang, B","venue":"cs.LG","work_id":"2c24205d-e043-4482-800c-bb7d2d61ad6c","year":2025},"citing_paper":{"arxiv_id":"2607.05691","last_updated":"2026-07-06T23:16:51Z","snapshot_observed_at":"2026-08-07T16:26:53.142666Z","submitted_at":"2026-07-06T23:16:51Z","title":"Where to cut, how deep: BPE and Unigram-LM on chemistry SMILES","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T03:42:21.307552Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2607.05691"},"observation_digest":"sha256:f16b5ee5eba28e3a0a1cb1469cf8a66e0e387bd85b257c97bfd2d2c4e23fc886","observation_id":"d5766850-77ea-4625-ae20-1d4e9ab4e451","resolution":{"observed_at":"2026-07-11T03:47:48.606361Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-08-05T16:21:01.254302Z","title":"arXiv preprint arXiv:2507.07955 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03599","last_updated":"2026-08-04T12:51:21Z","snapshot_observed_at":"2026-08-13T14:50:09.701524Z","submitted_at":"2026-08-04T12:51:21Z","title":"Disentangling Language Modeling and Boundaries","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T16:21:01.254302Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2608.03599"},"observation_digest":"sha256:114a08735f963af49623e279fbb8093c5bcfe9151f2496d57e6d9ad7998121d6","observation_id":"9cebbb5d-a838-4eec-99b5-915c34068861","resolution":{"observed_at":"2026-08-05T16:21:01.254302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-08-07T23:13:07.268239Z","title":"arXiv preprint arXiv:2507.07955 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05806","last_updated":"2026-08-06T09:41:41Z","snapshot_observed_at":"2026-08-12T16:07:23.111396Z","submitted_at":"2026-08-06T09:41:41Z","title":"Hierarchical Latent Prediction for Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T23:13:07.268239Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2608.05806"},"observation_digest":"sha256:982ec5b785e6b4f5e6802d8c04136c684365f3c0ae09a635ceaf54227cfa136a","observation_id":"18d42a9c-0e4c-44fd-aade-a9a5d2649be3","resolution":{"observed_at":"2026-08-07T23:13:07.268239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07955/citation-record","integrity":"/paper/2507.07955/integrity","json":"/paper/2507.07955/citation-record.json","paper":"/paper/2507.07955"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:56.069034Z","title":"MAGNET: Improving the Multilingual Fairness of Language Models with Adaptive Gradient-based Tokenization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:56.069034Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:31839752117c30e617999de6415c8d9dc80833d0ff9ca28177d8f5d932e51e65","observation_id":"707c6725-6344-4713-88e3-d4590d560da8","resolution":{"observed_at":"2026-08-06T18:33:56.069034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13707","last_updated":"2023-05-23T05:46:45Z","snapshot_observed_at":"2026-08-13T11:35:56.858678Z","submitted_at":"2023-05-23T05:46:45Z","title":"Do All Languages Cost the Same? Tokenization in the Era of Commercial Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13707","snapshot_observed_at":"2026-08-06T18:33:56.148760Z","title":"Do All Languages Cost the Same? Tokenization in the Era of Commercial Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:56.148760Z"},"links":{"cited_paper":"/paper/2305.13707","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:3f74b796277555618a6f5094ab4e0e27a64d7089eb5797ef1eb44d4d41d83461","observation_id":"3e20b3f1-0a96-4e46-8f30-ce8d7e970e50","resolution":{"observed_at":"2026-08-06T18:33:56.148760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.02173","last_updated":"2018-02-24T19:44:38Z","snapshot_observed_at":"2026-07-06T06:08:03.192267Z","submitted_at":"2017-11-06T20:59:58Z","title":"Synthetic and Natural Noise Both Break Neural Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.02173","snapshot_observed_at":"2026-08-06T18:33:56.248506Z","title":"Synthetic and Natural Noise Both Break Neural Machine Translation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:56.248506Z"},"links":{"cited_paper":"/paper/1711.02173","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:13a120265fe166ddab78ad1bd0a03aa6f6ac13bdcc3c95a00e8b9680efb5c7af","observation_id":"83b2d33c-3b63-42fe-9b3f-c4a116342364","resolution":{"observed_at":"2026-08-06T18:33:56.248506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-06T18:33:56.352694Z","title":"Longformer: The Long-document Transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:56.352694Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:0d117789a4bebafcd92508a25c125e8c356f54da252778b806a74394ff4e3c1e","observation_id":"ee3be644-deda-44dc-8e17-65dcf5c6c251","resolution":{"observed_at":"2026-08-06T18:33:56.352694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-08-11T05:54:56.124984Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-06T18:33:56.442435Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:56.442435Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:a6f4e80a00b6c7cc6d7687f49f6370a17fb6c359b027d79d3b928bacc4dff6cf","observation_id":"8c9a3f8a-0b8a-4fd1-bed3-0a3df2f9a4f8","resolution":{"observed_at":"2026-08-06T18:33:56.442435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:56.525717Z","title":"Transformers to SSMs: Distilling Quadratic Knowledge to Subquadratic Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:56.525717Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:6deb491320d569827f3fab8bdc9d712f675f4bb0d8015738af1041e9c0902693","observation_id":"29ee2793-2146-42c7-8333-d75017ec83d6","resolution":{"observed_at":"2026-08-06T18:33:56.525717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:56.613945Z","title":"PIQA: Reasoning About Physical Commonsense in Natural Language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:56.613945Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:eabfcea327d23e005faf8d104bee3bbb21bf7fd94beb86fd377c4961d0f3c59f","observation_id":"4a07803f-87d8-4344-8d5c-6ceabafe270b","resolution":{"observed_at":"2026-08-06T18:33:56.613945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-08-13T04:00:22.647615Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-06T18:33:56.720718Z","title":"Token Merging: Your VIT but Faster","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:56.720718Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:3783b88a64bea96d9cc935ff30b22b87dff47e01a2edb31929da2ec1542077a6","observation_id":"9f5dad53-8214-4c22-a289-ce1b4d2fc3c4","resolution":{"observed_at":"2026-08-06T18:33:56.720718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:56.808022Z","title":"Genome Modeling and Design Across All Domains of Life with Evo 2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:56.808022Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:3bc846a63bce4df01c86760d606a5f2471be5ea47fb4be4143b109e2d20b7383","observation_id":"91320439-9707-4f71-be92-1901582af275","resolution":{"observed_at":"2026-08-06T18:33:56.808022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:56.914512Z","title":"Language Models are Few-shot Learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:56.914512Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:991c2439eb31cf9d5be48cdb505e1cf3092f8f665c107654b8523194b7b3fe64","observation_id":"62a9fd53-1ee1-4d8d-b662-86d5d30220fd","resolution":{"observed_at":"2026-08-06T18:33:56.914512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:56.994395Z","title":"Dilated Recurrent Neural Networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:56.994395Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:bd99c4ca27fd0dd63f9fec0470315b60171a910ff4473cbc487dd347ef857fb2","observation_id":"10be0abd-e827-478e-ac21-caf4354396cb","resolution":{"observed_at":"2026-08-06T18:33:56.994395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-08-10T21:52:49.568983Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-06T18:33:57.127775Z","title":"Accel- erating Large Language Model Decoding with Speculative Sampling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:57.127775Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:86eb1bcc94eaa42ddaea84f51771dd2bf8bb2c154c845c21d0fd7be5fe9205fa","observation_id":"282b3504-9a1e-4928-9058-9427d4ae8d14","resolution":{"observed_at":"2026-08-06T18:33:57.127775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:57.218342Z","title":"Don’t Look Twice: Faster Video Transformers with Run-Length Tokenization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:57.218342Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:06e74af00bf14dd0c7f90e358714b6c57ae76a258e74fad6b400c5ab0b7ff0a4","observation_id":"b1a07763-f22a-4f5d-aa5e-4e82af5491f4","resolution":{"observed_at":"2026-08-06T18:33:57.218342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:57.303728Z","title":"Canine: Pre-training an Efficient Tokenization-free Encoder for Language Representation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:57.303728Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:7f3d8c2729bc58d5ffc6d1dec8615b03ce7ab9a42d927361481458530ef609d3","observation_id":"5e366462-5017-42b0-b9ff-777f9c496e53","resolution":{"observed_at":"2026-08-06T18:33:57.303728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-06T18:33:57.397934Z","title":"Think You Have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:57.397934Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:15787813b4113bb504dbab67125d71799cab0a4fa64e73e9198c8e2ab919090c","observation_id":"07068e03-605d-48bc-b35d-8f060569a3ba","resolution":{"observed_at":"2026-08-06T18:33:57.397934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:57.534134Z","title":"Funnel-Transformer: Filtering out Sequential Redundancy for Efficient Language Processing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:57.534134Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:e9b3f69242cfef57cecf170a0cb78c13a43e417aca93b23779db173bb3fe611a","observation_id":"b4c391f2-d1ac-4dd1-a7ba-8cbbc495801a","resolution":{"observed_at":"2026-08-06T18:33:57.534134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:57.636340Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:57.636340Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:51495f0a67172f8dfdd69d4ecb3dbb9d8d43f3b02b657174d30cf1dcfabc5552","observation_id":"a9e79734-0578-4005-b9a0-d47518933e11","resolution":{"observed_at":"2026-08-06T18:33:57.636340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:57.737504Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:57.737504Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:8875b46d6a95f69d6bbdd0cda53d90480cde16f6aded4d34a65473979f5cd554","observation_id":"fc08cb45-3213-4cd7-a104-462c7aef6871","resolution":{"observed_at":"2026-08-06T18:33:57.737504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T18:33:57.827233Z","title":"DeepSeek-V3 Technical Report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:57.827233Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:5cce091f84c3ad100552eaf2610dd4123957c8f2eee75259e1320e0182620b88","observation_id":"96f036bf-24f4-4210-a8d5-f664d3d6c88d","resolution":{"observed_at":"2026-08-06T18:33:57.827233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06089","last_updated":"2021-03-10T14:42:31Z","snapshot_observed_at":"2026-08-07T00:20:05.002017Z","submitted_at":"2021-03-10T14:42:31Z","title":"Variable-rate discrete representation learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06089","snapshot_observed_at":"2026-08-06T18:33:57.894052Z","title":"Variable-rate Discrete Representation Learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:57.894052Z"},"links":{"cited_paper":"/paper/2103.06089","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:edfb417226ac889667cbda4ba027e178eb7081acc6b4c04cf06f2a8f72c86978","observation_id":"32a4080e-4585-41fb-8b0f-a248afbc0ea4","resolution":{"observed_at":"2026-08-06T18:33:57.894052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:57.985194Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:57.985194Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:8a630c778021fe217dd1eaf852f018bd614d43abe73c622809c6629f9479b764","observation_id":"2323c7ec-a7b3-44bc-ba15-3df2fdafb985","resolution":{"observed_at":"2026-08-06T18:33:57.985194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:58.123541Z","title":"Adaptive Length Image Tokenization via Recurrent Allocation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:58.123541Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:e121b6e42edbc9952dc3140763c17e1b050eb9b977a67a5df7e696d7a96dbf28","observation_id":"61996061-ffb8-4299-8d57-7848f7353990","resolution":{"observed_at":"2026-08-06T18:33:58.123541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14553","last_updated":"2025-02-20T13:31:50Z","snapshot_observed_at":"2026-08-07T18:02:01.109370Z","submitted_at":"2025-02-20T13:31:50Z","title":"Multiscale Byte Language Models -- A Hierarchical Architecture for Causal Million-Length Sequence Modeling","version":1},"cited_work":{"arxiv_id":"2502.14553","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.14553","snapshot_observed_at":"2026-08-06T18:34:04.257306Z","title":"Multiscale Byte Language Models -- A Hierarchical Architecture for Causal Million-Length Sequence Modeling","venue":"cs.CL","work_id":"bbb6ddb4-dc50-4218-83b5-6e732a4e5117","year":2025},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:58.172677Z"},"links":{"cited_paper":"/paper/2502.14553","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:3c34d2cb7fda6e815cf956053db5fa9b014714e926871ef6fef08f120fabada5","observation_id":"94f5b8d8-af5e-4a8e-b024-65de585eac53","resolution":{"observed_at":"2026-08-06T18:34:04.262427Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:58.236902Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:58.236902Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:0f99cfd3302535fbb180b926fca38fc9018b1b886b38d43391fb16af8584d063","observation_id":"ea5bf5b5-3296-4184-9632-fcfcc6774d32","resolution":{"observed_at":"2026-08-06T18:33:58.236902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08620","last_updated":"2023-11-15T00:57:51Z","snapshot_observed_at":"2026-08-13T16:54:57.871265Z","submitted_at":"2023-11-15T00:57:51Z","title":"Toucan: Token-Aware Character Level Language Modeling","version":1},"cited_work":{"arxiv_id":"2311.08620","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.08620","snapshot_observed_at":"2026-08-06T18:34:04.235625Z","title":"Toucan: Token-Aware Character Level Language Modeling","venue":"cs.CL","work_id":"f119c1a6-acce-4e53-b2bc-a381844ce6bb","year":2023},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:58.300524Z"},"links":{"cited_paper":"/paper/2311.08620","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:b3cc591cbd23c2718e494c2d27793b955f697fd758eba90d2f1be35fb244af09","observation_id":"a25322da-6241-4cb6-b0f2-63623ecbf488","resolution":{"observed_at":"2026-08-06T18:34:04.245652Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-06T18:33:58.364801Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:58.364801Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:988c10976126ac8cf701399ceac49bb44b77d92222397d23d07b8908ac319850","observation_id":"c82d2767-fc89-4f09-b1de-4ed0d8fe790b","resolution":{"observed_at":"2026-08-06T18:33:58.364801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:58.424785Z","title":"The Language Model Evaluation Harness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:58.424785Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:46c80605efc2ea4250700dcbdc4d9c8f3d7fd00e49fdd40c02eeda083327306b","observation_id":"0faeb429-e058-479d-a7ce-28195b37d55b","resolution":{"observed_at":"2026-08-06T18:33:58.424785Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05171","last_updated":"2025-02-17T17:14:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-07T18:55:02Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05171","snapshot_observed_at":"2026-08-06T18:33:58.488903Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:58.488903Z"},"links":{"cited_paper":"/paper/2502.05171","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:bfab96beaed350e41981548de99f1f93d5c0211ad28c14c9498b8d5cdf44267e","observation_id":"5082abf8-d89d-47e2-b239-b481bf1ab8d7","resolution":{"observed_at":"2026-08-06T18:33:58.488903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:58.548362Z","title":"MANTa: Efficient Gradient- Based Tokenization for End-to-End Robust Language Modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:58.548362Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:91e32767d75e0836375ae182be076d98f0ae1ad15969af1b268e3622942d7e84","observation_id":"f140f5c2-9b26-41a2-bf7f-785c1919e8c1","resolution":{"observed_at":"2026-08-06T18:33:58.548362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:58.621929Z","title":"It’s Raw! Audio Generation with State-Space Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:58.621929Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:757fa7404f57be83a1202da55e327440fa7b259d7a5fd8df1ec2264f20e09749","observation_id":"7763644f-8401-4baa-9ce9-c55bae0be62f","resolution":{"observed_at":"2026-08-06T18:33:58.621929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T18:33:58.673703Z","title":"The Llama 3 Herd of Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:58.673703Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:8b1ba5947e31b00c9789e99504c2e07859959e4918f1c848b147fcea3a7da131","observation_id":"0606f69a-7175-4e76-bd43-dd12fa31f9a1","resolution":{"observed_at":"2026-08-06T18:33:58.673703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:58.728086Z","title":"Modeling Sequences with Structured State Spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:58.728086Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:db04a64a84ef97a991e9ffe799d88724a7ac2392143bd1afb9d2f1b3ff60211a","observation_id":"0ce72938-074e-4ff1-820d-bd3bb097ed78","resolution":{"observed_at":"2026-08-06T18:33:58.728086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:58.798006Z","title":"On the Tradeoffs of State Space Models and Transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:58.798006Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:8a4d8eec5926f3a69b6c71e6248671495682cb11dcac615872c300ca7dfab43e","observation_id":"0ec14e83-de2b-4cbf-b2a9-dcc3c6e462c0","resolution":{"observed_at":"2026-08-06T18:33:58.798006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:58.861404Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:58.861404Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:a2907e90dd57657708a6f58b538b124c7622a8f0e13cb7fba64d745c7ae2f6be","observation_id":"188bd421-de77-49cb-a2dd-8756d656af64","resolution":{"observed_at":"2026-08-06T18:33:58.861404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:58.932243Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:58.932243Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:56b05f35ede19b8b1dff18a6480f15f081af6b41d0a6b39cc80e43f652e3d86c","observation_id":"8df56b5b-a90b-4f88-80de-826f28f202f6","resolution":{"observed_at":"2026-08-06T18:33:58.932243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:58.990431Z","title":"Log-Linear Attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:58.990431Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:33d3e349359a477cca6c854edf67f40aca389bc1fa06890bd5f1f7d6736cf049","observation_id":"2f9a1be9-6480-480d-8309-247c76078400","resolution":{"observed_at":"2026-08-06T18:33:58.990431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:59.055589Z","title":"Scaling Laws and Compute- optimal Training Beyond Fixed Training Durations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:59.055589Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:82f99842ff6bf123e7d134e2440b09c646b247fdfee1633956762c1dd6716af9","observation_id":"ddd4fb3f-4a89-4fae-956f-eeeac7e86d39","resolution":{"observed_at":"2026-08-06T18:33:59.055589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-06T18:33:59.115960Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:59.115960Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:47b14d9e7f2d6034f4af32a66deeb36ce330204f75b6e227d19d0be7d3f69588","observation_id":"8963a931-1215-4de5-9499-bdee0ba23b2d","resolution":{"observed_at":"2026-08-06T18:33:59.115960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:59.173351Z","title":"Data Mixture Inference Attack: BPE Tokenizers Reveal Training Data Compositions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:59.173351Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:a266f5d9f98b8d0c6ea302a6728c464b8a48b9bf04188b8af87f916001aece73","observation_id":"a0548bdf-0c17-4358-b78e-ec8c7f03db0d","resolution":{"observed_at":"2026-08-06T18:33:59.173351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:59.235396Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:59.235396Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:d852b562a591252353820641cd7c1350f1c7bdf60b11df502181023bd22c1132","observation_id":"af1a5679-b455-403d-8306-0ecfe6177f9b","resolution":{"observed_at":"2026-08-06T18:33:59.235396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:59.302514Z","title":"Block Transformer: Global-to-local Language Modeling for Fast Inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:59.302514Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:375a0c260c0f446947e4598d31b2dbe614106818139b5c29eff04c53c1391060","observation_id":"689483e8-c140-4d2c-9561-d2bbf72a6762","resolution":{"observed_at":"2026-08-06T18:33:59.302514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T18:33:59.356222Z","title":"Training Compute-Optimal Large Language Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:59.356222Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:311e084b7a14d3de885c4f70726ea4b03285bed7cc2bb1b4fe8ac98ff0589635","observation_id":"c978949e-743f-4cc7-b2e8-aa75ebae865b","resolution":{"observed_at":"2026-08-06T18:33:59.356222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-06T18:33:59.393544Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:59.393544Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:123afb46d451274bca75b515eba5abd99a0212a82e58eaec75577d5569a61acc","observation_id":"7460326c-062d-4d2b-a595-69d4ed9a738f","resolution":{"observed_at":"2026-08-06T18:33:59.393544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:59.396344Z","title":"Over-Tokenized Transformer: Vocabulary is Generally Worth Scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:59.396344Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:c171262068002967cd58c4160d96019bfcb76273e4263dc8c34c88b3edd3ec1c","observation_id":"a8406be4-22ff-4571-8b0c-3f0854251f13","resolution":{"observed_at":"2026-08-06T18:33:59.396344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-13T00:54:55.069129Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-06T18:33:59.479358Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:59.479358Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:ed99e530ca84b6224fffe7f2ed86e86604eb6ec9c5c846f573192d63be4cde5c","observation_id":"0636fc25-2837-42bf-a493-1f01ffbe242e","resolution":{"observed_at":"2026-08-06T18:33:59.479358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:59.687663Z","title":"Categorical Reparameterization with Gumbel-Softmax","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:59.687663Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:37c4c968a62df6e52496700ca7c360d27fb49e5c4792caed152663f66cd919ec","observation_id":"e67d51d6-6a55-4f15-beaf-ec31daf93ffa","resolution":{"observed_at":"2026-08-06T18:33:59.687663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-13T04:28:50.810145Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-06T18:33:59.785532Z","title":"Repeat After Me: Transformers are Better Than State Space Models at Copying","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:59.785532Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:8a323fe42610579838c769e88fde6a3cd0f87b4bcdeae425acbdc38927d9c8b8","observation_id":"9ae3ec0a-4294-471e-999e-c31d90f76e51","resolution":{"observed_at":"2026-08-06T18:33:59.785532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:59.863542Z","title":"MrT5: Dynamic Token Merging for Efficient Byte-level Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:59.863542Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:07c8c427e64e417bd0886505f82985176f7863b71fb3fe3812efef7773572e74","observation_id":"3e4d0250-d042-4740-8e03-eb9141ae8a79","resolution":{"observed_at":"2026-08-06T18:33:59.863542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T18:33:59.969329Z","title":"Scaling Laws for Neural Language Models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:59.969329Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:f6c898a8bdb5a8e3b08a6e79f9cbf3c8679071c249966013bd498c474d8c5ade","observation_id":"0252c6dd-9a34-4253-9fb0-714c328c4f5c","resolution":{"observed_at":"2026-08-06T18:33:59.969329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:00.109902Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:00.109902Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:5f010f5bbeb0cbda43a93609d3b8d235b989eee2b5e247aeaad963a1134b48bf","observation_id":"b06434ab-1537-4761-99d6-68d3506d46d9","resolution":{"observed_at":"2026-08-06T18:34:00.109902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:00.241224Z","title":"A Clockwork RNN","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:00.241224Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:ba408c4583d30a6e19f1c55d1ad316b0d928e7124af556ecd01a2db7bea23fa2","observation_id":"6a014035-051b-41b5-8344-2d2a486c2418","resolution":{"observed_at":"2026-08-06T18:34:00.241224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:00.364696Z","title":"ImageNet Classification with Deep Convolutional Neural Networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:00.364696Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:01e3a53a49b6c076c773f47b9afc767274d3f5568149dd58b427e92607baabbe","observation_id":"95a86f15-3415-42d8-b11e-41ac065cbe99","resolution":{"observed_at":"2026-08-06T18:34:00.364696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06226","last_updated":"2018-08-19T16:49:06Z","snapshot_observed_at":"2026-07-06T06:56:20.935388Z","submitted_at":"2018-08-19T16:49:06Z","title":"SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06226","snapshot_observed_at":"2026-08-06T18:34:00.445000Z","title":"SentencePiece: A Simple and Language Independent Subword Tokenizer and Detokenizer for Neural Text Processing","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:00.445000Z"},"links":{"cited_paper":"/paper/1808.06226","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:4bf7c92bcd679224aa2560d0e7d1102fc34b7426a0f8ad8cfc0045035d543e59","observation_id":"c5633181-3908-4854-89f8-6903dc78fcf3","resolution":{"observed_at":"2026-08-06T18:34:00.445000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:00.556734Z","title":"From Digits to Decisions: How Tokenization Impacts Arithmetic in LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:00.556734Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:ec55deb506dfdb2ebd7cc4778e1705bbaab062a968d4348d8874cd8740b120e4","observation_id":"b02f13da-1d69-48e2-9c80-fad83ca2bf58","resolution":{"observed_at":"2026-08-06T18:34:00.556734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:00.642539Z","title":"Fast Inference from Transformers via Speculative Decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:00.642539Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:1de89f75fb2cfe87f63ba2f86ab4d06381a445a0de1959e6162003652ab92710","observation_id":"46071184-7723-4fa7-a1e1-3f997333a229","resolution":{"observed_at":"2026-08-06T18:34:00.642539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:00.784649Z","title":"Autoregressive Adversarial Post-Training for Real-Time Interactive Video Generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:00.784649Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:cdc4c9778bfb1c904c9efc9b96682ff285aa796623bf72849982daa544e75419","observation_id":"8f89d9cd-c5b7-40e6-9f7b-eb1c7eaa2ea3","resolution":{"observed_at":"2026-08-06T18:34:00.784649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13423","last_updated":"2025-08-26T18:43:00Z","snapshot_observed_at":"2026-08-09T19:39:35.500768Z","submitted_at":"2025-03-17T17:53:23Z","title":"SuperBPE: Space Travel for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13423","snapshot_observed_at":"2026-08-06T18:34:00.904383Z","title":"SuperBPE: Space Travel for Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:00.904383Z"},"links":{"cited_paper":"/paper/2503.13423","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:152c9e3d7aceb5aad413c48ae4709e4eeb27d558f870a676c9be4561a78446b6","observation_id":"f6782354-3162-4084-9c49-07ccb092254b","resolution":{"observed_at":"2026-08-06T18:34:00.904383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T18:34:01.032619Z","title":"Decoupled Weight Decay Regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:01.032619Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:9aa9f9d7dbba30c2aca81942e8df643802104c969365d5733ec7eb33657136bc","observation_id":"4ca83b9d-1575-44fa-b969-bdc14e7c3d1b","resolution":{"observed_at":"2026-08-06T18:34:01.032619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:01.146905Z","title":"Structured State Space Models for In-context Reinforcement Learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:01.146905Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:be3a06584849d82df04daffc9e83929e9c63c75169452197cb8ee1af4a0c3979","observation_id":"ae1f0fd3-d508-45fb-8464-7b7d473f9181","resolution":{"observed_at":"2026-08-06T18:34:01.146905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:01.267229Z","title":"The Concrete Distribution: A Continuous Relaxation of Discrete Random Variables","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:01.267229Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:e0a0f349963364629087cbb71fa41b6328ba70ed3deb0ab5e477d8bd9be65465","observation_id":"d23eada1-fdfc-43b6-b8f3-62a7c240d035","resolution":{"observed_at":"2026-08-06T18:34:01.267229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:01.377193Z","title":"On the SDEs and Scaling Rules for Adaptive Gradient Algorithms","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:01.377193Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:5232e0401b7113567e9d48d23704c659d33d7b488247ab89c78c5c90de07fe97","observation_id":"645de534-b3c9-4001-b3fa-cb076b81198b","resolution":{"observed_at":"2026-08-06T18:34:01.377193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:01.502212Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:01.502212Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:5e51133e89b02e06203a8fab21f1158eb762241b6658a14023e01da150432609","observation_id":"d52883c0-8ab6-4f41-aaa8-c4568d021b0c","resolution":{"observed_at":"2026-08-06T18:34:01.502212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:01.552977Z","title":"Critical Batch Size Revisited: A Simple Empirical Approach to Large-Batch Language Model Training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:01.552977Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:5bd90bcb7028b7acadf253805c5d87ec719df3f9773c41499ad5192ff0fc5375","observation_id":"e06543a6-941d-4c2a-abdd-ab33c25f39ce","resolution":{"observed_at":"2026-08-06T18:34:01.552977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-13T17:52:06.366703Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-06T18:34:01.648462Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:01.648462Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:5fcbcc836ae1701089683dd539d68ca2407d732da560dda1e43d2958b2a6954f","observation_id":"d7df0829-a47d-4d16-a6f1-a2e938eb4c5c","resolution":{"observed_at":"2026-08-06T18:34:01.648462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:01.732878Z","title":"Zero-Shot Tokenizer Transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:01.732878Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:3a1b027a41f67212634c7ab60deb3400bd746e89f33f1a6bc100f040c0ed1cc3","observation_id":"5d827db5-0d8b-4e6e-b79a-1d8ea4c3b9cb","resolution":{"observed_at":"2026-08-06T18:34:01.732878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:01.818277Z","title":"Universal Cross-Tokenizer Distillation via Approximate Likelihood Matching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:01.818277Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:d3ec82968d21dade3467f94cee7cfbd7831efcf27b8a9f2b739867a6e0130930","observation_id":"764d25c4-0409-41cb-b92d-c8391fa2c400","resolution":{"observed_at":"2026-08-06T18:34:01.818277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:01.858564Z","title":"Crosslingual Generalization through 27 Multitask Finetuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:01.858564Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:7042563e24cb6dec6e4e3ed4d3299b228daa59a29fa67b48f06f2b52ed2a3489","observation_id":"da186991-6278-4831-927b-ab7048a73008","resolution":{"observed_at":"2026-08-06T18:34:01.858564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T18:34:01.952008Z","title":"S1: Simple Test-Time Scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:01.952008Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:da02e120cb95bdbdaf1715ab884ff94d1ca95b24d82a49555eaab6f364c467b3","observation_id":"03d96932-f9a4-430e-8d77-08fb15f705a0","resolution":{"observed_at":"2026-08-06T18:34:01.952008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:02.045003Z","title":"Efficient Transformers with Dynamic Token Pooling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:02.045003Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:3a749de1e8335af306cbda32099eb2b64b502f0c33d1ad221f7400bdb0f5f0cf","observation_id":"a1a80607-7892-49b2-9e44-df5fb21cdccd","resolution":{"observed_at":"2026-08-06T18:34:02.045003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:02.185925Z","title":"Hierarchical Transformers Are More Efficient Language Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:02.185925Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:2a7133d4429dcdc84a445cfa4c63afda959dbf74259476c405b5e79ba3e7f936","observation_id":"434310d7-9cd2-451a-bb13-1944f0bf85d5","resolution":{"observed_at":"2026-08-06T18:34:02.185925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:02.205975Z","title":"Introducing OpenAI o1-preview","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:02.205975Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:7aa075c77e1114ceb6efd36ea811e1d56d4ef9aafdc6b2a40b3bd9edb9a27318","observation_id":"ecb503ee-ed2b-4f3e-ae74-e12c7f943463","resolution":{"observed_at":"2026-08-06T18:34:02.205975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-12T11:57:41.742961Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-06T18:34:02.209101Z","title":"Byte Latent Transformer: Patches Scale Better than Tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:02.209101Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:35dc333bbba22fd1de6f6b0017e425c453c87c463c929231298bb91960ed5dcf","observation_id":"8e67bcc0-2611-495d-9d96-e7291394e431","resolution":{"observed_at":"2026-08-06T18:34:02.209101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06031","last_updated":"2016-06-20T09:37:17Z","snapshot_observed_at":"2026-08-10T23:14:34.195361Z","submitted_at":"2016-06-20T09:37:17Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06031","snapshot_observed_at":"2026-08-06T18:34:02.316858Z","title":"The LAMBADA Dataset: Word Prediction Requiring a Broad Discourse Context","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:02.316858Z"},"links":{"cited_paper":"/paper/1606.06031","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:9bf6e35f10fac4ced1682005953a500d206b761f2633d92168859a5bd9fb83e2","observation_id":"df0d336c-b7b9-4338-a98e-418a51bf1cd9","resolution":{"observed_at":"2026-08-06T18:34:02.316858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:02.394837Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:02.394837Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:8ab5f6d93b1c632ee961bfb59d4d0b8cb4cf8c6b9c481f9f152a7427d1ed1f44","observation_id":"7b2f71fd-f2b2-4560-bc1b-f854b93f85f4","resolution":{"observed_at":"2026-08-06T18:34:02.394837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:04.842045Z","title":"The Bitter Lesson is coming for Tokenization","venue":null,"work_id":"c41013f5-6ef6-417c-8a65-0ce1e80b0522","year":2025},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:02.487766Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:2a4857ebe6a8153419074ffd9db17e576aa80d1b7047da5f3812a433e1f4f4be","observation_id":"2e44aa7a-9f9d-413a-8efe-823f53a769aa","resolution":{"observed_at":"2026-08-06T18:34:04.844929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:04.820322Z","title":"Language Model Tokenizers Introduce Unfairness Between Languages","venue":null,"work_id":"12cbd842-6cf2-4d48-9bf8-bf9b2f352a3a","year":2023},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:02.563580Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:4ada023361fd26b1eb97a6584721ff4a779107bdc6e46520f4fbaeb0adc1d541","observation_id":"07e9a470-a82f-471d-b120-1778c4234278","resolution":{"observed_at":"2026-08-06T18:34:04.835466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09303","last_updated":"2025-04-11T20:53:36Z","snapshot_observed_at":"2026-08-13T07:02:44.441464Z","submitted_at":"2024-10-11T23:30:42Z","title":"Exact Byte-Level Probabilities from Tokenized Language Models for FIM-Tasks and Model Ensembles","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09303","snapshot_observed_at":"2026-08-06T18:34:02.569149Z","title":"Exact Byte-Level Proba- bilities from Tokenized Language Models for FIM-Tasks and Model Ensembles","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:02.569149Z"},"links":{"cited_paper":"/paper/2410.09303","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:8712aa44378dfe2eae3e9140e18846adb368cd1155062bb666e44eea807ab5a3","observation_id":"ca052b0c-be44-41be-951a-6fc25ece7d45","resolution":{"observed_at":"2026-08-06T18:34:02.569149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:04.808463Z","title":"Hyena Hierarchy: Towards Larger Convolutional Language Models","venue":null,"work_id":"75b9cbec-aa5b-44e1-b7dc-017484864fa6","year":2023},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:02.583306Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:a6f6aa85598eaba0b23e085fa515883b7f92219c08bdcd0671037fecf1073398","observation_id":"26d26839-2663-45bc-80dc-42f2e3fb7fc8","resolution":{"observed_at":"2026-08-06T18:34:04.811174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:04.792820Z","title":"Language Models are Unsupervised Multitask Learners","venue":null,"work_id":"f59e7587-2ac1-442f-931a-bfeca0a034d8","year":2019},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:02.665123Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:e8389d85a54d9fe70821fd7b54928231be4e13ec8e8a523d89777419686d6792","observation_id":"c47c4ead-945c-4b51-87bd-b8647d482249","resolution":{"observed_at":"2026-08-06T18:34:04.796734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:04.781785Z","title":"An Analysis of Tokenization: Transformers Under Markov Data","venue":null,"work_id":"444b73bd-1af6-4c0a-a607-a86ece6bb940","year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:02.759272Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:7000f0deff2c5b2b8a7170e4f2b93dcabf787929ade0c2150b657a6fe565d484","observation_id":"f7f312ea-261d-4372-81e0-3ae1fc9c8d4a","resolution":{"observed_at":"2026-08-06T18:34:04.784507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-08-13T18:31:52.318837Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-06T18:34:02.828915Z","title":"Mixture-of-Depths: Dynamically Allocating Compute in Transformer-based Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:02.828915Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:e9065b67eba4f017b03d787861cf714be016851221fe26f71d99df3373535bf7","observation_id":"5f16c1be-30f6-460d-b9b6-a27452801c7a","resolution":{"observed_at":"2026-08-06T18:34:02.828915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:04.766842Z","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","venue":null,"work_id":"7f4c6aad-45f4-41d2-a94a-61a74284fbe0","year":2015},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:02.884515Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:84fa3739a54cbde5dc671020197c82a09ab84868d368813c95854a1465b5cf49","observation_id":"13288869-d75a-41a5-a60b-a3cdcff90b40","resolution":{"observed_at":"2026-08-06T18:34:04.773342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:04.750491Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","venue":null,"work_id":"7d7f1d8a-d754-4914-b77f-e8491c287675","year":2021},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:02.927239Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:f929a8156355a7bcb07ffb4a02d5a6b00ee6af75ccc1844d9048bfdaf1a7184d","observation_id":"ecc96691-bb96-4e89-b50e-990b31027845","resolution":{"observed_at":"2026-08-06T18:34:04.759690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:04.717489Z","title":"Caduceus: Bi- directional Equivariant Long-Range DNA Sequence Modeling","venue":null,"work_id":"72cef5f4-6f97-4548-bb3b-f0eae4ed134b","year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:03.001334Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:096984bba41029783c3ee437e41dbdfa34bcce2c02627fee051f9a405dc567e4","observation_id":"6efdc217-8389-487f-aaaf-3ff9bd4a1c35","resolution":{"observed_at":"2026-08-06T18:34:04.730706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:04.691668Z","title":"Tokenization Is More Than Compression","venue":null,"work_id":"6757b595-306c-4601-8257-449f709fd91a","year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:03.081340Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:b0f5627485d0d69f4c7374298337674596190c933e343b774d0cb468d7c59aa4","observation_id":"95bfa5fa-8eb0-43fe-8642-f330d7c01304","resolution":{"observed_at":"2026-08-06T18:34:04.699290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-08-13T18:41:35.355818Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-06T18:34:03.098703Z","title":"Neural Machine Translation of Rare Words with Subword Units","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:03.098703Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:f4115012a28f73196fecfe398248076530fc902f47b6d8b78691faf6413fb39f","observation_id":"eb383d93-85e3-4134-b398-c42b1ea6d052","resolution":{"observed_at":"2026-08-06T18:34:03.098703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-13T11:35:07.866136Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-06T18:34:03.210520Z","title":"Outra- geously Large Neural Networks: The Sparsely-gated Mixture-of-Experts Layer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:03.210520Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:604ae629fd62e1b0b8a6489bb2f1e88f081d5f344a68a8d89939ae7779280593","observation_id":"e7d79ca5-a589-4ad3-9139-4d980e3666e5","resolution":{"observed_at":"2026-08-06T18:34:03.210520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:04.674295Z","title":"SpaceByte: Towards Deleting Tokenization from Large Language Modeling","venue":null,"work_id":"9ad09cf5-c070-4dc7-a9d8-83db71124037","year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:03.288340Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:8fba6a58056cd5c2c72adee44f300271535a9ece175dfb159735d763254538c8","observation_id":"d182f5ec-9cba-4ee5-9408-21f482208fe6","resolution":{"observed_at":"2026-08-06T18:34:04.684400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:04.646834Z","title":"Local Byte Fusion for Neural Machine Translation","venue":null,"work_id":"7e306537-6dc4-4673-87a3-9810fe116cb3","year":2023},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:03.369256Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:40aab10d8d304879f88b784f5220e9419c2f978916e0b681dcc96a7ccb99aca9","observation_id":"81ef6245-ade3-4da5-b76f-37829110e8f7","resolution":{"observed_at":"2026-08-06T18:34:04.655766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04985","last_updated":"2020-02-27T22:07:11Z","snapshot_observed_at":"2026-08-12T17:40:57.385798Z","submitted_at":"2020-02-27T22:07:11Z","title":"Adv-BERT: BERT is not robust on misspellings! Generating nature adversarial samples on BERT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04985","snapshot_observed_at":"2026-08-06T18:34:03.396926Z","title":"Adv-BERT: BERT is Not Robust on Misspellings! Generating Nature Adversarial Samples on BERT","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:03.396926Z"},"links":{"cited_paper":"/paper/2003.04985","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:bb55491f5e0f5dd98f8a3b7d321222e5451308b52e93efea379e14a9ca2b7b26","observation_id":"ae6f2142-4cd7-4a54-8945-18366df212ff","resolution":{"observed_at":"2026-08-06T18:34:03.396926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:04.633622Z","title":"The Bitter Lesson","venue":null,"work_id":"8da33824-093f-4ed6-b550-47bc1bfe2ece","year":2019},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:03.413775Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:22a1844d12b2994be0398673a8cab65aabf19a04440cfda0ba39ec749cbd77e2","observation_id":"6c522fc6-d195-41f0-a069-18937510a245","resolution":{"observed_at":"2026-08-06T18:34:04.636231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:04.616871Z","title":"Scaling Laws with Vocabulary: Larger Models Deserve Larger Vocabularies","venue":null,"work_id":"ee592dd8-85c3-4bea-b36c-0bf2019f3bf8","year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:03.416364Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:4893e3abd811bf83a39222fa8008dff90c37f89d177d14e4f649bddc5c7d468b","observation_id":"dfc9d467-10a2-4736-abca-3696d3092229","resolution":{"observed_at":"2026-08-06T18:34:04.628677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.12672","last_updated":"2022-02-23T09:17:28Z","snapshot_observed_at":"2026-08-13T18:58:16.494694Z","submitted_at":"2021-06-23T22:24:14Z","title":"Charformer: Fast Character Transformers via Gradient-based Subword Tokenization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.12672","snapshot_observed_at":"2026-08-06T18:34:03.418750Z","title":"CharFormer: Fast Character Transformers via Gradient-based Subword Tokeniza- tion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:03.418750Z"},"links":{"cited_paper":"/paper/2106.12672","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:5274c0df1c7634d73b8437cd9804110ef4f245d520fada50b4ec0f74079ded1d","observation_id":"87a89f24-7de9-4067-8470-1f4da4f6750d","resolution":{"observed_at":"2026-08-06T18:34:03.418750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:04.609109Z","title":"Learn Your Tokens: Word-Pooled Tokenization for Language Modeling","venue":null,"work_id":"a2369b3a-78ea-46c3-97e1-27a9ddc53636","year":2023},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:03.421475Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:6da32a18e9261fc69ddb81f525af799cd72c5d0d193bb551d28021a29db15dcd","observation_id":"0b81fbfd-4f2d-40e8-8d7f-3ecafd591814","resolution":{"observed_at":"2026-08-06T18:34:04.611686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T18:34:03.423892Z","title":"Llama: Open and Efficient Foundation Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:03.423892Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:92a2b576843c5b7d295d001b43bf8287f28de8904a94afa907542642c9945d5c","observation_id":"754847c3-3beb-4a61-98e3-0d9ecd1f8aa6","resolution":{"observed_at":"2026-08-06T18:34:03.423892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T18:34:03.426630Z","title":"Llama 2: Open Foundation and Fine-tuned Chat Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:03.426630Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:a9b586cfaa3be5ace167a4e16c4c1490875eb5c92fba30f235bec4ed7c9de674","observation_id":"35bb22f3-eaea-4704-b699-9acb5b24c711","resolution":{"observed_at":"2026-08-06T18:34:03.426630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:04.599759Z","title":"Neural Discrete Representation Learning","venue":null,"work_id":"7e66bcdb-f092-4eb0-b579-2bac1f723c21","year":2017},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:03.429283Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:80ff29fd5d35b762e80431f58902e51514bd7b81c92da1bc5afee4c11f7fb562","observation_id":"142a6589-acd9-40d3-a80b-6e774ba17ddb","resolution":{"observed_at":"2026-08-06T18:34:04.604339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:04.586750Z","title":"Attention is All You Need","venue":null,"work_id":"b7701c28-08f4-46f8-92ed-c7cde7bddc59","year":2017},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:03.431645Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:7a4eb5ae3ef8c47120f7f60a4f7c912fcfc15fdceb0c55ea8ded9e3f9f677b7b","observation_id":"0d49945e-125f-47e4-b509-adb85db59aa7","resolution":{"observed_at":"2026-08-06T18:34:04.590025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14761","last_updated":"2025-06-17T17:55:11Z","snapshot_observed_at":"2026-08-12T09:21:36.563735Z","submitted_at":"2025-06-17T17:55:11Z","title":"From Bytes to Ideas: Language Modeling with Autoregressive U-Nets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14761","snapshot_observed_at":"2026-08-06T18:34:03.434422Z","title":"From Bytes to Ideas: Language Modeling with Autoregressive U-Nets","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:03.434422Z"},"links":{"cited_paper":"/paper/2506.14761","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:50f5dafbdf048fd219df929e10e67d7250dadd0795d002f3c89d9ec7cfee0d51","observation_id":"acb66ced-78d1-4170-8fd1-d82fe0b1d8db","resolution":{"observed_at":"2026-08-06T18:34:03.434422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:34:04.576794Z","title":"From Language Models over Tokens to Language Models over Characters","venue":null,"work_id":"485f4a4b-8e88-4f5f-af01-23cee790d899","year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:03.437070Z"},"links":{"citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:b19dd8083805c9aa733f6c82da05565c0d7351e71b9e7edee487122444e49888","observation_id":"8c8d60ff-fcb6-4297-8df3-51b60604ccc8","resolution":{"observed_at":"2026-08-06T18:34:04.581347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":80,"verified_exact":2,"verified_fuzzy":17},"total_outbound_references":122},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 100 of 122 outbound references and 20 inbound Pith citation observations for arXiv:2507.07955."}