{"as_of":"2026-08-05T22:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c2daa8dd87afd81eef94412a108b590c2f1786c5b4a72525001762e55ffe8d00","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T03:55:20.355345Z","state":"measured"},{"denominator":150,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":150,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":267,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:12:56.194961Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":12,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T10:31:03.777169Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2406.07887"},"observation_digest":"sha256:24c419a6338a6abdd881955e14b1d7eb5be7f060db947507aae91262b592f73a","observation_id":"f63d2815-1a60-4d50-b63e-0170ed0eca87","resolution":{"observed_at":"2026-05-18T10:31:03.856868Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:daca586841f4e03c9e9e39c093df83ec911713693849b65db34dcee8bc2448b3","observation_id":"ebba2fa9-a7f8-4386-8b23-c4a196d7a320","resolution":{"observed_at":"2026-05-17T11:16:32.092177Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:9bd1a6c5c8f84b43c4b2228690ea723e0a6ab05f389619158f318af159822ff7","observation_id":"668d82fd-a21c-4c5d-a307-c768301643ee","resolution":{"observed_at":"2026-05-18T08:12:01.927648Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2410.13846","last_updated":"2026-05-18T05:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T17:58:14Z","title":"LightTransfer: Your Long-Context LLM is Secretly a Hybrid Model with Effortless Adaptation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T18:31:35.391674Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2410.13846"},"observation_digest":"sha256:a72d68531d0c6ebcaa574b46f3ad28a2cbf78e64d6797dfc5cf4290e790e986d","observation_id":"27de3fbf-9b34-431d-8dde-ec5ef769926d","resolution":{"observed_at":"2026-05-23T18:33:19.458385Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T13:53:33.585035Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2410.17434"},"observation_digest":"sha256:2fe321e7dfa66f88d620543cd4b119ea792b4ef88149a59d68535dd3747c4b17","observation_id":"21c60990-16dc-488a-9ba3-4d2bc792eb4b","resolution":{"observed_at":"2026-05-16T13:53:33.651706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2412.13663","last_updated":"2024-12-19T06:32:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T09:39:44Z","title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","version":2},"reference_index":145,"source":"arxiv_source","source_observed_at":"2026-05-20T17:46:46.845424Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2412.13663"},"observation_digest":"sha256:3c89b015715a32d2c204ebe655c18601da9094a69f0a7aecf62b9de6bfa2de1c","observation_id":"b461d87f-1aa1-4763-93c5-6b42fd6895f0","resolution":{"observed_at":"2026-05-20T17:46:47.033367Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T06:25:00.376073Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2412.15115"},"observation_digest":"sha256:8d1bc331f23647f21844b7d45b1fbfaf836b3d0d4d37204810dc31c625756d67","observation_id":"9980a612-065d-4e78-8bb1-ddf8a96334c8","resolution":{"observed_at":"2026-05-23T06:25:27.894293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-07-31T01:49:29.562668Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T05:25:59.964619Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2501.15383"},"observation_digest":"sha256:a287d17f04fe99890fb4c33be9099998b731be71d297cb71a60d6d16c25b0516","observation_id":"9f523472-7434-48e6-a85f-3f195607d5f5","resolution":{"observed_at":"2026-05-15T05:26:00.078471Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2502.01068","last_updated":"2026-04-20T06:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T05:25:09Z","title":"FastKV: Decoupling of Context Reduction and KV Cache Compression for Prefill-Decoding Acceleration","version":7},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-23T03:59:58.634512Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2502.01068"},"observation_digest":"sha256:a418d6b8539e74549e1ee854d5646313650ae70e1926571d8c1752fa35c4d76d","observation_id":"d13189d0-bdb4-464e-87d6-f339f55e6fb1","resolution":{"observed_at":"2026-05-23T04:02:30.332370Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2502.01941","last_updated":"2026-05-12T08:04:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-04T02:23:06Z","title":"Semantic Integrity Matters: Benchmarking and Preserving High-Density Reasoning in KV Cache Compression","version":4},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-23T04:15:36.906263Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2502.01941"},"observation_digest":"sha256:14b8b0ac30704c7b3910977f3811aabbf5054ee7d09870ded0b0c776db9910c3","observation_id":"e9bbe8dc-94b1-42ea-869f-70fe802fe765","resolution":{"observed_at":"2026-05-23T04:17:31.152439Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T22:18:55.976503Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2503.19786"},"observation_digest":"sha256:1a0bb46dc4147d9470cf2d0b2800d0070b0307833d7f65f10660548e5e2f13df","observation_id":"480461f8-4d6c-41ee-9ede-246cc628ea66","resolution":{"observed_at":"2026-05-22T22:22:12.270624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2505.02922","last_updated":"2026-04-27T10:13:35Z","snapshot_observed_at":"2026-08-02T06:23:14.961990Z","submitted_at":"2025-05-05T18:01:17Z","title":"RetroInfer: A Vector Storage Engine for Scalable Long-Context LLM Inference","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T15:59:04.724780Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2505.02922"},"observation_digest":"sha256:e2a6d8a23e837f801f8dc7a242956833c0b37f8811b232cf2afd0a4edbce230a","observation_id":"3cebae00-ee04-4f0e-88c7-c73c4f6e159c","resolution":{"observed_at":"2026-05-11T03:55:20.729537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:3c3a6991b76d8fbb8bcaa22e5cd9617c7f6522ecf44968ae6e5968931971a4b7","observation_id":"a1ccb3e3-005f-4567-bd79-499455a8460d","resolution":{"observed_at":"2026-05-12T09:04:34.881436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T06:35:27.813995Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2505.09388"},"observation_digest":"sha256:e7ff734bdc33108f725be34ddd6cd3dbc59a40122922cc06ed7613d16e15969a","observation_id":"a77f06ac-0280-4426-aa3b-217160ca3878","resolution":{"observed_at":"2026-05-11T03:55:20.729537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2507.02259","last_updated":"2026-07-29T12:55:39Z","snapshot_observed_at":"2026-08-01T23:32:07.108143Z","submitted_at":"2025-07-03T03:11:50Z","title":"MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T11:17:24.406028Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2507.02259"},"observation_digest":"sha256:948c7454652c907cd12807e63d91767a78664511f31e1f3896bd058a1572bc9b","observation_id":"c2657354-f4d5-4002-8bca-22559cd615eb","resolution":{"observed_at":"2026-05-15T11:17:24.518478Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2507.05257","last_updated":"2026-06-28T17:25:01Z","snapshot_observed_at":"2026-08-05T13:16:54.824937Z","submitted_at":"2025-07-07T17:59:54Z","title":"Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T21:20:22.146417Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2507.05257"},"observation_digest":"sha256:5821d39c5b6a30f49fcd9132931d83be5e8cb1722f3d7b8cd8cb3687eae61940","observation_id":"41703050-a6b6-41aa-88bd-db75ec200299","resolution":{"observed_at":"2026-05-16T21:20:22.192101Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T03:05:34.843274Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2507.21526"},"observation_digest":"sha256:45273610a4cf2975ec4468522f581c8d9d2b82fe33f03d2d1818d9e6c486b492","observation_id":"013ae64f-7454-4a2a-b689-fba98dda6e35","resolution":{"observed_at":"2026-05-19T03:06:59.967683Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T22:12:56.194961Z","title":"Maor Ivgi, Uri Shaham, and Jonathan Berant","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.07479","last_updated":"2025-08-10T20:40:24Z","snapshot_observed_at":"2026-08-05T22:12:54.565838Z","submitted_at":"2025-08-10T20:40:24Z","title":"Positional Biases Shift as Inputs Approach Context Window Limits","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T22:12:56.194961Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2508.07479"},"observation_digest":"sha256:81e3cdf41aa0b8650093117a956e9430a523a15dfdc9902e7acfb7cf1dc616b2","observation_id":"283513f8-bde8-420d-9dab-cb6e3baec262","resolution":{"observed_at":"2026-08-05T22:12:56.194961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T17:26:28.840842Z","title":"RULER : What's the real context size of your long-context language models? CoRR, abs/2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16279","last_updated":"2025-08-22T10:35:56Z","snapshot_observed_at":"2026-08-05T17:26:26.551966Z","submitted_at":"2025-08-22T10:35:56Z","title":"AgentScope 1.0: A Developer-Centric Framework for Building Agentic Applications","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T17:26:28.840842Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2508.16279"},"observation_digest":"sha256:972d5d7e8ee15c5a1581a686ea551d255168cb4bfeb61b4c8a6507b5bec51b3a","observation_id":"9e4b150b-8abe-431f-a37a-beaac3f253e9","resolution":{"observed_at":"2026-08-05T17:26:28.840842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T15:52:16.476792Z","title":"Ruler: What’s the real context size of your long-context language models?arXiv preprint arXiv:2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-05T15:52:15.223024Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.476792Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:f19281585407c0c9624bc996fd201d4585c390918334e940c4ee47e5e7eeb39d","observation_id":"cd06ca60-2ec1-4a76-b8b5-03085f6dc174","resolution":{"observed_at":"2026-08-05T15:52:16.476792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T14:54:06.285905Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20778","last_updated":"2025-08-31T09:48:40Z","snapshot_observed_at":"2026-08-05T14:53:46.860941Z","submitted_at":"2025-08-28T13:34:42Z","title":"SEAL: Structure and Element Aware Learning to Improve Long Structured Document Retrieval","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T14:54:06.285905Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2508.20778"},"observation_digest":"sha256:a24a85b19daab2f6abc70ef2552e8f776b3577901dd27066c7b7812e25a963ad","observation_id":"113b4b48-d119-47bf-9482-f955b04c9871","resolution":{"observed_at":"2026-08-05T14:54:06.285905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T11:10:56.839861Z","title":"Ruler: What’s the real context size of your long-context language models? arXiv preprint arXiv:2404.06654,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03136","last_updated":"2025-09-03T08:38:40Z","snapshot_observed_at":"2026-08-05T11:10:55.803387Z","submitted_at":"2025-09-03T08:38:40Z","title":"Adaptive KV-Cache Compression without Manually Setting Budget","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T11:10:56.839861Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2509.03136"},"observation_digest":"sha256:bc72770576e781592a24eb30d4813e03ab0bdb7d05eea2e9cbefb2aee4d391e8","observation_id":"d3c16903-29e1-4a49-8fd4-52048f6aacb2","resolution":{"observed_at":"2026-08-05T11:10:56.839861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T06:00:51.040320Z","title":"Ruler: What’s the real context size of your long-context language models?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04714","last_updated":"2025-09-05T00:02:17Z","snapshot_observed_at":"2026-08-05T06:00:50.344332Z","submitted_at":"2025-09-05T00:02:17Z","title":"ThumbnailTruth: A Multi-Modal LLM Approach for Detecting Misleading YouTube Thumbnails Across Diverse Cultural Settings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:51.040320Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2509.04714"},"observation_digest":"sha256:2ee652ae5884c489b0eba593f76926b8fc15a695fab9375bea450da128501ca2","observation_id":"0ddadf61-75d8-46f2-ad82-405bed515bbc","resolution":{"observed_at":"2026-08-05T06:00:51.040320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-04T20:53:28.828244Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-04T20:53:17.807634Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:28.828244Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:18e286eef94f9bb9308ef5a76b1a3ab3b37f64be9852aef842a8fe6aeb7a2d66","observation_id":"2aa56bfe-9d3d-4cfb-8a1b-2fa388d93e0b","resolution":{"observed_at":"2026-08-04T20:53:28.828244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2509.11206","last_updated":"2026-04-20T05:43:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-14T10:24:13Z","title":"Evalet: Evaluating Large Language Models through Functional Fragmentation","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T16:57:25.259866Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2509.11206"},"observation_digest":"sha256:f722cb6341d585128e1ff0ff30401e76bfa6d766a5e5c85efa3a720f1ce4179e","observation_id":"eac8a79b-885f-47a5-ace7-1a73f776d90a","resolution":{"observed_at":"2026-05-18T17:01:40.093068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2509.21623","last_updated":"2026-04-16T21:29:54Z","snapshot_observed_at":"2026-08-03T21:57:13.209890Z","submitted_at":"2025-09-25T21:42:27Z","title":"OjaKV: Context-Aware Online Low-Rank KV Cache Compression","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T13:26:02.980973Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2509.21623"},"observation_digest":"sha256:a879c517d7738b83716694e0fe95574c473ccf473cf2964209b99ff3e4715734","observation_id":"e8585220-8e51-46a3-bbdf-55c27dba0d6f","resolution":{"observed_at":"2026-05-18T13:26:24.719833Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2509.22630","last_updated":"2026-04-24T05:03:12Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T17:55:22Z","title":"StateX: Enhancing RNN Recall via Post-training State Expansion","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T12:27:06.616920Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2509.22630"},"observation_digest":"sha256:3923d1a95e552b32c8b048c1f0357187d084c09508dd4fd40a1d927e8c8496f2","observation_id":"55eab44e-7608-433c-a0d8-d8160bcf5053","resolution":{"observed_at":"2026-05-18T12:31:22.107132Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2509.24552","last_updated":"2026-05-04T14:21:45Z","snapshot_observed_at":"2026-08-02T23:01:03.041288Z","submitted_at":"2025-09-29T10:04:12Z","title":"Short window attention enables long-term memorization","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T12:10:42.646127Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2509.24552"},"observation_digest":"sha256:d29a1da15cbe338e765ace31f91daf5cf03b09e5a5aa7598c6759d17a7660b04","observation_id":"82e3e3f2-318a-435e-b58f-751768b61645","resolution":{"observed_at":"2026-05-18T12:11:21.796529Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-04T13:54:13.845691Z","title":", Sun , S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24563","last_updated":"2026-07-15T12:54:15Z","snapshot_observed_at":"2026-08-04T13:51:39.486781Z","submitted_at":"2025-09-29T10:16:05Z","title":"NeMo: Needle in a Montage for Video-Language Understanding","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:13.845691Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2509.24563"},"observation_digest":"sha256:3e4bcfd1218a0ac90ce8fc43a45812725d7f086a11b1240189d605bd0f18e72a","observation_id":"4c9bec84-57e7-4346-8947-ca318dca12ef","resolution":{"observed_at":"2026-08-04T13:54:13.845691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-04T11:21:07.118536Z","title":"Ruler: What's the real context size of your long-context language models? arXiv preprint arXiv:2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05688","last_updated":"2026-05-25T12:53:13Z","snapshot_observed_at":"2026-08-04T11:21:03.843752Z","submitted_at":"2025-10-07T08:46:08Z","title":"vAttention: Verified Sparse Attention","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:07.118536Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2510.05688"},"observation_digest":"sha256:11394d77073b8418174a2bff9ce1746f1453587d7f9d74e9518dbd862f801590","observation_id":"25db6d29-6a16-42d8-9dc1-b86f2f681cb4","resolution":{"observed_at":"2026-08-04T11:21:07.118536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-04T10:57:43.388072Z","title":"Ruler: What’s the real context size of your long-context language models?arXiv preprint arXiv:2404.06654,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"reference_index":1992,"source":"pdf_text","source_observed_at":"2026-08-04T10:57:43.388072Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2510.07651"},"observation_digest":"sha256:17ae0beec77fb4d40fe8f449a2f398857cfc76a57c9eb0362eb4cd88cd663a75","observation_id":"5e24562f-9ff6-4b16-9c8f-fc0e680c0989","resolution":{"observed_at":"2026-08-04T10:57:43.388072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2510.10129","last_updated":"2026-05-21T08:20:19Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-11T09:28:26Z","title":"CacheClip: Accelerating RAG with Effective KV Cache Reuse","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T12:36:41.630618Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2510.10129"},"observation_digest":"sha256:be3bf28fa4d1d4c1dec2c8e5b6404d6341f22f167ad05f9d6036d467be78bd2e","observation_id":"190281d5-16b3-459d-8cec-5c033b6daaa8","resolution":{"observed_at":"2026-05-22T12:41:33.655723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-04T07:30:52.144276Z","title":"Ruler: What’s the real context size of your long-context language models?arXiv preprint arXiv:2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.25743","last_updated":"2026-07-15T02:29:29Z","snapshot_observed_at":"2026-08-04T07:30:51.162707Z","submitted_at":"2025-10-29T17:46:07Z","title":"Agentic Economic Modeling","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T07:30:52.144276Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2510.25743"},"observation_digest":"sha256:1e7714927e55a26b4ac1712de01bdd7919455fe31eccb2ca1edd3eef7213974b","observation_id":"4ec561f1-2992-4a75-a272-53ee333e7222","resolution":{"observed_at":"2026-08-04T07:30:52.144276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2510.26083","last_updated":"2026-04-08T13:55:00Z","snapshot_observed_at":"2026-07-06T22:34:28.484520Z","submitted_at":"2025-10-30T02:41:54Z","title":"Nirvana: A Specialized Generalist Model With Task-Aware Memory Mechanism","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T03:05:06.069642Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2510.26083"},"observation_digest":"sha256:29c6bda5700258457ecdfe139007f67318976b0ee9dd9c4b9dd681a1d13bc6eb","observation_id":"e05c2644-f934-4eec-b8d7-0859061b6f1b","resolution":{"observed_at":"2026-05-18T03:05:47.964443Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:4fe8dc3e4c1011106adfa8d69c0b0e01e52c92d43a82316ac6d09cf7991203eb","observation_id":"34e7ecfc-c416-4ea7-8b3f-9ba281284098","resolution":{"observed_at":"2026-05-13T23:49:11.144494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2511.02805","last_updated":"2026-05-08T08:08:53Z","snapshot_observed_at":"2026-08-02T15:47:22.171069Z","submitted_at":"2025-11-04T18:27:39Z","title":"MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T00:57:25.902674Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2511.02805"},"observation_digest":"sha256:aed6773c703386fc9fe3fe8770d5c1585215de438915e1045dbf6a2583eb497d","observation_id":"da807122-5697-45d5-94c1-9b4e7ba345df","resolution":{"observed_at":"2026-05-18T01:00:34.493566Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:c075039b45378a5f2f2e894ca2c78651b6b27a7f5abc1cda5e34193b7bd88232","observation_id":"4ad8e13b-fbb1-4987-90f5-f33cad7e6545","resolution":{"observed_at":"2026-05-18T02:00:39.322244Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-03T23:33:56.240171Z","title":"Ruler: What's the real context size of your long-context language models? arXiv preprint arXiv:2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-05T19:12:56.677346Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:56.240171Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:ee022722577a998d12a594fbd5ad7d54bbff9b417657562154d59851c848c4b4","observation_id":"4fdf4524-0a13-45db-94ad-9cd088e66d7b","resolution":{"observed_at":"2026-08-03T23:33:56.240171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2511.07328","last_updated":"2026-05-04T15:02:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-10T17:31:02Z","title":"Q-RAG: Long Context Multi-step Retrieval via Value-based Embedder Training","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T23:27:49.126341Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2511.07328"},"observation_digest":"sha256:acba1dc7c5ec397db5d2552e707244c1e6c15c72659a6e0b4dbafc6c65aa91d6","observation_id":"4dc3d4ae-8d64-474f-a2d5-62b3ad5a8a11","resolution":{"observed_at":"2026-05-17T23:30:29.416978Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2511.12676","last_updated":"2026-04-20T15:58:25Z","snapshot_observed_at":"2026-08-03T08:02:06.363721Z","submitted_at":"2025-11-16T16:30:38Z","title":"BridgeEQA: Virtual Embodied Agents for Real Bridge Inspections","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T21:40:51.426489Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2511.12676"},"observation_digest":"sha256:97736a7c3df26be5449b3abab4b15db7941306c4a738bd7d7f37aadfe374ac29","observation_id":"d0e43665-fd16-461f-8426-ef43d8db4020","resolution":{"observed_at":"2026-05-17T21:42:07.484193Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2511.14823","last_updated":"2025-11-18T15:59:44Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T15:59:44Z","title":"Dynamic Nested Hierarchies: Pioneering Self-Evolution in Machine Learning Architectures for Lifelong Intelligence","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T20:12:46.999729Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2511.14823"},"observation_digest":"sha256:32514097cdcbb1f8453c72d759a9dce681fe8c204da0812f8cfa9c8bfd904fef","observation_id":"586b7447-037d-4410-ae37-d0aa79e7f97e","resolution":{"observed_at":"2026-05-17T20:15:10.595005Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2511.21016","last_updated":"2026-05-17T20:43:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-26T03:26:37Z","title":"Gated KalmaNet: A Fading Memory Layer Through Test-Time Ridge Regression","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T17:59:23.826110Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2511.21016"},"observation_digest":"sha256:4cd9a13b923d567a6a91ec7e0a9377ef959aa1606f527c0fd98300d00e8bbc81","observation_id":"c7abe6fa-ffb4-48f7-b2dc-48e38dc2db97","resolution":{"observed_at":"2026-05-21T18:00:27.124892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2511.22972","last_updated":"2026-04-29T12:32:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-28T08:23:30Z","title":"Training-Free Loosely Speculative Decoding: Accepting Semantically Correct Drafts Beyond Exact Match","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T05:07:11.466066Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2511.22972"},"observation_digest":"sha256:8fe341eaab330e31de73848309e4c34fb76ff402c84598a54bcf57b0a3c01ae3","observation_id":"3e80f517-d4d7-4aa7-9563-1caa98825594","resolution":{"observed_at":"2026-05-17T05:09:03.785097Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2512.12087","last_updated":"2026-04-28T06:58:25Z","snapshot_observed_at":"2026-07-06T22:38:54.914862Z","submitted_at":"2025-12-12T23:30:43Z","title":"BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T22:20:53.856657Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2512.12087"},"observation_digest":"sha256:ba60eeaf173f98ce273a2e31219b95c7af0e33cd28e4d9e0b9abb5ccc9723e54","observation_id":"9e592699-ad48-44c9-92e1-46968a28be95","resolution":{"observed_at":"2026-05-16T22:21:18.657950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-03T15:22:49.949583Z","title":"Ruler: What’s the real context size of your long-context language models?arXiv preprint arXiv:2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.17351","last_updated":"2026-07-28T16:53:50Z","snapshot_observed_at":"2026-08-03T18:14:53.588030Z","submitted_at":"2025-12-19T08:47:28Z","title":"Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T15:22:49.949583Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2512.17351"},"observation_digest":"sha256:3af005113216eb8c9924b779be03f8de623860beb89d172312df26583fb41daa","observation_id":"e350d2d2-7d73-423a-8058-58e055774756","resolution":{"observed_at":"2026-08-03T15:22:49.949583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2512.20856","last_updated":"2025-12-24T00:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-24T00:24:05Z","title":"NVIDIA Nemotron 3: Efficient and Open Intelligence","version":1},"reference_index":202,"source":"arxiv_source","source_observed_at":"2026-05-18T01:40:42.190369Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2512.20856"},"observation_digest":"sha256:d9a0e029cc8efc3cb6be302f13fe71509cc82ea55d0a451ec4988a776277c8cc","observation_id":"1c7cbcfa-5c15-4b22-af06-7796b5346517","resolution":{"observed_at":"2026-05-18T01:40:42.781438Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2512.24601","last_updated":"2026-05-11T15:26:31Z","snapshot_observed_at":"2026-07-06T22:40:27.178487Z","submitted_at":"2025-12-31T03:43:41Z","title":"Recursive Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2512.24601"},"observation_digest":"sha256:e819fb57ac29977f540f3c10e02751b5fc37cd23d6376e62c9e229999bce3ada","observation_id":"7c355692-44b3-4558-b8df-c6a037e35ac1","resolution":{"observed_at":"2026-05-16T19:33:19.984935Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2601.01972","last_updated":"2026-03-20T17:28:41Z","snapshot_observed_at":"2026-07-06T22:40:41.626783Z","submitted_at":"2026-01-05T10:27:19Z","title":"Hidden State Poisoning Attacks against Mamba-based Language Models","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T18:15:05.108462Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2601.01972"},"observation_digest":"sha256:0981ad78233b8daaf6ed613c6669ab118aedfba094d8a4af7df3f24f62a89fa9","observation_id":"7a8829df-3419-4b10-b4bc-6949bc920734","resolution":{"observed_at":"2026-05-16T18:18:14.509469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-03T12:42:28.451858Z","title":"RULER: What’s the real context size of your long-context language models?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.02023","last_updated":"2026-07-14T21:47:31Z","snapshot_observed_at":"2026-08-04T07:31:52.300054Z","submitted_at":"2026-01-05T11:30:56Z","title":"Not All Needles Are Found: How Fact Distribution and Don't Make It Up Prompts Shape Retrieval, Reasoning, and Hallucination in Long-Context LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T12:42:28.451858Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2601.02023"},"observation_digest":"sha256:1beeed53bd4c486ddfac0accde74bc805a50eab8e8d84ff4f7689c71ca819caf","observation_id":"db891dfb-12f3-469b-aa78-9454e26c06c4","resolution":{"observed_at":"2026-08-03T12:42:28.451858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2601.20255","last_updated":"2026-05-28T06:29:39Z","snapshot_observed_at":"2026-08-03T07:22:22.213004Z","submitted_at":"2026-01-28T05:03:24Z","title":"HE-SNR: Uncovering Latent Logic via Entropy for Guiding Mid-Training on SWE-bench","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T11:01:57.191751Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2601.20255"},"observation_digest":"sha256:6a877c1b5f509de45ef95b6a2510c6602a2b2fb947b9993078d5df93afcf7ebf","observation_id":"550a78ea-6902-4395-bf8c-82606f2975e1","resolution":{"observed_at":"2026-05-16T11:02:47.140148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2601.21468","last_updated":"2026-05-18T07:50:29Z","snapshot_observed_at":"2026-08-04T01:48:38.560710Z","submitted_at":"2026-01-29T09:47:17Z","title":"MemOCR: Layout-Aware Visual Memory for Efficient Long-Horizon Reasoning","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T15:15:22.055616Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2601.21468"},"observation_digest":"sha256:d8b64cd5d42b4fe8a3334886375aab624e16ceaee41f7e7eb90b600b1ba6e547","observation_id":"524975d7-045c-449e-9542-8a2a44f8763b","resolution":{"observed_at":"2026-05-21T15:20:17.597887Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-03T05:09:29.294674Z","title":"Ruler: What's the real context size of your long-context language models? arXiv preprint arXiv:2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03216","last_updated":"2026-05-29T02:42:46Z","snapshot_observed_at":"2026-08-03T05:09:26.451185Z","submitted_at":"2026-02-03T07:31:14Z","title":"Token Sparse Attention: Efficient Long-Context Inference with Interleaved Token Selection","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T05:09:29.294674Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2602.03216"},"observation_digest":"sha256:ae85d20637e076d65848cd94dbef9a1312a9e0b1abff51e89eb971b77f333cef","observation_id":"28f4c632-2495-4cef-a9fc-2f1e1c49b928","resolution":{"observed_at":"2026-08-03T05:09:29.294674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-03T03:22:54.313489Z","title":"Ruler: What’s the real context size of your long-context language models?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08426","last_updated":"2026-05-25T11:18:29Z","snapshot_observed_at":"2026-08-03T03:22:52.672693Z","submitted_at":"2026-02-09T09:31:06Z","title":"Prism: Spectral-Aware Block-Sparse Attention","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T03:22:54.313489Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2602.08426"},"observation_digest":"sha256:5b05625a3b0ea44e70423cd9dd5703636c9a6dd3818aabfcfb690bb9b0ad3200","observation_id":"376b31a7-d1b8-468f-9f3c-c15c698d5e30","resolution":{"observed_at":"2026-08-03T03:22:54.313489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-03T03:17:42.006742Z","title":"doi: 10.18653/v1/2020.coling-main.580","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.08585","last_updated":"2026-06-01T09:16:10Z","snapshot_observed_at":"2026-08-03T03:17:37.567545Z","submitted_at":"2026-02-09T12:23:38Z","title":"Predicting Future Utility: Global Combinatorial Optimization for Task-Agnostic KV Cache Eviction","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T03:17:42.006742Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2602.08585"},"observation_digest":"sha256:4cffe6e1952060370453cfa2e0784e53c65c42f8aa6799bcad06b404c9646684","observation_id":"877b562b-e818-4d5c-8045-4b32ca21fefc","resolution":{"observed_at":"2026-08-03T03:17:42.006742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-03T01:18:03.447847Z","title":"Simon Jegou and Maximilian Jeblick","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10238","last_updated":"2026-06-26T10:01:58Z","snapshot_observed_at":"2026-08-03T01:17:29.085975Z","submitted_at":"2026-02-10T19:34:15Z","title":"Learning to Evict from Key-Value Cache","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T01:18:03.447847Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2602.10238"},"observation_digest":"sha256:f86cf447724bee677e17cbd0419cce277186281d06d7a8868646be51e2527c2d","observation_id":"0f1793f0-fc94-4741-997c-34b6955abc14","resolution":{"observed_at":"2026-08-03T01:18:03.447847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-02T22:05:41.622495Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T20:59:33.902420Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:66efb373bd38b5c6182f023d7b86e9b0a98f9f66a8ad2306a5c87543883585e0","observation_id":"3a04a40a-b20f-4c24-ae41-2ac26b639f53","resolution":{"observed_at":"2026-05-15T21:00:17.869353Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-02T22:05:41.622495Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T12:45:27.150368Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:789bbc85b2cb050ebadb2af3f4f9ddd9b3151e20e627021b209cdda827fef50c","observation_id":"88e9fc9c-790f-45eb-8079-133997643db6","resolution":{"observed_at":"2026-05-21T12:50:09.424467Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-02T22:05:43.012265Z","title":"Ruler: What’s the real context size of your long-context language models? arXiv preprint arXiv:2404.06654,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-02T22:05:41.622495Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T22:05:43.012265Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:420584f322bff02d376eb3ea282fa4e818a20051f278c4a5b8b138a8a594968d","observation_id":"6d318660-f24f-4ab8-80e7-a680480bbaa7","resolution":{"observed_at":"2026-08-02T22:05:43.012265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2602.22575","last_updated":"2026-05-05T13:29:50Z","snapshot_observed_at":"2026-07-06T22:47:06.893212Z","submitted_at":"2026-02-26T03:30:28Z","title":"S2O: Early Stopping for Sparse Attention via Online Permutation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T19:32:52.948154Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2602.22575"},"observation_digest":"sha256:4cc4460d8ccfcb9ac1c5de79831bcbd7192273b0aff8064adb0a186f87d51643","observation_id":"a89fd13e-69d7-4f39-b041-93b294d71695","resolution":{"observed_at":"2026-05-15T19:36:32.853929Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2603.04759","last_updated":"2026-04-09T15:16:58Z","snapshot_observed_at":"2026-08-02T20:00:30.056450Z","submitted_at":"2026-03-05T03:16:16Z","title":"Stacked from One: Multi-Scale Self-Injection for Context Window Extension","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T16:57:09.401220Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2603.04759"},"observation_digest":"sha256:f65b0b7455acd33cf98f507f844ddb57f9558703c7539758c51a489493482d5e","observation_id":"a8d3b192-fc11-4a60-884c-65e38dd8b9c1","resolution":{"observed_at":"2026-05-15T17:00:10.300236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-03T02:39:28.630801Z","title":"Ruler: What’s the real context size of your long-context language models? arXiv preprint arXiv:2404.06654,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.06274","last_updated":"2026-07-31T10:15:33Z","snapshot_observed_at":"2026-08-05T22:09:58.727430Z","submitted_at":"2026-03-06T13:33:29Z","title":"Stem: Rethinking Causal Information Flow in Sparse Attention","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T02:39:28.630801Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2603.06274"},"observation_digest":"sha256:575bb6caba285d78f20deb17b4f3094a5cb6b0ed25404ab76beae853da27d0f6","observation_id":"cb11970c-984a-4db2-bd94-59f4edc4c7c7","resolution":{"observed_at":"2026-08-03T02:39:28.630801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2603.06610","last_updated":"2026-05-22T08:27:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-19T09:46:24Z","title":"CapTrack: Multifaceted Evaluation of Forgetting in LLM Post-Training","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-25T06:40:51.046965Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2603.06610"},"observation_digest":"sha256:33e32833898ac591d0ad5849d6b635f2793c99f536808477db450cfbddea1adc","observation_id":"b9c3acd9-fd98-442c-8f1d-a6f55a5449ae","resolution":{"observed_at":"2026-05-25T06:45:25.642297Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2603.14360","last_updated":"2026-05-13T23:29:01Z","snapshot_observed_at":"2026-08-01T09:38:25.349230Z","submitted_at":"2026-03-15T12:53:09Z","title":"M$^2$RNN: Non-Linear RNNs with Matrix-Valued States for Scalable Language Modeling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2603.14360"},"observation_digest":"sha256:85af4f85c6cf9060d818f9f55f63f2561550cc57e1f1631e61901b424843b2f8","observation_id":"53b89b20-c1dc-4ce0-8e6d-093d3ce19c88","resolution":{"observed_at":"2026-05-15T11:39:58.684563Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2603.21354","last_updated":"2026-04-08T22:31:39Z","snapshot_observed_at":"2026-07-06T22:50:05.914888Z","submitted_at":"2026-03-22T18:30:11Z","title":"The Workload-Router-Pool Architecture for LLM Inference Optimization: A Vision Paper from the vLLM Semantic Router Project","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-15T06:40:27.945478Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2603.21354"},"observation_digest":"sha256:bb32f1eefb22c6c2be21572aebc1d46ce7c395b23650bbfda616409522ed43e1","observation_id":"1c8f3c23-468a-49f3-b8f5-dbee84d94fe7","resolution":{"observed_at":"2026-05-15T06:45:11.971173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2603.22241","last_updated":"2026-04-13T08:19:37Z","snapshot_observed_at":"2026-08-03T01:01:53.602471Z","submitted_at":"2026-03-23T17:39:56Z","title":"MemDLM: Memory-Enhanced DLM Training","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T00:42:22.989588Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2603.22241"},"observation_digest":"sha256:9f11849d40162f4819721631b809d488981e83528fbc24b20216b2b361272065","observation_id":"0f7445a9-5417-4c2d-baea-17a40fbeab63","resolution":{"observed_at":"2026-05-15T00:43:24.464770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2603.22910","last_updated":"2026-05-13T05:25:05Z","snapshot_observed_at":"2026-07-06T22:50:14.856451Z","submitted_at":"2026-03-24T07:58:42Z","title":"EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T01:09:07.983785Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2603.22910"},"observation_digest":"sha256:c472f1e28ae02776d87eb68a101dafa3efb475827004c3f191a4d253bc51e9e3","observation_id":"71bf7c3b-df27-4845-878e-f27ff9930d2a","resolution":{"observed_at":"2026-05-15T01:09:36.996722Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2603.23516","last_updated":"2026-04-13T03:01:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-06T02:29:54Z","title":"MSA: Memory Sparse Attention for Efficient End-to-End Memory Model Scaling to 100M Tokens","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T16:00:03.578685Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2603.23516"},"observation_digest":"sha256:627cdf9b6861791bdddafc662c62abb3b998d59148759d730d4f91ee08bad0d7","observation_id":"96fd8547-2574-451b-9bcc-c7beb301f32c","resolution":{"observed_at":"2026-05-15T16:00:10.041245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-02T18:36:57.917048Z","title":"Ruler: What’s the real context size of your long-context language models? arXiv preprint arXiv:2404.06654,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.00004","last_updated":"2026-07-23T07:35:13Z","snapshot_observed_at":"2026-08-03T08:52:32.473253Z","submitted_at":"2026-03-09T10:51:01Z","title":"LinearARD: Linear-Memory Attention Distillation for RoPE Restoration","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-02T18:36:57.917048Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.00004"},"observation_digest":"sha256:b2952885f9d4e9793d9fdcb36362216867e8aff25ec91d838255ca67fc0e4131","observation_id":"ee7d8a08-9594-425a-81be-3c30b3bafeae","resolution":{"observed_at":"2026-08-02T18:36:57.917048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.03044","last_updated":"2026-04-08T07:22:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-03T13:52:38Z","title":"JoyAI-LLM Flash: Advancing Mid-Scale LLMs with Token Efficiency","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-13T19:26:38.134505Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.03044"},"observation_digest":"sha256:cf8f7577732e06d8796f321d6183cbd687fa8de5fa82b680fe3b7c9c5acb9cfa","observation_id":"5044b67b-61d5-4d53-ac7a-f1f532a04fb4","resolution":{"observed_at":"2026-05-13T19:28:09.862765Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.06111","last_updated":"2026-04-10T03:07:44Z","snapshot_observed_at":"2026-08-02T21:04:18.191344Z","submitted_at":"2026-04-07T17:21:28Z","title":"AgentCE-Bench: Agent Configurable Evaluation with Scalable Horizons and Controllable Difficulty under Lightweight Environments","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T19:07:46.077831Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.06111"},"observation_digest":"sha256:74a3669b872da4cd2568d2b8c3ff4b3e14bd61069b9434af6a1f2257cf185323","observation_id":"dcb588d2-0fb7-4d39-91c6-74a6b93d621d","resolution":{"observed_at":"2026-05-11T03:55:20.729537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.06169","last_updated":"2026-04-07T17:59:44Z","snapshot_observed_at":"2026-08-03T02:43:13.230039Z","submitted_at":"2026-04-07T17:59:44Z","title":"In-Place Test-Time Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T19:07:47.174513Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.06169"},"observation_digest":"sha256:35cfcec481a75212bc4d5aa35ee9a0313c6d18365af5ad4ed5eb8fa29d1ac9a4","observation_id":"a122f7ab-6eec-4977-a3d7-72840de7b830","resolution":{"observed_at":"2026-05-11T03:55:20.729537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.06746","last_updated":"2026-04-08T07:10:35Z","snapshot_observed_at":"2026-07-06T22:55:11.560398Z","submitted_at":"2026-04-08T07:10:35Z","title":"StructKV: Preserving the Structural Skeleton for Scalable Long-Context Inference","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-10T18:37:10.526359Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.06746"},"observation_digest":"sha256:164c521220dd0a8ce35ee511beef20e67d883840d85d776daf694ec9110c758c","observation_id":"47fcde2c-8b3e-4daa-a878-f1e978c1e8be","resolution":{"observed_at":"2026-05-11T03:55:20.729537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.07394","last_updated":"2026-04-08T07:36:17Z","snapshot_observed_at":"2026-07-31T19:41:40.292757Z","submitted_at":"2026-04-08T07:36:17Z","title":"Flux Attention: Context-Aware Hybrid Attention for Efficient LLMs Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T17:39:18.387881Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.07394"},"observation_digest":"sha256:18fc519a31a7ff25d2153bbfb7b67ca7866f9809210062aa87343055e520b5df","observation_id":"5e55b46c-36ad-4d78-bbcb-214993daef6a","resolution":{"observed_at":"2026-05-11T06:25:58.336348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.07883","last_updated":"2026-04-09T06:51:32Z","snapshot_observed_at":"2026-07-06T22:57:05.146373Z","submitted_at":"2026-04-09T06:51:32Z","title":"An Agentic Evaluation Architecture for Historical Bias Detection in Educational Textbooks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T17:14:21.744708Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.07883"},"observation_digest":"sha256:375adcdd37555db573f7672fa6aa42f08223bb5c7bf29f67004dca485ae1b545","observation_id":"1913ff30-3594-4860-a0d7-408dad20b45a","resolution":{"observed_at":"2026-05-11T07:16:08.800354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.07981","last_updated":"2026-04-09T08:51:47Z","snapshot_observed_at":"2026-08-05T18:06:44.297905Z","submitted_at":"2026-04-09T08:51:47Z","title":"A Decomposition Perspective to Long-context Reasoning for LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T18:05:34.666937Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.07981"},"observation_digest":"sha256:8a85a7aefe253015109aee20f82809162d1345b92f7126c696d4433319778dca","observation_id":"ac08603e-afbd-47b5-82ff-50e62885f05a","resolution":{"observed_at":"2026-05-11T05:30:59.910617Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.09604","last_updated":"2026-03-10T10:38:47Z","snapshot_observed_at":"2026-08-03T01:33:20.279162Z","submitted_at":"2026-03-10T10:38:47Z","title":"LLMs for Text-Based Exploration and Navigation Under Partial Observability","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T14:08:14.290030Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.09604"},"observation_digest":"sha256:3ddbf24ebf7246b70ba958dc4324df6f1ba63f8b9bfbd45c683c85bf3b8a232b","observation_id":"4843e0e7-8754-41b6-9fd6-979446ab10e2","resolution":{"observed_at":"2026-05-15T14:10:03.241583Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.10539","last_updated":"2026-04-12T09:02:20Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T09:02:20Z","title":"IceCache: Memory-efficient KV-cache Management for Long-Sequence LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T15:46:43.682254Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.10539"},"observation_digest":"sha256:55e5e2aba1f4d49907cc826bb1739fb77136ebf989e09bb38871ded1ce601dbd","observation_id":"d0866204-99f7-4903-8693-3fea8f0dde9d","resolution":{"observed_at":"2026-05-11T09:51:01.262659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.12452","last_updated":"2026-04-16T06:26:39Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:40:31Z","title":"Latent-Condensed Transformer for Efficient Long Context Modeling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:11:15.970619Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.12452"},"observation_digest":"sha256:bddcafcc17d3c85b7c3fa0d7816cf9b64265b822357e290d05dcf97ca3b6e1ad","observation_id":"b03745c2-44dc-4a71-9d57-28b9cc224403","resolution":{"observed_at":"2026-05-11T11:01:18.525152Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.14922","last_updated":"2026-04-16T12:06:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T12:06:59Z","title":"LongAct: Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-10T11:17:43.769244Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.14922"},"observation_digest":"sha256:669b6f36f9b7f6c0367d1cbb63db920e0f2311f6940a90f6659c995141525950","observation_id":"2c522065-4907-43d8-8f0f-618a80b35959","resolution":{"observed_at":"2026-05-11T03:55:20.729537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.15732","last_updated":"2026-04-17T06:16:32Z","snapshot_observed_at":"2026-08-02T15:30:13.684807Z","submitted_at":"2026-04-17T06:16:32Z","title":"Accuracy Is Speed: Towards Long-Context-Aware Routing for Distributed LLM Serving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T08:15:45.474618Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.15732"},"observation_digest":"sha256:93b6108f99c987fc7f07f6751666e1ee8cd0895a2a24e78037f8bf0af89c8e5c","observation_id":"1dd097fd-afd3-47d9-a0b4-cce1b70b0faa","resolution":{"observed_at":"2026-05-11T03:55:20.729537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.16197","last_updated":"2026-07-19T20:58:40Z","snapshot_observed_at":"2026-08-02T16:12:05.608942Z","submitted_at":"2026-04-17T16:07:11Z","title":"Sketching the Readout of Large Language Models for Scalable Data Attribution and Valuation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T08:47:36.122054Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.16197"},"observation_digest":"sha256:8a5a70c7c3de195467d73093e14b5a882c9a2e7db2548ce96122128853653932","observation_id":"627f991a-e373-42c7-abd8-65b46e9d2184","resolution":{"observed_at":"2026-05-11T03:55:20.729537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-02T16:12:09.034012Z","title":"Ruler: What’s the real context size of your long-context language models?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.16197","last_updated":"2026-07-19T20:58:40Z","snapshot_observed_at":"2026-08-02T16:12:05.608942Z","submitted_at":"2026-04-17T16:07:11Z","title":"Sketching the Readout of Large Language Models for Scalable Data Attribution and Valuation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T16:12:09.034012Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.16197"},"observation_digest":"sha256:4381f540db73a25390f2185941805c70915a9810379f9e95e7b558dc61782741","observation_id":"21bdfb0c-0a2a-4d04-88a1-c5fc96f4dc7e","resolution":{"observed_at":"2026-08-02T16:12:09.034012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.16424","last_updated":"2026-04-04T13:08:38Z","snapshot_observed_at":"2026-07-06T23:03:43.854612Z","submitted_at":"2026-04-04T13:08:38Z","title":"Safety, Security, and Cognitive Risks in State-Space Models: A Systematic Threat Analysis with Spectral, Stateful, and Capacity Attacks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T17:34:13.306368Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.16424"},"observation_digest":"sha256:a0c8422d333018f8caca168f30498c279acdee9a84c8f55633e65aacb8ffca57","observation_id":"4a60d32d-20ae-42bd-9626-fdfbb2b83b5c","resolution":{"observed_at":"2026-05-13T17:38:02.858411Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.17535","last_updated":"2026-04-19T16:53:56Z","snapshot_observed_at":"2026-07-06T23:04:37.370465Z","submitted_at":"2026-04-19T16:53:56Z","title":"OPSDL: On-Policy Self-Distillation for Long-Context Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T06:07:36.830550Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.17535"},"observation_digest":"sha256:25c597181477eb21f9e1828caccfd9929d72c4ea1cbdc6ec64aad4620a0d4076","observation_id":"7fcde247-6323-4813-b27f-f683c2a931a5","resolution":{"observed_at":"2026-05-11T03:55:20.729537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.18788","last_updated":"2026-04-20T19:52:56Z","snapshot_observed_at":"2026-07-31T18:40:43.182032Z","submitted_at":"2026-04-20T19:52:56Z","title":"Efficient Mixture-of-Experts LLM Inference with Apple Silicon NPUs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T05:31:25.826205Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.18788"},"observation_digest":"sha256:e672da699bb3a6de1e79e43625c94a15ae41e56c1bd852eaf28dedbcd42dd8e6","observation_id":"bef82562-8fb8-4d06-8a3d-1e2707279f21","resolution":{"observed_at":"2026-05-11T03:55:20.729537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.19021","last_updated":"2026-05-03T07:41:57Z","snapshot_observed_at":"2026-07-06T23:05:44.499005Z","submitted_at":"2026-04-21T03:15:28Z","title":"FG$^2$-GDN: Enhancing Long-Context Gated Delta Networks with Doubly Fine-Grained Control","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T02:27:18.261984Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.19021"},"observation_digest":"sha256:a5a209dd3d2e9a3750b3949fefcf80d10b9888e31cfa78198b68521b3246250b","observation_id":"3b303e5e-d194-4906-a476-032d21c63f00","resolution":{"observed_at":"2026-05-11T13:01:23.288038Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.21100","last_updated":"2026-04-22T21:38:25Z","snapshot_observed_at":"2026-08-02T18:50:20.662385Z","submitted_at":"2026-04-22T21:38:25Z","title":"Preconditioned DeltaNet: Curvature-aware Sequence Modeling for Linear Recurrences","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-10T00:19:24.366922Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.21100"},"observation_digest":"sha256:263c61abcff5cd5195742c4025017b7a71ddab22331bc6f959c2f8a987d7b75b","observation_id":"2be0bae8-abfc-478d-827e-680695ee103a","resolution":{"observed_at":"2026-05-11T03:55:20.729537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.21100","last_updated":"2026-04-22T21:38:25Z","snapshot_observed_at":"2026-08-02T18:50:20.662385Z","submitted_at":"2026-04-22T21:38:25Z","title":"Preconditioned DeltaNet: Curvature-aware Sequence Modeling for Linear Recurrences","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-10T00:19:24.366922Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.21100"},"observation_digest":"sha256:09ab6d4e67029fb375c029847fbaf9d11342263f7958c5d4594b440af1fa6d05","observation_id":"3748fe0d-a1a4-46e4-8292-80c92f94991f","resolution":{"observed_at":"2026-05-11T03:55:20.729537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.22117","last_updated":"2026-04-28T07:34:34Z","snapshot_observed_at":"2026-07-06T23:08:33.204647Z","submitted_at":"2026-04-23T23:32:36Z","title":"PermaFrost-Attack: Stealth Pretraining Seeding(SPS) for planting Logic Landmines During LLM Training","version":2},"reference_index":135,"source":"arxiv_source","source_observed_at":"2026-05-09T21:42:16.848186Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.22117"},"observation_digest":"sha256:184f62dada7162c454217b0911bd938c1052ea222020d0e00db5e15d8d702bf6","observation_id":"8055a87f-e8df-4c47-96c0-0d359630a900","resolution":{"observed_at":"2026-05-11T14:31:06.166463Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.22575","last_updated":"2026-04-24T14:07:54Z","snapshot_observed_at":"2026-07-06T23:08:56.419589Z","submitted_at":"2026-04-24T14:07:54Z","title":"SpikingBrain2.0: Brain-Inspired Foundation Models for Efficient Long-Context and Cross-Platform Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T12:18:23.898779Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.22575"},"observation_digest":"sha256:94ee97b9ce35bf7ea91ab4574013ca4707c84493d7a08dcfa82a6916997daebd","observation_id":"c5039a83-775f-4172-897d-957dbea5187e","resolution":{"observed_at":"2026-05-11T19:21:06.767351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2604.24715","last_updated":"2026-04-27T17:23:37Z","snapshot_observed_at":"2026-08-02T10:33:56.860167Z","submitted_at":"2026-04-27T17:23:37Z","title":"Long-Context Aware Upcycling: A New Frontier for Hybrid LLM Scaling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T03:39:37.485602Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2604.24715"},"observation_digest":"sha256:17b42c8c9bac3c1300e8ffad8d2bb1124e0a19cf5a5017b84b790762d8db31a9","observation_id":"e04db42f-7aba-419c-ae77-8850bf5538bd","resolution":{"observed_at":"2026-05-11T22:01:10.827615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2605.00072","last_updated":"2026-04-30T11:50:32Z","snapshot_observed_at":"2026-07-06T23:13:33.799847Z","submitted_at":"2026-04-30T11:50:32Z","title":"XekRung Technical Report","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-09T20:55:10.400291Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2605.00072"},"observation_digest":"sha256:a414c55bf93a4bafd197ed67be5b2b6e1a81c0214f03ac3134d6de6cf1112f60","observation_id":"c9c5bd04-e8ad-4ecb-8b64-d02873354c3e","resolution":{"observed_at":"2026-05-11T14:51:14.611980Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2605.00292","last_updated":"2026-05-07T01:55:25Z","snapshot_observed_at":"2026-08-01T20:53:34.373171Z","submitted_at":"2026-04-30T23:31:10Z","title":"Caracal: Causal Architecture via Spectral Mixing","version":2},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-05-09T19:42:17.090149Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2605.00292"},"observation_digest":"sha256:b0ea7ed22281ceea18e4e035e4d9032ee9c3d2df80f850a204211cd6f72a42ee","observation_id":"457c3131-b36a-4a3f-83e2-a81d85059300","resolution":{"observed_at":"2026-05-11T15:31:21.922011Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2605.00300","last_updated":"2026-05-01T00:05:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-01T00:05:54Z","title":"Token Arena: A Continuous Benchmark Unifying Energy and Cognition in AI Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-09T20:13:18.892594Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2605.00300"},"observation_digest":"sha256:5aec30a421cf1cc9c3db7bbc454c5f9eb1da879cc8a437895178657c0f3263b5","observation_id":"3375531b-8e80-43f6-bfa5-48a806673c46","resolution":{"observed_at":"2026-05-11T15:21:07.368057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2605.00336","last_updated":"2026-05-01T01:34:53Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:34:53Z","title":"Budget-Aware Routing for Long Clinical Text","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-09T19:59:00.888734Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2605.00336"},"observation_digest":"sha256:e326f21f96dcd7198ceff810eb5aa463db0433c879c7d83540048d231fa6b008","observation_id":"4895ebfb-043d-460a-8f75-fd71fb5297c4","resolution":{"observed_at":"2026-05-11T15:26:10.210440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2605.02173","last_updated":"2026-05-04T03:05:56Z","snapshot_observed_at":"2026-07-29T15:21:30.847953Z","submitted_at":"2026-05-04T03:05:56Z","title":"Retrieval and Multi-Hop Reasoning in 1M-Token Context Windows: Evaluating LLMs on Classical Chinese Text","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-09T16:46:02.443761Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2605.02173"},"observation_digest":"sha256:b2c201170e953b862383751b70c29b76e5266517e0549054bf219bccc02658ca","observation_id":"416dbbb6-26fa-46f4-a2d3-064d3ed7371b","resolution":{"observed_at":"2026-05-11T16:26:09.833550Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2605.02209","last_updated":"2026-05-04T04:17:02Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T04:17:02Z","title":"Submodular Benchmark Selection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T19:23:51.649257Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2605.02209"},"observation_digest":"sha256:80166c9e741c3adfdb7252f51d28c2448a33669caf0a3029308447a8c689a4ed","observation_id":"fb63fe8c-5805-4bb9-bb99-82320b417abd","resolution":{"observed_at":"2026-05-11T03:55:20.729537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2605.02568","last_updated":"2026-05-04T13:19:29Z","snapshot_observed_at":"2026-07-31T19:18:10.074012Z","submitted_at":"2026-05-04T13:19:29Z","title":"StreamIndex: Memory-Bounded Compressed Sparse Attention via Streaming Top-k","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-08T18:44:42.456111Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2605.02568"},"observation_digest":"sha256:0b66c4a2ddb35b7c076771f249c5aee9ceba1bef8beb5a8f466748ab990c7741","observation_id":"18d84944-c4db-43eb-b9fe-89ca4e28493b","resolution":{"observed_at":"2026-05-11T03:55:20.729537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2605.04257","last_updated":"2026-05-05T19:49:36Z","snapshot_observed_at":"2026-08-02T18:12:45.223294Z","submitted_at":"2026-05-05T19:49:36Z","title":"HUGO-CS: A Hybrid-Labeled, Uncertainty-Aware, General-Purpose, Observational Dataset for Cold Spray","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T18:42:54.300521Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2605.04257"},"observation_digest":"sha256:d1ba034207b2aa335158e2236fbc1e7ea333c6d166a42cba9c14786967200835","observation_id":"d29a5fe4-6636-4863-b7e5-89e512a7d16b","resolution":{"observed_at":"2026-05-11T03:55:20.729537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2605.04496","last_updated":"2026-05-06T04:55:59Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T04:55:59Z","title":"SCOUT: Active Information Foraging for Long-Text Understanding with Decoupled Epistemic States","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-08T17:20:53.540362Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2605.04496"},"observation_digest":"sha256:1570cfb921de20c09bca0a66bd049e050ce29737700aa6f8d737bf174e04e8ff","observation_id":"6abee6b9-d273-40b6-8280-62053a133272","resolution":{"observed_at":"2026-05-11T17:41:06.832357Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2404.06654/citation-record","integrity":"/paper/2404.06654/integrity","json":"/paper/2404.06654/citation-record.json","paper":"/paper/2404.06654"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":"2404.14219","doi":"10.48550/arxiv.2404.14219","metadata_source":"pith","pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","venue":"cs.CL","work_id":"feef9556-a016-493c-abd2-0c97a23a7ebf","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:8f5359d21946775ff9bb6b3cf448160a65de2e9a4059b3be11bc6ac96aa9f72f","observation_id":"26815c88-fcda-4432-8233-826a8684642f","resolution":{"observed_at":"2026-05-11T03:55:20.583432Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11018","last_updated":"2024-10-17T17:45:09Z","snapshot_observed_at":"2026-07-06T18:01:18.745347Z","submitted_at":"2024-04-17T02:49:26Z","title":"Many-Shot In-Context Learning","version":3},"cited_work":{"arxiv_id":"2404.11018","doi":"10.48550/arxiv.2404.11018","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Many-shot in-context learning","venue":"arXiv (Cornell University)","work_id":"1ff25d89-9966-4623-9f61-876eb43549b4","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2404.11018","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:1fc70d4079551469edf15e908df23893d44c0865a21cdea9893a3a680fa13c6c","observation_id":"91fcfe3a-e6c9-4c4c-9a5e-c440418add1e","resolution":{"observed_at":"2026-05-11T03:55:20.460412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-02T11:20:36.216220Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":"2308.14508","doi":"10.48550/arxiv.2308.14508","metadata_source":"pith","pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","venue":"cs.CL","work_id":"ba7831c4-9427-4e0e-a5c1-4e98511f4b53","year":2023},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:78f4a643e2ec1750330200637504beec3e28a43e80cf6e916082baa13000adf4","observation_id":"db3a4c21-bb2c-44ab-b8f3-fb75df253997","resolution":{"observed_at":"2026-05-12T20:22:11.032040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04517","last_updated":"2024-12-06T15:42:07Z","snapshot_observed_at":"2026-08-01T08:27:42.920637Z","submitted_at":"2024-05-07T17:50:21Z","title":"xLSTM: Extended Long Short-Term Memory","version":2},"cited_work":{"arxiv_id":"2405.04517","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.04517","snapshot_observed_at":"2026-07-10T01:36:43.972832Z","title":"xlstm: Extended long short-term memory","venue":"cs.LG","work_id":"cd8ee2fb-957f-4f9d-bdf9-e168fba4c2b8","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2405.04517","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:6e78c188791ac8f4c9360601c8b68c531684e1e53c7eae9ed83da18b7dbd34e0","observation_id":"10c3e557-1ea9-48bf-bf24-7eab00852f92","resolution":{"observed_at":"2026-05-11T03:55:20.472002Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00200","last_updated":"2025-03-03T19:53:28Z","snapshot_observed_at":"2026-08-04T16:59:22.807968Z","submitted_at":"2024-04-30T21:06:52Z","title":"In-Context Learning with Long-Context Models: An In-Depth Exploration","version":2},"cited_work":{"arxiv_id":"2405.00200","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00200","snapshot_observed_at":"2026-07-03T09:17:48.381748Z","title":"Gormley, and Graham Neubig","venue":null,"work_id":"16af75a7-d946-4ab5-a85c-1a423767113b","year":2025},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2405.00200","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:f62d792669d2faf95dbe40436a2f32cb5911ba825431131a6a7ebe046d2d5b4e","observation_id":"546bfbad-7e42-4abe-b378-39e7f4c5320d","resolution":{"observed_at":"2026-05-11T03:55:20.476582Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11062","last_updated":"2024-02-06T10:16:54Z","snapshot_observed_at":"2026-07-06T15:18:26.300068Z","submitted_at":"2023-04-19T16:18:54Z","title":"Scaling Transformer to 1M tokens and beyond with RMT","version":2},"cited_work":{"arxiv_id":"2304.11062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.11062","snapshot_observed_at":"2026-06-28T17:42:25.966370Z","title":"Scaling transformer to 1m tokens and beyond with rmt","venue":null,"work_id":"f5b46c3e-9f26-481f-a773-689cbd972ec4","year":2023},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2304.11062","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:3bd77b6aac8167b03f99990adc37dfcd06a4f24bac75a9fd15242613fe2b4dc7","observation_id":"4952204a-48e1-4565-b871-b3998a2ead14","resolution":{"observed_at":"2026-05-11T03:55:20.480965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":"1904.10509","doi":"10.48550/arxiv.1904.10509","metadata_source":"pith","pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generating Long Sequences with Sparse Transformers","venue":"cs.LG","work_id":"c5b81688-45ee-4a9a-b095-e6290f45cb6c","year":2019},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:7586142031d47eebd7c127e108e8b3f8288c60a9199672faacec5b2847703a95","observation_id":"fcf158ed-a220-49fa-8a17-c0326fb73b8c","resolution":{"observed_at":"2026-05-11T03:55:20.484767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":"2307.08691","doi":"10.48550/arxiv.2307.08691","metadata_source":"pith","pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","venue":"cs.LG","work_id":"fff3953b-5efb-4753-bee4-002f59995810","year":2023},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:8b2aff15afe3f920abf55c806545406f859c99f0a7f9ee87714af10bcf501201","observation_id":"caac8aa9-2118-417f-aebd-94d2ca96fd28","resolution":{"observed_at":"2026-05-11T03:55:20.489912Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing dbrx: A new state-of-the-art open llm","venue":null,"work_id":"0ff3ae18-8640-4332-af6b-3ae41908d0dc","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:c647ca8d74d476f8b183050faab11ca450ab975768049a6f85c0de4e5d5baf6f","observation_id":"bfbdb15a-e16a-41f4-b7c0-e8ae7894f851","resolution":{"observed_at":"2026-05-11T03:55:20.667175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:5f1140ed6be9e4308b87555bbd2811564571363de6a5e5c401d3dab66a794944","observation_id":"4272cbb2-d1e6-4182-9ba8-2c942d28a784","resolution":{"observed_at":"2026-05-11T03:55:20.565845Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13753","last_updated":"2024-02-21T12:30:33Z","snapshot_observed_at":"2026-08-02T12:47:57.325302Z","submitted_at":"2024-02-21T12:30:33Z","title":"LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens","version":1},"cited_work":{"arxiv_id":"2402.13753","doi":"10.48550/arxiv.2402.13753","metadata_source":"pith","pith_arxiv_id":"2402.13753","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens","venue":"cs.CL","work_id":"41fabff1-11da-43da-8efd-2eb55186b9f2","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2402.13753","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:fd5f8e41ab4580692cb4badc90f53abe9254c558af9970b82141dcacfa32ca69","observation_id":"96f97e74-23c5-4e4f-82f7-7a225283de2a","resolution":{"observed_at":"2026-05-15T08:31:04.851790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13345","last_updated":"2024-03-19T09:00:32Z","snapshot_observed_at":"2026-07-06T16:22:42.704981Z","submitted_at":"2023-09-23T11:36:15Z","title":"BAMBOO: A Comprehensive Benchmark for Evaluating Long Text Modeling Capacities of Large Language Models","version":3},"cited_work":{"arxiv_id":"2309.13345","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.13345","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X., and Wen, J.-R","venue":null,"work_id":"fef3b87e-4dfd-4dc7-aaaf-47745e85af2a","year":2023},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2309.13345","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:8e4ea5ad148affc869f16723ce4a7f9d2b118c2b90340413beea2a7c79b5ef0c","observation_id":"9992c9b5-ee95-4f34-997e-1a16d5143b5f","resolution":{"observed_at":"2026-05-11T03:55:20.575906Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-03T09:02:39.861878Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:8c7ccec7e3fd41087e37cb591547f0ed961cdadfa01080a71aa4bf285695dabf","observation_id":"e1181f8f-1386-4869-85a9-5b1aae4af19d","resolution":{"observed_at":"2026-05-11T03:55:20.448654Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00402","last_updated":"2025-07-06T08:13:18Z","snapshot_observed_at":"2026-07-31T17:16:16.006644Z","submitted_at":"2024-06-29T11:09:47Z","title":"Is It Really Long Context if All You Need Is Retrieval? Towards Genuinely Difficult Long Context NLP","version":4},"cited_work":{"arxiv_id":"2407.00402","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00402","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is it really long context if all you need is retrieval? towards genuinely difficult long context nlp","venue":null,"work_id":"01c604f9-983e-4a9b-8ba8-2a92f1dd22e1","year":null},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2407.00402","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:c08757cbf910bb3202ef7161fe93ed8e0cb48964ab68b3e99b0ad2e84a8fe475","observation_id":"adbdbc9b-9d39-4a1b-a17d-3da4800870bc","resolution":{"observed_at":"2026-05-11T03:55:20.587514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1410.5401","last_updated":"2014-12-10T16:01:39Z","snapshot_observed_at":"2026-08-01T22:22:04.725773Z","submitted_at":"2014-10-20T19:28:26Z","title":"Neural Turing Machines","version":2},"cited_work":{"arxiv_id":"1410.5401","doi":"10.48550/arxiv.1410.5401","metadata_source":"pith","pith_arxiv_id":"1410.5401","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Turing Machines","venue":"cs.NE","work_id":"0a5ce53c-9670-42b9-8be5-386de7eed50c","year":2014},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/1410.5401","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:283514f0d4076781fbc849054210d66fb523252f693a085d5e72027fab2eb7c5","observation_id":"dedbc471-1d7d-4f8f-a39b-82ce5d8ac187","resolution":{"observed_at":"2026-05-13T07:34:44.411886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T23:19:27.735387+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T23:19:27.735387+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":"2312.00752","doi":"10.48550/arxiv.2312.00752","metadata_source":"pith","pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","venue":"cs.LG","work_id":"4ee75248-1199-492c-a52f-6661e0f4adff","year":2023},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:ad8a18c2bee1a191f56eae1c5f942d1f355def1e60f4562e26160f896fd0b859","observation_id":"8360b882-591c-4233-9a15-0460bbe4a952","resolution":{"observed_at":"2026-05-11T03:55:20.620132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16137","last_updated":"2024-06-24T21:22:00Z","snapshot_observed_at":"2026-07-31T23:13:29.378237Z","submitted_at":"2023-08-30T16:47:51Z","title":"LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language Models","version":7},"cited_work":{"arxiv_id":"2308.16137","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.16137","snapshot_observed_at":"2026-07-04T16:59:58.965650Z","title":"Lm- infinite: Simple on-the-fly length generalization for large language models","venue":null,"work_id":"62f73354-8046-4134-b4e3-1bfab8df2d99","year":2023},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2308.16137","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:3ca01bcc0a28a3de3e015043e92e97d2e71ec9c05de0d2a832214d723104dfd3","observation_id":"fbe42069-2855-4559-b05c-d2537847f947","resolution":{"observed_at":"2026-05-11T03:55:20.625562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":"2309.14509","doi":"10.48550/arxiv.2309.14509","metadata_source":"pith","pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","venue":"cs.LG","work_id":"bb119d0b-c7f0-412a-a426-f74bd6949a51","year":2023},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:f1d5d23378253968b6b4a7acb98e45f2808b749faf3f2976ebd3c48380dc01ec","observation_id":"7632e926-8083-4a5c-92d3-219d739e4ae2","resolution":{"observed_at":"2026-05-13T01:07:22.650116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":"2401.04088","doi":"10.48550/arxiv.2401.04088","metadata_source":"pith","pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixtral of Experts","venue":"cs.LG","work_id":"0de8c352-9daa-4e1e-8c7b-3d0dec69f369","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:8214902ce3cd45748b9b8daea4f34b07338be286543fa169243d9b85c3d52577","observation_id":"49d4e094-3781-408e-afac-9381e65c4538","resolution":{"observed_at":"2026-05-11T03:55:20.638569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06839","last_updated":"2024-08-12T03:53:35Z","snapshot_observed_at":"2026-07-06T16:30:41.852589Z","submitted_at":"2023-10-10T17:59:58Z","title":"LongLLMLingua: Accelerating and Enhancing LLMs in Long Context Scenarios via Prompt Compression","version":2},"cited_work":{"arxiv_id":"2310.06839","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.06839","snapshot_observed_at":"2026-07-10T01:36:44.274003Z","title":"Longllmlingua: Accelerating and enhancing llms in long context scenarios via prompt compression","venue":"cs.CL","work_id":"216713e7-eb05-4ec2-b67c-cd543ff0d117","year":2023},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2310.06839","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:d80e673fe79c68c90b02562db89fef3dbbf2b650aae4f4e38b32fb5836c63078","observation_id":"b7daf39e-08a9-45d7-9a3a-8c5d5137b215","resolution":{"observed_at":"2026-05-11T03:55:20.645643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16264","last_updated":"2024-10-22T15:09:58Z","snapshot_observed_at":"2026-07-06T18:35:45.699877Z","submitted_at":"2024-06-24T02:03:57Z","title":"One Thousand and One Pairs: A \"novel\" challenge for long-context language models","version":3},"cited_work":{"arxiv_id":"2406.16264","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16264","snapshot_observed_at":"2026-07-03T19:28:52.491023Z","title":"One thousand and one pairs: A\" novel\" challenge for long-context language models.arXiv preprint arXiv:2406.16264","venue":null,"work_id":"80e23d96-4416-4320-b56b-9b11c3349ecd","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2406.16264","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:4aa92c62b03aa007d4c43ba8e1ef01e8e4174dcb4398409d48552b2c04a3bf6a","observation_id":"f8bbca0f-b3e3-4670-a060-d9685fb5b464","resolution":{"observed_at":"2026-05-11T03:55:20.651601Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10149","last_updated":"2024-11-06T14:50:40Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:00:29Z","title":"BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack","version":2},"cited_work":{"arxiv_id":"2406.10149","doi":"10.48550/arxiv.2406.10149","metadata_source":"pith","pith_arxiv_id":"2406.10149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Bulatov, Petr Anokhin, Ivan Rodkin, Dmitry Sorokin, Artyom Y","venue":"cs.CL","work_id":"3c13d7c5-4137-4127-9390-500e01f37de6","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2406.10149","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:a5030d6cd68325df52321e994cbeb7469ad2fe898f96a0d966b8d7f6b4ab6a21","observation_id":"dcbe3a3d-3b5a-46fa-b0fa-600ee6d9fdf8","resolution":{"observed_at":"2026-05-11T03:55:20.655690Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13121","last_updated":"2024-06-19T00:28:58Z","snapshot_observed_at":"2026-07-06T18:33:24.206083Z","submitted_at":"2024-06-19T00:28:58Z","title":"Can Long-Context Language Models Subsume Retrieval, RAG, SQL, and More?","version":1},"cited_work":{"arxiv_id":"2406.13121","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.13121","snapshot_observed_at":"2026-07-03T20:48:55.205497Z","title":"Can long-context lan- guage models subsume retrieval, rag, sql, and more?","venue":null,"work_id":"2d2ca8bd-142a-4b7e-b0e5-e57558616422","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2406.13121","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:2d32129acc4edf231f2484a9429825770f922332cd4f4af82c2cf7957ea7f3da","observation_id":"a5b23d56-d3ca-4d81-a5b5-7ceea9d261ef","resolution":{"observed_at":"2026-05-11T03:55:20.663710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14848","last_updated":"2024-07-10T17:01:37Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-19T16:04:53Z","title":"Same Task, More Tokens: the Impact of Input Length on the Reasoning Performance of Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14848","snapshot_observed_at":"2026-07-03T17:18:44.146415Z","title":"arXiv preprint arXiv:2402.14848 , year=","venue":null,"work_id":"65c67986-25d0-42a3-9a20-9a7c1528e845","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2402.14848","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:c0d68b7599c320b25ca1a323556bce16327bd5551b3ee4498d7aa34e9bc4b0b6","observation_id":"0edffe73-7ca3-4eec-a313-dde7174a971c","resolution":{"observed_at":"2026-05-11T03:55:20.495161Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04939","last_updated":"2024-09-06T05:06:51Z","snapshot_observed_at":"2026-07-06T16:44:55.494764Z","submitted_at":"2023-11-08T01:45:37Z","title":"LooGLE: Can Long-Context Language Models Understand Long Contexts?","version":2},"cited_work":{"arxiv_id":"2311.04939","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04939","snapshot_observed_at":"2026-06-30T13:44:41.798978Z","title":"2311.04939 , archivePrefix=","venue":null,"work_id":"6c3139c6-2a19-401e-b498-f223cf0c76ea","year":2023},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2311.04939","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:b4ffc5ae27468d47f1977c18bcd2c65ebb71996aa5586776d24f5941f45b00b3","observation_id":"707ac0af-f3af-48f0-a13a-6b7d55ca813e","resolution":{"observed_at":"2026-05-11T03:55:20.499754Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":"2402.08268","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-07-04T10:59:46.566942Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","venue":"cs.LG","work_id":"162054d2-6f8e-4dc0-87b8-ebff78210c7c","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:8475034aaeb5706fd77c7c249dd818a6214b46ac6b0301cec91103c44830a156","observation_id":"fd3c681b-0144-4204-90a7-184b19b29814","resolution":{"observed_at":"2026-05-16T06:36:57.375169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"13 Published as a conference paper at COLM 2024 Amirkeivan Mohtashami and Martin Jaggi","venue":null,"work_id":"abc6042a-b55d-41c3-81bd-e4a4765eb269","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:ec07fe1a9bf19b3f892bc5aff5913197da63442003e8b9992534bee7cd10e271","observation_id":"2488c650-e8c8-4725-8b5c-caff1577c3cd","resolution":{"observed_at":"2026-05-11T03:55:20.698942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:4743f9061ee8d8fed9ef00cc91d623dd8771f40fb511369a9b3e78106ff82057","observation_id":"0d9ede78-0dc0-46df-b4ed-3225792dced5","resolution":{"observed_at":"2026-05-11T03:55:20.508468Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:20297cea651cb87aebab08227441173251bd883476a6266e9a8362fbb725bda2","observation_id":"546d3613-67ae-4eed-97a1-123e71a43bab","resolution":{"observed_at":"2026-05-11T03:55:20.512423Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":"2104.09864","doi":"10.48550/arxiv.2104.09864","metadata_source":"pith","pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","venue":"cs.CL","work_id":"4e5eee26-cd04-4c7a-988f-3e6d1a1f0eb9","year":2021},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:d638ebf0828ef8b7abc073c76a8002b8593e0d43c5f27dd59eedd5683accd4d5","observation_id":"2c9d5a88-949a-42fa-a0fe-212500069806","resolution":{"observed_at":"2026-05-11T03:55:20.516088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:47.452101+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:47.452101+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ChapterBreak: A challenge dataset for long-range language models","venue":null,"work_id":"89835375-8048-4501-81e1-8340d4aea708","year":2022},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:c0ff5ec57264bbb1031de384789d45aedade3da859146d2e564d6328ad21e6da","observation_id":"a248afd9-12bf-4be3-bc54-9f7008611b69","resolution":{"observed_at":"2026-05-11T03:55:20.716256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":"2307.08621","doi":"10.48550/arxiv.2307.08621","metadata_source":"pith","pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","venue":"cs.CL","work_id":"5b0449ac-92b0-41f2-8b4f-586c2b5a08b6","year":2023},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:3dd53429c5cf456af5fe80b6f25e6c1f6ea6059ecc04aecb399781ef24c7b6de","observation_id":"5c109a87-4bd6-487b-9095-ad80b976613f","resolution":{"observed_at":"2026-05-11T20:30:00.053340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:989d152324b9ae11aa93627c0ad99a9e565786f7a45894d73a23cb57a4f43b16","observation_id":"8ccd186c-3cdf-4958-a6c2-eabef6a6981b","resolution":{"observed_at":"2026-05-11T03:55:20.524488Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":"1910.03771","doi":"10.48550/arxiv.1910.03771","metadata_source":"pith","pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","venue":"cs.CL","work_id":"9d86da8d-01d3-41af-a0d2-ee14897927a9","year":2019},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:5ecbf17da4c6a416700e7bafdd8668cf9b60623c6c0f283c91b06711b2304ef9","observation_id":"a0f1f828-c510-4779-8951-5e8e7ee35b41","resolution":{"observed_at":"2026-05-11T14:54:00.336000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04617","last_updated":"2024-05-28T12:05:12Z","snapshot_observed_at":"2026-07-06T17:26:39.109878Z","submitted_at":"2024-02-07T06:50:42Z","title":"InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory","version":2},"cited_work":{"arxiv_id":"2402.04617","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04617","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infllm: Unveiling the intrinsic capacity of llms for under- standing extremely long sequences with training-free memory","venue":null,"work_id":"45ccf018-82ed-4c2e-b31c-ae31d8346349","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2402.04617","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:c3bef2c56e45534b6dab592ebf1ffd6347f26caa70c38adc5518f704e9764e70","observation_id":"1708376e-0b7e-4515-9f58-d8f5c3b9e49a","resolution":{"observed_at":"2026-05-11T03:55:20.538903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16695","last_updated":"2024-12-02T20:23:49Z","snapshot_observed_at":"2026-07-06T18:50:52.800619Z","submitted_at":"2024-07-23T17:57:41Z","title":"Stress-Testing Long-Context Language Models with Lifelong ICL and Task Haystack","version":2},"cited_work":{"arxiv_id":"2407.16695","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.16695","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retrieval meets long context large language models","venue":null,"work_id":"788bc0ea-8ee7-4157-b131-0883a9109766","year":null},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2407.16695","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:aacf3babfe48d15ef637c8612da52288d62b521812cd7888c329bb82d0cc8e1c","observation_id":"4f4e2a7f-7752-4d46-91f3-146f71fb30ec","resolution":{"observed_at":"2026-05-11T03:55:20.543579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":"2403.04652","doi":"10.48550/arxiv.2403.04652","metadata_source":"pith","pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Yi: Open Foundation Models by 01.AI","venue":"cs.CL","work_id":"8efee8a1-5e3c-4851-9c65-18e3d1d9e769","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:993cf02e93b2d1abd9e3c88be251ce51929201b30023e869937a4c14500eeaad","observation_id":"40989b32-6885-4a23-bb54-617693c80ad7","resolution":{"observed_at":"2026-05-13T05:47:28.044136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2402.05136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T15:25:48.110956Z","title":"LV-Eval: A balanced long-context benchmark with 5 length levels up to 256K","venue":null,"work_id":"f9d0736d-ad1a-4059-aaec-2fde79a17bb8","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:f86b47d9bd179724899a6fa375c460d967a4dd17a7b2cd4af39ed0b6bad64148","observation_id":"3c5a932c-fc4d-4da2-81cb-c18a3f84f4dd","resolution":{"observed_at":"2026-05-11T03:55:20.554746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03462","last_updated":"2024-10-11T02:18:24Z","snapshot_observed_at":"2026-08-05T14:53:23.650244Z","submitted_at":"2024-01-07T11:57:40Z","title":"Long Context Compression with Activation Beacon","version":3},"cited_work":{"arxiv_id":"2401.03462","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.03462","snapshot_observed_at":"2026-07-10T01:36:44.299242Z","title":"Soaring from 4k to 400k: Extending llm’s context with activation beacon","venue":"cs.CL","work_id":"78aba7c2-bb5d-41b3-91fb-d31607f3960a","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2401.03462","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:19e7c87cb212d59ea3d9a83dfac770013da83394ef02c0584a7e6661b74377ec","observation_id":"149cf2aa-b89b-4781-9b9a-cdc56f990a96","resolution":{"observed_at":"2026-05-11T03:55:20.559332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Our results in the main text only include aligned models (GPT-4, Gemini-1.5, and 15 open-source models)","venue":null,"work_id":"0ac1f63b-2830-4559-a3c1-d7aa08dedb5a","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:b710aa2f2dcd50ca2e06d9a09ce718113070bcaf03c54fd5f0e8923718bd9ab6","observation_id":"b7966c14-d3d8-4b0c-b65d-f5639509e98c","resolution":{"observed_at":"2026-05-11T03:55:20.701841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"470e1974-87e4-4c5d-9955-ae746cae1e98","year":2023},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:ca53427abe9097c755280c45c617865eba345a58f32383035029b818c8680b59","observation_id":"7af95bc5-357f-4648-a97b-a855b431db77","resolution":{"observed_at":"2026-05-11T03:55:20.707119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7cc993e5-6a3c-454d-93f7-04ae32d27e93","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:98e3e6c811bd88b34e7671eee948a697960e92aa6659fadbd99999a456a50079","observation_id":"c3d07644-6102-4d83-9df8-148910427083","resolution":{"observed_at":"2026-05-11T03:55:20.710209Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dbeacce6-661a-4383-b1ef-8e9b075acc63","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:a9e5a255e2e0a2c79ead28d66522e71de99a0e6387c477b8d234d2d387386613","observation_id":"86d86d3c-0a84-4385-b1cc-4e79669557d4","resolution":{"observed_at":"2026-05-11T03:55:20.719024Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8cd92368-c7f7-44ad-8a0e-c428feefc507","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:5a20ac48303d7bc66baa74206c8555237791f9e3ade9d2fbd1019e58ccbc6725","observation_id":"317dd765-7c18-4b86-b603-596a19c13871","resolution":{"observed_at":"2026-05-11T03:55:20.721505Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9c916ff3-0b45-4751-a706-0b5cf7a6bf07","year":2023},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:9634bf75c811d5ead9c609590084607a1efaa60ecdb9fbb081fa7b9d332202fa","observation_id":"bf811a66-a29e-48ce-9c52-0aa4e5937737","resolution":{"observed_at":"2026-05-11T03:55:20.723960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"17 Published as a conference paper at COLM 2024 B Task Configurations RULER is designed to be configurable to allow for diverse sequence lengths and task complexities","venue":null,"work_id":"7d5828f2-b507-471e-b5e1-f15e3c178806","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:44a2ecf3f26fb035a96ac34f3350e12bdb7950109da69cba545747750673e2ea","observation_id":"c8553943-c0d3-492a-ab6d-81493d3d9f70","resolution":{"observed_at":"2026-05-11T03:55:20.728340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Additionally, we change the value type to UUID, for the purpose of testing model robustness at retrieving long strings from context","venue":null,"work_id":"bf0f58b2-82b4-48d6-8319-bd6c126323cf","year":2023},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:afa6f6e7e7cc68474aaea80084a0a0cfb83d80c5630bde1aa03d84084f9c6c04","observation_id":"3aa36ccd-636c-417c-b688-4dfe37eeeb15","resolution":{"observed_at":"2026-05-11T03:55:20.670399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"They are representative of single-hop and multi-hop question answering tasks respectively","venue":null,"work_id":"c964bb59-96f4-4d50-ac91-f045d33e10d6","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:d446bf0fa9ab819e0f8936cd3fc84ab8a61c1c67b20acc49f71c5ec0247fc332","observation_id":"9413d04b-6e07-4aa3-b166-edfac9675f08","resolution":{"observed_at":"2026-05-11T03:55:20.684991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"To prevent models from refusing to answer our questions, we append the input with an answer prefix to elicit model responses","venue":null,"work_id":"64fd19ee-9bd0-4949-8ca6-4cc6ab3c1b08","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:6c9b59f380b3db77dba1009d02a5bad84829c71c434d1634502c27492f4a3b8b","observation_id":"9f11232e-24bd-40e0-9207-0325f8cc03b3","resolution":{"observed_at":"2026-05-11T03:55:20.688789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fe923e64-9c36-4e7e-8c62-6c211a3d7d94","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:6886c83fb652e59ac73989860482e29226589213bd87762112317d0e96209cb8","observation_id":"fb23c32c-9443-4d48-8f44-ec6199c626d8","resolution":{"observed_at":"2026-05-11T03:55:20.695725Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":1,"metadata_mismatch":10,"parse_uncertain":0,"unresolved":5,"verified_exact":26,"verified_fuzzy":8},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 100 inbound Pith citation observations for arXiv:2404.06654."}