{"as_of":"2026-08-06T02:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3359d16465871c7c56c64023ac17d252dc5260102bc518872fea6bfaa4109fdd","coverage":[{"denominator":125,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T10:46:16.373197Z","state":"measured"},{"denominator":166,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":166,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":66,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:31:43.616971Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":49,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-10T21:35:18.513342Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2101.00027"},"observation_digest":"sha256:02edb7a31e34e7d58443dac495d3217a622d2834f57db5fbd38c71f99efc4a1f","observation_id":"63809903-8635-4bd3-b81f-8a7560c4b954","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-07-06T13:00:12.148951Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-24T12:33:37.701655Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2204.06745"},"observation_digest":"sha256:051f2f0c90db4fe3d4c9e400dea9602d5371bfb181dd549c21a72194feb6b9e0","observation_id":"472d0823-1309-469b-b33b-ad06489daa07","resolution":{"observed_at":"2026-05-24T12:34:28.437554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2402.13753","last_updated":"2024-02-21T12:30:33Z","snapshot_observed_at":"2026-08-02T12:47:57.325302Z","submitted_at":"2024-02-21T12:30:33Z","title":"LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T08:31:04.774135Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2402.13753"},"observation_digest":"sha256:dfda6dc704c46b9f1aeb9447161dfd37657660b3da067efe5b5396c7dbb2331c","observation_id":"3a48f80c-fad7-40f5-980d-001e1e13e499","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":145,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:2bc994aecabe293cff8caaf4459d8f8198ac9698cc1c58170c438e83ab847c3a","observation_id":"7fa00ae7-6ad3-488a-b6fa-c8386789d63d","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-02T14:27:24.212588Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T18:17:00.157129Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2404.07143"},"observation_digest":"sha256:b9bc9e8863810f148866e1550f3420e69a1516f50d2b0fc8dd83f2cd40b7a646","observation_id":"2dd8d092-b481-41e2-869a-ff31dc0309a1","resolution":{"observed_at":"2026-05-21T18:17:00.268630Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-15T14:12:20.809594Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2406.10774"},"observation_digest":"sha256:87cd489129463398517caacda819640eefffe67ae9442bd4c3376e607a62177d","observation_id":"b8f20cf7-42a5-479a-8dac-bdd9c725e96f","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2502.05171","last_updated":"2025-02-17T17:14:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-07T18:55:02Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","version":2},"reference_index":125,"source":"arxiv_source","source_observed_at":"2026-05-12T15:39:40.845703Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2502.05171"},"observation_digest":"sha256:ddcb441e5712ae9aa8b0d9fe8e53a5c031bcea901557833a04d5406dc82a2a6c","observation_id":"2eca5e19-4bec-41b5-aa16-ec4782087a75","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:7b465bdc00456e1eb0256d8a6811645a7f10bb927779398e1d4d20b75f820501","observation_id":"46ce69cf-37df-4b9a-b60b-22475a9d62bc","resolution":{"observed_at":"2026-05-22T17:01:48.565577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T20:31:43.616971Z","title":"Compressive Transformers for Long-range Sequence Modelling,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.616971Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:1a089b0f780139bbf8b348c8f532dee5f27a0e6b7f324c823d01f368fb310532","observation_id":"cdcaf6aa-a5b6-4586-b7a8-9ab090614695","resolution":{"observed_at":"2026-08-05T20:31:43.616971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T20:15:53.765855Z","title":"Compressive transformers for long-range sequence modelling","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2508.10824","last_updated":"2025-08-16T03:17:35Z","snapshot_observed_at":"2026-08-06T02:00:57.019893Z","submitted_at":"2025-08-14T16:48:38Z","title":"Memory-Augmented Transformers: A Systematic Review from Neuroscience Principles to Enhanced Model Architectures","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-05T20:15:53.765855Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2508.10824"},"observation_digest":"sha256:6bbc7e6c8b5e294a5a70cfffdfda36fd1fee2050cca93f7f1d53557070f93d49","observation_id":"948eb287-38f8-4ba1-aeff-1bbcd9720208","resolution":{"observed_at":"2026-08-05T20:15:53.765855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T18:07:40.090807Z","title":"Rae, Anna Potapenko, Siddhant M","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.15190","last_updated":"2025-08-21T03:01:53Z","snapshot_observed_at":"2026-08-05T18:07:36.427940Z","submitted_at":"2025-08-21T03:01:53Z","title":"SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T18:07:40.090807Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2508.15190"},"observation_digest":"sha256:7ca6bdd9b5c2f4900dfd04a0f001756f2de4666388f853ef2263d2473694059c","observation_id":"adb9c764-4364-469c-80c3-c8b0d9920fde","resolution":{"observed_at":"2026-08-05T18:07:40.090807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T17:26:02.290468Z","title":"Compressive transformers for long-range sequence modelling","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2508.16309","last_updated":"2025-08-22T11:36:19Z","snapshot_observed_at":"2026-08-05T17:26:01.709917Z","submitted_at":"2025-08-22T11:36:19Z","title":"Quantum-Enhanced Optimization by Warm Starts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T17:26:02.290468Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2508.16309"},"observation_digest":"sha256:bc8fa992781b99fc1ce87413c60cd3e8181c371d8e02b9b517377a22be42c66f","observation_id":"4f1579aa-a5dc-45f3-b2ab-3964f193006d","resolution":{"observed_at":"2026-08-05T17:26:02.290468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T17:27:27.408925Z","title":"Compressive transformers for long-range sequence modelling","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-05T17:27:26.462654Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.408925Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:2835dc5f86fe02aeec173afa5a9c449f7d804023723de30e4b87aaf9c80fe7c7","observation_id":"48d4fc6e-9e8f-40bd-acd3-ceb99b965205","resolution":{"observed_at":"2026-08-05T17:27:27.408925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2508.16745","last_updated":"2026-05-07T14:29:44Z","snapshot_observed_at":"2026-08-02T06:49:37.602255Z","submitted_at":"2025-08-22T18:57:08Z","title":"Beyond Memorization: Extending Reasoning Depth with Recurrence, Memory and Test-Time Compute Scaling","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-18T20:49:26.966293Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2508.16745"},"observation_digest":"sha256:e82acc80306456a6b097932616afd21899d09d1411a2705b6f2e5eef0b5f8f35","observation_id":"3a4fd09a-84f8-4d0f-89ec-3a2e57246d41","resolution":{"observed_at":"2026-05-18T20:51:50.848944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T05:36:55.106978Z","title":"Rae, Anna Potapenko, Siddhant M","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.05218","last_updated":"2025-09-08T03:13:38Z","snapshot_observed_at":"2026-08-05T05:36:47.037209Z","submitted_at":"2025-09-05T16:20:48Z","title":"HoPE: Hyperbolic Rotary Positional Encoding for Stable Long-Range Dependency Modeling in Large Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T05:36:55.106978Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2509.05218"},"observation_digest":"sha256:f55ca75c865d5bf5f95f9afbe2571aadb4c97836bb3dacc953b5695889ea33e3","observation_id":"3de31226-4896-40b5-8dd7-9044c00dd5ff","resolution":{"observed_at":"2026-08-05T05:36:55.106978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2509.12635","last_updated":"2026-05-10T22:28:15Z","snapshot_observed_at":"2026-08-03T03:02:00.357806Z","submitted_at":"2025-09-16T03:53:32Z","title":"Positional Encoding via Token-Aware Phase Attention","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T16:19:48.318702Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2509.12635"},"observation_digest":"sha256:d935abad2fa5e838305c1ae5deeb96af628b38ae3dbb3a11fc4e455083835392","observation_id":"5d869398-4cd6-4fc4-a352-9d5bf6659e52","resolution":{"observed_at":"2026-05-18T16:21:36.681588Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-04T14:43:03.696218Z","title":"Compressive transformers for long-range sequence modelling","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2510.02361","last_updated":"2026-05-25T07:51:15Z","snapshot_observed_at":"2026-08-04T14:42:55.586487Z","submitted_at":"2025-09-28T11:04:00Z","title":"ChunkLLM: A Lightweight Pluggable Framework for Accelerating LLMs Inference","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:03.696218Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2510.02361"},"observation_digest":"sha256:8b18704034297822350b34149829ca23476e8c1f37c5cdf6df1da7b2902110be","observation_id":"c08777be-abd3-4ce6-bf49-45963a88d071","resolution":{"observed_at":"2026-08-04T14:43:03.696218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2510.04800","last_updated":"2026-04-21T13:16:20Z","snapshot_observed_at":"2026-08-02T20:03:37.497118Z","submitted_at":"2025-10-06T13:30:07Z","title":"Hybrid Architectures for Language Models: Systematic Analysis and Design Insights","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T10:18:04.431436Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2510.04800"},"observation_digest":"sha256:60b6505764595f2290ee601f69ee7e99b9413a3647dd8c905784c7344a950dc9","observation_id":"e6935100-463b-4ad1-9f3f-3d4eae79cbcb","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-04T10:57:43.845157Z","title":"Compressive transformers for long-range sequence modelling.arXiv preprint arXiv:1911.05507,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T10:57:43.845157Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2510.07651"},"observation_digest":"sha256:fca7aaccbe9ae7bd8277dde961ef18615779764cf638b3afe972b0771037c886","observation_id":"3fafd378-c5e3-4f4c-8aea-981b1e5929ff","resolution":{"observed_at":"2026-08-04T10:57:43.845157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:fc695040b081369cea0b8a6098fce478e6632940016ca806f7a5535054ddf533","observation_id":"9acf4671-7194-4cb0-a65e-e8227b7d8ab9","resolution":{"observed_at":"2026-05-21T19:44:19.647760Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-04T08:28:51.749218Z","title":"Compressive transformers for long-range sequence modelling","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.20535","last_updated":"2026-07-29T08:07:09Z","snapshot_observed_at":"2026-08-05T14:03:48.654042Z","submitted_at":"2025-10-23T13:20:57Z","title":"ARC-Encoder: learning compressed text representations for large language models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T08:28:51.749218Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2510.20535"},"observation_digest":"sha256:1e8bb6952e16f138e040ad76424b2ff6402031793622078f44b75baddcea5cc8","observation_id":"a47257d8-5a90-4870-aead-a7dd9d5bb1fd","resolution":{"observed_at":"2026-08-04T08:28:51.749218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2512.21110","last_updated":"2026-04-24T20:27:34Z","snapshot_observed_at":"2026-07-06T22:39:58.137482Z","submitted_at":"2025-12-24T11:15:57Z","title":"Beyond Context: Large Language Models' Failure to Grasp Users' Intent","version":3},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-16T20:09:25.827452Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2512.21110"},"observation_digest":"sha256:dcc693029504448744c1becc7d1688bd53655b2503174f10a036f67e58a7374f","observation_id":"acf31256-ba86-4ec8-b50d-f1bda63de08e","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-03T03:22:54.245744Z","title":"Rae, Anna Potapenko, Siddhant M","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.08426","last_updated":"2026-05-25T11:18:29Z","snapshot_observed_at":"2026-08-03T03:22:52.672693Z","submitted_at":"2026-02-09T09:31:06Z","title":"Prism: Spectral-Aware Block-Sparse Attention","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T03:22:54.245744Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2602.08426"},"observation_digest":"sha256:e2f58f95f02075bdc370c674ecda69852c34cb12ef9b663bf291607cd0c943c4","observation_id":"3e114493-9e38-4368-b471-f3ec41da3ceb","resolution":{"observed_at":"2026-08-03T03:22:54.245744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2604.03263","last_updated":"2026-03-12T21:21:51Z","snapshot_observed_at":"2026-07-06T22:52:29.705312Z","submitted_at":"2026-03-12T21:21:51Z","title":"LPC-SM: Local Predictive Coding and Sparse Memory for Long-Context Language Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T11:22:08.937342Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2604.03263"},"observation_digest":"sha256:a60e622ec1600fddf82ffc6c5f9c7ee82e472155f9d458c3c3b4c7aa20fd1958","observation_id":"59f0eb41-f2e9-4efd-b797-d8ac2e434d37","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2604.03799","last_updated":"2026-05-26T23:21:25Z","snapshot_observed_at":"2026-08-02T23:46:38.710077Z","submitted_at":"2026-04-04T17:07:37Z","title":"Next-Scale Autoregressive Models for Text-to-Motion Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T17:27:34.972785Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2604.03799"},"observation_digest":"sha256:fe6cc798723670e46a466d3d6f0c584162350c76dc6b3946b450f43e96fb8cc8","observation_id":"7fd2fd39-ee49-4da2-bb98-43e7956f4c88","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-07-13T12:16:25.843631Z","title":"Compressive transform- ers for long-range sequence modelling.arXiv preprint arXiv:1911.05507, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2604.03799","last_updated":"2026-05-26T23:21:25Z","snapshot_observed_at":"2026-08-02T23:46:38.710077Z","submitted_at":"2026-04-04T17:07:37Z","title":"Next-Scale Autoregressive Models for Text-to-Motion Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T12:16:25.843631Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2604.03799"},"observation_digest":"sha256:5d962688ae9f9052d4e2735eef326bd4b00ecd77b5022a87b415df7c8ed7aa98","observation_id":"a1dedfaf-8d67-471f-b182-e03222374a82","resolution":{"observed_at":"2026-07-13T12:16:25.843631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2604.06746","last_updated":"2026-04-08T07:10:35Z","snapshot_observed_at":"2026-07-06T22:55:11.560398Z","submitted_at":"2026-04-08T07:10:35Z","title":"StructKV: Preserving the Structural Skeleton for Scalable Long-Context Inference","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-10T18:37:10.526359Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2604.06746"},"observation_digest":"sha256:095d5d5fa3e6166bff11db9e99d01d7562e5bca29b6f1ea5cc0c30dfea481e3a","observation_id":"1906eeb9-07dc-4f4a-8170-6e268ef191a1","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T14:20:34.452801Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:e77f65089a3d0ec086e3a5b59e89a78ff045b91e8a1bd17a45cb8f117e3abdab","observation_id":"c222a16f-f403-4377-8cb9-746b3e654eb7","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:dd5b9833fac5c11da0e549220c4218cc5fa54812c261560ce06ad266444f0eff","observation_id":"4c76dc23-6216-4dfa-b833-1a6b6a2f153f","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.06946","last_updated":"2026-05-07T21:05:28Z","snapshot_observed_at":"2026-08-04T02:08:48.810630Z","submitted_at":"2026-05-07T21:05:28Z","title":"Adaptive Memory Decay for Log-Linear Attention","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-11T01:02:56.848785Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.06946"},"observation_digest":"sha256:37eaa911f95041cda55f2a9bb20e1ca9be5dba83088e5706e04014632ed8f340","observation_id":"4634c71a-bf3b-436d-a5cf-4bef74f422f2","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.07076","last_updated":"2026-05-12T15:47:00Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T00:50:09Z","title":"Self-Consolidating Language Models: Continual Knowledge Incorporation from Context","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T01:47:15.491588Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.07076"},"observation_digest":"sha256:ee93ca8b29c4eb4f0da0fbda05cd154273176e3edf86294c9e0f63a462eca4ff","observation_id":"0272af1d-c476-4a06-90de-0c161292e790","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.07076","last_updated":"2026-05-12T15:47:00Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T00:50:09Z","title":"Self-Consolidating Language Models: Continual Knowledge Incorporation from Context","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T07:53:43.047696Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.07076"},"observation_digest":"sha256:6401f900be6fa911fa1194460da17ee05da4beefb3b19ac791a1f3aefc852ebe","observation_id":"452525e6-2079-4b5c-956e-2c987be69c1c","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.12697","last_updated":"2026-05-12T19:48:36Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T19:48:36Z","title":"A Unified Framework for Critical Scaling of Inverse Temperature in Self-Attention","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-14T19:56:02.462786Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.12697"},"observation_digest":"sha256:f71fcc34145160fb8d9d8aef199cfa3552ad77b8b910e1159edbaa9609d74605","observation_id":"d00a0907-a585-4fe3-a6dc-ebaad3b76fcb","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.13370","last_updated":"2026-05-13T11:28:06Z","snapshot_observed_at":"2026-08-03T02:10:50.275997Z","submitted_at":"2026-05-13T11:28:06Z","title":"Phasor Memory Networks: Stable Backpropagation Through Time for Scalable Explicit Memory","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T20:36:12.321162Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.13370"},"observation_digest":"sha256:06948df9cf096b609da9ef68652ffeb05d8758134c9baa97cab9768b5e05fcec","observation_id":"01ca2394-6f6f-4412-ae37-0027b9767b96","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:39fbf13291c227ca4bfffd9577cfb30345f7ba623187914f4979731d9ded31d8","observation_id":"160af0ae-55de-4745-a0d8-725a7434f862","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.14037","last_updated":"2026-05-13T18:58:16Z","snapshot_observed_at":"2026-08-04T00:53:16.855757Z","submitted_at":"2026-05-13T18:58:16Z","title":"Self-Pruned Key-Value Attention: Learning When to Write by Predicting Future Utility","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-15T05:35:09.705532Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.14037"},"observation_digest":"sha256:0e320c882fa9fbaa6b252e739aa3c012c7d9b67d87ecd5f4c29881a1f537cdd8","observation_id":"4bb91e15-a8a5-4d08-b720-8bb0ccb348b7","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.17365","last_updated":"2026-05-17T10:17:41Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T10:17:41Z","title":"Memory-Augmented Query Intent Understanding for Efficient Chat-based Image Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T13:31:45.891242Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.17365"},"observation_digest":"sha256:90926637d001a7e05301ffde80a8a84238cbfb36a493b32295c16f3af2dc4d05","observation_id":"9f22a9a7-4c73-450d-b969-c2053966c400","resolution":{"observed_at":"2026-05-20T13:33:19.119023Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.18856","last_updated":"2026-06-07T06:58:25Z","snapshot_observed_at":"2026-08-02T07:58:37.314471Z","submitted_at":"2026-05-13T18:48:48Z","title":"SPHERICAL KV: Angle-Domain Attention and Rate-Distortion Retention for Efficient Long-Context Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T20:30:33.208386Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.18856"},"observation_digest":"sha256:f37344d25048d8c59c41eddba61725ed3672cc234713a61e7af164daa848a1c3","observation_id":"968d7557-c88c-437e-8442-96e931cf5092","resolution":{"observed_at":"2026-05-20T20:33:43.292296Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.22337","last_updated":"2026-05-23T16:54:41Z","snapshot_observed_at":"2026-07-06T23:32:39.761431Z","submitted_at":"2026-05-21T11:24:46Z","title":"Meta-Soft: Leveraging Composable Meta-Tokens for Context-Preserving KV Cache Compression","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T05:10:53.133346Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.22337"},"observation_digest":"sha256:95b9cdeada5a073e78a0120e2e39ad528e52bdd97e9419ba407830c43e827ff3","observation_id":"e40f18a9-e2ff-425f-a0e8-e4b29d91d6ee","resolution":{"observed_at":"2026-05-22T05:11:06.148819Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.22337","last_updated":"2026-05-23T16:54:41Z","snapshot_observed_at":"2026-07-06T23:32:39.761431Z","submitted_at":"2026-05-21T11:24:46Z","title":"Meta-Soft: Leveraging Composable Meta-Tokens for Context-Preserving KV Cache Compression","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T17:28:08.750049Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.22337"},"observation_digest":"sha256:675f7efd8d1083af1c4db3c84fcdd6b4bb12a0634fbc8eeb258dcda8ba6fe4cc","observation_id":"c7adbd75-c8d7-4abc-bfce-fb4d2991447a","resolution":{"observed_at":"2026-06-30T17:34:57.862128Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.22884","last_updated":"2026-05-21T00:21:51Z","snapshot_observed_at":"2026-07-06T23:33:09.561760Z","submitted_at":"2026-05-21T00:21:51Z","title":"Tensor Cache: Eviction-conditioned Associative Memory for Transformers","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-25T05:49:43.160574Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.22884"},"observation_digest":"sha256:a31c0578b9fbb779f9b22be7c771eccae7441309abdaa27c28c87573d7ce38ca","observation_id":"d71b0822-891c-4e53-8020-282e8eb4da50","resolution":{"observed_at":"2026-05-25T05:50:23.541466Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:e06b5546379ebe4e2d1e75ff46bbaf9fe5ba7ad27ebded99280ccccc731b90b2","observation_id":"eb9e9bd5-3a79-4c8d-9263-11c7c44f33b2","resolution":{"observed_at":"2026-06-29T19:43:54.972100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.27268","last_updated":"2026-05-26T16:44:25Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T16:44:25Z","title":"Lost in Sampling: Assessing Lexical Reachability in LLMs via the Word Coverage Score (WCS)","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T18:07:58.776272Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.27268"},"observation_digest":"sha256:101194ce26633dbc13f77182b75ed08f1368e2b2c5f74ee381e098a03d44d5f0","observation_id":"ba73e450-642d-4a8d-a84a-a5e9f8d1aa74","resolution":{"observed_at":"2026-06-29T18:13:48.865948Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.27686","last_updated":"2026-05-26T21:03:42Z","snapshot_observed_at":"2026-08-02T04:59:17.402182Z","submitted_at":"2026-05-26T21:03:42Z","title":"Tensor Memory: Fixed-Size Recurrent State for Long-Horizon Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T18:08:42.533804Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.27686"},"observation_digest":"sha256:86b0d86cbe2b5116d7250ba0cfaeffb5426a4c5d133ebee246e11bb53d48e6cc","observation_id":"e4dd4fd4-4db2-4eed-98c7-7feb03a7270b","resolution":{"observed_at":"2026-06-29T18:13:48.720885Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.31163","last_updated":"2026-05-29T11:13:00Z","snapshot_observed_at":"2026-08-01T14:41:04.597557Z","submitted_at":"2026-05-29T11:13:00Z","title":"Memory by Design: Probabilistic Sequence Layers","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T21:07:31.407554Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.31163"},"observation_digest":"sha256:498840f4dd356a72630218cb739200fa8cd82a14de67a55283f664076bb7dfdb","observation_id":"02102b0d-65be-4540-94bc-e708a9ca550a","resolution":{"observed_at":"2026-07-01T20:26:12.837033Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2606.00732","last_updated":"2026-07-10T15:55:28Z","snapshot_observed_at":"2026-07-15T23:18:25.474692Z","submitted_at":"2026-05-30T13:55:02Z","title":"SHARP: Sleep-based Hierarchical Accelerated Replay for Long Range Non-Stationary Temporal Pattern Recognition","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T18:43:49.689283Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2606.00732"},"observation_digest":"sha256:682417f3d3eb8ac6fbabf4b37bb571df4d4634d2e8dab7018f2850c93fa28eeb","observation_id":"d3deb08a-3283-4f09-bab6-bfa64733516d","resolution":{"observed_at":"2026-06-28T20:22:37.816854Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-07-12T15:29:20.475050Z","title":"Compressive transformers for long-range sequence modelling","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2606.00732","last_updated":"2026-07-10T15:55:28Z","snapshot_observed_at":"2026-07-15T23:18:25.474692Z","submitted_at":"2026-05-30T13:55:02Z","title":"SHARP: Sleep-based Hierarchical Accelerated Replay for Long Range Non-Stationary Temporal Pattern Recognition","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T15:29:20.475050Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2606.00732"},"observation_digest":"sha256:6dd31e4071c946032e452b2d0b38f655c79019f77f49c883fec5d656ad05f51d","observation_id":"bc30eaef-04f8-4010-a89b-8ebf85687cbf","resolution":{"observed_at":"2026-07-12T15:29:20.475050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-07-13T07:45:49.272396Z","title":"Compressive transformers for long-range sequence modelling","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2606.00732","last_updated":"2026-07-10T15:55:28Z","snapshot_observed_at":"2026-07-15T23:18:25.474692Z","submitted_at":"2026-05-30T13:55:02Z","title":"SHARP: Sleep-based Hierarchical Accelerated Replay for Long Range Non-Stationary Temporal Pattern Recognition","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T07:45:49.272396Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2606.00732"},"observation_digest":"sha256:e632bba2bbe052e5f5c8d2d890e38d0494ed16b28e8cd0f730162a08aea4511e","observation_id":"f0656ac3-a417-40a1-8378-729ac1ad01c9","resolution":{"observed_at":"2026-07-13T07:45:49.272396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2606.05208","last_updated":"2026-05-26T06:44:07Z","snapshot_observed_at":"2026-07-06T23:45:11.627867Z","submitted_at":"2026-05-26T06:44:07Z","title":"Transformer-Enhanced Reinforcement Learning: Fundamentals and Applications in Communication Networks","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-29T16:14:25.741686Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2606.05208"},"observation_digest":"sha256:fa9fab817d6a0df4008c23f8416ab200c230e413ddf87ea87bfa19b78043aecb","observation_id":"125aa08e-2c4c-40ba-ba37-434fb90e72e5","resolution":{"observed_at":"2026-06-29T16:23:39.681605Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2606.08184","last_updated":"2026-06-06T14:12:54Z","snapshot_observed_at":"2026-07-06T23:47:43.942733Z","submitted_at":"2026-06-06T14:12:54Z","title":"TextEconomizer: Enhancing Lossy Text Compression with Denoising Transformers and Entropy Coding","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-27T19:54:39.953302Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2606.08184"},"observation_digest":"sha256:9fc26174bf0eea028483b2fb6e19f82826d344fd50c841d61e8366dcdf10f98a","observation_id":"54cd3937-2aa4-4ccc-92e7-7b9ae87ec8b2","resolution":{"observed_at":"2026-07-02T21:07:24.272384Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2606.09659","last_updated":"2026-06-08T15:43:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-08T15:43:16Z","title":"End-to-End Context Compression at Scale","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-06-27T16:36:54.699174Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2606.09659"},"observation_digest":"sha256:0bd873bbd8178dcf4b068062614d060dc418a1c1aa7cf4edaf63dca38bdda860","observation_id":"541552d7-ebef-494b-87a6-2a9d41a105a0","resolution":{"observed_at":"2026-07-03T01:17:31.561208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2606.24957","last_updated":"2026-06-23T08:51:20Z","snapshot_observed_at":"2026-07-06T23:59:28.120338Z","submitted_at":"2026-06-23T08:51:20Z","title":"Dustin: Draft-Augmented Sparse Verification for Efficient Long-Context Generation with Speculative Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:58.636939Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2606.24957"},"observation_digest":"sha256:6e92855cdb8f34a9e8f2e31573deb76e1afa378b67274fd4a4b6fb4c5aed816b","observation_id":"f97bef45-5deb-462e-b04d-0dce00056a4b","resolution":{"observed_at":"2026-07-04T16:49:58.000560Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2606.25379","last_updated":"2026-06-24T04:21:36Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T04:21:36Z","title":"Story Operators: Decomposing the Original $\\to$ Sequel Transformation in Embedding Space","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-25T21:19:44.766586Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2606.25379"},"observation_digest":"sha256:216e558c3d0b673f1406946dc4ad81f323968026244edd035b02080ebb163396","observation_id":"1249abb2-eec2-42cd-9c83-e77952abfa42","resolution":{"observed_at":"2026-07-04T19:30:07.243777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2606.28876","last_updated":"2026-07-10T02:16:42Z","snapshot_observed_at":"2026-07-15T23:17:48.998907Z","submitted_at":"2026-06-27T11:38:43Z","title":"Memory-Managed Long-Context Attention: Bounded Editable Memory with a Hard Lifecycle and Calibrated Sparse Fallback","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T09:46:57.030469Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2606.28876"},"observation_digest":"sha256:7f2b11fbcf81cf493beb8c10c43303fda2751b1e4140131e3a8c32d504ea203e","observation_id":"e1d11da3-9332-44dc-8e91-60747613b0dc","resolution":{"observed_at":"2026-06-30T09:54:35.249847Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-07-13T07:16:45.194991Z","title":"Rae et al","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2606.28876","last_updated":"2026-07-10T02:16:42Z","snapshot_observed_at":"2026-07-15T23:17:48.998907Z","submitted_at":"2026-06-27T11:38:43Z","title":"Memory-Managed Long-Context Attention: Bounded Editable Memory with a Hard Lifecycle and Calibrated Sparse Fallback","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T07:16:45.194991Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2606.28876"},"observation_digest":"sha256:a34f66dd77c83c3e4a5eaf13efa4aeb74b986fed0ab4d2b6991557df98c12f78","observation_id":"eec98df6-c555-4703-bfae-9e3de2402520","resolution":{"observed_at":"2026-07-13T07:16:45.194991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2607.07740","last_updated":"2026-07-10T03:53:58Z","snapshot_observed_at":"2026-07-15T23:17:51.274512Z","submitted_at":"2026-07-08T06:23:42Z","title":"Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-10T19:59:46.713277Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2607.07740"},"observation_digest":"sha256:00aabe1ef2ed17cbf57a3b2169dfcb5d689bddbadbe54a91a547c61a4f783c12","observation_id":"9a1f1709-3f85-4165-b378-81f4fdb07f70","resolution":{"observed_at":"2026-07-10T20:07:33.496053Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-07-13T06:47:09.927626Z","title":"Compressive transformers for long-range sequence modelling.arXiv preprint arXiv:1911.05507, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.07740","last_updated":"2026-07-10T03:53:58Z","snapshot_observed_at":"2026-07-15T23:17:51.274512Z","submitted_at":"2026-07-08T06:23:42Z","title":"Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T06:47:09.927626Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2607.07740"},"observation_digest":"sha256:5d2b0d4fa7d0dfbdd4019c7dcc9d24e8527eb2f68bfc5a5a45079612d5b79685","observation_id":"d3270bb5-2f27-48cf-87d0-73d0420d46db","resolution":{"observed_at":"2026-07-13T06:47:09.927626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-02T16:38:21.894642Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:6962757feebe0442a7ae1d68023c8f07c3e92936acdf3b1ad89b79e0e4a4f11b","observation_id":"50ada0fb-8be7-40f3-8d98-bae125d8ddbc","resolution":{"observed_at":"2026-07-10T01:36:44.161415Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-07-14T12:08:05.502310Z","title":"arXiv preprint arXiv:1911.05507 , year=","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.10386","last_updated":"2026-07-11T16:29:51Z","snapshot_observed_at":"2026-08-03T03:24:52.663992Z","submitted_at":"2026-07-11T16:29:51Z","title":"Structured Thoughts For Improved Reasoning And Context Pruning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-14T12:08:05.502310Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2607.10386"},"observation_digest":"sha256:75e9b1ac82eb0e2b8dc9271ffb5abceb09843d84d1a2cf9981b07598621232c0","observation_id":"55d8fb98-b1bc-4dbf-a4dc-258e23a394e2","resolution":{"observed_at":"2026-07-14T12:08:05.502310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-02T04:51:21.716911Z","title":null,"venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.13565","last_updated":"2026-07-15T08:05:00Z","snapshot_observed_at":"2026-08-03T03:58:10.087435Z","submitted_at":"2026-07-15T08:05:00Z","title":"UTS at ELOQUENT 2026 Voight-Kampff: structural shifts in AI writing bypass state-of-the-art detectors","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T04:51:21.716911Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2607.13565"},"observation_digest":"sha256:b44cf0bca3603a0bcc4c048d870d943339c546f0459ee8941da2de4987fd179f","observation_id":"10ea30ad-5d09-43c0-bb88-fa02bd9dc8f9","resolution":{"observed_at":"2026-08-02T04:51:21.716911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-02T09:50:33.078440Z","title":"arXiv:1911.05507","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.16248","last_updated":"2026-06-27T01:22:47Z","snapshot_observed_at":"2026-08-05T04:21:35.447834Z","submitted_at":"2026-06-27T01:22:47Z","title":"High-accuracy Low-Bit KV-Cache Quantization via Local Distribution Restoration","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-02T09:50:33.078440Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2607.16248"},"observation_digest":"sha256:6c292512023828875d057b1ef91dfee64d3088d4e4a2ee4012f2df6c7def36b0","observation_id":"40a5614f-3ab9-493e-9345-6b25e5a45a65","resolution":{"observed_at":"2026-08-02T09:50:33.078440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-01T17:53:16.638682Z","title":"arXiv preprint arXiv:1911.05507 , year=","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.17486","last_updated":"2026-07-20T02:20:52Z","snapshot_observed_at":"2026-08-01T17:53:13.486608Z","submitted_at":"2026-07-20T02:20:52Z","title":"SALT: Salience-Aware Lexical Trie for Long-Context Compression","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T17:53:16.638682Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2607.17486"},"observation_digest":"sha256:a22f2d1c9010da4792164e61bc4943d0b2358b457b9d394fe48fd2eaca008953","observation_id":"c35e796e-91dc-4215-867d-4cc8591c3827","resolution":{"observed_at":"2026-08-01T17:53:16.638682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-01T07:13:10.122353Z","title":"arXiv preprint arXiv:1911.05507 , year=","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.21535","last_updated":"2026-07-23T17:21:44Z","snapshot_observed_at":"2026-08-05T10:47:47.863363Z","submitted_at":"2026-07-23T17:21:44Z","title":"Windowed-MTP: Removing the Full-Context Draft-KV Tax at Million-Token Context","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T07:13:10.122353Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2607.21535"},"observation_digest":"sha256:0d571ab06548d261f920f2cb21f6e77993a159606f8d28de5d7e2999c148da20","observation_id":"976465b4-3d89-4d2a-bd95-09dea427e9f3","resolution":{"observed_at":"2026-08-01T07:13:10.122353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-01T01:59:49.824935Z","title":"Compressive trans- formers for long-range sequence modelling.arXiv preprint arXiv:1911.05507,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.25614","last_updated":"2026-07-28T11:45:34Z","snapshot_observed_at":"2026-08-06T00:50:11.917796Z","submitted_at":"2026-07-28T11:45:34Z","title":"MemSFT: Mitigating Alignment Tax with an External Parametric Memory","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-01T01:59:49.824935Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2607.25614"},"observation_digest":"sha256:05920b8d0dac9b3f02557d232cfa36b4519d31ecaef44a8289c45d20f87f7dcd","observation_id":"6cad2ed6-b857-4284-aee9-8f1b4fb670f1","resolution":{"observed_at":"2026-08-01T01:59:49.824935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-07-31T12:56:45.774990Z","title":"Stephen Robertson and Hugo Zaragoza","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.28263","last_updated":"2026-07-30T14:19:11Z","snapshot_observed_at":"2026-08-03T17:54:50.685930Z","submitted_at":"2026-07-30T14:19:11Z","title":"Understanding Is Done Early: A Depth Division of Labor in Large Language Models and Its Use for Unbounded-Context Memory","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-07-31T12:56:45.774990Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2607.28263"},"observation_digest":"sha256:b4ff6cca60088c5d40e7393f30da657151c36e23969a3069878594a75c6e1ad1","observation_id":"7fcdedf1-afc9-4a53-8d29-2ed1fc60cea6","resolution":{"observed_at":"2026-07-31T12:56:45.774990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-04T04:52:58.464228Z","title":"Compressive transformers for long-range sequence modelling,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02553","last_updated":"2026-08-03T17:37:38Z","snapshot_observed_at":"2026-08-06T02:26:30.543051Z","submitted_at":"2026-08-03T17:37:38Z","title":"A Taxonomy of Cognitive Capability Gaps in Generative and Agentic AI","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T04:52:58.464228Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2608.02553"},"observation_digest":"sha256:3fec3a5300542f7bf647be0d53b776949e230a81505ea531976c8cb4cbb35b55","observation_id":"12359230-a0c2-4073-873b-dd0e93983145","resolution":{"observed_at":"2026-08-04T04:52:58.464228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1911.05507/citation-record","integrity":"/paper/1911.05507/integrity","json":"/paper/1911.05507/citation-record.json","paper":"/paper/1911.05507"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Al-Rfou, D","venue":null,"work_id":"a44d68e5-77fc-447a-9411-a6ecaa323cb1","year":2019},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:99669f7d69efb9027678274944598f620f0fbbfb962b7a068f595ed73d7fac67","observation_id":"14f1b0de-3282-41ad-b631-bb2f06cf9968","resolution":{"observed_at":"2026-05-18T10:46:16.756021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"240767ac-2879-4ebd-82f9-06e11f530dba","year":2018},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:c434417ee2ad7cde77af6c0a16a51da337df9e86ce755bb55de8a5b17e7e39f8","observation_id":"61dc761f-37a4-4016-929a-0908e78dfdaf","resolution":{"observed_at":"2026-05-18T10:46:16.850932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03801","last_updated":"2016-12-13T12:19:48Z","snapshot_observed_at":"2026-07-06T05:22:21.129782Z","submitted_at":"2016-12-12T17:32:49Z","title":"DeepMind Lab","version":2},"cited_work":{"arxiv_id":"1612.03801","doi":null,"metadata_source":"pith","pith_arxiv_id":"1612.03801","snapshot_observed_at":"2026-07-09T12:56:14.879463Z","title":"DeepMind Lab","venue":"cs.AI","work_id":"8a8d827f-5377-4733-bfe8-bc66c011d458","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1612.03801","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:b68206f46957bb545636a284cac550d00da6e9e41515a4730f58d638e710893d","observation_id":"2c55da32-9924-499b-8d5f-e34def6f7364","resolution":{"observed_at":"2026-05-18T10:46:16.698044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a0cb2852-a473-45a6-adab-0fa427c3ef4c","year":2003},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:c5e2982ae15edea2dd29eaca263941b1aef5c6f72da82c3d42f5a4210e1c0bce","observation_id":"dde1abfd-f111-4915-9e3e-5b627c3860aa","resolution":{"observed_at":"2026-05-18T10:46:16.854400Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Espeholt, H","venue":null,"work_id":"a5ca2a29-ba14-460b-bfe2-ffeaa367077b","year":2018},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:feb9bb18ba10f7ea2df2d7fe90be7a8fbda4c8408022b7764c70f0154e0b1b8f","observation_id":"dc4127aa-e3ec-43a9-8782-d9ddbeab7655","resolution":{"observed_at":"2026-05-18T10:46:16.857718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Graves, G","venue":null,"work_id":"bef87013-8690-4961-8e92-1f58ded22ebb","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:15c9416dff3ce66cc4c4a70a992b7be90d5f437a9b748c2007d19dfd3a8c2b05","observation_id":"3b71d78a-01bb-4a7d-a398-9119bfe12a5c","resolution":{"observed_at":"2026-05-18T10:46:16.860846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hochreiter and J","venue":null,"work_id":"46eb7462-6231-4b9e-8adc-60270841e31c","year":1997},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:f125c2c7d22b8a15017d1afa9637e9a14f1e7237fd4b2f08654a9e3100e37ac9","observation_id":"62fc6e41-5c40-40a7-884c-3eb7f609dcb0","resolution":{"observed_at":"2026-05-18T10:46:16.864211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2cf9b4f2-6f40-477a-ab3b-7ccff6f65023","year":2012},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:735632c0d1a47d80b55c96050bc48bc11c63ef0ef0cf8a9803767592b9ffc9d2","observation_id":"ebfb2cbe-8a76-48f0-b098-48e22679645d","resolution":{"observed_at":"2026-05-18T10:46:16.867165Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ko c isk \\`y , J","venue":null,"work_id":"a30724fd-01e7-4623-9d03-37c3a67d3fa1","year":2018},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:cd85abab8a9916c1b74cd0dd5d88ce848f1ea8a692657d84a2353d652221cd51","observation_id":"6cccd004-adcf-48e9-a663-9d2cd9b7691b","resolution":{"observed_at":"2026-05-18T10:46:16.870112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08378","last_updated":"2019-04-17T17:26:01Z","snapshot_observed_at":"2026-08-05T20:05:19.093291Z","submitted_at":"2019-04-17T17:26:01Z","title":"Dynamic Evaluation of Transformer Language Models","version":1},"cited_work":{"arxiv_id":"1904.08378","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.08378","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic Evaluation of Transformer Language Models","venue":"cs.LG","work_id":"ff542af2-0611-456d-a5db-3b6c46fed067","year":2019},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1904.08378","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:2b41f93012d8de7d770974effc98f4b86a46a00779fe8382ee269f43c65d22e8","observation_id":"958832a4-d899-4a1a-a0e9-cdf1c8081547","resolution":{"observed_at":"2026-05-18T10:46:16.455743Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mikolov, M","venue":null,"work_id":"fc034ec0-2fbc-4927-988c-51a58761697d","year":2010},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:04741e4d0c0d848b6582dfea337dede2426a82103a2eb54cb08842e22c131aa5","observation_id":"0546c390-dc1d-48f6-b280-5f57cc8ea601","resolution":{"observed_at":"2026-05-18T10:46:16.872728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ab30f475-7cc0-42b8-8324-51c241033f58","year":2018},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:814b31be64fea63d0191c4144a0180dd85b3c670a35e3e48e1fba6f44fa372cf","observation_id":"19850504-3b31-4c77-a03b-5e20c445462a","resolution":{"observed_at":"2026-05-18T10:46:16.875648Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Paperno, G","venue":null,"work_id":"ef6ba2ee-1ed7-4915-b16d-4c8367ca18f6","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:e70bed9b68406250c8f88451bc53cdf71c627f64137654a5c5d78389cf7b1c23","observation_id":"951cbd9c-6036-47de-aa04-0de9f1de7a24","resolution":{"observed_at":"2026-05-18T10:46:16.878804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a21ea07d-db9a-4579-b4c2-cbd0c8bacd96","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:953c1dec214f1806868ec45fb14b73a5f282464e55e8b8bed03db7868db61bac","observation_id":"90e48575-dfbf-4d52-8389-f7ff9aaa0827","resolution":{"observed_at":"2026-05-18T10:46:16.882023Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fac332e0-494c-4c79-8956-32007dab9829","year":2017},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:d520510f0cd15ff401c2386075327abf4f5f25bffd1b83e763f8d08818c4d9ff","observation_id":"73a78e3d-4531-4e89-a06c-ae491972d450","resolution":{"observed_at":"2026-05-18T10:46:16.885212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"57f80160-7342-4b55-956a-e321d0cdcaf8","year":1986},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:abb7519a7acd7533e48ac92b6bb8ec71b9f605c175dd6a64966d5206af27439e","observation_id":"0153efbc-eb91-4c02-8565-773a1ab5f2bc","resolution":{"observed_at":"2026-05-18T10:46:16.888247Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Santoro, R","venue":null,"work_id":"07b0f7b9-f6d8-406b-8f49-6d442b21ac0b","year":2018},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:1fe0c635bb75e07fa975200fcb0245add67e6a2f4e0d4806f14e4e017bcb92b7","observation_id":"4d12252e-d82a-47a5-bf7d-375191e30f45","resolution":{"observed_at":"2026-05-18T10:46:16.891109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shoeybi, M","venue":null,"work_id":"8b2c62c6-f36e-40f7-898e-3f5954b7c34b","year":2019},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:65126612b24efb09aa02471b9f239d56b1626f705ec3f3424b6fdd91e8589dbb","observation_id":"c699f14d-616e-4e77-8068-d363409da2e4","resolution":{"observed_at":"2026-05-18T10:46:16.894158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smith, P","venue":null,"work_id":"df1d3fe5-d146-4c11-80ab-e4522f5a82f8","year":2018},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:a831d62a95ef4aff361503372227534590fa0c4f9f3cf8bf94f3bda362ca997d","observation_id":"85b01846-fd61-4f91-8ad2-642b459cdfc2","resolution":{"observed_at":"2026-05-18T10:46:16.897157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vaswani, N","venue":null,"work_id":"f27a7013-5ec2-4b3e-8425-f64c395ebb5c","year":2017},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:c59672463125f6c5f0da9f09cea00a744f3da54eb34c4684885293c97cfa130f","observation_id":"e7ec0fe2-12cc-42e3-9a92-ebc74b6f3427","resolution":{"observed_at":"2026-05-18T10:46:16.900541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f42bb3bc-1bd8-4eea-bfd6-e120f156c502","year":2018},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:491830f8607102d032f46cc3e94b1fd85af4ed44baed2fb02ed7a58d09bc3b52","observation_id":"5d668fb3-e5e1-4baa-8a2b-ecdc36309eac","resolution":{"observed_at":"2026-05-18T10:46:16.904485Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dc7685a8-5576-4dae-b11e-a9ebf7070b7f","year":2015},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:adb45038ed15abfd7daa32e7a64ede77ca96c09e03f40e1e86a33ac7c8cf9da7","observation_id":"bc74beb4-54d9-4d62-b5bd-41b13cd534a1","resolution":{"observed_at":"2026-05-18T10:46:16.907596Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ebda8e0a-2793-4572-8668-5cc29202c5e7","year":2017},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:7312a0f46113c28328dd800c7f9593fc72c4e5ef38b976c29d23930644a782af","observation_id":"e8b67db5-e87a-4274-9a2e-3e748dd8b033","resolution":{"observed_at":"2026-05-18T10:46:16.910545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.204501Z","title":"nature , volume=","venue":null,"work_id":"585a074e-f862-4309-b209-0fc33d7c0666","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:7b5bfcde5adedf88015307af50d62233eaad72b14b5f86e8f095370b8d1b8c7e","observation_id":"38f02672-c05f-436c-aa45-61efd8ea56c6","resolution":{"observed_at":"2026-05-18T10:46:16.914060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1410.5401","last_updated":"2014-12-10T16:01:39Z","snapshot_observed_at":"2026-08-01T22:22:04.725773Z","submitted_at":"2014-10-20T19:28:26Z","title":"Neural Turing Machines","version":2},"cited_work":{"arxiv_id":"1410.5401","doi":"10.48550/arxiv.1410.5401","metadata_source":"pith","pith_arxiv_id":"1410.5401","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Turing Machines","venue":"cs.NE","work_id":"0a5ce53c-9670-42b9-8be5-386de7eed50c","year":2014},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1410.5401","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:6d51c0a45552728846b1d5133342e6bc61d09ab8b7566fea791c62b983ca1ab4","observation_id":"eb9b5a40-3308-4a47-969d-588e4018b647","resolution":{"observed_at":"2026-05-18T10:46:16.665814Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T23:19:27.735387+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T23:19:27.735387+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nature , volume=","venue":null,"work_id":"67e10d6e-1642-442e-87dc-743a76087d73","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:de8026d8a477bb7a5c932578847980be88c13b229039b441f105b9e7ca5ba718","observation_id":"8529a0f0-371a-4bc3-9963-774ffa63b442","resolution":{"observed_at":"2026-05-18T10:46:16.916851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , pages=","venue":null,"work_id":"435337a5-b38b-4251-88bf-b24026faa521","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:b1c27b0afc8a8ecc1d88acf1a4bd538fde2328f536d5758eb12621810183e7da","observation_id":"9a3882bc-a404-4cd0-9bfc-01bfee36289c","resolution":{"observed_at":"2026-05-18T10:46:16.920329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-07-06T03:53:10.336430Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":"1409.0473","doi":"10.48550/arxiv.1409.0473","metadata_source":"pith","pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","venue":"cs.CL","work_id":"d831e763-d530-4029-a65c-ac595d82cb2a","year":2014},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:97a86270a639d839b5f42313e81f8b46c98df380ef643a29bbc568dd5ade4808","observation_id":"25dc9822-30c2-4efe-b618-29c694940b93","resolution":{"observed_at":"2026-05-18T10:46:16.593979Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-16T23:20:48.784513+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T23:20:48.784513+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , pages=","venue":null,"work_id":"e7412981-62d8-414e-89ea-1693e4aaad2c","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:17eb092ba825c959dbc62c15d907564acb56ab7183b36f69d136ee496e522415","observation_id":"1a85df91-50f4-42ba-aa1f-1cab198bf8b1","resolution":{"observed_at":"2026-05-18T10:46:16.923246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Acoustics, speech and signal processing (icassp), 2013 ieee international conference on , pages=","venue":null,"work_id":"a764cd84-8f18-4f8b-aebc-dec1a70385a1","year":2013},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:2e94c44c15326c8d5faaadeb635f844a70440c8d9fad968c6da81d58f3de1856","observation_id":"882d5cb8-e0e8-41ac-a591-41a3bf2b6104","resolution":{"observed_at":"2026-05-18T10:46:16.926426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"8f47e752-cd2c-4113-b2fb-687a704a873d","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:1b7bca27c9fbc8bcc8ab3e0bc9d13faa7ee6ab15fde7702a585d17483dda54ca","observation_id":"2375f3f9-6b14-4706-8226-6ff213e8cfae","resolution":{"observed_at":"2026-05-18T10:46:16.929631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08144","last_updated":"2016-10-08T19:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-26T19:59:55Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","version":2},"cited_work":{"arxiv_id":"1609.08144","doi":"10.18653/v1/2021.eacl-main.163","metadata_source":"pith","pith_arxiv_id":"1609.08144","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","venue":"cs.CL","work_id":"e294e5a1-5dd2-44a0-b348-adbd62fe1916","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1609.08144","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:9673441223ed00d82ec0d9b498a23db643b7b841d7b7f708fb0f363a9cd11ed6","observation_id":"c65f45b4-f040-42fe-81a1-d0a2b31cb1d0","resolution":{"observed_at":"2026-05-18T10:46:16.531810Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:25:40.338364Z","title":"Neural computation , volume=","venue":null,"work_id":"4914089f-a9c3-4c65-9a48-040e9ec189be","year":1997},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:2bdbacefcdd824b89702876496fd66481a4e5ed8ffa9ad4a208d3b1481403e44","observation_id":"4761d66e-d0e8-4345-851b-5444360e14f8","resolution":{"observed_at":"2026-05-18T10:46:16.932885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Journal of Uncertainty, Fuzziness and Knowledge-Based Systems , volume=","venue":null,"work_id":"9e8f2c0f-3020-4c13-bd6c-ca5a88c2fbd4","year":1998},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:47b8382e5e219f7744eedf8fd3c92d6b8cd6040c493473940287e17d91588da5","observation_id":"2a604502-f44b-458c-aaf0-da1d1bbdf719","resolution":{"observed_at":"2026-05-18T10:46:16.937812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.04455","last_updated":"2015-12-14T18:44:48Z","snapshot_observed_at":"2026-07-06T04:39:51.329643Z","submitted_at":"2015-12-14T18:44:48Z","title":"Memory-based control with recurrent neural networks","version":1},"cited_work":{"arxiv_id":"1512.04455","doi":null,"metadata_source":"pith","pith_arxiv_id":"1512.04455","snapshot_observed_at":"2026-06-29T19:03:51.189918Z","title":"Memory-based control with recurrent neural networks","venue":"cs.LG","work_id":"19288659-e620-433f-99dd-34295c429b3c","year":2015},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1512.04455","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:d23c9bf574fefbcb6b4571d13198341fbc23a5d8d7a22f807fbce241752079bf","observation_id":"b124e65c-d49d-4fe4-8c73-1d1c99137f87","resolution":{"observed_at":"2026-05-18T10:46:16.683229Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.06065","last_updated":"2016-05-19T17:44:51Z","snapshot_observed_at":"2026-08-03T18:45:26.284373Z","submitted_at":"2016-05-19T17:44:51Z","title":"One-shot Learning with Memory-Augmented Neural Networks","version":1},"cited_work":{"arxiv_id":"1605.06065","doi":null,"metadata_source":"pith","pith_arxiv_id":"1605.06065","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One-shot Learning with Memory-Augmented Neural Networks","venue":"cs.LG","work_id":"0b06f109-e249-4602-847d-86a1a4ada41e","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1605.06065","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:3094d59eef0eb4c820531796ebefa2f77857ef2044741948805342ff2cdd8557","observation_id":"80e2d20a-61ef-4a58-988a-8f6bf0141a89","resolution":{"observed_at":"2026-05-18T10:46:16.688673Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , pages=","venue":null,"work_id":"714a28ce-81bd-4dab-bdf2-9c906a8620a4","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:85a409309eac05d0451e3863894d49bcc8dcb44b34711f119631e0383b4673c7","observation_id":"89268fea-ca11-4c55-b745-a6b42d018f70","resolution":{"observed_at":"2026-05-18T10:46:16.940948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , pages=","venue":null,"work_id":"a8103261-41f7-4e23-bd80-ac2e0c1a874c","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:eb7883edd05b92682834b154efc468a9fa1f645aa3bd8fc93b7d4f2c0bf4201b","observation_id":"ccf862c8-e024-49c4-b982-afb45c4c787a","resolution":{"observed_at":"2026-05-18T10:46:16.947277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06986","last_updated":"2017-04-23T21:31:22Z","snapshot_observed_at":"2026-07-06T05:38:55.598961Z","submitted_at":"2017-04-23T21:31:22Z","title":"Learning to Create and Reuse Words in Open-Vocabulary Neural Language Modeling","version":1},"cited_work":{"arxiv_id":"1704.06986","doi":null,"metadata_source":"pith","pith_arxiv_id":"1704.06986","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to Create and Reuse Words in Open-Vocabulary Neural Language Modeling","venue":"cs.CL","work_id":"db5ebef7-7ee4-43c4-9f69-d18f5cf71318","year":2017},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1704.06986","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:7306460df70fa98c00cfd170c903fe9ae1f23e2af15e7759c3ccc0496f30495d","observation_id":"964b98e2-22f5-4525-816a-78a01745fd9a","resolution":{"observed_at":"2026-05-18T10:46:16.467292Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":"1609.07843","doi":"10.1007/978-3-030-62077-6","metadata_source":"pith","pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pointer Sentinel Mixture Models","venue":"cs.CL","work_id":"fef3833e-dc80-42a3-a1e0-ffbfafee6fff","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:f63ae09b54a526242814332183df11006f09412ecb242fed00489119a8fd5b1f","observation_id":"13e2763d-33fa-4947-9525-c0a83c604698","resolution":{"observed_at":"2026-05-18T10:46:16.487194Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.04426","last_updated":"2016-12-13T23:09:49Z","snapshot_observed_at":"2026-07-06T05:22:35.662420Z","submitted_at":"2016-12-13T23:09:49Z","title":"Improving Neural Language Models with a Continuous Cache","version":1},"cited_work":{"arxiv_id":"1612.04426","doi":null,"metadata_source":"pith","pith_arxiv_id":"1612.04426","snapshot_observed_at":"2026-07-03T04:17:37.504858Z","title":"Improving Neural Language Models with a Continuous Cache","venue":"cs.CL","work_id":"b4addec9-bdfb-4ab2-9733-638cf8925342","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1612.04426","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:8b6f69dbf34cd1aa697a969ab3d454476d98d68c8ecac1593e73e2720a009399","observation_id":"3325e77b-d8a4-401e-96d7-0b27622976ad","resolution":{"observed_at":"2026-05-18T10:46:16.517630Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , pages=","venue":null,"work_id":"e255b1ab-5ef4-40b5-83df-4035cf0e3e0e","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:7f8403e7a0e4fa76005b83dcac851bd0c2f700ff1471f8d795b4d0c0350eed4a","observation_id":"fc0ccd2e-ed4c-4a3f-ad45-846c1b4c8941","resolution":{"observed_at":"2026-05-18T10:46:16.950693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04309","last_updated":"2017-06-19T16:33:04Z","snapshot_observed_at":"2026-07-06T05:10:48.516101Z","submitted_at":"2016-09-14T15:15:08Z","title":"Efficient softmax approximation for GPUs","version":3},"cited_work":{"arxiv_id":"1609.04309","doi":null,"metadata_source":"pith","pith_arxiv_id":"1609.04309","snapshot_observed_at":"2026-06-29T08:13:14.772302Z","title":"Efficient softmax approximation for GPUs","venue":"cs.CL","work_id":"035e33f4-b8d8-4b4f-b01f-d750ab48cacb","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1609.04309","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:d39f016de76bef731f8c18ac82781c11a80d95744929b8bb6e7409df415981ec","observation_id":"41e4383c-375f-4908-b64b-961f2046ad67","resolution":{"observed_at":"2026-05-18T10:46:16.582529Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Acoustics, Speech, and Signal Processing","venue":null,"work_id":"bf8d5a4e-f940-4458-91a7-454a744a6bc9","year":2001},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:a5ec3aa48c2e8ea309251bac1e9732adeea3ff1e1e9ff1b0a0dc7608f7b7a032","observation_id":"f85e9bc2-b424-4b3f-964b-08e577dcfcbb","resolution":{"observed_at":"2026-05-18T10:46:16.955705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":"1607.06450","doi":"10.1007/978-3-319-32025-0","metadata_source":"pith","pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Layer Normalization","venue":"stat.ML","work_id":"20a2d720-0046-4c7c-bcd6-327ec8143f69","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:ee4aa5e29baf4117ec08c0aef705a7bea781cb600d0710e9eabda846d03d0ca7","observation_id":"12c7aef1-be53-49c6-8305-aa917585e1ae","resolution":{"observed_at":"2026-05-18T10:46:16.616698Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.08083","last_updated":"2017-09-08T22:26:49Z","snapshot_observed_at":"2026-08-02T05:45:00.617012Z","submitted_at":"2016-12-23T20:32:33Z","title":"Language Modeling with Gated Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1612.08083","doi":"10.48550/arxiv.1612.08083","metadata_source":"pith","pith_arxiv_id":"1612.08083","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Modeling with Gated Convolutional Networks","venue":"cs.CL","work_id":"4e058d7a-a6b5-46f4-ae22-b3cdb9386477","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1612.08083","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:2922a362c01429a2586a7006d512c6f8fc9a12ca3f56f1544602bb133e501ead","observation_id":"2e206eb0-4850-4990-baa5-f6cb50edb57a","resolution":{"observed_at":"2026-05-18T10:46:16.630593Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07267","last_updated":"2018-03-08T08:15:24Z","snapshot_observed_at":"2026-08-02T02:54:04.370191Z","submitted_at":"2017-05-20T06:53:09Z","title":"Search Engine Guided Non-Parametric Neural Machine Translation","version":2},"cited_work":{"arxiv_id":"1705.07267","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.07267","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Search Engine Guided Non-Parametric Neural Machine Translation","venue":"cs.CL","work_id":"0cb45a82-6dad-41c5-bbf6-36a28ee8a9db","year":2017},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1705.07267","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:311cb0fd9ba2337fc13be92045f6725d0b929a572a63cef5f44f3c87389220d9","observation_id":"233a4e9c-f36c-4ad1-ab62-cd865f88b96a","resolution":{"observed_at":"2026-05-18T10:46:16.659674Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , pages=","venue":null,"work_id":"90fa0985-f652-426f-b626-74c3e6e214b0","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:046cbab460409c90f1b7caec6c021fce86f4decc343f1635d5d1a4b944f209b8","observation_id":"72e591f3-4bff-4034-ad5b-1a7c8715f4b8","resolution":{"observed_at":"2026-05-18T10:46:16.959551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.09601","last_updated":"2018-10-05T08:40:30Z","snapshot_observed_at":"2026-07-06T06:11:17.645784Z","submitted_at":"2017-11-27T09:48:44Z","title":"Memory Aware Synapses: Learning what (not) to forget","version":4},"cited_work":{"arxiv_id":"1711.09601","doi":null,"metadata_source":"pith","pith_arxiv_id":"1711.09601","snapshot_observed_at":"2026-06-29T23:24:01.958617Z","title":"Memory Aware Synapses: Learning what (not) to forget","venue":"cs.CV","work_id":"284bd109-de7d-449b-84ba-a955aff83acc","year":2017},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1711.09601","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:aa4311693bbc62056a0e0eb100f06bf9f65787a11cbff39de48265f255898693","observation_id":"897f60bb-516b-4aea-99bb-3b2be5fb50d0","resolution":{"observed_at":"2026-05-18T10:46:16.677716Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Acoustics, Speech, and Signal Processing","venue":null,"work_id":"7ea7a5f6-9163-4582-81b1-3be970cc8a3d","year":1995},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:e3b99bbe878cba97a679acf90f664a5c5758ad073c3da21e7d54f35b9fe6d998","observation_id":"4d5453cf-c78a-4862-b479-cdd66c53d4cc","resolution":{"observed_at":"2026-05-18T10:46:16.963922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thirteenth Annual Conference of the International Speech Communication Association , year=","venue":null,"work_id":"ad5ac123-c324-4bb3-9557-8f017df56528","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:948dc36e19c97b7d7c68548d0231dddfad96fbf57bba4776ddc2c16a6db1c9b8","observation_id":"3d9b5437-40b8-4a88-8ed3-553165042567","resolution":{"observed_at":"2026-05-18T10:46:16.966891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 25th international conference on Machine learning , pages=","venue":null,"work_id":"6b6a811d-af48-453c-bae9-44f928978e64","year":2008},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:2b93817d64ff46ea843217c30e1a12fa68b9e4dcbc1d16c8099375bae0a9a808","observation_id":"17a09e04-bc2f-4f5b-ba7c-ba006de93d71","resolution":{"observed_at":"2026-05-18T10:46:16.971237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1404.2188","last_updated":"2014-04-08T15:46:44Z","snapshot_observed_at":"2026-07-06T03:40:40.008561Z","submitted_at":"2014-04-08T15:46:44Z","title":"A Convolutional Neural Network for Modelling Sentences","version":1},"cited_work":{"arxiv_id":"1404.2188","doi":null,"metadata_source":"pith","pith_arxiv_id":"1404.2188","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A Convolutional Neural Network for Modelling Sentences","venue":"cs.CL","work_id":"2c17ab98-9918-45b7-a867-2e4fa4f40bdf","year":2014},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1404.2188","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:1956cad7809239da0c140b250696d80b5b1e09c83779d8dbf9d8687b6bc981ac","observation_id":"18da6790-1065-4e8b-bfaf-80818ee7abee","resolution":{"observed_at":"2026-05-18T10:46:16.721929Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.02410","last_updated":"2016-02-11T23:01:48Z","snapshot_observed_at":"2026-07-06T04:45:24.152472Z","submitted_at":"2016-02-07T19:11:17Z","title":"Exploring the Limits of Language Modeling","version":2},"cited_work":{"arxiv_id":"1602.02410","doi":"10.48550/arxiv.1602.02410","metadata_source":"pith","pith_arxiv_id":"1602.02410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploring the Limits of Language Modeling","venue":"cs.CL","work_id":"a9dbcb7a-e48d-42a4-8d60-a8f723751a97","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1602.02410","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:3ba1633ca07c542df9781170b1b8c6eb450bf01d207635576ff6a5c4fb496f0d","observation_id":"ffcc4068-c12c-45df-ab8d-ed19f5deb328","resolution":{"observed_at":"2026-05-18T10:46:16.731598Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:12:51.438400Z","title":"author=","venue":null,"work_id":"e114ac8a-3c45-4448-ac8c-4aee5cbbb98c","year":1995},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:c92c02902c9d2c150860c60fee31be469f6f9aafa9eb598d1c7b11836f2f87b5","observation_id":"c26a15f6-7e28-443c-9857-a70027020544","resolution":{"observed_at":"2026-05-18T10:46:16.973971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trends in cognitive sciences , volume=","venue":null,"work_id":"c29507ba-949c-410d-b58e-cb53c4f3b287","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:7e7fdfc582e5da9b3bc491573c3db8d4fbde3debd6c9bc716104f55a01bc1a75","observation_id":"ba88e12a-f764-45a9-8d6f-cee15e27a9f8","resolution":{"observed_at":"2026-05-18T10:46:16.977580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1603.08148","last_updated":"2016-08-21T20:03:39Z","snapshot_observed_at":"2026-08-03T11:03:47.796449Z","submitted_at":"2016-03-26T22:31:57Z","title":"Pointing the Unknown Words","version":3},"cited_work":{"arxiv_id":"1603.08148","doi":null,"metadata_source":"pith","pith_arxiv_id":"1603.08148","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pointing the Unknown Words","venue":"cs.CL","work_id":"a542257d-1947-4933-bb55-867a5c1c3bbc","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1603.08148","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:31cea58fa31a13e2f2382ff32a9d0af1ed5cb878d2b52f6a1e6959530355437a","observation_id":"d57c507f-a40a-40b3-a976-3786bc2981da","resolution":{"observed_at":"2026-05-18T10:46:16.474309Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"1949 , publisher=","venue":null,"work_id":"fdc3daca-22c0-4c30-a1b4-762d75989906","year":1949},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:6e22adcdf6405e0b277c8d6b9b112b28deec9d8fe1ec7a51bc2970605b333f6c","observation_id":"7be95c50-8231-475c-a504-7ccf20e81130","resolution":{"observed_at":"2026-05-18T10:46:16.980481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NY Houghton-Mifflin , year=","venue":null,"work_id":"643e1f8e-519c-4a8e-986a-c8830c1f784b","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:b8ded9194eb14e1d0784e80697ca2563c79a4224d397f0fe24835fbbf8fad662","observation_id":"cc90ed68-d6da-4f10-ad59-49636ee78f88","resolution":{"observed_at":"2026-05-18T10:46:16.983529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2018 , url=","venue":null,"work_id":"13ee4481-749f-4211-8bdd-fd708bfe9e42","year":2018},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:d6ba8161a7eefc91674d080e75e57e66dc5d686b488ecfce5eb847be18ac9ba3","observation_id":"234ba166-f8c9-41a1-8533-f99cabe68bdb","resolution":{"observed_at":"2026-05-18T10:46:16.987171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Artificial Neural Networks , pages=","venue":null,"work_id":"85d7bfec-b4f6-45fe-b870-5230f0dd016c","year":2001},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:4e9bfdb36d211efc6fc367b05d214427f727b0626d1131fd9e0649254e4995e9","observation_id":"b3ed0d0b-ab06-47a4-ae65-cf3945d1bd82","resolution":{"observed_at":"2026-05-18T10:46:16.990242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , pages=","venue":null,"work_id":"adcad31d-93c1-4cda-9b77-7a2459aa4c56","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:648eb69c0a306b29a81830172643d66f9ca7c9b94d0394c37be7c2cae3bc4395","observation_id":"22889612-60a6-4d08-b0f3-90e30b172d67","resolution":{"observed_at":"2026-05-18T10:46:16.993103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.00767","last_updated":"2017-06-30T07:37:56Z","snapshot_observed_at":"2026-07-31T17:45:32.663008Z","submitted_at":"2017-03-02T12:47:40Z","title":"Attentive Recurrent Comparators","version":3},"cited_work":{"arxiv_id":"1703.00767","doi":null,"metadata_source":"pith","pith_arxiv_id":"1703.00767","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attentive Recurrent Comparators","venue":"cs.CV","work_id":"ffa4bceb-4cf7-4541-acbb-013e0b174f53","year":2017},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1703.00767","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:703720d4afd1564336e1f6d33fbe92976567f05a59e7f05b5c569be716ef8fa9","observation_id":"47506610-fd3d-4963-86c6-2751897bc113","resolution":{"observed_at":"2026-05-18T10:46:16.609435Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:32:41.149027Z","title":"Proceedings of the National Academy of Sciences , volume=","venue":null,"work_id":"a47cd6ca-21ef-4567-a465-ebd54baad018","year":2017},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:7b19a00540f45835b9c87c51f05d1ea9afd0649f60e99a268bcb94636b1996e2","observation_id":"a01ed393-41bb-43c0-9a20-0a0995a2c9ed","resolution":{"observed_at":"2026-05-18T10:46:16.996576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"87dfdd96-930b-4d03-b697-1cac13cd5b6c","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:d8197f40530b856c6d9e1a82bd2b6250a3d3b853013556d9d184710a8f676286","observation_id":"d9e38191-e93b-463b-a72d-500dbb6f7d9c","resolution":{"observed_at":"2026-05-18T10:46:16.999707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.03400","last_updated":"2017-07-18T16:45:29Z","snapshot_observed_at":"2026-08-03T03:10:27.423500Z","submitted_at":"2017-03-09T18:58:03Z","title":"Model-Agnostic Meta-Learning for Fast Adaptation of Deep Networks","version":3},"cited_work":{"arxiv_id":"1703.03400","doi":"10.48550/arxiv.1703.03400","metadata_source":"pith","pith_arxiv_id":"1703.03400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model-Agnostic Meta-Learning for Fast Adaptation of Deep Networks","venue":"cs.LG","work_id":"5f47d2dd-edaa-4d92-abe2-7f68a48ff1cf","year":2017},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1703.03400","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:16ccb94eb3cfdb32ab4f270d11975aaa87916d0f19b5b1ef1539052aa9d398f9","observation_id":"4c31bf8f-78fa-4d51-98ce-4f21e360447d","resolution":{"observed_at":"2026-05-18T10:46:16.635514Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-19T23:52:04.953818+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T23:52:04.953818+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , pages=","venue":null,"work_id":"7b51bcd4-2ba6-4d69-86ee-9abd1cd10312","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:86c9e373113b682a999256359b8219fba0de131e5e973843fbf53d620de13bbf","observation_id":"85492747-8742-4698-9d48-ec5d57381028","resolution":{"observed_at":"2026-05-18T10:46:17.003392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the Thirteenth International Conference on Artificial Intelligence and Statistics , pages=","venue":null,"work_id":"fd2d401b-7b4c-4fa2-9dfa-495769bcb83a","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:c19b84b6cdca132976507d5ad1f159f7574778ea3dcbf1925ca7ca6a79467903","observation_id":"f42e9e0d-a4d2-4530-a268-b01390c4d07f","resolution":{"observed_at":"2026-05-18T10:46:16.735605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:40.158139Z","title":"Science , volume=","venue":null,"work_id":"e304116b-a096-4339-90d7-1550a95d5440","year":2015},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:469bfc7a8501c3e048ae781082bae63cefe5507d87d2a6f27490b91b5664b3f1","observation_id":"0133baa6-6d43-4cdf-9782-05bca6773a71","resolution":{"observed_at":"2026-05-18T10:46:16.738966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"COURSERA: Neural networks for machine learning , volume=","venue":null,"work_id":"727d67f4-6209-4c0c-b164-0c2917d6a514","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:b2394cf964858ea1bdbc920079e23a0aed514bd99449cffe07efc5be6b607c34","observation_id":"4fef4839-c74d-4b43-8a10-61687642c36c","resolution":{"observed_at":"2026-05-18T10:46:16.742377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"dvd , author=","venue":null,"work_id":"4d42a05f-db04-401f-8d4d-bc37f8630711","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:17913cd8858f5b964088a942dc10e1f337834b3cc6e1524c0713f1e86496db17","observation_id":"9d08faa1-07c5-4c98-8b9f-10874c0a511d","resolution":{"observed_at":"2026-05-18T10:46:16.745694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.05589","last_updated":"2017-11-20T17:57:58Z","snapshot_observed_at":"2026-07-06T05:51:36.145913Z","submitted_at":"2017-07-18T12:35:53Z","title":"On the State of the Art of Evaluation in Neural Language Models","version":2},"cited_work":{"arxiv_id":"1707.05589","doi":null,"metadata_source":"pith","pith_arxiv_id":"1707.05589","snapshot_observed_at":"2026-06-29T18:53:51.687415Z","title":"On the State of the Art of Evaluation in Neural Language Models","venue":"cs.CL","work_id":"ab688bcb-8407-488a-8445-6ceea09a6665","year":2017},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1707.05589","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:2961076daee00539325c6900da5265b3751eae813769a1110200c0b5950e9e9a","observation_id":"bf7b805a-1c64-4fbf-bb1a-9cf86a856411","resolution":{"observed_at":"2026-05-18T10:46:16.693638Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2017 , journal=","venue":null,"work_id":"0ed36a8c-0852-4ab0-bc90-e84975aa4682","year":2017},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:0d3f1356adaf9a2a368d03e1ce03fa2e3818f6d69ac2d0f1e9f688a4ac6e1d25","observation_id":"e1289665-b79f-4dfb-b846-ecc41afb93dd","resolution":{"observed_at":"2026-05-18T10:46:16.749725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.04906","last_updated":"2015-12-15T19:29:01Z","snapshot_observed_at":"2026-08-02T13:22:18.606524Z","submitted_at":"2015-12-15T19:29:01Z","title":"Strategies for Training Large Vocabulary Neural Language Models","version":1},"cited_work":{"arxiv_id":"1512.04906","doi":null,"metadata_source":"pith","pith_arxiv_id":"1512.04906","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Strategies for Training Large Vocabulary Neural Language Models","venue":"cs.CL","work_id":"518c70a6-d8b4-46f9-b528-c9568961858e","year":2015},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1512.04906","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:bed898e3d9b160fc8f283c10387e1f43dac45f6d3d42ac26b55d66f3042ae220","observation_id":"0c3c4725-eb75-4eba-8666-19750ea1484e","resolution":{"observed_at":"2026-05-18T10:46:16.702975Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03596","last_updated":"2018-02-10T14:18:08Z","snapshot_observed_at":"2026-08-02T14:00:57.779355Z","submitted_at":"2018-02-10T14:18:08Z","title":"Deep Meta-Learning: Learning to Learn in the Concept Space","version":1},"cited_work":{"arxiv_id":"1802.03596","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.03596","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep Meta-Learning: Learning to Learn in the Concept Space","venue":"cs.LG","work_id":"384d7ca8-3c31-4fcc-ad77-82f2391809f3","year":2018},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1802.03596","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:db617ef669e25c27c6e1ebef4970fea52642b9196f0aa7855621b21d135c511f","observation_id":"519e806b-9a87-4d32-9224-bec9e76eebef","resolution":{"observed_at":"2026-05-18T10:46:16.707657Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.03953","last_updated":"2018-03-02T20:20:52Z","snapshot_observed_at":"2026-08-04T06:22:23.897655Z","submitted_at":"2017-11-10T18:29:00Z","title":"Breaking the Softmax Bottleneck: A High-Rank RNN Language Model","version":4},"cited_work":{"arxiv_id":"1711.03953","doi":null,"metadata_source":"pith","pith_arxiv_id":"1711.03953","snapshot_observed_at":"2026-07-04T08:19:44.399751Z","title":"Breaking the Softmax Bottleneck: A High-Rank RNN Language Model","venue":"cs.CL","work_id":"bfedf27f-9cbb-4e1d-9585-2a5229779437","year":2017},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1711.03953","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:831a7f8c8e030c37e7dd6f4cc53aa3fde010894dd2beb596ae0e7184c981efb9","observation_id":"b2a9de35-17c8-4805-9611-676a9917d8c4","resolution":{"observed_at":"2026-05-18T10:46:16.717100Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to learn , pages=","venue":null,"work_id":"2aa3e262-a998-4b8b-9681-b72e52c87449","year":1998},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:c6a19f13cbf1983f73e871c4bbdffeebc2bbbfe3e43590a602a46f6857f430e1","observation_id":"8c008ac4-abde-46d9-9140-b5a4a9f3e4f0","resolution":{"observed_at":"2026-05-18T10:46:16.752962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"1996a , school=","venue":null,"work_id":"5573b563-c4be-4974-887f-d85f0a4b365d","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:ccddc98d68f580d9f0dfc8f9ff3973b590413ed51246ad798fab272f841ff145","observation_id":"d2916fc0-b51e-4a18-b84a-f67ff6c383e0","resolution":{"observed_at":"2026-05-18T10:46:16.847206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural computation , volume=","venue":null,"work_id":"e546ceaa-b2da-446b-91cd-38c1157bb1b0","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:9fc95576b49265b7c57a2d698bc992c582ec66b0f81744778fda78cdd83b0645","observation_id":"149dee19-63c2-4f73-8c64-06ace70e7e9a","resolution":{"observed_at":"2026-05-18T10:46:16.759195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , pages=","venue":null,"work_id":"c835ae10-374a-4420-b054-4b4de3bdb9b2","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:1112e81a43ca1e89c52e417496970567dc2c753ba69271eafb5088f88cd490f6","observation_id":"62949997-c542-41ee-9b86-ee8a4f90a198","resolution":{"observed_at":"2026-05-18T10:46:16.762736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eleventh Annual Conference of the International Speech Communication Association , year=","venue":null,"work_id":"746f3000-6821-4c77-9dd8-2280b6ec72a5","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:4abf07bf4c2861b7d266498c96588bbae60526c8c742837b32072d4fffe13f9a","observation_id":"8fd72273-9273-4191-92ff-9d82bf127091","resolution":{"observed_at":"2026-05-18T10:46:16.766652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10049","last_updated":"2018-03-27T12:53:24Z","snapshot_observed_at":"2026-07-06T06:30:26.313049Z","submitted_at":"2018-03-27T12:53:24Z","title":"Fast Parametric Learning with Activation Memorization","version":1},"cited_work":{"arxiv_id":"1803.10049","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.10049","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast Parametric Learning with Activation Memorization","venue":"cs.LG","work_id":"bf2cd6d9-2050-488a-b926-962a932511e8","year":2018},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1803.10049","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:c13426455539f1bc3bd0526c4a887d1b9210b4a83408be8401cdfa99b74eb76d","observation_id":"914581d2-d3d4-4dcf-8cc4-601c20718b95","resolution":{"observed_at":"2026-05-18T10:46:16.480480Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , pages=","venue":null,"work_id":"f1cd7341-40c8-49be-b164-28200e18c3fb","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:b14ac495b048021df2cd8ebbaac6b827f701086df3a4a4f4f4b81c18645d10a8","observation_id":"f4a208bb-7e8c-4845-abf2-71b3836247f9","resolution":{"observed_at":"2026-05-18T10:46:16.770232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.10853","last_updated":"2019-02-22T23:41:46Z","snapshot_observed_at":"2026-07-06T07:04:49.995800Z","submitted_at":"2018-09-28T04:30:11Z","title":"Adaptive Input Representations for Neural Language Modeling","version":3},"cited_work":{"arxiv_id":"1809.10853","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.10853","snapshot_observed_at":"2026-07-03T17:38:43.607419Z","title":"Adaptive Input Representations for Neural Language Modeling","venue":"cs.CL","work_id":"84b64f8d-525e-4a27-b130-855b07cc501f","year":2018},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1809.10853","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:68df3f32b559e3ce4eb05697ecb8640a877e49f95a6c6761e65caac565471745","observation_id":"b1ea3cc4-a4a6-4b64-a11f-bd5bff1e80b5","resolution":{"observed_at":"2026-05-18T10:46:16.493965Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02860","last_updated":"2019-06-02T21:21:48Z","snapshot_observed_at":"2026-07-06T07:25:48.468658Z","submitted_at":"2019-01-09T18:28:19Z","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","version":3},"cited_work":{"arxiv_id":"1901.02860","doi":"10.48550/arxiv.1901.02860","metadata_source":"pith","pith_arxiv_id":"1901.02860","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","venue":"cs.LG","work_id":"eb970d64-41ff-4e44-afd0-e3bb975e0dc4","year":2019},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1901.02860","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:14bcde58fafdd4956b901b063c600bf14063f48ddf8ae6df0a9f0fe23e51a96a","observation_id":"5215501a-4072-49da-99be-20fe95e04ced","resolution":{"observed_at":"2026-05-18T10:46:16.499561Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.09106","last_updated":"2016-12-01T10:08:15Z","snapshot_observed_at":"2026-07-06T05:12:38.024970Z","submitted_at":"2016-09-27T05:57:00Z","title":"HyperNetworks","version":4},"cited_work":{"arxiv_id":"1609.09106","doi":"10.48550/arxiv.1609.09106","metadata_source":"pith","pith_arxiv_id":"1609.09106","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HyperNetworks","venue":"cs.LG","work_id":"45baa084-f34a-44f4-bb45-6d2b9131cb67","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1609.09106","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:35d20f5df6051de0f8b4258ee1a77ee74f47c762f03439c956faf9ea18f9c599","observation_id":"200a289e-cbe0-4cc0-96ee-74d22302b029","resolution":{"observed_at":"2026-05-18T10:46:16.504786Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.01704","last_updated":"2017-03-09T05:22:52Z","snapshot_observed_at":"2026-08-01T18:52:33.790642Z","submitted_at":"2016-09-06T19:37:57Z","title":"Hierarchical Multiscale Recurrent Neural Networks","version":7},"cited_work":{"arxiv_id":"1609.01704","doi":null,"metadata_source":"pith","pith_arxiv_id":"1609.01704","snapshot_observed_at":"2026-07-04T17:40:00.843260Z","title":"Hierarchical Multiscale Recurrent Neural Networks","venue":"cs.LG","work_id":"135f03cf-af58-404b-a925-021d374da668","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1609.01704","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:85ff997bbb27828060e0abd9150c3e56f32d75aa0b256b8450b4c914c216f877","observation_id":"bcd11c4f-fdb0-450a-8519-36b8c067fdfa","resolution":{"observed_at":"2026-05-18T10:46:16.511171Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 34th International Conference on Machine Learning-Volume 70 , pages=","venue":null,"work_id":"11804e90-6007-452c-af2f-7da9d249292b","year":2017},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:63743d488f38519d78deeb86668fa184bd6967e5f7d1cdc23cdf1b1a4efcb0d2","observation_id":"03e0ad89-e809-4a3b-805c-2b959edc3252","resolution":{"observed_at":"2026-05-18T10:46:16.774201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07959","last_updated":"2017-10-12T17:05:47Z","snapshot_observed_at":"2026-07-06T05:12:12.264453Z","submitted_at":"2016-09-26T13:12:51Z","title":"Multiplicative LSTM for sequence modelling","version":3},"cited_work":{"arxiv_id":"1609.07959","doi":null,"metadata_source":"pith","pith_arxiv_id":"1609.07959","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multiplicative LSTM for sequence modelling","venue":"cs.NE","work_id":"97bc7655-1c7d-4522-9c03-ab85fd9a2b7d","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1609.07959","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:095f75878ea391b0aed4189d9e3dc46267ddf6f8b9e65775e5c9ef51c1979cf8","observation_id":"549acdf6-fd6e-4043-8279-d6f8fe166dd2","resolution":{"observed_at":"2026-05-18T10:46:16.524083Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":"b1fd833d-c9dc-4d5e-823e-2f3b5dce834b","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:ed2206fd88cd43ad5b252334f1ed4fcf1d548ef2e17813522e583ea4206201db","observation_id":"e904083a-3c20-4f5d-8aae-72181104069c","resolution":{"observed_at":"2026-05-18T10:46:16.778718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1308.0850","last_updated":"2014-06-05T16:04:02Z","snapshot_observed_at":"2026-08-05T10:16:44.137827Z","submitted_at":"2013-08-04T21:04:36Z","title":"Generating Sequences With Recurrent Neural Networks","version":5},"cited_work":{"arxiv_id":"1308.0850","doi":"10.48550/arxiv.1308.0850","metadata_source":"pith","pith_arxiv_id":"1308.0850","snapshot_observed_at":"2026-07-10T20:07:33.400866Z","title":"Generating Sequences With Recurrent Neural Networks","venue":"cs.NE","work_id":"3da63ce3-c701-48e0-a32e-756f2712b58c","year":2013},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":117,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1308.0850","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:62f269c911a24f1d7a32e44eb98bc84f5f2164b51a6e79deff69d550a666b66d","observation_id":"50901ec4-d001-44db-bac7-c5874fc068fd","resolution":{"observed_at":"2026-05-18T10:46:16.537878Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.10099","last_updated":"2017-03-15T18:09:51Z","snapshot_observed_at":"2026-07-06T05:16:51.224466Z","submitted_at":"2016-10-31T19:56:39Z","title":"Neural Machine Translation in Linear Time","version":2},"cited_work":{"arxiv_id":"1610.10099","doi":null,"metadata_source":"pith","pith_arxiv_id":"1610.10099","snapshot_observed_at":"2026-07-02T02:36:27.049458Z","title":"Neural Machine Translation in Linear Time","venue":"cs.CL","work_id":"c208d1e3-bef0-4d3f-82d3-6f4b028d6250","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1610.10099","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:1c7914a1cfa349a2694122796310ae3d1ab5b7aef7815e6df168e869ce260977","observation_id":"e6374931-4216-4b32-a97c-e6e38396bd45","resolution":{"observed_at":"2026-05-18T10:46:16.543617Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01576","last_updated":"2016-11-21T20:52:34Z","snapshot_observed_at":"2026-07-06T05:17:29.499249Z","submitted_at":"2016-11-05T00:31:25Z","title":"Quasi-Recurrent Neural Networks","version":2},"cited_work":{"arxiv_id":"1611.01576","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.01576","snapshot_observed_at":"2026-07-04T03:29:29.390096Z","title":"Quasi-Recurrent Neural Networks","venue":"cs.NE","work_id":"a3b3168b-5ab0-4a88-9e57-969e93933291","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":119,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1611.01576","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:bc3bd1947a36589cbbe8875b4934a971382fe2a16f23951c9af066598117f503","observation_id":"f9f4e484-35c2-4926-9170-77614067a27f","resolution":{"observed_at":"2026-05-18T10:46:16.549503Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":"1904.10509","doi":"10.48550/arxiv.1904.10509","metadata_source":"pith","pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generating Long Sequences with Sparse Transformers","venue":"cs.LG","work_id":"c5b81688-45ee-4a9a-b095-e6290f45cb6c","year":2019},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":120,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:ddd4e472a4243b84c3d4fba5df0168d77e0affddfb6191111aa9cdf2a8a15769","observation_id":"9e64f01b-3e4a-42a1-ac60-f908c93aaf62","resolution":{"observed_at":"2026-05-18T10:46:16.556074Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07799","last_updated":"2019-08-08T06:58:31Z","snapshot_observed_at":"2026-07-06T07:54:02.817335Z","submitted_at":"2019-05-19T19:43:14Z","title":"Adaptive Attention Span in Transformers","version":2},"cited_work":{"arxiv_id":"1905.07799","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.07799","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:1905.07799 , year=","venue":null,"work_id":"08e00647-200c-4770-8b3e-fd49def2e288","year":1905},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1905.07799","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:45235a94768c76522a0641ee40be8e5abf83d5af5df533a3b14999fa70ad62d4","observation_id":"f9bcd4de-875f-426d-bffa-9045c64bd324","resolution":{"observed_at":"2026-05-18T10:46:16.561868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.3005","last_updated":"2014-03-04T18:30:26Z","snapshot_observed_at":"2026-08-05T11:04:54.095339Z","submitted_at":"2013-12-11T00:25:57Z","title":"One Billion Word Benchmark for Measuring Progress in Statistical Language Modeling","version":3},"cited_work":{"arxiv_id":"1312.3005","doi":null,"metadata_source":"pith","pith_arxiv_id":"1312.3005","snapshot_observed_at":"2026-07-04T13:59:52.553578Z","title":"One Billion Word Benchmark for Measuring Progress in Statistical Language Modeling","venue":"cs.CL","work_id":"9d2758a8-0899-488e-adf7-065babd89bba","year":2013},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":122,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1312.3005","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:0f11addde8e664003083e8354522b28b933f63ff06dd96a3f53f8e522aefa427","observation_id":"5992963e-c0bd-463e-a49a-80b6e17977aa","resolution":{"observed_at":"2026-05-18T10:46:16.570709Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.06682","last_updated":"2019-03-11T21:37:42Z","snapshot_observed_at":"2026-08-02T04:51:39.379194Z","submitted_at":"2018-10-15T20:50:05Z","title":"Trellis Networks for Sequence Modeling","version":2},"cited_work":{"arxiv_id":"1810.06682","doi":null,"metadata_source":"pith","pith_arxiv_id":"1810.06682","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trellis Networks for Sequence Modeling","venue":"cs.LG","work_id":"243d66ee-4e2a-4546-8720-9e48091ef704","year":2018},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":123,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1810.06682","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:a4f37f6e9d97888cdd1cfbb5f26eb8d86496649633850c40cbb2dd274c99d9d0","observation_id":"66167163-2d6b-4229-b232-7f097e54cf6a","resolution":{"observed_at":"2026-05-18T10:46:16.576678Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2016 , organization=","venue":null,"work_id":"8eeaf03f-97bf-48a1-9027-8cd9ac01e56b","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:c9d24135a63a40b74bb55c70a20e67d82aa9dc0fd04a3c427ec688e06fccbf5c","observation_id":"b28a4541-61b4-457d-a8c7-e601d94543f2","resolution":{"observed_at":"2026-05-18T10:46:16.782636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.02301","last_updated":"2016-04-01T05:31:33Z","snapshot_observed_at":"2026-07-06T04:35:42.374943Z","submitted_at":"2015-11-07T04:36:20Z","title":"The Goldilocks Principle: Reading Children's Books with Explicit Memory Representations","version":4},"cited_work":{"arxiv_id":"1511.02301","doi":"10.48550/arxiv.1511.02301","metadata_source":"pith","pith_arxiv_id":"1511.02301","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Goldilocks Principle: Reading Children's Books with Explicit Memory Representations","venue":"cs.CL","work_id":"008f6afd-b884-4be2-8478-affc3abfba1e","year":2015},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":125,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1511.02301","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:36c2c896c61eb4b8cb8e7060639129200b5fcb3227fd15a8356e40cc7dea433e","observation_id":"4067da91-de35-4d1a-8933-856c062ce62b","resolution":{"observed_at":"2026-05-18T10:46:16.587737Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T04:40:40.990246Z","title":"Proceedings of the IEEE international conference on computer vision , pages=","venue":null,"work_id":"3dca998a-9d55-4c15-a722-380c3d1f74af","year":null},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":126,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:1f213a8222f1899f980977150f03913a77dd41112a8246497da05aa4dc643910","observation_id":"cd39ff37-907b-4a61-a80e-696c7feda8bb","resolution":{"observed_at":"2026-05-18T10:46:16.786410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":34,"parse_uncertain":0,"unresolved":10,"verified_exact":4,"verified_fuzzy":52},"total_outbound_references":125},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 125 outbound references and 66 inbound Pith citation observations for arXiv:1911.05507."}