{"as_of":"2026-08-08T10:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6f0cbef683b2765b0338978da120bf279e76d3b82562370c3c2720ad08f003e3","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:23:18.048778Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T21:48:14.799377Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T18:57:16.733464Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"cited_work":{"arxiv_id":"2505.22107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22107","snapshot_observed_at":"2026-07-02T18:57:16.733464Z","title":"arXiv preprint arXiv:2505.22107 , year=","venue":null,"work_id":"8dea0a3c-1a57-45bc-8b90-48e126ff9e6b","year":null},"citing_paper":{"arxiv_id":"2606.07183","last_updated":"2026-06-05T11:47:22Z","snapshot_observed_at":"2026-08-02T00:42:00.662612Z","submitted_at":"2026-06-05T11:47:22Z","title":"Geometry of Semantic Space: Comparative Study of Discrete and Continuous Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T21:48:14.799377Z"},"links":{"cited_paper":"/paper/2505.22107","citing_paper":"/paper/2606.07183"},"observation_digest":"sha256:531f9e5c984593145a41a153d4da5cf7ad9786be10c6adb84cdbe9319f301b96","observation_id":"d2243730-4e23-4389-a64d-66de4541f70a","resolution":{"observed_at":"2026-07-02T18:57:16.734945Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22107/citation-record","integrity":"/paper/2505.22107/integrity","json":"/paper/2505.22107/citation-record.json","paper":"/paper/2505.22107"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:05.497056Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:05.497056Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:a459a604dc203f85aaf5270b38ac20a7e39a375f3495a033e54a601e63d1406e","observation_id":"18651005-b509-4a02-902a-eb052e4dfd87","resolution":{"observed_at":"2026-08-07T13:23:05.497056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:26.765005Z","title":"and Krzywinski, M","venue":null,"work_id":"c8d7bb0e-d8c8-4858-ac2a-a9ca09ea7a57","year":2018},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:07.321505Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:c54e375c57a8da8fae3257b6d2d15b4d9ecfb16c2449f10494c83babeeb878e0","observation_id":"c213ddd3-63fb-4db1-bee2-722f4144a7d1","resolution":{"observed_at":"2026-08-07T13:23:26.932302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:26.531232Z","title":"Training-free long-context scaling of large language models","venue":null,"work_id":"54a42408-085a-4897-af25-f474e4060386","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:07.456894Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:e2476ac55cc9fedb52ee63842658517e83810d910251a2c644e3ed3118218e74","observation_id":"039aee5e-6eb8-4593-9211-82712562113f","resolution":{"observed_at":"2026-08-07T13:23:26.651407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:26.230042Z","title":"V., Du, J., Iyer, S., Pasunuru, R., et al","venue":null,"work_id":"3c16a32b-ef2f-413c-9c0d-c0cd2733fcc9","year":2022},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:07.623944Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:23611917f5049d265ab57f71fb68eaa3188fa28328e9665959892fe104a65f08","observation_id":"6c76cc74-0855-4198-99b9-b0f4a49cf3ee","resolution":{"observed_at":"2026-08-07T13:23:26.355555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:26.006309Z","title":"Proof-pile","venue":null,"work_id":"7f2a6142-c17d-4cbd-833a-03be4e69d6b7","year":2022},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:08.111044Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:451187fdaf50159fa4eeb4f1ccec00e92f6dcaf878b49558d8dcd4a5fe179b39","observation_id":"35d62f6e-259c-4033-be00-0d8112a109d2","resolution":{"observed_at":"2026-08-07T13:23:26.114633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:25.784733Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":"3d732d10-811b-433a-a9b2-98b866d5786b","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:09.937823Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:790ece3be44338bdf036e790fe5ab3ddf6df0f69a72a6ec652905e2f5e08ee8b","observation_id":"10e4d6a9-d381-4914-bf2b-1ac3edd3cec4","resolution":{"observed_at":"2026-08-07T13:23:25.891181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T13:23:10.048655Z","title":"E., and Cohan, A","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:10.048655Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:96cea15f094a5edbc9d1834758c6587e7b7f892f5c87006b4b3b812ff35612c7","observation_id":"7cb15523-72a2-4288-b599-a467d9a24ac3","resolution":{"observed_at":"2026-08-07T13:23:10.048655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:25.581627Z","title":"Mathematical analysis: an introduction","venue":null,"work_id":"2a922c80-4107-43b0-b0ca-568f2dfb5bfd","year":2012},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:10.190604Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:bd8881283f2602beecf3c0d42d642f29a93b998ce5c5079a4796bbd4d9de76f3","observation_id":"36b19264-7f67-484a-a704-28fdec616a79","resolution":{"observed_at":"2026-08-07T13:23:25.637921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:25.358093Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":"d300f5db-f35e-4504-9119-3ca07c86c32a","year":1901},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:10.300741Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:abf1bd86773f713aa7ec7aa3bad91db66599c8de96bf323e6418d52f76efc359","observation_id":"c2e4471f-e906-4e82-a20f-aa136f942541","resolution":{"observed_at":"2026-08-07T13:23:25.475625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:25.132199Z","title":"Improving multi-document summarization via text classification","venue":null,"work_id":"95888cb0-c72a-475e-8fa6-f4a58f5822af","year":2017},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:10.427300Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:2a6bfa0aa656565e05985bf7ea95086aaaef44273c296fb4a497da06d3018e2e","observation_id":"eaf36553-f735-4d8e-828d-b49b294c2772","resolution":{"observed_at":"2026-08-07T13:23:25.232658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:24.853667Z","title":"Slimpajama: A 627b token cleaned and deduplicated version of redpajama","venue":null,"work_id":"5337e22f-77f2-4d0e-840f-7490f47556a4","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:10.578225Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:c6f6dd25a763b4dc2f4b888c9798e4efbca4d5c8991b51b84a5c0b03509413ab","observation_id":"9fd682b8-f344-4cd6-8ce6-66a366169a58","resolution":{"observed_at":"2026-08-07T13:23:24.999777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-07T13:23:10.730745Z","title":"Extending context window of large language models via positional interpolation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:10.730745Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:6986a1a4f15d4c1062e6dc585fce721adb4baedb58c6bdded9f6e68b382cbfdd","observation_id":"19da10e4-b6ec-4d44-b805-aac4373fc6a3","resolution":{"observed_at":"2026-08-07T13:23:10.730745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:24.608752Z","title":"Longlora: Efficient fine-tuning of long-context large language models","venue":null,"work_id":"b5224a14-7a11-43e6-86c1-17b1748c38f4","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:10.900738Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:1482da1d3824e1dfc7444e06ec68e2cabdfd942a71dbb74a3c0e675c6056c4e1","observation_id":"4b167caf-ef02-49a6-95a6-e8fa051c0b25","resolution":{"observed_at":"2026-08-07T13:23:24.745161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:24.332113Z","title":"Core context aware transformers for long context language modeling","venue":null,"work_id":"e2bffa5d-1fdf-40b3-a6f8-40067cbb5834","year":2025},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:11.090094Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:5731c8a577106bc44c1538a230b9ad9692da330225022eefbd88547bda0d051f","observation_id":"97f79d5b-f42d-4bab-a439-7fff2a8e841b","resolution":{"observed_at":"2026-08-07T13:23:24.480152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:24.050304Z","title":"T., Raskar, S., Kale, B., Ferdaus, F., Tanikanti, A., Raffenetti, K., Taylor, V., Emani, M., and Vishwanath, V","venue":null,"work_id":"40c72057-c66f-42c1-b5ce-1a40553be547","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:11.230949Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:b81453f976806d93976c233961ffd10202b19d22d5cf4cc9b987f7519b17cd2b","observation_id":"88055cfa-c820-4caf-b54f-8978810f275f","resolution":{"observed_at":"2026-08-07T13:23:24.202919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:23.852616Z","title":"M., Likhosherstov, V., Dohan, D., Song, X., Gane, A., Sarlos, T., Hawkins, P., Davis, J","venue":null,"work_id":"4cb9342c-d6be-4d54-88c5-72ce4ef33724","year":2021},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:11.429368Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:4b84d2f05144839a725ec739996f34304788604ac29cc33259ebfbc723a6ea41","observation_id":"517aeb64-6b76-4a08-a313-fd13e8f9df52","resolution":{"observed_at":"2026-08-07T13:23:23.906716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:11.567632Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:11.567632Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:9189a0aabbeebef297dd094e2180eb87e62a1aa7afb582b09365794b52cfdbfb","observation_id":"4c2cc6f6-ed6a-416b-9cfd-d9335b67701b","resolution":{"observed_at":"2026-08-07T13:23:11.567632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:23.633747Z","title":"Eigenvalues and condition numbers of random matrices","venue":null,"work_id":"6b87cb1f-1771-43f0-8360-b1a0f9750c14","year":1988},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:11.681991Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:86abc6cae62b921f13c1186105977e2849d760b7144101a435b33c1508c024cc","observation_id":"b9152c8f-7bc6-4f7f-8a1d-34f11e075846","resolution":{"observed_at":"2026-08-07T13:23:23.737833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-07T13:23:11.844293Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:11.844293Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:8a496ad2191741a5c1237667182007254d215394661ad136091eb471c6bbada9","observation_id":"6cfc457e-b37f-496a-8bfc-3eb6398b8a76","resolution":{"observed_at":"2026-08-07T13:23:11.844293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-03T09:02:39.861878Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-08-07T13:23:11.956205Z","title":"Data engineering for scaling language models to 128k context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:11.956205Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:79ec798dfcf8d0ff5520282ca46c8a2f490a1b661dddff692edb9cfab0ef4829","observation_id":"74e21fdf-8cc7-4f77-9d34-24ad798e1e8a","resolution":{"observed_at":"2026-08-07T13:23:11.956205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:23.393260Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":"ad5467f9-0f22-42c2-8180-767d8bce6d99","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:12.103099Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:1949a816f942fec2b041138b0039e6e20013039c83288be239cd265c6aa42b69","observation_id":"d80de69e-debf-46aa-855e-a36c9fb2f6af","resolution":{"observed_at":"2026-08-07T13:23:23.487403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16137","last_updated":"2024-06-24T21:22:00Z","snapshot_observed_at":"2026-08-07T16:57:45.872655Z","submitted_at":"2023-08-30T16:47:51Z","title":"LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16137","snapshot_observed_at":"2026-08-07T13:23:12.222334Z","title":"LM -infinite: Simple on-the-fly length generalization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:12.222334Z"},"links":{"cited_paper":"/paper/2308.16137","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:a9315ca7289b42eb3e6b1719575fc45088b0d67b8f7053999a04dd11f29e52ab","observation_id":"b6f39f0d-4cd4-4439-ba1b-049f3fb3b6ab","resolution":{"observed_at":"2026-08-07T13:23:12.222334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:23.170155Z","title":"Hyperattention: Long-context attention in near-linear time","venue":null,"work_id":"458490c2-56ee-4db5-b658-a7dd609172b7","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:12.395393Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:59908e8b2c6263d68b5e795510f50441add04ba14c85b9a577070efdda632f3e","observation_id":"299f8050-4411-4bb5-a4a5-c68ce9bff079","resolution":{"observed_at":"2026-08-07T13:23:23.267125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:22.932528Z","title":"Overview of supervised learning","venue":null,"work_id":"85425b90-6ff8-4296-a949-85eb7acc3888","year":2009},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:12.497966Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:51ff3c657094a552672ae839da5088d09c209146642a02e7836f0d005db60414","observation_id":"f130aae4-29b6-4714-b51c-778dcfd423b4","resolution":{"observed_at":"2026-08-07T13:23:23.031560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14256","last_updated":"2024-05-23T07:37:16Z","snapshot_observed_at":"2026-07-06T18:18:21.334080Z","submitted_at":"2024-05-23T07:37:16Z","title":"ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14256","snapshot_observed_at":"2026-08-07T13:23:12.619787Z","title":"Zipcache: Accurate and efficient kv cache quantization with salient token identification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:12.619787Z"},"links":{"cited_paper":"/paper/2405.14256","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:ea2b4d9a21dbbd467c842aec358a198868f761b6610223aacae219076c68eced","observation_id":"b39b5d56-55ca-4faf-bff3-a4be71881975","resolution":{"observed_at":"2026-08-07T13:23:12.619787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:12.810758Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:12.810758Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:ad50c8f673b436c7c896e8efe0ed308a778b1063d6c64d270b3b8e7883f85e86","observation_id":"b199c556-fb14-4647-a38d-c626f9e477c9","resolution":{"observed_at":"2026-08-07T13:23:12.810758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:22.726870Z","title":"Neural autoregressive flows","venue":null,"work_id":"b779be4b-ee54-4646-93a9-e93dd2850956","year":2018},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:12.923700Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:c84a64c2a6fe65119df9b151f76c689390ac68e2a1b962bf67a49f526687b7c0","observation_id":"a9a852a4-fb86-4ea7-84b9-7804ce802148","resolution":{"observed_at":"2026-08-07T13:23:22.833972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:22.487097Z","title":"and Zhang, T","venue":null,"work_id":"6c871493-5500-4a70-b8a0-dc6d3d196b40","year":2010},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:13.076385Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:a8b08f747dca86f62e1c0c5b2d694a6279dc92e6613b0af4a35adb27828c893c","observation_id":"f0aed81a-d536-4bfc-8211-e997cec1e746","resolution":{"observed_at":"2026-08-07T13:23:22.572849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:22.376076Z","title":"H., Li, D., Lin, C.-Y., Yang, Y., and Qiu, L","venue":null,"work_id":"17a12dfb-068f-4072-b157-8e948e45a882","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:13.232482Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:bb23f2b7049c59d91eed2fa75a64cd6986db9ce8876c181d8b5c4114f280df92","observation_id":"63431ec6-16fa-44ca-9b6c-4f257bddefe4","resolution":{"observed_at":"2026-08-07T13:23:22.428403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:22.265756Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":"f34b7474-8c24-4d83-b826-e668881707c4","year":2020},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:13.362829Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:2414321386227774f7c183362acbee6da356b07b63553edb4bda49b305a84106","observation_id":"0999e38a-3b49-45fe-a6f2-691364a638d6","resolution":{"observed_at":"2026-08-07T13:23:22.313392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:22.069547Z","title":"Continual pre-training of language models","venue":null,"work_id":"53869960-5c69-4b4d-9570-1ba8a68bb838","year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:13.510662Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:a9c06d6fafe1e25aca03e32c358128b7eb812337bead07710266b210c469d1e1","observation_id":"138ba262-361c-4dca-89c9-a51e35701dd6","resolution":{"observed_at":"2026-08-07T13:23:22.176420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:13.671525Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:13.671525Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:3f09b9797d9f8d4e4b78d8a5c49185f8c4f44e2e76003dfc06d3c1162315b90d","observation_id":"52d14827-c8dd-401e-bd1e-1c1c4bf69142","resolution":{"observed_at":"2026-08-07T13:23:13.671525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:21.830542Z","title":"Reformer: The efficient transformer","venue":null,"work_id":"e792c410-e1aa-482f-870e-9227588a429d","year":2020},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:13.861167Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:33140bf6f0d8ac831411df98144d220b05111c749223ae4b56f89503f66b99f2","observation_id":"37925fe8-47f5-4821-bf94-17d37850f5a8","resolution":{"observed_at":"2026-08-07T13:23:21.928588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:21.628234Z","title":"F., Lin, K., Hewitt, J., Paranjape, A., Bevilacqua, M., Petroni, F., and Liang, P","venue":null,"work_id":"6ae1c3d1-c139-469c-b358-9b7107e25de3","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:14.041225Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:f722a69c03b890f9a89685f3d49f9251cde208d795efe9ac53761ba9e0e40968","observation_id":"c3d8f57a-17d7-4407-948a-90b6cf94f3e1","resolution":{"observed_at":"2026-08-07T13:23:21.681311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:21.398711Z","title":"Scaling laws of rope-based extrapolation","venue":null,"work_id":"d528726f-bbfc-41c2-a59f-5a61a8da01e1","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:14.195471Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:4b1c18bcf7731374033aaeba469c343ba9d05600ad10176af3b04759dab373fd","observation_id":"ff0e39dc-ca5c-400e-9fad-9cd93295b999","resolution":{"observed_at":"2026-08-07T13:23:21.514077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:21.198211Z","title":null,"venue":null,"work_id":"6051a681-33b8-475d-af59-7889c4b4b8e4","year":2011},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:14.372061Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:1efbcdd664d0fb9413a2fd996c2e4963f4fbf00cde4a097a6551fb579b99bae4","observation_id":"65c7cbbe-2678-4700-9c13-84911fe8f69f","resolution":{"observed_at":"2026-08-07T13:23:21.302798Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:21.052946Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"d61d2080-0cd6-4a04-9c9b-6e8afc78cf52","year":2022},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:14.484747Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:31db8981a6db9dfbf20d8273909aff0b7d924aa4bc25085fdafe19e579a22342","observation_id":"f2735ae3-7396-4d4e-8e96-b7a3f1eea879","resolution":{"observed_at":"2026-08-07T13:23:21.119597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:20.871592Z","title":null,"venue":null,"work_id":"78116b5f-d7a5-4d51-900c-9b420711f079","year":2003},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:14.622471Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:091449b4e147b13ee5d48981360daffbd0c4c9c73b0e7773f504646b7cc8f516","observation_id":"03b2cd6d-a5a7-44e2-b8c1-465649052280","resolution":{"observed_at":"2026-08-07T13:23:20.968019Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:20.732686Z","title":"The spectral norm of a nonnegative matrix","venue":null,"work_id":"c8681afc-3997-45d5-8425-defca4eab911","year":1990},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:14.725369Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:a488bda0663b22176224a20f11ec158657bbd81ddb95db7714f8be7456075aa4","observation_id":"11d0f157-9be2-49d5-9aa5-d8efe0ce3325","resolution":{"observed_at":"2026-08-07T13:23:20.788216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16300","last_updated":"2023-11-20T01:16:17Z","snapshot_observed_at":"2026-08-04T15:01:39.394740Z","submitted_at":"2023-05-25T17:53:42Z","title":"Landmark Attention: Random-Access Infinite Context Length for Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16300","snapshot_observed_at":"2026-08-07T13:23:14.831997Z","title":"and Jaggi, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:14.831997Z"},"links":{"cited_paper":"/paper/2305.16300","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:7eaddc2b74036122c04825ab36c4beaaa84c83703fd62ad7e18bc24066f9c46f","observation_id":"2e501e07-2701-4d9a-b01d-8b65e82adb6a","resolution":{"observed_at":"2026-08-07T13:23:14.831997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:20.581786Z","title":"An overview of the supervised machine learning methods","venue":null,"work_id":"5fb3727f-187d-45d4-a748-7a92a60962e0","year":2017},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:14.939720Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:9ce07079e0e18cb91b385e2f78329060576988334be19ab1db6d3c781f8b6c9d","observation_id":"16f7f092-32d2-4705-946e-33d40cb74eea","resolution":{"observed_at":"2026-08-07T13:23:20.639432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:23:15.012231Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:15.012231Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:46bd3cdec00a1fd83806c1e095f282a97eb04f19c50e63e518cfb68c24b7b39f","observation_id":"fdf156eb-a02b-4c4e-9df9-28e6a0c48363","resolution":{"observed_at":"2026-08-07T13:23:15.012231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:20.427771Z","title":"Data augmentation for abstractive query-focused multi-document summarization","venue":null,"work_id":"42ba0025-27c9-45f2-9af8-e3bb9c23482a","year":2021},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:15.111944Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:674f880826b494c2f70048a983c77255089c095f9f8ff33b3ee2719b425c65c3","observation_id":"c94da18e-f10e-4a5f-8fa7-d048b94a3e17","resolution":{"observed_at":"2026-08-07T13:23:20.504675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:20.294007Z","title":"Yarn: Efficient context window extension of large language models","venue":null,"work_id":"f172c929-a634-4a92-ad30-646bfe99c5df","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:15.176797Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:a2591c7af0a9dab36bc0ddcbe231841e8048d6fea190be78196d8edadd5ef529","observation_id":"54d28dc8-a9a0-4740-aaf2-58fbf48e6fce","resolution":{"observed_at":"2026-08-07T13:23:20.365654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:15.294294Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:15.294294Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:e50f01c8d5bbb4c02d978cf32b016b22d60784078da812b034e0d41f7368281b","observation_id":"be1d2524-bcde-4aa4-85a3-eed6af8735cd","resolution":{"observed_at":"2026-08-07T13:23:15.294294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:15.453551Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:15.453551Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:2364d6f09f57093f61e473a6f8fb5ca54a9306869ea79b7b77156d771e0c6ce7","observation_id":"cec19125-3f2c-443c-bac0-ad8140c62852","resolution":{"observed_at":"2026-08-07T13:23:15.453551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:20.147235Z","title":"and Lin, S","venue":null,"work_id":"88994e8d-7cde-49be-9632-03dda9466446","year":2009},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:15.586474Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:6307799a33875119f81483d5ff046b4ac40073d69e47808ee908cac9e94733ac","observation_id":"fc8f9e81-8e5a-451c-8bfa-23eb5ebfcfc2","resolution":{"observed_at":"2026-08-07T13:23:20.196227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:20.041265Z","title":"Are emergent abilities of large language models a mirage? Advances in Neural Information Processing Systems, 36, 2023","venue":null,"work_id":"c972fefd-993c-40e3-a076-e3dde5676b6c","year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:15.676961Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:5bb98e42dee2e75ee14a2429fe392d7ebb48139505468e7a297320bec827d0f4","observation_id":"fb92a7a4-729d-4d90-bc04-852bf0c02b86","resolution":{"observed_at":"2026-08-07T13:23:20.091877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:19.784496Z","title":"R., Cole-Lewis, H., et al","venue":null,"work_id":"7c1a51a1-727b-4e90-b5a6-bb49bb6af156","year":2025},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:15.822810Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:004cb362a26f0a96ae23dfe7910e6defa931fb41e917bf035cd5c546d0f2d6ee","observation_id":"b65a00ec-6579-499b-892e-707bc58af9bc","resolution":{"observed_at":"2026-08-07T13:23:19.908040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-07T13:23:15.954492Z","title":"Retentive network: A successor to transformer for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:15.954492Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:019de12419feaa44ef0d6bf8aab684d4ba48bd184964f3fffe7250ff979107a5","observation_id":"d6615869-bd2d-41b9-bc50-aa1944c51ee5","resolution":{"observed_at":"2026-08-07T13:23:15.954492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:19.562881Z","title":"Sparse attention with learning to hash","venue":null,"work_id":"4e6a1457-5b40-4aa7-bb88-48eafdf5d7c3","year":2021},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:16.043002Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:511ea10246c8e16d0754fb23c11bbdebb1bb5695b2d5be83f9fe527e1c3efac9","observation_id":"45df5808-40aa-4e04-bb69-d7e02c445085","resolution":{"observed_at":"2026-08-07T13:23:19.670386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T13:23:16.146762Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:16.146762Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:90fb9f8d9d030c2170f2b41cae0daf58aaf5a8b8174da1ef43cd6db9f5ff2c59","observation_id":"c3dbd60f-dea9-4aa4-aaa1-cbf67bc6369e","resolution":{"observed_at":"2026-08-07T13:23:16.146762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T13:23:16.277430Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:16.277430Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:e9c5d0a683ec97e91a4fa8770e499a28fed0151995add31e2c686e3ca8da4f0c","observation_id":"b422c2a4-0013-4502-aa35-17d807464fc1","resolution":{"observed_at":"2026-08-07T13:23:16.277430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:19.383210Z","title":"Focused transformer: Contrastive training for context scaling","venue":null,"work_id":"201a0dcc-6905-4af4-9c86-bc8640411025","year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:16.386129Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:df05ced510d6f36a2707cdd63dc0e9eeab5a6a5f4f5237afbf1f88aeaabceeb8","observation_id":"84a3b04e-5b8d-44c6-82b7-27af9452da45","resolution":{"observed_at":"2026-08-07T13:23:19.478740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:16.512204Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:16.512204Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:1dd52d96df8c774b722ec3cc3afeeb889af485993b1c0b3915d78b32ceb870eb","observation_id":"87e4d887-0a83-4a15-8e22-2e011a254f15","resolution":{"observed_at":"2026-08-07T13:23:16.512204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T13:23:16.626693Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:16.626693Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:6441285b463324d1fec1ce034508b39100edc2897841db7305acb033c496403a","observation_id":"c97b554d-698a-4c8e-ac4d-4f4c4aec1bff","resolution":{"observed_at":"2026-08-07T13:23:16.626693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08454","last_updated":"2024-07-21T02:37:11Z","snapshot_observed_at":"2026-07-06T18:44:49.512236Z","submitted_at":"2024-07-11T12:50:42Z","title":"Model Tells You Where to Merge: Adaptive KV Cache Merging for LLMs on Long-Context Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08454","snapshot_observed_at":"2026-08-07T13:23:16.748973Z","title":"Model tells you where to merge: Adaptive kv cache merging for llms on long-context tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:16.748973Z"},"links":{"cited_paper":"/paper/2407.08454","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:144558b8136a9504c77fb9fa55fe9a0d3299f764061cf917229b1d5efe012ddc","observation_id":"55799ab1-3984-4f1f-8861-7db453514f8c","resolution":{"observed_at":"2026-08-07T13:23:16.748973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:16.882892Z","title":"V., Zhou, D., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:16.882892Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:69c08256ad4b5e2802d59edb0fbf4404a3b0e101e349e0adf059743d750bb640","observation_id":"a9f749b2-475b-4492-9d5f-065a4318b63d","resolution":{"observed_at":"2026-08-07T13:23:16.882892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:19.178242Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"f438157e-c52c-4c57-833d-7ce0eb6f2cc1","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:17.013916Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:1dbfdedd20859229ebcbabc95d0aa7a1d2f602d3b73a24a622805c4aa05129cd","observation_id":"fa9203f0-0b0a-4f8f-9e78-e801f189ccf9","resolution":{"observed_at":"2026-08-07T13:23:19.253659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:18.884532Z","title":"A., Oguz, B., Khabsa, M., Fang, H., Mehdad, Y., Narang, S., Malik, K., Fan, A., Bhosale, S., Edunov, S., Lewis, M., Wang, S., and Ma, H","venue":null,"work_id":"63568b9b-e3c7-4045-b99a-b12a29e6bf8c","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:17.147867Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:7fa488fedce447ba175b9eec966c7c73d790a2f220ee24c2010e45aa9d6ffb74","observation_id":"1b6c7e42-8989-425b-9aad-819a31bd7dd0","resolution":{"observed_at":"2026-08-07T13:23:19.026709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:18.613134Z","title":"Long-context language modeling with parallel context encoding","venue":null,"work_id":"bf0f515b-237e-4b8a-9db8-777a44f95444","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:17.231268Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:4b846e1a6e2a1bf73735450cf701e45cfd8fd5edc84969fb159091c2e769593c","observation_id":"1a6a0cb8-764c-4015-b57a-1585ca714643","resolution":{"observed_at":"2026-08-07T13:23:18.749679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:17.318637Z","title":"A., Ainslie, J., Alberti, C., Ontanon, S., Pham, P., Ravula, A., Wang, Q., Yang, L., et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:17.318637Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:e7a8db7840780b3df0b4fff6e0b11298ee27eb4f34be58950e87b540fa0f3fe8","observation_id":"906dbd58-3240-4530-a03c-1e4d84aa0c9c","resolution":{"observed_at":"2026-08-07T13:23:17.318637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-07T13:23:17.432878Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:17.432878Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:afe681857071e4926ce5bff821281d47cbd3a932fb42063669b60d5e124cf94c","observation_id":"c0cc82a2-9832-452d-874d-a6320360af00","resolution":{"observed_at":"2026-08-07T13:23:17.432878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-07T13:23:17.614845Z","title":"V., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:17.614845Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:6e15c5c0b9dc39c9897196a1685f0f9f3f0c3b0ac3a3abcaea2472db59b3b01d","observation_id":"a9301f6d-79c7-40ea-8265-2caf6e639b1b","resolution":{"observed_at":"2026-08-07T13:23:17.614845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:17.750697Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:17.750697Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:57b74526a88d652ade49b13215e6771b8c37422c7bf1b5e18051d8f04f6e7dda","observation_id":"e336b779-99da-4b72-b53d-88cc1c33af2d","resolution":{"observed_at":"2026-08-07T13:23:17.750697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:18.366634Z","title":"Pose: Efficient context window extension of llms via positional skip-wise training","venue":null,"work_id":"63662ebf-141f-44bf-8f60-7a7542c08b48","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:17.886475Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:1c11c7145e5ba07ceed32eecb4bbf074fa832177347e3453bd63104aa6c047fb","observation_id":"86f2e456-ecf4-4ac3-a030-f06d3c57879d","resolution":{"observed_at":"2026-08-07T13:23:18.495756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:18.048778Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:18.048778Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:ba4f72e5c115053806afdd79d7b7b81769305a2debbb0aee8dcd97866c94a68b","observation_id":"1cf7fd48-3584-4635-871c-c3ce72914c83","resolution":{"observed_at":"2026-08-07T13:23:18.048778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T13:12:42.090389Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":39},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 1 inbound Pith citation observation for arXiv:2505.22107."}