{"as_of":"2026-08-08T09:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea732c380d996d25a0a9d249e123d096ae325144d1145110da984c617a484edc","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:20:26.736743Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:40:58.250915Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T05:00:21.895979Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"cited_work":{"arxiv_id":"2505.19293","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19293","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"17c3c1ba-09af-444c-8e37-f19796964104","year":null},"citing_paper":{"arxiv_id":"2605.23170","last_updated":"2026-05-22T02:42:41Z","snapshot_observed_at":"2026-08-03T03:47:34.013785Z","submitted_at":"2026-05-22T02:42:41Z","title":"Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-25T04:58:15.184063Z"},"links":{"cited_paper":"/paper/2505.19293","citing_paper":"/paper/2605.23170"},"observation_digest":"sha256:dd982a4a69427cde2fe604ce32f8c2814625b0bc4683d9bdce80b947d8c566f9","observation_id":"0acb92be-2151-487a-a413-a395146d8257","resolution":{"observed_at":"2026-06-04T02:07:03.614635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19293","snapshot_observed_at":"2026-07-13T03:52:24.872919Z","title":"100-longbench: Are de facto long-context benchmarks literally evaluating long-context ability?arXiv preprint arXiv:2505.19293,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T03:52:24.872919Z"},"links":{"cited_paper":"/paper/2505.19293","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:332a48392c39c7cae859427a9d08b2781c1cc768f509b45582bbd8e4b813cc73","observation_id":"6121b6e2-da21-4c2b-9b6e-dc4fb3b358bd","resolution":{"observed_at":"2026-07-13T03:52:24.872919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19293","snapshot_observed_at":"2026-08-02T07:40:58.250915Z","title":"100-longbench: Are de facto long-context benchmarks literally evaluating long-context ability?arXiv preprint arXiv:2505.19293,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:58.250915Z"},"links":{"cited_paper":"/paper/2505.19293","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:dc8d0d22557a260d2347a105c779f8691234acb3ed3db8ec6d79ca46021e714e","observation_id":"b118c4f5-32ae-4d1a-aa9d-fbb97ea9b043","resolution":{"observed_at":"2026-08-02T07:40:58.250915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19293/citation-record","integrity":"/paper/2505.19293/integrity","json":"/paper/2505.19293/citation-record.json","paper":"/paper/2505.19293"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:24.126509Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:24.126509Z"},"links":{"citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:70c6bbbcadf3f5de4aed40137f86f86ff4ba4f4a6c7f64ec8f2d4cab256fd550","observation_id":"7765fd1d-24eb-47ff-a883-0d7f005b270e","resolution":{"observed_at":"2026-08-07T14:20:24.126509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:24.180478Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:24.180478Z"},"links":{"citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:3c89c2a20f646de2bd83be5e7d0d833024d102b65d214a6c8538ff77ea8e193d","observation_id":"7785cc7a-5b1f-475b-956d-a36804d325e9","resolution":{"observed_at":"2026-08-07T14:20:24.180478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T14:20:24.244756Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:24.244756Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:dbb22e39a7036289e1ba529b45f0c143a3051af154050e16d8a7bb1afd9eedbc","observation_id":"7a986590-0b74-4e28-a975-fd73578628f2","resolution":{"observed_at":"2026-08-07T14:20:24.244756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:20:24.261232Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:24.261232Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:1c10ac3af2d816fa9ceb2160a8139d0aadcc096cdbcdfab8f1274a63100d4e6c","observation_id":"b688bf22-8169-4d5f-9dc2-cfb763875804","resolution":{"observed_at":"2026-08-07T14:20:24.261232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11018","last_updated":"2024-10-17T17:45:09Z","snapshot_observed_at":"2026-07-06T18:01:18.745347Z","submitted_at":"2024-04-17T02:49:26Z","title":"Many-Shot In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11018","snapshot_observed_at":"2026-08-07T14:20:24.272210Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:24.272210Z"},"links":{"cited_paper":"/paper/2404.11018","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:64a0cbb3208c9942b312a73c42e0c7a0a8256a7a5e717dd03f3e4b392f82bba8","observation_id":"9213b459-1029-4b1c-ba61-9c03bf6eb69b","resolution":{"observed_at":"2026-08-07T14:20:24.272210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-07-06T15:56:38.019661Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-07T14:20:24.321920Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:24.321920Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:c505a4eebf9e19690fdd2aa83c5cb3e04809d3d1815bfbb423df1118c0c01fd1","observation_id":"c728fe26-7aa8-4634-9e18-24b52d96d5b0","resolution":{"observed_at":"2026-08-07T14:20:24.321920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-07T14:20:24.418649Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:24.418649Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:4aecd4e5fbe7b35b2e801ab11662bc6c8a8a366025f68a1c370c7f3af787b919","observation_id":"ffb476a2-5b16-4523-94d7-f7fd05e20bb2","resolution":{"observed_at":"2026-08-07T14:20:24.418649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:28.395485Z","title":null,"venue":null,"work_id":"3a6aa554-17ee-4f35-ad29-95ed74b923ea","year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:24.483016Z"},"links":{"citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:bbd7519b2756c4d866edc10fe92dbcab86e29dc2449bddc632cc36825675f71e","observation_id":"0daae9fc-557d-49ca-b9c5-826db961a409","resolution":{"observed_at":"2026-08-07T14:20:28.458074Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-07T14:20:24.550556Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:24.550556Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:0946db457164acaec89c60e7054891db3792a42b17c3c93c654dbc1f085dad15","observation_id":"a821fbc7-3ddb-4320-aa9c-93c253bf5643","resolution":{"observed_at":"2026-08-07T14:20:24.550556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12307","last_updated":"2024-03-08T15:26:38Z","snapshot_observed_at":"2026-07-06T16:21:57.649550Z","submitted_at":"2023-09-21T17:59:11Z","title":"LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12307","snapshot_observed_at":"2026-08-07T14:20:24.621120Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:24.621120Z"},"links":{"cited_paper":"/paper/2309.12307","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:5af72d75eb5ce40411d8f83380088ec752d989907e4f213593445a57ca2266cf","observation_id":"a46d8258-ff30-447f-9756-d2eb5aa8260e","resolution":{"observed_at":"2026-08-07T14:20:24.621120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:24.696735Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:24.696735Z"},"links":{"citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:943550e7708da66c13a7058197c293c0c0b2567cddec0c7259eef1a03a362b86","observation_id":"dbac3db7-9e4c-4bc9-b544-60ac81a6badc","resolution":{"observed_at":"2026-08-07T14:20:24.696735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:20:24.781338Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:24.781338Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:f9106e1fd53ff3c2ff48144f8b1d822dbf8fd4c9b3e1e181fcd7db9572c63a35","observation_id":"23951161-ae45-4f9c-8cb6-b09ebe855f14","resolution":{"observed_at":"2026-08-07T14:20:24.781338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15019","last_updated":"2024-06-21T09:46:57Z","snapshot_observed_at":"2026-07-06T18:34:47.155846Z","submitted_at":"2024-06-21T09:46:57Z","title":"MedOdyssey: A Medical Domain Benchmark for Long Context Evaluation Up to 200K Tokens","version":1},"cited_work":{"arxiv_id":"2406.15019","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.15019","snapshot_observed_at":"2026-08-07T14:20:27.760155Z","title":"MedOdyssey: A Medical Domain Benchmark for Long Context Evaluation Up to 200K Tokens","venue":"cs.CL","work_id":"34a7af51-0bd0-4679-8049-12a556d576aa","year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:24.793978Z"},"links":{"cited_paper":"/paper/2406.15019","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:83f18078d8fb45d9153afcbaa06838fd67ab68d81b95dc2eaaf701655f0dbe5e","observation_id":"93b193c1-b023-4dfe-bef3-985d11c5bdc5","resolution":{"observed_at":"2026-08-07T14:20:27.805331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:24.804087Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:24.804087Z"},"links":{"citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:028b784ee521b1b277296eb3956c1b87e5a72233a6812493ef850ec36cab8b5f","observation_id":"c9a4335e-851d-4fc3-848f-3c771c57f95a","resolution":{"observed_at":"2026-08-07T14:20:24.804087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:24.810361Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:24.810361Z"},"links":{"citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:d5d28d7b872f6a07f9d4b758d707e848271469925855b2cd9ee33c39a0411025","observation_id":"5ff83b31-5369-4e9f-9c35-d957cb6dac6b","resolution":{"observed_at":"2026-08-07T14:20:24.810361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00097","last_updated":"2024-12-30T19:00:01Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:01Z","title":"CaseSumm: A Large-Scale Dataset for Long-Context Summarization from U.S. Supreme Court Opinions","version":1},"cited_work":{"arxiv_id":"2501.00097","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00097","snapshot_observed_at":"2026-08-07T14:20:27.547161Z","title":"CaseSumm: A Large-Scale Dataset for Long-Context Summarization from U.S. Supreme Court Opinions","venue":"cs.CL","work_id":"9a6fdfe5-5dde-42e2-aa07-b7b5a741a782","year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:24.835670Z"},"links":{"cited_paper":"/paper/2501.00097","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:fdcebfeb4d629fb8c2a6a3dad846c5e921dc37cef6af6669d731801d42b18028","observation_id":"7b2b4f5d-42fe-479d-bbb2-971369faef7f","resolution":{"observed_at":"2026-08-07T14:20:27.578318Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-07T14:20:24.924084Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:24.924084Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:caa362521cf218a69fa6450f4c917f27d7b8eb1e7921494cd65ddec4220d045f","observation_id":"aa4703b7-b1d2-4a88-94c5-99b999c0c675","resolution":{"observed_at":"2026-08-07T14:20:24.924084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10989","last_updated":"2025-01-24T00:14:55Z","snapshot_observed_at":"2026-07-06T19:33:26.078722Z","submitted_at":"2024-10-14T18:17:01Z","title":"Liger Kernel: Efficient Triton Kernels for LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10989","snapshot_observed_at":"2026-08-07T14:20:25.008242Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:25.008242Z"},"links":{"cited_paper":"/paper/2410.10989","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:8b2262068f195bb43b237eaecf199262cf06025a1bb12d71b9e3920ce6318633","observation_id":"5f8e0671-926e-4089-9ee3-c86c824530ca","resolution":{"observed_at":"2026-08-07T14:20:25.008242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06839","last_updated":"2024-08-12T03:53:35Z","snapshot_observed_at":"2026-08-06T17:12:58.658176Z","submitted_at":"2023-10-10T17:59:58Z","title":"LongLLMLingua: Accelerating and Enhancing LLMs in Long Context Scenarios via Prompt Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06839","snapshot_observed_at":"2026-08-07T14:20:25.095761Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:25.095761Z"},"links":{"cited_paper":"/paper/2310.06839","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:06270b8e5666a6a6906db38b53513a7776eb3c76fd544d1b97d4f14a127e6d96","observation_id":"845c94eb-5dac-41e9-a23e-553281c6f0d1","resolution":{"observed_at":"2026-08-07T14:20:25.095761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01325","last_updated":"2024-07-11T06:11:46Z","snapshot_observed_at":"2026-08-03T00:46:19.287073Z","submitted_at":"2024-01-02T18:30:51Z","title":"LLM Maybe LongLM: Self-Extend LLM Context Window Without Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01325","snapshot_observed_at":"2026-08-07T14:20:25.146848Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:25.146848Z"},"links":{"cited_paper":"/paper/2401.01325","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:36b7dfd4712f53a06e18c574f2619682fe1bf1446280d3ba4761532ef5e86103","observation_id":"fb754909-6e43-484e-a40d-a28a508b4009","resolution":{"observed_at":"2026-08-07T14:20:25.146848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04939","last_updated":"2024-09-06T05:06:51Z","snapshot_observed_at":"2026-07-06T16:44:55.494764Z","submitted_at":"2023-11-08T01:45:37Z","title":"LooGLE: Can Long-Context Language Models Understand Long Contexts?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04939","snapshot_observed_at":"2026-08-07T14:20:25.205683Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:25.205683Z"},"links":{"cited_paper":"/paper/2311.04939","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:c534b43dfb4261af6807a1c6eb36d869a196f8c3ba67acb2d71f51fe7cf60d96","observation_id":"00993ed0-2ba8-433d-b8ba-24bacf7d5cc5","resolution":{"observed_at":"2026-08-07T14:20:25.205683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-07T14:20:25.288961Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:25.288961Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:35d0489fd7646fd09c64afaa2876cfffab073b4e6aa42312f212a0833c0bb03a","observation_id":"7b19a446-827a-4ff6-87aa-f8fe4cbc08b9","resolution":{"observed_at":"2026-08-07T14:20:25.288961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06201","last_updated":"2023-10-09T23:03:24Z","snapshot_observed_at":"2026-08-06T01:26:00.668084Z","submitted_at":"2023-10-09T23:03:24Z","title":"Compressing Context to Enhance Inference Efficiency of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06201","snapshot_observed_at":"2026-08-07T14:20:25.308833Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:25.308833Z"},"links":{"cited_paper":"/paper/2310.06201","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:6c5cb3a615eea85699c311af2c063a9f140df84feff80da8af0bf4431956d89f","observation_id":"57c65d74-f6c6-43ae-b1db-8229c215db9e","resolution":{"observed_at":"2026-08-07T14:20:25.308833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12875","last_updated":"2024-09-21T06:48:45Z","snapshot_observed_at":"2026-08-07T02:31:13.044154Z","submitted_at":"2024-02-20T10:11:03Z","title":"Chain of Thought Empowers Transformers to Solve Inherently Serial Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12875","snapshot_observed_at":"2026-08-07T14:20:25.419215Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:25.419215Z"},"links":{"cited_paper":"/paper/2402.12875","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:ce084c353d091de2e68bf1a081bd1f8a818b797c3b3210a064901c086b3f8b08","observation_id":"0f459c01-634f-4b2c-9482-3ea5afab542c","resolution":{"observed_at":"2026-08-07T14:20:25.419215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:25.442595Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:25.442595Z"},"links":{"citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:5b58f0c492bc8b662ea2f688dcc58848226b40df171b3d6e46b9e8f4edeec95a","observation_id":"63264196-1f47-4755-9156-30de23677639","resolution":{"observed_at":"2026-08-07T14:20:25.442595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:25.469693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:25.469693Z"},"links":{"citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:7c7a3b6843f6d7ce44738154aafcfac76f05ed8d09a0fd5718375fbeb935d65f","observation_id":"230c6493-93ac-4731-b6aa-60f2fcce3d7e","resolution":{"observed_at":"2026-08-07T14:20:25.469693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12181","last_updated":"2024-09-23T14:39:07Z","snapshot_observed_at":"2026-08-05T14:35:40.369441Z","submitted_at":"2024-09-18T17:53:17Z","title":"A Controlled Study on Long Context Extension and Generalization in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12181","snapshot_observed_at":"2026-08-07T14:20:25.515017Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:25.515017Z"},"links":{"cited_paper":"/paper/2409.12181","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:078982201f220e63f980eab3d67e2f8240d3ceebf77f498722c9d39343173df7","observation_id":"50486a72-61a9-48ce-ac92-c1cbedf19cef","resolution":{"observed_at":"2026-08-07T14:20:25.515017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16300","last_updated":"2023-11-20T01:16:17Z","snapshot_observed_at":"2026-08-04T15:01:39.394740Z","submitted_at":"2023-05-25T17:53:42Z","title":"Landmark Attention: Random-Access Infinite Context Length for Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16300","snapshot_observed_at":"2026-08-07T14:20:25.577961Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:25.577961Z"},"links":{"cited_paper":"/paper/2305.16300","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:eaa9586d33731928411580cf3d786ae29abc22eea8391c2e9c18367c5a0b936a","observation_id":"4476c01e-0511-439f-a552-e9eca5dcd166","resolution":{"observed_at":"2026-08-07T14:20:25.577961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:25.626842Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:25.626842Z"},"links":{"citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:bfadafbc5f68616a3e2fa95fb0a3bd19a31a89f226f5033e8ea608f126b8e476","observation_id":"8f5cc80b-5417-43cd-82b2-9031e1968f8f","resolution":{"observed_at":"2026-08-07T14:20:25.626842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-07T14:20:25.669954Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:25.669954Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:d0e154efab0fd17330b78e6428e8ee2661b709e41b416721e5bb5ad7bc70b440","observation_id":"209228c9-fd6c-4ec9-b7f3-fb5c3f6e08ff","resolution":{"observed_at":"2026-08-07T14:20:25.669954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11802","last_updated":"2024-12-24T01:41:28Z","snapshot_observed_at":"2026-07-06T17:46:20.935124Z","submitted_at":"2024-03-18T14:01:45Z","title":"Counting-Stars: A Multi-evidence, Position-aware, and Scalable Benchmark for Evaluating Long-Context Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11802","snapshot_observed_at":"2026-08-07T14:20:25.752009Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:25.752009Z"},"links":{"cited_paper":"/paper/2403.11802","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:3acadd41f8184dc501ab969f5b07fe7516c5b8f3f29302c74a397b065c8313e9","observation_id":"16b931d1-cca0-4832-86c7-03529d525cb7","resolution":{"observed_at":"2026-08-07T14:20:25.752009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:25.875196Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:25.875196Z"},"links":{"citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:75c625a701e6aa9b66f716449eeaa0f23b6900ce0ee390d4e6251190115762cf","observation_id":"a1f5f048-b73d-4ef5-8bf5-d2d54a49344a","resolution":{"observed_at":"2026-08-07T14:20:25.875196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-07T14:20:25.968312Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:25.968312Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:379c9718388c14705869d09bb9ee3f50364ce05f3660217f6d6c99959959ae87","observation_id":"e8bbd1dc-631f-4ba0-bba4-95b283e3cd07","resolution":{"observed_at":"2026-08-07T14:20:25.968312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T14:20:26.013754Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:26.013754Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:0350d284b0d59ebe6ce81f943f296474f96848ed408f543d841b801deb43eb69","observation_id":"1501f1a1-72aa-4039-a278-e0920a9a9b5b","resolution":{"observed_at":"2026-08-07T14:20:26.013754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06480","last_updated":"2024-04-10T07:40:56Z","snapshot_observed_at":"2026-07-06T17:57:52.364338Z","submitted_at":"2024-04-09T17:30:48Z","title":"Ada-LEval: Evaluating long-context LLMs with length-adaptable benchmarks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06480","snapshot_observed_at":"2026-08-07T14:20:26.146395Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:26.146395Z"},"links":{"cited_paper":"/paper/2404.06480","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:14e62c472d0afda9bf1c449baae73f4047acad0d99ca5e37ff505fdddf3d15ee","observation_id":"ebd10410-c72e-44a1-9d17-4fcdf0c3360d","resolution":{"observed_at":"2026-08-07T14:20:26.146395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:26.228218Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:26.228218Z"},"links":{"citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:4fb563ee9f7843007f3650e418cdd8e744d33fda8085a5642304137bc0c74c5d","observation_id":"66cf8d94-71d7-4122-bc93-fd08332f0159","resolution":{"observed_at":"2026-08-07T14:20:26.228218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:28.181424Z","title":null,"venue":null,"work_id":"c03e3444-6bfc-4e37-83fc-94dbd8d3cb24","year":2023},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:26.277548Z"},"links":{"citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:b549a63d40e04a3eb5ae9968fcbce20135e70c76a038574d3eaae4b017902026","observation_id":"d9bd265d-1a31-4ee3-84ce-cd1fab6893aa","resolution":{"observed_at":"2026-08-07T14:20:28.217434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T14:20:26.335648Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:26.335648Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:8a5009a6ab39bb49d23c8e25a6d5f8d815ad54269b4df29b90a4826a4f77f851","observation_id":"72e3d66b-1e85-4b29-81d7-24fdb87c2829","resolution":{"observed_at":"2026-08-07T14:20:26.335648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-07-06T16:24:38.375055Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-07T14:20:26.452682Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:26.452682Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:43978e3ea822d1bc654d031eed5d746d70b42aa0190179cbd9a1aaa3ed6654b1","observation_id":"b4197dba-3d4d-4a2f-9023-2461b166a976","resolution":{"observed_at":"2026-08-07T14:20:26.452682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03025","last_updated":"2024-01-23T07:49:13Z","snapshot_observed_at":"2026-08-06T04:59:02.070453Z","submitted_at":"2023-10-04T17:59:41Z","title":"Retrieval meets Long Context Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03025","snapshot_observed_at":"2026-08-07T14:20:26.529399Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:26.529399Z"},"links":{"cited_paper":"/paper/2310.03025","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:1f2a5baf3406cb9f343eacd38989e8b65e3ea1cd8e1fbe18bd74c58546484a89","observation_id":"9d6080f2-1949-4bc6-9f7b-ade0e9f6c6fa","resolution":{"observed_at":"2026-08-07T14:20:26.529399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T14:20:26.597274Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:26.597274Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:e1994db710a38157bf68971f823824db5f3f54f79ed9233e27b2c7663fdd5b25","observation_id":"712a7281-3054-48fc-ae0a-4479ad7bbbed","resolution":{"observed_at":"2026-08-07T14:20:26.597274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-07T14:20:26.649185Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:26.649185Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:e66d34ce8b18cdd38da538ed0b2cc1b37f2144bd7320964cbc9b974c902f1a01","observation_id":"87e77dc3-cefc-4599-b02b-e6c49b622e11","resolution":{"observed_at":"2026-08-07T14:20:26.649185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-07T14:20:26.695690Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:26.695690Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:5e26174dab6b865c0c6fa6dad3e4b74df0794d1a506e782495b273906380be05","observation_id":"8835e627-336e-4a43-b395-415ed7333fa4","resolution":{"observed_at":"2026-08-07T14:20:26.695690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:26.729592Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:26.729592Z"},"links":{"citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:1daea0f2c7012c30d50e709db8d41f24a1f5482eb85635773fae3f6eaeafa9cc","observation_id":"e67bf589-4100-49f3-a77d-8ef444fae1a8","resolution":{"observed_at":"2026-08-07T14:20:26.729592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:28.095023Z","title":null,"venue":null,"work_id":"56b5041b-ab5f-4611-b39d-63c12561eb86","year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:26.736743Z"},"links":{"citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:536c7ab92ad734386af310867da747e932a530a45cc31db4e1cfa1c3b8342462","observation_id":"ffb15062-fd8c-4a26-9137-5e4771313c26","resolution":{"observed_at":"2026-08-07T14:20:28.135544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 3 inbound Pith citation observations for arXiv:2505.19293."}