{"as_of":"2026-08-09T05:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a28023f7fa17fccd9d0de13ef7b78a040b380a7549a3abe4e6a7d6222f128019","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":34,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T04:28:03.989883Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":"2410.02694","doi":"10.48550/arxiv.2410.02694","metadata_source":"pith","pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694","venue":"cs.CL","work_id":"1772d787-6ea9-4bf6-8e87-b1f854eb1779","year":2024},"citing_paper":{"arxiv_id":"2502.02737","last_updated":"2025-02-04T21:43:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-04T21:43:16Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","version":1},"reference_index":246,"source":"arxiv_source","source_observed_at":"2026-05-13T17:30:02.803757Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2502.02737"},"observation_digest":"sha256:54da8dbfe46464bb78fb42597374694fec4e4e9ae7e17541d9d441d4dd4a5aca","observation_id":"1ea32d87-5046-413e-be99-b96caf472c65","resolution":{"observed_at":"2026-05-13T17:30:03.062768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-08T20:07:33.792487Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.792487Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:a605fdb8c75e1cbdc0460e9c6c0448c3213ae7f4f931bfacde01b52236a78034","observation_id":"a61a6ba2-5a9d-4e63-bf3a-bf0dfeedc3fe","resolution":{"observed_at":"2026-08-08T20:07:33.792487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-09T04:28:03.989883Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-09T04:20:35.077670Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.989883Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:0956c1f95f4fa11401aa01b69de73384745602b67cc8824742fcb7589c727146","observation_id":"d1a313e2-e6e0-47ca-99dd-de52c3fe93f1","resolution":{"observed_at":"2026-08-09T04:28:03.989883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-07T14:20:26.649185Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:26.649185Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:e66d34ce8b18cdd38da538ed0b2cc1b37f2144bd7320964cbc9b974c902f1a01","observation_id":"87e77dc3-cefc-4599-b02b-e6c49b622e11","resolution":{"observed_at":"2026-08-07T14:20:26.649185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-07T14:08:14.241741Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19959","last_updated":"2025-07-30T16:46:12Z","snapshot_observed_at":"2026-08-09T01:20:29.114355Z","submitted_at":"2025-05-26T13:21:18Z","title":"MiniLongBench: The Low-cost Long Context Understanding Benchmark for Large Language Models","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:14.241741Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2505.19959"},"observation_digest":"sha256:68be7392dde5a35a4076e3974ec4c4ee80d2b663d87bdc4f35d6d82e1b9194aa","observation_id":"27e9d54c-f2ab-49f2-9bfe-d1246d76f661","resolution":{"observed_at":"2026-08-07T14:08:14.241741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-07T04:13:17.791605Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11440","last_updated":"2025-06-13T03:38:29Z","snapshot_observed_at":"2026-08-07T04:06:34.003190Z","submitted_at":"2025-06-13T03:38:29Z","title":"AbsenceBench: Language Models Can't Tell What's Missing","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T04:13:17.791605Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2506.11440"},"observation_digest":"sha256:ed99c2c812cde810512623cedbe3640f9fcaf9df66beadc6a2939293ddce126e","observation_id":"23303ff9-36c3-4125-bd84-9493b8df1701","resolution":{"observed_at":"2026-08-07T04:13:17.791605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-06T19:45:12.557157Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04723","last_updated":"2025-07-07T07:33:24Z","snapshot_observed_at":"2026-08-08T04:19:34.064805Z","submitted_at":"2025-07-07T07:33:24Z","title":"LOOM-Scope: a comprehensive and efficient LOng-cOntext Model evaluation framework","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T19:45:12.557157Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2507.04723"},"observation_digest":"sha256:ab9f737eea06c976177f1e08692a018cfff18d7089447e30a7decb24d0515692","observation_id":"f3d1600d-058a-45d6-979d-5805a244b512","resolution":{"observed_at":"2026-08-06T19:45:12.557157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":"2410.02694","doi":"10.48550/arxiv.2410.02694","metadata_source":"pith","pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694","venue":"cs.CL","work_id":"1772d787-6ea9-4bf6-8e87-b1f854eb1779","year":2024},"citing_paper":{"arxiv_id":"2507.05257","last_updated":"2026-06-28T17:25:01Z","snapshot_observed_at":"2026-08-06T19:26:23.035442Z","submitted_at":"2025-07-07T17:59:54Z","title":"Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T21:20:22.146417Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2507.05257"},"observation_digest":"sha256:5b2ae7f79f2de1234c00fb06a00408c03c23661c045842fb1ce6947dd7016e2e","observation_id":"573f45ed-7569-4f96-b52f-7dbd576adc02","resolution":{"observed_at":"2026-05-16T21:20:22.281395Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-06T19:36:05.767328Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05257","last_updated":"2026-06-28T17:25:01Z","snapshot_observed_at":"2026-08-06T19:26:23.035442Z","submitted_at":"2025-07-07T17:59:54Z","title":"Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:36:05.767328Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2507.05257"},"observation_digest":"sha256:65fe6bf078a56cc049d168462d8bd991d9e1e3cf61232bd86acc8ed049331381","observation_id":"19a2db10-b3d0-44e6-af6f-cc712ef51006","resolution":{"observed_at":"2026-08-06T19:36:05.767328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-06T17:59:56.251833Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09506","last_updated":"2025-08-04T01:12:15Z","snapshot_observed_at":"2026-08-06T17:51:50.204391Z","submitted_at":"2025-07-13T06:17:53Z","title":"Ref-Long: Benchmarking the Long-context Referencing Capability of Long-context Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T17:59:56.251833Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2507.09506"},"observation_digest":"sha256:7d32d3a8c9e74912c4220c4174a0a8e97728815099338544f75a01bafe5d2090","observation_id":"c53058d7-0c5f-4868-9881-57a94bea899b","resolution":{"observed_at":"2026-08-06T17:59:56.251833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":"2410.02694","doi":"10.48550/arxiv.2410.02694","metadata_source":"pith","pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694","venue":"cs.CL","work_id":"1772d787-6ea9-4bf6-8e87-b1f854eb1779","year":2024},"citing_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-11T05:46:40.836161Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2602.15763"},"observation_digest":"sha256:9a4d6c8913b2d4e22574c010ef995d5ecf7ee51075a143bf31fd511d0607c5a9","observation_id":"6aead0e6-90b4-47e9-bc0a-19cb0e7972fa","resolution":{"observed_at":"2026-05-11T05:46:41.099372Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":"2410.02694","doi":"10.48550/arxiv.2410.02694","metadata_source":"pith","pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694","venue":"cs.CL","work_id":"1772d787-6ea9-4bf6-8e87-b1f854eb1779","year":2024},"citing_paper":{"arxiv_id":"2603.23231","last_updated":"2026-05-17T13:59:13Z","snapshot_observed_at":"2026-08-02T05:44:37.993945Z","submitted_at":"2026-03-24T14:04:11Z","title":"PERMA: Benchmarking Personalized Memory Agents via Event-Driven Preference and Realistic Task Environments","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-21T09:55:17.236296Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2603.23231"},"observation_digest":"sha256:ad732043cb0a5ec353184de5912171f7d1d2508be3a5443b4066b44f36b9acf6","observation_id":"93de6723-5a0e-4978-929a-02d8b6751012","resolution":{"observed_at":"2026-05-21T09:59:59.098721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":"2410.02694","doi":"10.48550/arxiv.2410.02694","metadata_source":"pith","pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694","venue":"cs.CL","work_id":"1772d787-6ea9-4bf6-8e87-b1f854eb1779","year":2024},"citing_paper":{"arxiv_id":"2604.02371","last_updated":"2026-06-29T16:52:45Z","snapshot_observed_at":"2026-08-07T20:37:01.650037Z","submitted_at":"2026-03-31T04:41:01Z","title":"Internalized Reasoning for Long-Context Visual Document Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T23:53:19.148407Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2604.02371"},"observation_digest":"sha256:6b2b277e0cc890da7986923bc29e7fa438258cd00cf6bca0c41f7dfd93757537","observation_id":"03e463e2-514e-4f33-bdd5-59d59e23b9f2","resolution":{"observed_at":"2026-05-13T23:53:27.832387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-07-13T15:50:49.083652Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.02371","last_updated":"2026-06-29T16:52:45Z","snapshot_observed_at":"2026-08-07T20:37:01.650037Z","submitted_at":"2026-03-31T04:41:01Z","title":"Internalized Reasoning for Long-Context Visual Document Understanding","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-13T15:50:49.083652Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2604.02371"},"observation_digest":"sha256:012c110ed4092fed5bb580abf68c93775bf20619af560ccad8598b55ea37ffda","observation_id":"d29ebaf7-1cab-43dd-942c-9a576f9e68f5","resolution":{"observed_at":"2026-07-13T15:50:49.083652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":"2410.02694","doi":"10.48550/arxiv.2410.02694","metadata_source":"pith","pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694","venue":"cs.CL","work_id":"1772d787-6ea9-4bf6-8e87-b1f854eb1779","year":2024},"citing_paper":{"arxiv_id":"2604.06111","last_updated":"2026-04-10T03:07:44Z","snapshot_observed_at":"2026-08-02T21:04:18.191344Z","submitted_at":"2026-04-07T17:21:28Z","title":"AgentCE-Bench: Agent Configurable Evaluation with Scalable Horizons and Controllable Difficulty under Lightweight Environments","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T19:07:46.077831Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2604.06111"},"observation_digest":"sha256:4d5707510b7a917fe937dbc9f2b319fbea2253815ad3635d3113bd1803c0a373","observation_id":"521582f8-285d-4bce-9683-cfd98a865bfc","resolution":{"observed_at":"2026-05-10T23:30:49.439342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":"2410.02694","doi":"10.48550/arxiv.2410.02694","metadata_source":"pith","pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694","venue":"cs.CL","work_id":"1772d787-6ea9-4bf6-8e87-b1f854eb1779","year":2024},"citing_paper":{"arxiv_id":"2604.07809","last_updated":"2026-04-09T05:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T05:07:57Z","title":"PolicyLong: Towards On-Policy Context Extension","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T17:23:28.939977Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2604.07809"},"observation_digest":"sha256:7f90b7dc5f822ccb26b91fd3f98f538ccee73a09e386c14a3639443bcb453bb0","observation_id":"951da3d5-e3e3-4fcf-b748-87e9df62b2ce","resolution":{"observed_at":"2026-05-11T06:55:59.860500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":"2410.02694","doi":"10.48550/arxiv.2410.02694","metadata_source":"pith","pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694","venue":"cs.CL","work_id":"1772d787-6ea9-4bf6-8e87-b1f854eb1779","year":2024},"citing_paper":{"arxiv_id":"2604.20727","last_updated":"2026-04-22T16:12:36Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T16:12:36Z","title":"Supplement Generation Training for Enhancing Agentic Task Performance","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-10T00:58:27.655909Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2604.20727"},"observation_digest":"sha256:8fb190e1e476bf4c1b11242aec437a4105ef801779c1e8b7d2b3044db733a15f","observation_id":"246c1295-99e0-4794-9171-795cdf0fb9b3","resolution":{"observed_at":"2026-05-10T00:59:49.544323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":"2410.02694","doi":"10.48550/arxiv.2410.02694","metadata_source":"pith","pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694","venue":"cs.CL","work_id":"1772d787-6ea9-4bf6-8e87-b1f854eb1779","year":2024},"citing_paper":{"arxiv_id":"2604.27043","last_updated":"2026-04-29T17:44:32Z","snapshot_observed_at":"2026-08-03T12:37:08.017930Z","submitted_at":"2026-04-29T17:44:32Z","title":"CL-bench Life: Can Language Models Learn from Real-Life Context?","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-07T09:42:33.635866Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2604.27043"},"observation_digest":"sha256:ad7d2857073ff0723abafab7bc53bdf84bb5f0dc20885d3b57c9ce5058cf184c","observation_id":"27048f3d-6cb3-415d-b813-fb1c731673e5","resolution":{"observed_at":"2026-05-12T09:41:27.021854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":"2410.02694","doi":"10.48550/arxiv.2410.02694","metadata_source":"pith","pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694","venue":"cs.CL","work_id":"1772d787-6ea9-4bf6-8e87-b1f854eb1779","year":2024},"citing_paper":{"arxiv_id":"2605.00072","last_updated":"2026-04-30T11:50:32Z","snapshot_observed_at":"2026-07-06T23:13:33.799847Z","submitted_at":"2026-04-30T11:50:32Z","title":"XekRung Technical Report","version":1},"reference_index":200,"source":"arxiv_source","source_observed_at":"2026-05-09T20:55:10.400291Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2605.00072"},"observation_digest":"sha256:4657ee8791221f240915fc8de4af60b551d7e2e4e0be76e921ba1ef1f970b0f0","observation_id":"219323fa-36d1-44ef-9d51-6f219bd8e7c2","resolution":{"observed_at":"2026-05-11T14:51:14.793114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":"2410.02694","doi":"10.48550/arxiv.2410.02694","metadata_source":"pith","pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694","venue":"cs.CL","work_id":"1772d787-6ea9-4bf6-8e87-b1f854eb1779","year":2024},"citing_paper":{"arxiv_id":"2605.05806","last_updated":"2026-05-08T05:21:54Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:42:28Z","title":"Retrieval from Within: An Intrinsic Capability of Attention-Based Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T14:44:21.325977Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2605.05806"},"observation_digest":"sha256:106bb305bc3350be8cde902fca911e6c6e98e0c328c0287ac6b3e8a745c2c6b8","observation_id":"ae37a2ae-a224-469f-aaf0-22e966c4aea3","resolution":{"observed_at":"2026-05-11T18:41:10.509957Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":"2410.02694","doi":"10.48550/arxiv.2410.02694","metadata_source":"pith","pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694","venue":"cs.CL","work_id":"1772d787-6ea9-4bf6-8e87-b1f854eb1779","year":2024},"citing_paper":{"arxiv_id":"2605.05806","last_updated":"2026-05-08T05:21:54Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:42:28Z","title":"Retrieval from Within: An Intrinsic Capability of Attention-Based Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T01:03:11.473175Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2605.05806"},"observation_digest":"sha256:8b96b855b7238e8744edba63826e191d5d02e25478c235ae7134d25b8a060996","observation_id":"7af95d44-3ce3-4012-8499-0b6c340a8bb8","resolution":{"observed_at":"2026-05-11T04:50:55.410903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":"2410.02694","doi":"10.48550/arxiv.2410.02694","metadata_source":"pith","pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694","venue":"cs.CL","work_id":"1772d787-6ea9-4bf6-8e87-b1f854eb1779","year":2024},"citing_paper":{"arxiv_id":"2605.10544","last_updated":"2026-05-11T13:23:21Z","snapshot_observed_at":"2026-07-06T23:22:28.318343Z","submitted_at":"2026-05-11T13:23:21Z","title":"Where Does Long-Context Supervision Actually Go? Effective-Context Exposure Balancing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T03:52:45.320454Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2605.10544"},"observation_digest":"sha256:91b663aea5a7c7d785b790186c6b5607153693377b6e18b0e35a5a48c6333aa2","observation_id":"7edf4609-ca80-4b36-abc7-b6c951ff0710","resolution":{"observed_at":"2026-05-12T06:51:29.079752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":"2410.02694","doi":"10.48550/arxiv.2410.02694","metadata_source":"pith","pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694","venue":"cs.CL","work_id":"1772d787-6ea9-4bf6-8e87-b1f854eb1779","year":2024},"citing_paper":{"arxiv_id":"2605.12493","last_updated":"2026-05-12T17:59:34Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:34Z","title":"LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-13T03:52:58.177144Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2605.12493"},"observation_digest":"sha256:875633f0e3d3806b40206c0e76f4494fea667fa749e312ccdfb4e63a72bac637","observation_id":"0fa1d0be-b2df-4c0c-8f3d-41ccb54a0b67","resolution":{"observed_at":"2026-05-13T03:57:12.685628Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":"2410.02694","doi":"10.48550/arxiv.2410.02694","metadata_source":"pith","pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694","venue":"cs.CL","work_id":"1772d787-6ea9-4bf6-8e87-b1f854eb1779","year":2024},"citing_paper":{"arxiv_id":"2605.14906","last_updated":"2026-05-14T14:41:17Z","snapshot_observed_at":"2026-08-02T09:41:14.453439Z","submitted_at":"2026-05-14T14:41:17Z","title":"MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T21:00:25.664841Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2605.14906"},"observation_digest":"sha256:ed94d03d91ebe933771128c044b924a13e99a46b0def2e51b14f31d01276d41c","observation_id":"e9354fae-bb7e-4e68-b278-fb5a13ac9c0d","resolution":{"observed_at":"2026-06-30T21:05:04.246831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":"2410.02694","doi":"10.48550/arxiv.2410.02694","metadata_source":"pith","pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694","venue":"cs.CL","work_id":"1772d787-6ea9-4bf6-8e87-b1f854eb1779","year":2024},"citing_paper":{"arxiv_id":"2606.17328","last_updated":"2026-06-15T22:21:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-15T22:21:23Z","title":"MemTrace: Probing What Final Accuracy Misses in Long-Term Memory","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T03:13:52.804489Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2606.17328"},"observation_digest":"sha256:4f36b4963d9aea1e38efc620132185c40b9f95648b1d840e5235d8daa6ce5032","observation_id":"db3126e0-991e-48b6-ba5c-4b502e76ab9f","resolution":{"observed_at":"2026-06-27T03:20:26.597377Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-07-11T22:15:14.580916Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07724","last_updated":"2026-07-04T20:41:42Z","snapshot_observed_at":"2026-08-08T03:46:34.472480Z","submitted_at":"2026-07-04T20:41:42Z","title":"Uncertainty-gated selection for block-sparse attention","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-11T22:15:14.580916Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2607.07724"},"observation_digest":"sha256:f96acd3c4e5bf156a119fa498da5a5be9c266522323eba4dac030fb30745c9bb","observation_id":"f952f4f6-6a0a-4837-b8db-c67ec05b0c78","resolution":{"observed_at":"2026-07-11T22:15:14.580916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":"2410.02694","doi":"10.48550/arxiv.2410.02694","metadata_source":"pith","pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694","venue":"cs.CL","work_id":"1772d787-6ea9-4bf6-8e87-b1f854eb1779","year":2024},"citing_paper":{"arxiv_id":"2607.07740","last_updated":"2026-07-10T03:53:58Z","snapshot_observed_at":"2026-08-08T09:03:10.158542Z","submitted_at":"2026-07-08T06:23:42Z","title":"Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T19:59:46.713277Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2607.07740"},"observation_digest":"sha256:b1dc85a588ce9c1a7dad95d29a5336a0ed7f196be2b27c7dcc4a356562368f2c","observation_id":"347f2a62-616e-47f3-86fb-a6b862b274c0","resolution":{"observed_at":"2026-07-10T20:07:33.460361Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-07-13T06:47:09.927626Z","title":"HELMET: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07740","last_updated":"2026-07-10T03:53:58Z","snapshot_observed_at":"2026-08-08T09:03:10.158542Z","submitted_at":"2026-07-08T06:23:42Z","title":"Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T06:47:09.927626Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2607.07740"},"observation_digest":"sha256:505de960de52c8e4606a26985ec034353f09a2fce712e82b23e76361bd4fc277","observation_id":"f78bcb0a-a59f-4e16-b56d-98590a653c64","resolution":{"observed_at":"2026-07-13T06:47:09.927626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":"2410.02694","doi":"10.48550/arxiv.2410.02694","metadata_source":"pith","pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694","venue":"cs.CL","work_id":"1772d787-6ea9-4bf6-8e87-b1f854eb1779","year":2024},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-02T16:38:21.894642Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":143,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:47e16745b33c59dc4e6652aeedc77811250c23feba893e4169e45573a6e6ef40","observation_id":"155aab53-fb26-499f-9c33-34b65ef412e5","resolution":{"observed_at":"2026-07-10T01:36:44.141102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-07-13T03:52:24.872919Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T03:52:24.872919Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:83a6612f28bf0184300fc54fb427fcb9c94dab537967247ada56187b8093b112","observation_id":"668b0072-bef2-4180-a91a-f3d24743d65a","resolution":{"observed_at":"2026-07-13T03:52:24.872919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-02T07:40:58.349130Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:58.349130Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:521f172f3ba89d7e5693d8591589c08d8f3c53786726709a277ca4e45335d917","observation_id":"7b9d11d5-bfea-4a30-a41a-fdc19305862f","resolution":{"observed_at":"2026-08-02T07:40:58.349130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-07-30T15:06:50.760396Z","title":"arXiv preprint arXiv:2410.02694 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23722","last_updated":"2026-07-26T15:38:28Z","snapshot_observed_at":"2026-08-09T04:53:18.077520Z","submitted_at":"2026-07-26T15:38:28Z","title":"E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-30T15:06:50.760396Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2607.23722"},"observation_digest":"sha256:9f40d6657fbe703818938a637473fc33c0392a81ab616185ad49a0a17e041164","observation_id":"7ed6ac1d-fda7-4d4a-9110-b6dbfa8945d8","resolution":{"observed_at":"2026-07-30T15:06:50.760396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-01T02:36:10.030487Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25398","last_updated":"2026-08-03T20:36:31Z","snapshot_observed_at":"2026-08-07T23:09:37.718671Z","submitted_at":"2026-07-28T07:58:07Z","title":"HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T02:36:10.030487Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2607.25398"},"observation_digest":"sha256:5f8e8e4b82e81c87c953990a3af918223a3bd95ff6b6144a7708c6d77876bd50","observation_id":"4e976dbf-c023-4458-a613-38acc352a6f7","resolution":{"observed_at":"2026-08-01T02:36:10.030487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-07T00:15:00.494998Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly.arXiv preprint arXiv:2410.02694,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01662","last_updated":"2026-08-04T07:46:43Z","snapshot_observed_at":"2026-08-07T23:09:43.802314Z","submitted_at":"2026-08-03T03:51:21Z","title":"LongCat Sparse Attention: Taming the Lightning via Streaming-aware Hierarchical Cross-Layer Indexing","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:00.494998Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2608.01662"},"observation_digest":"sha256:cc9c2c3e08588d7ba7c2331c192ec2ec031af5fb1f626c0d03913a13b40723e5","observation_id":"45d857b8-dd7b-4310-abb1-374c8be88b12","resolution":{"observed_at":"2026-08-07T00:15:00.494998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.02694/citation-record","integrity":"/paper/2410.02694/integrity","json":"/paper/2410.02694/citation-record.json","paper":"/paper/2410.02694"},"outbound":[],"paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 34 inbound Pith citation observations for arXiv:2410.02694."}