{"as_of":"2026-08-07T11:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:158d74151a71e6fc4caadecac8386ddc4ca3ee463fbeee33effb093c6ad37f61","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:40:58.826285Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09328/citation-record","integrity":"/paper/2607.09328/integrity","json":"/paper/2607.09328/citation-record.json","paper":"/paper/2607.09328"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:40:58.826285Z","title":"Raw-source evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:58.826285Z"},"links":{"citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:2cef0898da57a77eaf4831c55b94c0fa4635f3828e10640736366ea7ab98c842","observation_id":"e4165941-492b-4e1c-b4a2-6a4d33f0e1ac","resolution":{"observed_at":"2026-08-02T07:40:58.826285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:40:55.860969Z","title":"URL https://arxiv.org/ abs/2606.19348","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:55.860969Z"},"links":{"citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:b60f2808d04050fc7a2688e5d7d5e392dd68570ef1381595abbfa101dfda560c","observation_id":"3a4b5c20-6e72-4afc-8839-fd879b986223","resolution":{"observed_at":"2026-08-02T07:40:55.860969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11763","last_updated":"2025-06-13T13:17:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-13T13:17:32Z","title":"DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11763","snapshot_observed_at":"2026-08-02T07:40:55.937791Z","title":"Xiang Feng, Jiawei Zhou, Zhangfeng Huang, Kewei Wang, Shanshan Ye, Jinxin Hu, Zulong Chen, Yong Luo, and Jing Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:55.937791Z"},"links":{"cited_paper":"/paper/2506.11763","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:adeddf841ebff51ba937b3c5fce7e97a40dd39dd94a0175706e95955c6c3daf8","observation_id":"4622702c-c9ff-45af-95ab-d7f71a5845ed","resolution":{"observed_at":"2026-08-02T07:40:55.937791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08888","last_updated":"2026-05-14T06:57:18Z","snapshot_observed_at":"2026-07-06T23:21:02.177557Z","submitted_at":"2026-05-09T11:12:59Z","title":"DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.08888","snapshot_observed_at":"2026-08-02T07:40:56.029050Z","title":"Tianyu Gao, Howard Yen, Jiatong Yu, and Danqi Chen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:56.029050Z"},"links":{"cited_paper":"/paper/2605.08888","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:52b9c9da9cd174fa5e1b2294de570b23c2dcb8ab7438017b96efb7bc00995c8f","observation_id":"197b182d-0c74-49dd-adfd-2f2f0e5128d3","resolution":{"observed_at":"2026-08-02T07:40:56.029050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-02T07:40:56.168353Z","title":"URLhttps://arxiv.org/abs/2503.19786","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:56.168353Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:11c9d5ab4f6474618135ed92e8eb5b97d3c6a8376819d80998f2dd17d62dca78","observation_id":"7ca26883-e3ce-42d8-9d41-76d8e40b4db9","resolution":{"observed_at":"2026-08-02T07:40:56.168353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24964","last_updated":"2026-04-27T20:05:41Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T20:05:41Z","title":"Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24964","snapshot_observed_at":"2026-08-02T07:40:56.445058Z","title":"Tomáš Koˇciský, Jonathan Schwarz, Phil Blunsom, Chris Dyer, Karl Moritz Hermann, Gábor Melis, and Edward Grefenstette","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:56.445058Z"},"links":{"cited_paper":"/paper/2604.24964","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:7203a89e2d203e2d8f011e395750bc89c8f5f4763ad7a8e98883714dffb51f91","observation_id":"8af18281-6573-4540-b62e-5ed686f74739","resolution":{"observed_at":"2026-08-02T07:40:56.445058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:40:56.611667Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:56.611667Z"},"links":{"citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:279c5bde4f5ec8c9a96a12c7de94c3a28dcd4afa6c4c36cbf78293d968adb449","observation_id":"4fa34d82-c498-4dd2-b4a5-5e6b5208bdea","resolution":{"observed_at":"2026-08-02T07:40:56.611667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:40:56.670841Z","title":"Nelson F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:56.670841Z"},"links":{"citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:33bd7dac314a6d5a70973862b1a896957a366a153a7d954b9039d9e094fa6f53","observation_id":"2f2da1a5-1f07-41fa-8233-ec0c4fa9635c","resolution":{"observed_at":"2026-08-02T07:40:56.670841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-02T07:40:56.900586Z","title":"Sewon Min, Eric Wallace, Sameer Singh, Matt Gardner, Hannaneh Hajishirzi, and Luke Zettlemoyer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:56.900586Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:a7290fb39c13085dad1bc55e5228d58dd9993689e8afbedff83732f3dd70f6b9","observation_id":"7260b785-016b-44bb-a2ff-a3db3dd3e8e7","resolution":{"observed_at":"2026-08-02T07:40:56.900586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-02T14:27:24.212588Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07143","snapshot_observed_at":"2026-08-02T07:40:57.024753Z","title":"press/v267/modarressi25a.html","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:57.024753Z"},"links":{"cited_paper":"/paper/2404.07143","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:e1ec0e073b9e95eeca18d5f7aef52697a458c92d38f650059278947df20b4649","observation_id":"0d42286d-b6b7-4820-98a6-6a6c136b73a7","resolution":{"observed_at":"2026-08-02T07:40:57.024753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-02T14:27:24.212588Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07143","snapshot_observed_at":"2026-08-02T07:40:57.166701Z","title":"URLhttps://arxiv.org/abs/2404.07143","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:57.166701Z"},"links":{"cited_paper":"/paper/2404.07143","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:62d6025a8d021304084d1f1b68f2b294fcc92fff1a93a260a2982019952684cc","observation_id":"d22003ee-8a96-45b7-926b-793b11998dfc","resolution":{"observed_at":"2026-08-02T07:40:57.166701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-02T07:40:57.554756Z","title":"11 Harsh Trivedi, Niranjan Balasubramanian, Tushar Khot, and Ashish Sabharwal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:57.554756Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:90339b5db4d2c0dad053993985da5ab4a352678ad4ef8093322406d04f0ced58","observation_id":"3296dad3-f356-467d-b8b3-19ec7a5bf16f","resolution":{"observed_at":"2026-08-02T07:40:57.554756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12766","last_updated":"2025-04-23T12:52:18Z","snapshot_observed_at":"2026-07-06T17:47:02.560132Z","submitted_at":"2024-03-18T17:32:32Z","title":"NovelQA: Benchmarking Question Answering on Documents Exceeding 200K Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12766","snapshot_observed_at":"2026-08-02T07:40:57.650142Z","title":"Novelqa: Benchmarking question answering on documents exceeding 200k tokens.arXiv preprint arXiv:2403.12766, 2024a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:57.650142Z"},"links":{"cited_paper":"/paper/2403.12766","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:b9121ff0777bf6ec6a1c378003a4af3e386aebd33835ccdcc8e9d763739b3e30","observation_id":"120ccf54-e084-4efd-8057-16fdb228a777","resolution":{"observed_at":"2026-08-02T07:40:57.650142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-03T00:43:33.338074Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-08-02T07:40:57.984751Z","title":"Biao Xiang, Soyeon Caren Han, and Yihao Ding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:57.984751Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:053a06c93e9b3156fc1a2e9a967986bd78bee4e0f835ca50f5b1b451796855f5","observation_id":"9a7f0693-f639-49ef-8d61-87bfdc6691d9","resolution":{"observed_at":"2026-08-02T07:40:57.984751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:40:58.114779Z","title":"Kai Yan, Zhan Ling, Kang Liu, Yifan Yang, Ting-Han Fan, Lingfeng Shen, Zhengyin Du, and Jiecao Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:58.114779Z"},"links":{"citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:c24c05eb390b95656b43e2747944c2ebf5437de336cc05f09fb2dc4e2dd3b3bf","observation_id":"fe763d1b-0d53-4554-bd91-4ce47b9a6495","resolution":{"observed_at":"2026-08-02T07:40:58.114779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-07-06T21:30:09.658226Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19293","snapshot_observed_at":"2026-08-02T07:40:58.250915Z","title":"100-longbench: Are de facto long-context benchmarks literally evaluating long-context ability?arXiv preprint arXiv:2505.19293,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:58.250915Z"},"links":{"cited_paper":"/paper/2505.19293","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:a6debd2b9a5ef78cbc94d0760282ba7fa046a13b5544c4976daffb8f2dc129dd","observation_id":"b118c4f5-32ae-4d1a-aa9d-fbb97ea9b043","resolution":{"observed_at":"2026-08-02T07:40:58.250915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-02T07:40:58.349130Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:58.349130Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:521f172f3ba89d7e5693d8591589c08d8f3c53786726709a277ca4e45335d917","observation_id":"7b9d11d5-bfea-4a30-a41a-fdc19305862f","resolution":{"observed_at":"2026-08-02T07:40:58.349130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:40:58.484748Z","title":"Academiceval: Live long-context llm benchmark.arXiv preprint arXiv:2510.17725,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:58.484748Z"},"links":{"citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:0c4641879ea6380e26ee0dd82d294deefe42fc93bd131237fae36941639dc0f8","observation_id":"ef65d078-8b46-4f19-b04d-d11b6c463472","resolution":{"observed_at":"2026-08-02T07:40:58.484748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13718","last_updated":"2024-02-24T15:07:55Z","snapshot_observed_at":"2026-08-02T23:59:10.592798Z","submitted_at":"2024-02-21T11:30:29Z","title":"$\\infty$Bench: Extending Long Context Evaluation Beyond 100K Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13718","snapshot_observed_at":"2026-08-02T07:40:58.784842Z","title":"org/abs/2402.13718","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:58.784842Z"},"links":{"cited_paper":"/paper/2402.13718","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:4bb61d631246217c960dd084cab197181a334ea6cbfa3e7c1edf0a56d7d48a4b","observation_id":"b8133e90-1526-4ae2-bf84-6b0bf42b83dd","resolution":{"observed_at":"2026-08-02T07:40:58.784842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10149","last_updated":"2024-11-06T14:50:40Z","snapshot_observed_at":"2026-08-06T20:22:33.555366Z","submitted_at":"2024-06-14T16:00:29Z","title":"BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10149","snapshot_observed_at":"2026-08-02T07:40:56.540931Z","title":"Babilong: Testing the limits of llms with long context reasoning-in-a-haystack.arXiv preprint arXiv:2406.10149,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:56.540931Z"},"links":{"cited_paper":"/paper/2406.10149","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:b8e7e09c940b3b8b0f28f03416684cc2d50bd4e00c406c91bb375febfb77b90f","observation_id":"5b0fcf00-ff01-4511-b418-633c4506c10f","resolution":{"observed_at":"2026-08-02T07:40:56.540931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-02T07:40:56.244749Z","title":"Ruler: What’s the real context size of your long-context language models?arXiv preprint arXiv:2404.06654,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:56.244749Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:608efb88948b172a3f78065a1a44ac26887c4878a580956fda06d791afe192af","observation_id":"f9655137-add8-40a1-8f72-c849a75f5c15","resolution":{"observed_at":"2026-08-02T07:40:56.244749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:40:55.772989Z","title":"doi: 10.18653/v1/2021.naacl-main.365","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:55.772989Z"},"links":{"citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:21d08dae85b02a367db9462b3a9506505dd9e45718f4e0bd73c2f52a37481d40","observation_id":"b1c97332-b68b-4b22-9915-9ee9be2efefc","resolution":{"observed_at":"2026-08-02T07:40:55.772989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-02T07:40:56.105396Z","title":"Gemma Team","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:56.105396Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:9c2eebf7ae1f57d4b6981b189400978c794be3285bb0fc0d4146c047c566139d","observation_id":"a7c6c680-f4cd-4972-a310-bef86399acc0","resolution":{"observed_at":"2026-08-02T07:40:56.105396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-02T11:20:36.216220Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-02T07:40:55.337896Z","title":"doi: 10.18653/v1/2024.acl-long.776","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:55.337896Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:9faa4bff7e5b728f2a440ab6dacf3d4b7a342b6bf5fe4b2bdebf0d20060e3035","observation_id":"ceac9ee5-faf5-4ba3-9d24-290cb87df2b8","resolution":{"observed_at":"2026-08-02T07:40:55.337896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:40:55.418414Z","title":"acl-long.183","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:55.418414Z"},"links":{"citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:4835b98f7162e7b75779372a5ea8d07819e158b641d7f91e9bc77e0ddd16416e","observation_id":"61016f6d-48ac-4a0b-bd86-1562f88466a4","resolution":{"observed_at":"2026-08-02T07:40:55.418414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:40:55.620497Z","title":"Pradeep Dasigi, Kyle Lo, Iz Beltagy, Arman Cohan, Noah A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:55.620497Z"},"links":{"citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:c7a67c25aa0b5f9d1b29641fefb0fb43272cac1f72b2b1b4905f53aa7d278ec2","observation_id":"f2e7e000-6061-4f37-8cfe-1dcaf8c8331e","resolution":{"observed_at":"2026-08-02T07:40:55.620497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-05T04:17:50.821563Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2607.09328."}