{"as_of":"2026-08-20T18:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c9397bab493ea420d2460c2296a5a52d9de7917b8a7d771aedc662820eb142df","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T10:30:32.418086Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27283/citation-record","integrity":"/paper/2607.27283/integrity","json":"/paper/2607.27283/citation-record.json","paper":"/paper/2607.27283"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:29.784701Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:29.784701Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:70d2dbb7ba0cfb1d75be8cbd5906aca5b3094fd5f6c91e5114db8fc45f03c4c6","observation_id":"416b4d6b-cc6b-420e-8812-cea610b4f96b","resolution":{"observed_at":"2026-08-01T10:30:29.784701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:29.924211Z","title":"The Illusion of Diminishing Returns: Measuring Long Horizon Execution in","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:29.924211Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:7619745c15863f6129e00a0cab838f49af8abb04e7a6e71be7c5036d4b7f6f5e","observation_id":"1677bd92-60e3-4a6b-8d37-7168ed16ce23","resolution":{"observed_at":"2026-08-01T10:30:29.924211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11978","last_updated":"2026-04-13T19:11:42Z","snapshot_observed_at":"2026-08-12T18:25:38.721370Z","submitted_at":"2026-04-13T19:11:42Z","title":"The Long-Horizon Task Mirage? Diagnosing Where and Why Agentic Systems Break","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.11978","snapshot_observed_at":"2026-08-01T10:30:30.106570Z","title":"arXiv preprint arXiv:2604.11978 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:30.106570Z"},"links":{"cited_paper":"/paper/2604.11978","citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:f07f34db3a58cb5d7eba89779d068dbdabac28bbbcab7f6c089343717eb70ea6","observation_id":"f21b445c-9830-4aa6-8ac9-b5b1afcb208a","resolution":{"observed_at":"2026-08-01T10:30:30.106570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:30.182956Z","title":"Preprint , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:30.182956Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:baccb73ed43d332dbeaca4601bf43de81647deec9851bf7ede1d13d9437f49a0","observation_id":"07825610-0eb2-4abe-bb2d-69d32992ef67","resolution":{"observed_at":"2026-08-01T10:30:30.182956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:30.260859Z","title":"Proceedings of the 43rd International Conference on Machine Learning , series =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:30.260859Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:e60d0483ceab73aa0cf591d4b56ccc5582f275d143a5977c3d4c28f93d1706d5","observation_id":"c600c314-f5c5-4444-bd9b-528e6773f626","resolution":{"observed_at":"2026-08-01T10:30:30.260859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.08964","snapshot_observed_at":"2026-08-01T10:30:30.340852Z","title":"arXiv preprint arXiv:2607.08964 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:30.340852Z"},"links":{"cited_paper":"/paper/2607.08964","citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:0b710e4b0e6ffb198ae114509e8eaadcb3dfae64fe1461ab01df378ac2d13939","observation_id":"08769bb1-e34f-4a66-b9a0-2e02d1661f6e","resolution":{"observed_at":"2026-08-01T10:30:30.340852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:30.430783Z","title":", journal =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:30.430783Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:8021924625dcf8596d37336753797a67cfc47e5e77fc8b25589c455e57f078f7","observation_id":"91a6693b-d38e-4c6b-b929-9f7565c26a8c","resolution":{"observed_at":"2026-08-01T10:30:30.430783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:30.491629Z","title":"2026 , url =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:30.491629Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:f4b0a39385afda01859f663782999406f47c1709a6ef2d89297d96eb8e3ff80f","observation_id":"4485125b-a4af-4b2b-8a61-03a5363b6743","resolution":{"observed_at":"2026-08-01T10:30:30.491629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:30.560655Z","title":"2026 , url =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:30.560655Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:1efba5f0ac90a2d2b9d592187a6fb74e5f64c939ba159f3aca2319e53aceed7f","observation_id":"2d5ed4c3-d9ce-4a6d-aa80-03c9a9c5f472","resolution":{"observed_at":"2026-08-01T10:30:30.560655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:30.650247Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:30.650247Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:bb97cf8e6d47d57f7f8b268fc4c23a8f634633c7e3f68b1edf8f95bfe84d6d18","observation_id":"efde4d45-eace-460d-b784-7d77b7f740fa","resolution":{"observed_at":"2026-08-01T10:30:30.650247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:30.707776Z","title":"2025 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:30.707776Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:59a6536f5402f3e0ed068069a96ad04b1c8efd61571a35c70f99fde483751f6a","observation_id":"5f52406e-1889-4177-960d-49a709597963","resolution":{"observed_at":"2026-08-01T10:30:30.707776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:30.774929Z","title":"2025 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:30.774929Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:6a28d1fa9a92ef0b5bdf4ac1e351d48b2e84bac836b3af663436d1960e88a0f6","observation_id":"08f1540a-5a7c-4846-9de2-530e2e109de9","resolution":{"observed_at":"2026-08-01T10:30:30.774929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:30.859600Z","title":"Training Software Engineering Agents and Verifiers with","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:30.859600Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:5959fd075549c794b5b90a4a27a58687cf52db697a6a94418379f75c5903f15f","observation_id":"e0edacbf-a784-4273-a347-0b32d12b9275","resolution":{"observed_at":"2026-08-01T10:30:30.859600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:30.896915Z","title":"and Tang, Xiangru and Zhuge, Mingchen and Pan, Jiayi and Song, Yueqi and Li, Bowen and Singh, Jaskirat and Tran, Hoang H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:30.896915Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:6d303876830076f70cf16ca9868289b30b3c3529a2ddbfe4513272c1bee34d6f","observation_id":"5ac6a248-fa0c-4040-803a-07d1c764e3cb","resolution":{"observed_at":"2026-08-01T10:30:30.896915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:30.941874Z","title":"2025 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:30.941874Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:ee972635368da55602986794e8c50b179ac1238c58376fe8945d1299bbd249be","observation_id":"d32800a9-088e-4c60-a05d-5df168c75645","resolution":{"observed_at":"2026-08-01T10:30:30.941874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:31.009597Z","title":"and Barnes, Elizabeth and Chan, Lawrence , booktitle =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:31.009597Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:29fc92db3438c5c274a49ff239659567917c9d474d96739445802c30c30aeee3","observation_id":"b6e36523-86ec-46b0-a61e-8a0fc2a34004","resolution":{"observed_at":"2026-08-01T10:30:31.009597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:31.107964Z","title":"and Yang, John and Wettig, Alexander and Yao, Shunyu and Pei, Kexin and Press, Ofir and Narasimhan, Karthik , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:31.107964Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:f998ff40d04901a9378c12659d0685ca286c25d4ce2bd87ffd5c08ee94867673","observation_id":"baf90af4-73ca-4951-94c7-970eab67da7e","resolution":{"observed_at":"2026-08-01T10:30:31.107964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:31.164507Z","title":"and Wettig, Alexander and Lieret, Kilian and Yao, Shunyu and Narasimhan, Karthik and Press, Ofir , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:31.164507Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:ee2158505cff295cf2a7ef6d25052be64e649302b0700d0b1d9b9ab1488002a3","observation_id":"c3b040ec-5c68-4562-828e-930e811045b2","resolution":{"observed_at":"2026-08-01T10:30:31.164507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:31.210955Z","title":"Agentless: Demystifying","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:31.210955Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:4ae48a29c5cfa82a6cd9c283baa3683404f41094e95d82f2b89bfb19ad8ee71f","observation_id":"cbb4b1d2-a590-4e84-8878-8dc6fbc44bbf","resolution":{"observed_at":"2026-08-01T10:30:31.210955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:31.215235Z","title":"2024 , note =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:31.215235Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:2c8ec5f9249869380d6756e7759a12b0f0d0a2ac76d799a0777c9e0ebc521ec0","observation_id":"80ffb10c-8dd1-4641-828b-6f61389ad9c8","resolution":{"observed_at":"2026-08-01T10:30:31.215235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:31.333881Z","title":"2024 , url =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:31.333881Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:f630b4d45a3ecd743364084b712c837ecb20ecbfc42ad57b4e4a0a87dc05909b","observation_id":"c63a8134-c0c9-4f96-85b0-a7fb66cba8f0","resolution":{"observed_at":"2026-08-01T10:30:31.333881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:31.485842Z","title":"and Zhu, Hao and Zhou, Xuhui and Lo, Robert and Sridhar, Abishek and Cheng, Xianyi and Ou, Tianyue and Bisk, Yonatan and Fried, Daniel and Alon, Uri and Neubig, Graham , journal =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:31.485842Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:8ca896b2d62a82b9bcc5430229b05bbc5d730fd6bf7b163cba3baf93a8a09e80","observation_id":"6076facb-0225-4886-ad13-a52ec6b39652","resolution":{"observed_at":"2026-08-01T10:30:31.485842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:31.602457Z","title":"2024 , url =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:31.602457Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:027d5421964e010191ef4dba4db949dba6494835a79ee0944c2f04ff97e0a45f","observation_id":"6b0245d7-08bd-4ee8-b208-54e2f59d5074","resolution":{"observed_at":"2026-08-01T10:30:31.602457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:31.705642Z","title":"2024 , note =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:31.705642Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:a27a6aaacf9bc5ab33cf74da38b6893595db7ef0e8a6896264831c495fbcb52f","observation_id":"218e9b2e-e900-4c0d-ae1d-dfd55b73184c","resolution":{"observed_at":"2026-08-01T10:30:31.705642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:31.821756Z","title":"2024 , url =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:31.821756Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:0c7b38ceb388ed5f710c0177a2422ac8b7824470a233b2278693a129e0ee1613","observation_id":"f634f05c-1be2-464b-aa3a-78bceb2e778b","resolution":{"observed_at":"2026-08-01T10:30:31.821756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:31.913769Z","title":"Transactions of the Association for Computational Linguistics , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:31.913769Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:ef987126382da42a510b1bc78ee90030496deaab69ddacb9a014dea755eb8d0d","observation_id":"c6e9e80a-73ca-482f-bb49-09288070a716","resolution":{"observed_at":"2026-08-01T10:30:31.913769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:31.981418Z","title":"Context Rot: How Increasing Input Tokens Impacts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:31.981418Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:2c7496e6c8365a69cc7f2c650583d1456aa17497e7a5448a336c575f61d24887","observation_id":"fcbe5747-b539-4543-812c-c65f6a187d20","resolution":{"observed_at":"2026-08-01T10:30:31.981418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:32.081844Z","title":"The Memory Curse: How Expanded Recall Erodes Cooperative Intent in","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:32.081844Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:3ad5f9889468da34702c8e31ad1f25217e877f3b1e0c2532b3664c20f35efd8e","observation_id":"14efc06a-02f1-48ba-9bdb-72d050cf2701","resolution":{"observed_at":"2026-08-01T10:30:32.081844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:32.218517Z","title":"2026 , url =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:32.218517Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:858ce9167f0953f934460bffabc22fed11416735bc81db8dd0b998a859aebf44","observation_id":"7a8fe60d-a0ae-4c2b-b204-0d96c0ae96e6","resolution":{"observed_at":"2026-08-01T10:30:32.218517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:32.325218Z","title":"2026 , url =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:32.325218Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:62cb6557fe83f291f86e4f52d51387dc292e2cc0be409c38b009fbe46eac3a70","observation_id":"d3033fd5-e3a4-45e6-95be-7896808308ac","resolution":{"observed_at":"2026-08-01T10:30:32.325218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:30:32.418086Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:32.418086Z"},"links":{"citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:5c5e12600013284325f0e9a89017b1a8da8f71849b696ae4aabff99b79cf9b89","observation_id":"c9c556b7-9e29-4dc0-8aaf-0e5da401de2c","resolution":{"observed_at":"2026-08-01T10:30:32.418086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2607.27283."}