{"as_of":"2026-08-24T03:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f21e44196e84824452002d143dfb0dd9faf29c9384f30b4d01fe4a0437b98a31","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T15:24:58.589243Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:31:42.307916Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T04:45:37.640056Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.08964","snapshot_observed_at":"2026-08-01T10:30:30.340852Z","title":"arXiv preprint arXiv:2607.08964 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27283","last_updated":"2026-07-29T13:57:32Z","snapshot_observed_at":"2026-08-15T02:21:00.366778Z","submitted_at":"2026-07-29T13:57:32Z","title":"Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T10:30:30.340852Z"},"links":{"cited_paper":"/paper/2607.08964","citing_paper":"/paper/2607.27283"},"observation_digest":"sha256:0b710e4b0e6ffb198ae114509e8eaadcb3dfae64fe1461ab01df378ac2d13939","observation_id":"08769bb1-e34f-4a66-b9a0-2e02d1661f6e","resolution":{"observed_at":"2026-08-01T10:30:30.340852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.08964","snapshot_observed_at":"2026-08-08T12:35:01.407591Z","title":"Long-horizon-terminal-bench: Testing the limits of agents on long-horizon terminal tasks with dense reward-based grading, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05466","last_updated":"2026-08-12T19:28:42Z","snapshot_observed_at":"2026-08-20T11:17:32.203910Z","submitted_at":"2026-08-05T23:24:26Z","title":"Recursive Synthesis for Long-Horizon Terminal Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T12:35:01.407591Z"},"links":{"cited_paper":"/paper/2607.08964","citing_paper":"/paper/2608.05466"},"observation_digest":"sha256:1a3ed0c97726b694611a9578412f61c970b21d6b1177d41e6316c9bee056bcb2","observation_id":"f1b89008-24a9-40b4-bcdf-70106faf04c8","resolution":{"observed_at":"2026-08-08T12:35:01.407591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.08964","snapshot_observed_at":"2026-08-10T04:31:42.307916Z","title":"Long-horizon-terminal-bench: Testing the limits of agents on long-horizon terminal tasks with dense reward-based grading, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05466","last_updated":"2026-08-12T19:28:42Z","snapshot_observed_at":"2026-08-20T11:17:32.203910Z","submitted_at":"2026-08-05T23:24:26Z","title":"Recursive Synthesis for Long-Horizon Terminal Tasks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T04:31:42.307916Z"},"links":{"cited_paper":"/paper/2607.08964","citing_paper":"/paper/2608.05466"},"observation_digest":"sha256:01271fa7318a6f12ea58ea2f35703a7cafda1b93f468dccf0f71b8f57f8c60cb","observation_id":"f7153a8a-2cb8-43a7-a39e-afe35ad7ade3","resolution":{"observed_at":"2026-08-10T04:31:42.307916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"cited_work":{"arxiv_id":"2607.08964","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.08964","snapshot_observed_at":"2026-08-07T04:45:37.640056Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","venue":"cs.AI","work_id":"5e23529d-689b-4a5f-a15a-0faab39b70e0","year":2026},"citing_paper":{"arxiv_id":"2608.06352","last_updated":"2026-08-06T17:53:18Z","snapshot_observed_at":"2026-08-13T20:51:40.174750Z","submitted_at":"2026-08-06T17:53:18Z","title":"CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T04:45:35.074893Z"},"links":{"cited_paper":"/paper/2607.08964","citing_paper":"/paper/2608.06352"},"observation_digest":"sha256:e7eaeca9f62388c3c5ed0ebf0df1c9fb05d039174e4375c43976d8298b6743a3","observation_id":"ffc54f7c-ae67-4ca5-b881-0e330d5adf76","resolution":{"observed_at":"2026-08-07T04:45:37.646242Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.08964/citation-record","integrity":"/paper/2607.08964/integrity","json":"/paper/2607.08964/citation-record.json","paper":"/paper/2607.08964"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Seed2.1 officially released: Advancing ai productivity.https://seed.bytedance.com/ en/blog/seed2-1-officially-released-advancing-ai-productivity , June 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:9294bb71ae910b063c245dddf72204b2b6d9d3048a6099601214b16d9e53e7ff","observation_id":"0569f4d8-6645-4ae2-b5ab-4736017cec53","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"From language to action: a review of large language models as autonomous agents and tool users.Artificial Intelligence Review, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:7530ca814cf19720b1439f6215d698d4f84774b37e984dfccdcb0e4c32c85261","observation_id":"b5c023ec-0e69-4e8d-86bf-e88e100d7df4","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Frontierswe.Proximal Blog, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:31867463e7a0747a5ed09a73af835dd8ee3da971dcdf7cffb7d687ba704739a9","observation_id":"31194ba0-cc09-41eb-9c89-417fd17c9474","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Deepseek-v4: Towards highly efficient million-token context intelligence, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:ebf9a2b6d8b228eaa623e778c4375e30482efd370c7a09e2fc4ffdc0210ea84d","observation_id":"d31106d5-346b-42ea-ac7e-719542066fa7","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.07682","last_updated":"2026-06-05T00:39:44Z","snapshot_observed_at":"2026-08-15T19:17:43.535423Z","submitted_at":"2026-06-05T00:39:44Z","title":"SWE-Marathon: Can Agents Autonomously Complete Ultra-Long-Horizon Software Work?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.07682","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Swe-marathon: Can agents autonomously complete ultra-long-horizon software work?arXiv preprint arXiv:2606.07682, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2606.07682","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:af1113637615830f151e126c466a745ca6b836854e77b5ce538f292a2c199a2d","observation_id":"927fd05e-9172-4e17-b051-cc1c805660db","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"A survey on the optimization of large language model-based agents.ACM Computing Surveys, 58(9):1–37, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:ec1dda6ec1e417eadb712f8c35bbb43dd0e81137175b110270014b54dd3a4996","observation_id":"4c847665-069e-4e53-851d-0784c654d56b","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Longcli-bench: A preliminary benchmark and study for long-horizon agentic programming in command-line interfaces","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:584c5a86d0d41a1533944d82e2c2f57600f33573547b19b13fed236a5d549055","observation_id":"cb65927c-0edc-4c97-a62f-1606e7b108af","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Glm-5: from vibe coding to agentic engineering, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:8c5303e0a90e7b261b0c27d77a0dcf125f3ba5a290f4990877c10f6d01010c04","observation_id":"7b25a2df-14a7-466e-be8a-ef426b612a5c","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Gemini 3.1 pro model card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:5a7185535702189d7b3fecff64990443eb6c9c81b6d5d4e8f7e731d7893821fe","observation_id":"e0971fd6-8ab8-4f0a-a482-038306a8bbba","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Harbor: A framework for evaluating and optimizing agents and models in container environments, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:670b8f33c795bbe6ea1fafbe7ccbc12fbc42446d4b9479f26ad9421441af1913","observation_id":"180398ef-19c8-4ff7-9422-72e04cf5c973","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:74a1e536d545bebad14d8a42801896a02e4c34b041d71f6fa2bd3490b43138de","observation_id":"30c5921e-b5b4-47d7-a874-be8d0e02f152","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Swe-bench: Can language models resolve real-world github issues? InInternational Conference on Learning Representations, volume 2024, pages 54107–54157, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:bb284838c80e0e71313328a2ade22dd43e412866538a1496e054a343309e8578","observation_id":"3872e800-85ec-4435-b412-7e69c6d8c6c0","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Process reward models that think.arXiv preprint arXiv:2504.16828, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:5dbabbb8c2f02adefc86a4559833a360a85dc9d3fa17a295cd5ee05570f79bfa","observation_id":"25b2214d-ef77-4038-8578-8bfebd0d98ce","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14499","last_updated":"2026-07-10T21:48:09Z","snapshot_observed_at":"2026-08-16T12:48:53.169158Z","submitted_at":"2025-03-18T17:59:31Z","title":"Measuring AI Ability to Complete Long Software Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14499","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Measuring ai ability to complete long tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2503.14499","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:460102305fcb6edb92042d52440dbf91354ba473f83d7bc14d160338461da1fd","observation_id":"2001b714-9771-4e11-8bad-590d8ac77e5b","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.18470","last_updated":"2026-04-04T09:52:04Z","snapshot_observed_at":"2026-07-30T13:30:43.108201Z","submitted_at":"2025-12-20T19:08:15Z","title":"SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.18470","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Swe-evo: Benchmarking coding agents in long-horizon software evolution scenarios.arXiv preprint arXiv:2512.18470, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2512.18470","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:83f079fbbc664b9bafba4aa7869e8bfbf9b70465c52baf9b6f8aa38bdf4e57cf","observation_id":"2548c8b6-fd4c-4d28-9ac2-86a0e99e9266","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-08-15T16:01:07.680571Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Self-rewarding vision-language model via reasoning decomposition.arXiv preprint arXiv:2508.19652, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:d8280c28de3fad3ccc88d154dccb3d8fe491f76f7f227ed8354e0bd0a28f7a20","observation_id":"3a164a77-f953-4015-a040-5be20571ce00","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.01709","last_updated":"2026-07-02T05:00:40Z","snapshot_observed_at":"2026-08-12T20:52:18.367346Z","submitted_at":"2026-07-02T05:00:40Z","title":"COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.01709","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Comfyclaw: Self-evolving skill harnesses for image generation workflows.arXiv preprint arXiv:2607.01709, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2607.01709","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:3ceea0430e569dfa961c89591d999cf54939620fc18e42391391fca5464a0474","observation_id":"95ec34b4-08e8-4285-8020-0ab013f33d5f","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Let’s verify step by step, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:2c8313a9db392adf685a116dae90114ee912743415a99472d292f2d46d287787","observation_id":"7dbc04af-f42b-4da0-9a56-d3636ac96432","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Cuarewardbench: A benchmark for evaluating reward models on computer-using agent.arXiv preprint arXiv:2510.18596, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:bff6d896a9896bd29dbbb7900afa1ca24fbfbcc59c0ad78502ab53488dc994a8","observation_id":"900bd040-4a4e-4c96-a02d-b377ac0e5c77","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30621","last_updated":"2026-05-28T22:16:14Z","snapshot_observed_at":"2026-08-02T11:09:20.796647Z","submitted_at":"2026-05-28T22:16:14Z","title":"Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30621","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Harness updating is not harness benefit: Disentangling evolution capabilities in self-evolving llm agents.arXiv preprint arXiv:2605.30621, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2605.30621","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:125497c7d4b0e0632ccaa052850867dde1d03274df8c4fc1ec5358677bfc8b36","observation_id":"0c9ae61e-4b22-4b12-af30-28b97b755bc4","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.17547","last_updated":"2026-04-25T16:40:05Z","snapshot_observed_at":"2026-07-06T22:46:26.082843Z","submitted_at":"2026-02-19T17:01:08Z","title":"KLong: Training LLM Agent for Extremely Long-horizon Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.17547","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Klong: Training llm agent for extremely long-horizon tasks.arXiv preprint arXiv:2602.17547, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2602.17547","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:5494692c6e5eb5a3eee2401b9725471bc62da5d55284340154cabbb372ff3e9f","observation_id":"87cb8ece-e5c0-425e-be99-a295c3dd5883","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-08-20T02:32:10.164015Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Terminal-bench: Benchmarking agents on hard, realistic tasks in command line interfaces.arXiv preprint arXiv:2601.11868, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:24ccfe4b597f2f9e49a8b7393b555969046a8ccb2190665422f64459ed16ed66","observation_id":"be3d5d25-fb5f-45cc-bd74-e98c3ac0f5e9","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13392","last_updated":"2026-06-11T14:23:41Z","snapshot_observed_at":"2026-08-13T11:59:50.629136Z","submitted_at":"2026-06-11T14:23:41Z","title":"MiniMax Sparse Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13392","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Minimax sparse attention, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2606.13392","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:bf3ea73bc83d066a50fb11732d4c91823ce03e5ee6a3aecc7730aadfdc921bc5","observation_id":"163d28d8-f7b0-4600-a851-e2924fbe64e4","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Kimi k2.6: From code to creation, from one to many","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:7b6409697e3dede361fe121ee3deb43c41e5422ad365fbcac890fc1b2d5a3952","observation_id":"acb35c20-9cdc-4513-a18c-0ea0468925f0","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Kimi k2.7 code: Open-source 1t agentic coding model.https://kimik2ai.com/k2.7/, June 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:63f097fe05778eb57efb7796ace66bc702fe75b9d76ef2552dcecc0994cf5501","observation_id":"4d31dd8b-8611-4bd5-8533-96c993498dbf","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Swt-bench: Testing and validating real-world bug-fixes with code agents.Advances in Neural Information Processing Systems, 37:81857–81887, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:ba6fadcc542ea61be0bfef0ca20b349af7f76d7c0d052b165aca7fd4071ab844","observation_id":"8f9cfab3-5c5a-4f62-b533-79f43c01a821","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Codex.https://github.com/openai/codex, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:3092ec31d4dc9c478c55b2093e6d1c3e0d76a3cc159de3c45d79e847757e4dfe","observation_id":"4ecffd4e-2160-44cb-9433-1984c8ee78ee","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Gpt-5 system card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:2cd78553198a08625f5254deed5cef98686acce3ed325097183485a092593092","observation_id":"5ec6e7fe-9482-4da2-be93-2cafcba960f0","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Openclaw, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:380a3478c2b64f0d4b32b18230623888b8828b5484a958ebc191935449149baa","observation_id":"c0613d6c-b724-4724-8a69-9299e6a5b7e2","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Rubriceval: A rubric-level meta-evaluation benchmark for llm judges in instruction following","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:469d31c19bd8884870aad1ede9f06b67b888b043130436a7fa7312c2ffa3b7f6","observation_id":"a4702ce7-9f1a-4b50-8dfb-edce1839c82c","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Qwen3.6.https://qwen.ai/blog?id=qwen3.6, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:f6486cc00688f77e7bf7a05fff247ce3f4f06a1a04656d9f4d6ebcde360ec024","observation_id":"88b24471-f688-44c8-93f9-39daa6385223","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Qwen3.7.https://qwen.ai/blog?id=qwen3.7, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:111e1bf3ff08ce8d4776767d1b5020a271a7209c0b4d4c30f3ab819da5e5808b","observation_id":"da8b1671-2850-4085-8eab-72a766a0cae4","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.00077","last_updated":"2026-08-07T21:28:40Z","snapshot_observed_at":"2026-08-13T23:15:12.120279Z","submitted_at":"2026-02-13T02:26:30Z","title":"Autorubric: A Unifying Framework for Rubric-Based LLM Evaluation on Non-Verifiable Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.00077","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Autorubric: Unifying rubric-based llm evaluation.arXiv preprint arXiv:2603.00077, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2603.00077","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:2e015858d3cde2379b3bc1354b816db82e7085a2b5019cb23658fac18a2fd059","observation_id":"f96bb0c3-74ac-4dc2-9d06-bc11f76acf17","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17354","last_updated":"2025-03-21T17:54:01Z","snapshot_observed_at":"2026-08-16T12:47:51.900771Z","submitted_at":"2025-03-21T17:54:01Z","title":"HCAST: Human-Calibrated Autonomy Software Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17354","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Hcast: Human-calibrated autonomy software tasks.arXiv preprint arXiv:2503.17354, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2503.17354","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:a6159a2cab9defab282bae18313f345a989e2ca53fbd7e89972129e98597e4f1","observation_id":"3d5252ba-4f12-481d-b7f8-31074f118c77","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"The illusion of diminishing returns: Measuring long horizon execution in llms.arXiv preprint arXiv:2509.09677, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:4fcc34b95c18cd405d75abfad39724885d0dd29660ae740183c329d1a83191a0","observation_id":"e2d7f8af-7b38-4604-a28a-1cef99f3bc26","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:80e06d3b3536a7c495e3ef93aebe00c812f0780b87a265577f13d7942f3dfca6","observation_id":"68533192-2278-440d-9c0b-745446854a34","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Tencent hunyuan 3.https://hunyuan.tencent.com/, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:841598788b8663a2c71ae28186211a55bece789e28229adecb0249ebe1d994ef","observation_id":"7a8772a3-8bd0-4827-92a7-cef97d7c7614","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.21262","last_updated":"2026-07-23T15:28:36Z","snapshot_observed_at":"2026-08-16T17:04:24.121480Z","submitted_at":"2026-06-19T09:38:02Z","title":"ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.21262","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Arco: Adaptive rubric with co-evolution for multi-step llm-based agents, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2606.21262","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:eb9a067638d2b34277c13e52ce19184ec43ce8c2fd43d3abb2eaf6aa4a5e0038","observation_id":"d4472a5d-1bcb-40fb-871f-bc4e1ab7c3ac","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Solving math word problems with process-and outcome-based feedback.arXiv preprint arXiv:2211.14275, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:68f7fbce958002d74935e75a523d2180fedf1ed7aad3315b84c13f583bc348d2","observation_id":"8721f60f-92bd-4315-a963-35e05dee8c87","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Apex-agents.arXiv preprint arXiv:2601.14242, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:ba60bf3f4b8f765be610ed9af27c9794ca03a877cf30ff08f3f37c61d7291884","observation_id":"d1756103-768f-4219-ba83-ed2e05c1bf05","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Xu, Xiangru Tang, Mingchen Zhuge, Jiayi Pan, Yueqi Song, Bowen Li, Jaskirat Singh, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:f73cc5db16b9f1dd7801b42af12f6623d8f05d0e7968816f49bca571e80f3a83","observation_id":"cd4a1a6e-b61d-43c7-a38b-b5a543a3243b","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16741","last_updated":"2025-04-18T18:14:31Z","snapshot_observed_at":"2026-08-18T20:14:04.086811Z","submitted_at":"2024-07-23T17:50:43Z","title":"OpenHands: An Open Platform for AI Software Developers as Generalist Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16741","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2407.16741","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:a6c7b47f03dbe01d61c43dd499a48d40302b5c37b3c8d28c42e4c82b0e440b78","observation_id":"e871df6f-0e68-4356-90d0-259d43c9e111","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11978","last_updated":"2026-04-13T19:11:42Z","snapshot_observed_at":"2026-08-12T18:25:38.721370Z","submitted_at":"2026-04-13T19:11:42Z","title":"The Long-Horizon Task Mirage? Diagnosing Where and Why Agentic Systems Break","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.11978","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"The long-horizon task mirage? diagnosing where and why agentic systems break.arXiv preprint arXiv:2604.11978, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2604.11978","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:129bf98902d4e9042e077d49a67d516030d07475ad02d7a58277ed448e66d0ba","observation_id":"39cdc564-835b-49bd-bba2-3e2838575ae9","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15114","last_updated":"2025-05-27T03:32:23Z","snapshot_observed_at":"2026-08-12T16:49:37.896696Z","submitted_at":"2024-11-22T18:30:46Z","title":"RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15114","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Re-bench: Evaluating frontier ai r&d capabilities of language model agents against human experts.arXiv preprint arXiv:2411.15114, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2411.15114","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:b95e2523161dd0d5a3987a51cbaf41f9450cffa84765d06f2c3cbc9da15c0d34","observation_id":"c4e9e2a6-d05e-4c08-b8cf-89f4e4b97842","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20987","last_updated":"2026-04-22T18:17:17Z","snapshot_observed_at":"2026-08-15T12:42:21.923447Z","submitted_at":"2026-04-22T18:17:17Z","title":"Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.20987","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Co-evolving llm decision and skill bank agents for long-horizon tasks.arXiv preprint arXiv:2604.20987, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2604.20987","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:475c1e5a0ff3390e3cf7301244065b6fde8884b9e60fed91aa921cf98df14991","observation_id":"a7ec3062-52d4-475b-8b0b-fd0b3c58bc27","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Grok.https://x.ai/, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:2a1b337431e72e5352661baef4a7ed1d2899cccfcd67aa6b55eabb469af57550","observation_id":"5e61e23f-8b40-43fa-a326-f7db9dd3d788","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Grok 4.5.https://x.ai/, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:c49d1bcf6bf5b92c9caf1931e47f1868bb0367124542b647b84d9ca12aab7f9f","observation_id":"7e932d43-c268-409b-bfe0-ab8638842967","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-14T22:26:00.902198Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:c4aa01daabad12c01127d688876d39d4eda72af4209e01a985dae4a876f162ea","observation_id":"a0273930-b891-47d7-9cce-d9a27083e5ec","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15793","last_updated":"2024-11-11T20:01:15Z","snapshot_observed_at":"2026-07-06T18:19:29.996982Z","submitted_at":"2024-05-06T17:41:33Z","title":"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15793","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Jimenez, Alexander Wettig, Kilian Lieret, Shunyu Yao, Karthik Narasimhan, and Ofir Press","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2405.15793","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:969d8b1d5687579a613f020746af9bd9da66000e9230510ad5f4f1d68d9a3244","observation_id":"8fdd5fb5-5e47-4ca5-af01-524a96a24968","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27922","last_updated":"2026-05-27T03:47:35Z","snapshot_observed_at":"2026-08-15T20:32:45.694485Z","submitted_at":"2026-05-27T03:47:35Z","title":"Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27922","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Harness-bench: Measuring harness effects across models in realistic agent workflows.arXiv preprint arXiv:2605.27922, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2605.27922","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:a7ca098715583a8f239429c82bf213b1b489958eb8563d497e355f571926671a","observation_id":"1e3afeb1-d4eb-4dbd-85be-d2e879f716e7","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-15T01:20:08.134494Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Self-rewarding language models.arXiv preprint arXiv:2401.10020, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:e8d87caff7406b40af2df83eb7f4920a88610585dfe2cc4b994d40e021c8e608","observation_id":"52d4ddb4-5b6b-4cca-a130-6451205cf9a5","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in neural information processing systems, 36:46595–46623, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:04c0101da26e2a2e787bf7bacfe1f22a8fb60564edc9cf2982caf807855f08b3","observation_id":"2fb734a2-0497-4a60-b6ea-57d236373dc9","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-14T11:14:55.351653Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:597e1499b142236c1972cec00c4fedbcd4bd13ec235d5bfcc54e51bc0e52a85f","observation_id":"9825a558-4f43-4a83-b100-3ac4e4893cf0","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T18:21:39.354000Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 4 inbound Pith citation observations for arXiv:2607.08964."}