{"as_of":"2026-08-11T18:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d6e9131c28d9b832c75d0f545517eac6c0e83d141750a195b73fe7e8a94bfed","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T17:59:28.201166Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:10:33.975463Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05458","snapshot_observed_at":"2026-08-04T10:10:33.975463Z","title":"Hongzhuo Yu, Fei Zhu, Guo-Sen Xie, and Ling Shao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02276","last_updated":"2026-08-03T14:12:18Z","snapshot_observed_at":"2026-08-07T00:46:13.342278Z","submitted_at":"2026-08-03T14:12:18Z","title":"Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T10:10:33.975463Z"},"links":{"cited_paper":"/paper/2607.05458","citing_paper":"/paper/2608.02276"},"observation_digest":"sha256:eb46564971867932350559774cb9e433b1f9dd1ee46ed4d87b17c7ea7355b085","observation_id":"b92da23f-7233-4967-8ac6-620726359d9d","resolution":{"observed_at":"2026-08-04T10:10:33.975463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.05458/citation-record","integrity":"/paper/2607.05458/integrity","json":"/paper/2607.05458/citation-record.json","paper":"/paper/2607.05458"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"AgentBench: Evaluating","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:40d33aa6530be8dfd547b418f916bc0e6cb1b422c00189c0c745cff7eadd0dd2","observation_id":"0664bf45-a77b-44b0-ba9e-f7d28663e9d4","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15793","last_updated":"2024-11-11T20:01:15Z","snapshot_observed_at":"2026-07-06T18:19:29.996982Z","submitted_at":"2024-05-06T17:41:33Z","title":"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15793","snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"arXiv preprint arXiv:2405.15793 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"cited_paper":"/paper/2405.15793","citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:87a9fd0d1b28852693ac305ac01693230db71a4164f73e8aeccf950652662c4e","observation_id":"d85fda4f-3fb2-4a33-a705-3b4376e299de","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10762","last_updated":"2025-04-15T02:44:55Z","snapshot_observed_at":"2026-07-06T19:33:12.610676Z","submitted_at":"2024-10-14T17:40:40Z","title":"AFlow: Automating Agentic Workflow Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10762","snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"arXiv preprint arXiv:2410.10762 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"cited_paper":"/paper/2410.10762","citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:1fa1e31c874376a444434e83fb11a54a22d2e790ceb793d714258e39578299fe","observation_id":"f8c08bd2-c78e-414a-95aa-8a6f9e3245ce","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.05922","last_updated":"2026-06-10T05:04:53Z","snapshot_observed_at":"2026-08-03T16:23:21.190194Z","submitted_at":"2026-06-04T09:26:00Z","title":"Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.05922","snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"arXiv preprint arXiv:2606.05922 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"cited_paper":"/paper/2606.05922","citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:6395f908e26b69e1f7b2d580ba8ff10bd03750a1b6cbeb2830948a7da889dce8","observation_id":"cd97c3a0-7275-4ffe-8e6e-69d66e708e9d","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:f423e94dcecc368adb6a0d02c3ca51b90c9a2a02d2697a9b37a09ca83f65a9a2","observation_id":"db988c2e-77fd-4071-a898-22e0db6a142b","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:faf282fcda3f856928b03a35f475c2b4743d3c52abded6e6b24dbe4b54ad2b22","observation_id":"79fd85ee-e8f0-4d04-9d82-25d92345f025","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:b4a83e8a85f2cfc08d6b0009436a46f73f9b24a6e2789eefe6ee81eb64b702fd","observation_id":"7391420d-66ef-4463-99d9-4665a979af72","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12983","last_updated":"2023-11-21T20:34:47Z","snapshot_observed_at":"2026-08-11T05:56:00.837968Z","submitted_at":"2023-11-21T20:34:47Z","title":"GAIA: a benchmark for General AI Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12983","snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"arXiv preprint arXiv:2311.12983 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"cited_paper":"/paper/2311.12983","citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:60133e24c7ea0b695b79f15d7b0289b312e34f9131d5616ee4dd45325d1ba71a","observation_id":"7eb3cbbc-378a-42f3-9e15-2c484d1e2dc3","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"and Yang, John and Wettig, Alexander and Yao, Shunyu and Pei, Kexin and Press, Ofir and Narasimhan, Karthik , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:65117305de0b0ff3be640948d9f1026f1b706b02b7a121d7aae08025b9efc754","observation_id":"b30ec862-e2b3-4a2c-abb2-dcb3f2c35cf9","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:c991b818bbf6fde9ea39345f8c20dc03183a38a75a48b5c9311000d65d8853aa","observation_id":"dac36de7-4b10-44f4-8340-15af432625a9","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:29e493017d373e8937af2a34d7285ffacd2ae4d9b47d8cd5314a5988ab7a169a","observation_id":"d9dd8f26-f589-4edb-b453-8644e5853a87","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:3156e83003ec3239e61e93f4ac7ecf9e1fa8aeceb515753ecb420bee46550127","observation_id":"16311f42-fe58-4cca-b588-7264ef1e10bc","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:6aa3ffbaa7caf140e47a77c71e5f3524fa5098f58d5ac24b7f0dac307a252428","observation_id":"965b7abe-e470-4f3f-8c51-caaa2b0c4a0e","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:f7518006e41b9608952939ca04a972fe6c0e25e09f5fb8057531452ec7c1445a","observation_id":"1dd99511-4e5b-4599-80e8-8e3b8c21116d","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"and Moazam, Hanna and Miller, Heather and Zaharia, Matei and Potts, Christopher , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:a15aac8b227cec6666340ef89b375ae5c297db1bdd0fc38dbfb9075c624a6255","observation_id":"579d0376-ad82-489b-8841-3056180fa992","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:ecfe26d68b3e54f5b31c001e4f78243ccbf363bfc5a96db0aee50fc68dd6be3d","observation_id":"69b2e575-6ffb-4b0f-8c7d-6413bcb540d8","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:4f6523a59645152a681fd91f7cd08a7df4b83c3c24a35d9819124737313cc552","observation_id":"be06200b-c01b-4495-9329-a5a3241a9d1e","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:c0e22215b524d79b914143caee7b2b07ec24bcbc0e7a0c559c377e849e0d054f","observation_id":"374d94e8-e629-4f0e-9d54-e2c0482f5b50","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:5bb90e5b09d81b3646dd477c256c8399e8972a1821f029fd6dd46e66672a19b6","observation_id":"6fd18a8a-d4ea-4131-a9f3-42ddf78a99d3","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"and Tan, Shangyin and Soylu, Dilara and Ziems, Noah and Khare, Rishi and Opsahl-Ong, Krista and Singhvi, Arnav and Shandilya, Herumb and Ryan, Michael J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:eca4ccb4114ca0527eac4ad58860417cfdccd7731990ee68875276b5beccb7bf","observation_id":"3c84888e-4a4e-48b1-8e9b-a84521382fc5","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.25850","last_updated":"2026-05-18T15:11:47Z","snapshot_observed_at":"2026-08-11T12:18:53.491481Z","submitted_at":"2026-04-28T16:55:02Z","title":"Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.25850","snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"arXiv preprint arXiv:2604.25850 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"cited_paper":"/paper/2604.25850","citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:73cccc23e74785ede5e31f681bf37a3e61262bcf651d038a896fa4736a28a384","observation_id":"2db7ddec-8599-40e7-ac24-c7caa78640a6","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:87a1215aa50e3ba674a89bd468856bb7a15f9f6e6bbc44ca8539dd6245f7edb4","observation_id":"b7ccc6a2-8e8a-46d2-aab5-f391477ae2aa","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:c46f654abe34c88d62552b1e304a94cf1d37069533e4f829c0ad4d90d5cb801d","observation_id":"7ab18ca7-1297-4e8f-854f-8d1349979ba1","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:6549190e5158371911f1025bd68702168b3d3933a5d34858bbd5621ade63824e","observation_id":"263ab113-d5b8-4670-a433-a8eaf0c9c612","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:de26b0f650da53b1c53bc64b809ad1dfcb3b5c56179c2767620850e01fa37b79","observation_id":"e74298f1-c114-47f4-8ceb-5fb670473c2b","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:04853778399674c11c5ce93de26f40884b4d920f8aaa2b98d459c01a6fa679c8","observation_id":"85f8103a-5f56-47ae-9b28-2507652597d0","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"arXiv preprint arXiv:1910.00177 , year=","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:50ab143462d59ed7c3b85fe0bb6a545c798f30fa06878c12ec90c40b493d562b","observation_id":"d24bdd2d-8fd5-4080-914e-0ce71f54ae7d","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"arXiv preprint arXiv:2005.01643 , year =","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:c2c736308c94907d8a920909c771b154e9a5c8dada4c81c36582fe23443e57c9","observation_id":"07a8c811-b25a-4fb1-92cf-14ebfed10e9a","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:2bc5866e40165d3ea225ddd094c401b11df49bc5418ff7bd589936a7f86c1c0c","observation_id":"5d034320-5f84-4b5f-8d2f-670dbfff140c","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"Offline Reinforcement Learning with Implicit","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:adf86b2d6ff5d4eb02ed5a23b1dd01146a389b0b07663edbeaec0e7357b233f3","observation_id":"2902dd34-2650-4591-be05-c170f2cd5e50","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":", booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:d4ac0230acf9c3d539fdd0ba93f640f7cf409490b80034e1a44365c08fdaa42e","observation_id":"40c34489-5da4-4485-9e9f-a95d7b932e25","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"International Conference on Artificial Intelligence and Statistics (AISTATS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:d91c583827e0d26bb1e94cbb0d08f96b9e9461d8a2f76cd5c9c81e6ddf214502","observation_id":"6714bb8d-e124-4347-85bc-8973152a9fa2","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:93dfb750b83500baaf988bcb9854e1de8c2c2f8ec38fa7488d196767f94fc41e","observation_id":"0e286e28-7c73-4dac-9ec3-482c70ed8a2e","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:43ec6e5fd301f0c9e949d95b747b25c9afabe3280fd7f031b9eebb3c5f5c5e20","observation_id":"68445256-30dd-40f5-84fb-ea640b39c02e","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:37914d977bbe5be4144663fb56b6bbb5023cee9b1a25f1a04cdb3949b2a4cd8a","observation_id":"d5864aca-8b9a-43d9-a6b2-c4df8ce89a47","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:4e623779f20c1af8da12f667f8f410b55f0cb206bd549713d6eaf08994b013dc","observation_id":"23cad747-53fd-4180-890e-d236b2445f05","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"Process vs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:eea8c300a652b714444c07a7e99ddbe29d3ceb038de1fe7d2e458db1ca86f482","observation_id":"d0487d67-c7c4-4579-9746-ab5413ffe7d2","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"arXiv preprint arXiv:2510.25694 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:c63c663ff21b22624a87014c63d2b6a212c1081e231da317250922a1ea23804d","observation_id":"1764b52f-8495-41a5-b98f-04678a925e76","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:baddeb1fcbc4e2f45ff82fe2202f5c8d8a921bda0628c8638f0b875d677e59fc","observation_id":"731e91b7-33f9-4833-ad9c-e5baf3fd2c9e","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.07889","last_updated":"2026-06-05T22:52:16Z","snapshot_observed_at":"2026-07-06T23:47:29.065892Z","submitted_at":"2026-06-05T22:52:16Z","title":"Strained Coherence: A Pre-Failure Signal in Coding Agent Execution Trajectories","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.07889","snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"arXiv preprint arXiv:2606.07889 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"cited_paper":"/paper/2606.07889","citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:7413d9e5ac8015aed8b1ccb5990dd163ed2f43706a059803f539f35f6e51153a","observation_id":"4b19d764-e7c5-46cf-9491-d5b0cc7e16e2","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"and Salakhutdinov, Ruslan and Manning, Christopher D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:eb47d9959ec047c783e74dab197724b69bdaaf14134baf1b4f9c3abae69fd9bb","observation_id":"494390d9-45b7-4740-8962-c85c1d0279c5","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:0796ce5cb4f21aa27d351f8b975346d9fc53a2a382f93524ce019523fb5e8398","observation_id":"2541c560-0321-466b-b738-c607d3cc6b80","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:59:28.201166Z","title":"Proceedings of the 16th International Conference on Machine Learning (ICML) , pages =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-11T17:59:28.201166Z"},"links":{"citing_paper":"/paper/2607.05458"},"observation_digest":"sha256:0e50c452f0ada4f4ae9441ec14207a3163ff5a33166488cc7432ce8df6c927b4","observation_id":"3dd3a443-0263-44d1-812a-a60676cb0b03","resolution":{"observed_at":"2026-07-11T17:59:28.201166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.05458","last_updated":"2026-07-05T22:11:18Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T05:21:04.890364Z","submitted_at":"2026-07-05T22:11:18Z","title":"Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2607.05458."}