{"as_of":"2026-08-23T09:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b9f458a2ce51ea29e83abefac778b23ac074c1ff0db0d4f27ca1289e58e37449","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T00:25:13.817483Z","state":"measured"},{"denominator":92,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":92,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28802/citation-record","integrity":"/paper/2607.28802/integrity","json":"/paper/2607.28802/citation-record.json","paper":"/paper/2607.28802"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.16941","last_updated":"2025-11-14T22:00:03Z","snapshot_observed_at":"2026-08-10T12:32:55.999823Z","submitted_at":"2025-09-21T06:28:17Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16941","snapshot_observed_at":"2026-08-03T00:25:05.267133Z","title":"arXiv preprint arXiv:2509.16941 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:05.267133Z"},"links":{"cited_paper":"/paper/2509.16941","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:ae795521ca79d3e050331184d8947b5057aa8c897c789b2c632751fdbd877936","observation_id":"01eb7ec7-fe53-4937-a8ed-8e5f83ba6d3a","resolution":{"observed_at":"2026-08-03T00:25:05.267133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00212","last_updated":"2025-06-02T03:25:55Z","snapshot_observed_at":"2026-08-20T23:16:30.945921Z","submitted_at":"2025-04-30T23:09:44Z","title":"Which Agent Causes Task Failures and When? On Automated Failure Attribution of LLM Multi-Agent Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00212","snapshot_observed_at":"2026-08-03T00:25:05.394072Z","title":"arXiv preprint arXiv:2505.00212 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:05.394072Z"},"links":{"cited_paper":"/paper/2505.00212","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:79981f364923739a599d9d13fef67e961a2088bd46d33eb27a49f2b9e5026144","observation_id":"67f04fec-d243-4f66-b1aa-d54894df2bb3","resolution":{"observed_at":"2026-08-03T00:25:05.394072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:05.579888Z","title":"From Failed Trajectories to Reliable","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:05.579888Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:87fedb29ce7916642b34b75a214e51c181e978a5cde52647d90821e90ada6a62","observation_id":"d4c723e1-2848-454b-8054-14c8381aa54d","resolution":{"observed_at":"2026-08-03T00:25:05.579888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13657","last_updated":"2025-10-26T23:25:18Z","snapshot_observed_at":"2026-08-16T06:37:17.259416Z","submitted_at":"2025-03-17T19:04:38Z","title":"Why Do Multi-Agent LLM Systems Fail?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13657","snapshot_observed_at":"2026-08-03T00:25:05.719800Z","title":"arXiv preprint arXiv:2503.13657 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:05.719800Z"},"links":{"cited_paper":"/paper/2503.13657","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:08b38d3fed09da19b25c4804e194f45fefd4e5d2632e9927c16beab7f67187a4","observation_id":"ff766a9e-57de-4a60-8516-4dd09578787f","resolution":{"observed_at":"2026-08-03T00:25:05.719800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:05.926190Z","title":"arXiv preprint arXiv:2509.25370 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:05.926190Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:81fa9012d692904595372bef82b5f197a4efa0e7366fc25b1fbb10df8ca437b3","observation_id":"81aa5493-b8b3-4e74-adc8-1a61975ca9c8","resolution":{"observed_at":"2026-08-03T00:25:05.926190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:06.107271Z","title":"2025 , month = apr, type =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:06.107271Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:06e437d2e98a219c788678075268608ba1e21724573b6c6b194d02759d2bf920","observation_id":"9ae6be71-3f22-47fe-8be8-fc362d85a3ff","resolution":{"observed_at":"2026-08-03T00:25:06.107271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.06847","last_updated":"2026-05-07T16:46:46Z","snapshot_observed_at":"2026-08-12T19:29:28.939078Z","submitted_at":"2026-03-06T20:12:29Z","title":"Characterizing Faults in Agentic AI: A Taxonomy of Types, Symptoms, and Root Causes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.06847","snapshot_observed_at":"2026-08-03T00:25:06.262679Z","title":"arXiv preprint arXiv:2603.06847 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:06.262679Z"},"links":{"cited_paper":"/paper/2603.06847","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:39a6de9752ecf6613ee1d6e00413571f2a28024f9462711b8154b0efccbe3a41","observation_id":"0fab849c-486c-4c9d-967d-ad4de25ad37e","resolution":{"observed_at":"2026-08-03T00:25:06.262679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:06.382890Z","title":"arXiv preprint arXiv:2603.04259 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:06.382890Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:48bf60606b48ba804fb3ba86ce121e53a73467feaf15fe10063f529da9b6e667","observation_id":"52da8092-772b-4133-a0b5-1ed4cfe5fa54","resolution":{"observed_at":"2026-08-03T00:25:06.382890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:06.476373Z","title":"arXiv preprint arXiv:2511.19933 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:06.476373Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:e407f88f4c14dab9b40492973e30a9251b277a58e2fa1411ea0a97ea345f8e45","observation_id":"9d1b4411-945f-442c-b516-b6ddf457f43f","resolution":{"observed_at":"2026-08-03T00:25:06.476373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17467","last_updated":"2026-05-17T14:09:35Z","snapshot_observed_at":"2026-08-15T16:14:15.853642Z","submitted_at":"2026-05-17T14:09:35Z","title":"VerifyMAS: Hypothesis Verification for Failure Attribution in LLM Multi-Agent Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.17467","snapshot_observed_at":"2026-08-03T00:25:06.559706Z","title":"arXiv preprint arXiv:2605.17467 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:06.559706Z"},"links":{"cited_paper":"/paper/2605.17467","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:b7cfa261120083e3b1b9fd9ea491077753c3bbf9f0c62b9aceb0f7d1ed4c954d","observation_id":"ae7fae6c-47c1-418d-9b2e-0f7887b6fedc","resolution":{"observed_at":"2026-08-03T00:25:06.559706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:06.657645Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:06.657645Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:ab854f7cee492c6c6d6f8555f388e661fc5c685d9ca45c920bc84453d1b5699b","observation_id":"ae56d8be-4a74-410b-a56c-e9f7c85dfcac","resolution":{"observed_at":"2026-08-03T00:25:06.657645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18796","last_updated":"2024-05-01T15:37:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-29T15:33:23Z","title":"Replacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18796","snapshot_observed_at":"2026-08-03T00:25:06.768508Z","title":"arXiv preprint arXiv:2404.18796 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:06.768508Z"},"links":{"cited_paper":"/paper/2404.18796","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:dd35d17ff9e98a4e4891f99073219ff6aba3b2b6c6d1224af6dcc8d2936dc354","observation_id":"fec78dce-8994-48f1-9591-0cc8a60d5f86","resolution":{"observed_at":"2026-08-03T00:25:06.768508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:06.924716Z","title":"The thirteenth international conference on learning representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:06.924716Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:1ac5b07c6941bea5c2b1a86e7e2e96d907287935bfd3a3bebd8d6762a1c7e9d5","observation_id":"0026a71f-e5f0-4a77-8838-fb2431f45c7c","resolution":{"observed_at":"2026-08-03T00:25:06.924716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:07.090902Z","title":"arXiv preprint arXiv:2602.02475 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:07.090902Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:80727b109e8f1c7604fa0b12ca6202e8b90d92aadbeb01d195dfd6a5fd60195e","observation_id":"d9fe1dbf-59f7-4cb7-8421-ee54dc07afe0","resolution":{"observed_at":"2026-08-03T00:25:07.090902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:07.212383Z","title":"arXiv preprint arXiv:2510.07593 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:07.212383Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:569ce988e1fe18313c48b6432de3e925e4e6f994b8f3e1542a47750e0af98216","observation_id":"3d629816-9310-4354-b1ef-9b4af782a4ff","resolution":{"observed_at":"2026-08-03T00:25:07.212383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:07.358508Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:07.358508Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:3602423c2d16ad3a3ba436553e923bd2cd786dd2072ebbd79e5e9bd2cd0c4157","observation_id":"6ec71105-5f25-47aa-bc6f-e0d90b7ecb56","resolution":{"observed_at":"2026-08-03T00:25:07.358508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.09408","last_updated":"2026-05-04T23:00:33Z","snapshot_observed_at":"2026-08-11T04:56:25.126002Z","submitted_at":"2026-04-10T15:21:44Z","title":"HiL-Bench (Human-in-Loop Benchmark): Do Agents Know When to Ask for Help?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.09408","snapshot_observed_at":"2026-08-03T00:25:07.431094Z","title":"arXiv preprint arXiv:2604.09408 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:07.431094Z"},"links":{"cited_paper":"/paper/2604.09408","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:b1d831e1001fe8ed025d818cf3dec6346531e8aab3e42bad7c0bf078daaef2dc","observation_id":"c716e255-170b-4343-9034-1347403f0774","resolution":{"observed_at":"2026-08-03T00:25:07.431094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.16380","last_updated":"2026-06-10T21:26:48Z","snapshot_observed_at":"2026-08-12T22:31:22.515020Z","submitted_at":"2025-10-18T07:34:31Z","title":"MoReBench: Evaluating Procedural and Pluralistic Moral Reasoning in Language Models, More than Outcomes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.16380","snapshot_observed_at":"2026-08-03T00:25:07.540258Z","title":"arXiv preprint arXiv:2510.16380 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:07.540258Z"},"links":{"cited_paper":"/paper/2510.16380","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:5e5d055d43cf932edd74a78425cf0ff73f6c21ee5cc5b85c189c99eaad4306b5","observation_id":"d27f01ec-6eff-4f39-8666-d65fe8e79a7b","resolution":{"observed_at":"2026-08-03T00:25:07.540258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13295","last_updated":"2025-08-27T11:15:11Z","snapshot_observed_at":"2026-08-19T14:17:02.949477Z","submitted_at":"2025-02-18T21:32:24Z","title":"Demonstrating specification gaming in reasoning models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13295","snapshot_observed_at":"2026-08-03T00:25:07.625304Z","title":"arXiv preprint arXiv:2502.13295 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:07.625304Z"},"links":{"cited_paper":"/paper/2502.13295","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:c4367365a378cf54dbc4cb178f4db246a1ef9cf6ad7a254262c09ac1ed2cb4de","observation_id":"c44056a3-0217-4eaf-a36d-f77322b2aa0c","resolution":{"observed_at":"2026-08-03T00:25:07.625304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:07.697147Z","title":"arXiv preprint arXiv:2509.21054 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:07.697147Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:5d6e032b6ec14275fae8c2eac004f554e1dabdb1017af95527aea29d32918019","observation_id":"cf58c1ed-8e88-4c0a-8b33-da3a689ef2b5","resolution":{"observed_at":"2026-08-03T00:25:07.697147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04374","last_updated":"2025-10-05T21:36:43Z","snapshot_observed_at":"2026-07-06T22:31:44.964774Z","submitted_at":"2025-10-05T21:36:43Z","title":"GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04374","snapshot_observed_at":"2026-08-03T00:25:07.762977Z","title":"arXiv preprint arXiv:2510.04374 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:07.762977Z"},"links":{"cited_paper":"/paper/2510.04374","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:c9f06b740bd4508222f3c98a5ebfcf0e7700bb2fa096ce7c8bd2498596494e93","observation_id":"c75644e7-17d7-47f9-aaff-7674740a7d96","resolution":{"observed_at":"2026-08-03T00:25:07.762977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.05806","last_updated":"2026-06-04T07:38:46Z","snapshot_observed_at":"2026-08-16T04:19:10.176201Z","submitted_at":"2026-06-04T07:38:46Z","title":"When Tools Fail: Benchmarking Dynamic Replanning and Anomaly Recovery in LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.05806","snapshot_observed_at":"2026-08-03T00:25:07.824579Z","title":"arXiv preprint arXiv:2606.05806 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:07.824579Z"},"links":{"cited_paper":"/paper/2606.05806","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:daf2cd6220eae56bbe230158102f2393a002c8ecec879460699406dea2208b1c","observation_id":"cbbdf74c-524d-4c1e-90f1-0b79dd7d9336","resolution":{"observed_at":"2026-08-03T00:25:07.824579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15296","last_updated":"2025-07-21T06:55:37Z","snapshot_observed_at":"2026-08-21T05:28:04.149419Z","submitted_at":"2025-07-21T06:55:37Z","title":"Butterfly Effects in Toolchains: A Comprehensive Analysis of Failed Parameter Filling in LLM Tool-Agent Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15296","snapshot_observed_at":"2026-08-03T00:25:07.884043Z","title":"arXiv preprint arXiv:2507.15296 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:07.884043Z"},"links":{"cited_paper":"/paper/2507.15296","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:5198bc946f640be5794a4a9bc2caf1cb92c6c603478e30ed8458c31e5ea88511","observation_id":"5aa1a9a4-d62e-4397-9a4d-089244ffaa84","resolution":{"observed_at":"2026-08-03T00:25:07.884043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:07.946203Z","title":"arXiv preprint arXiv:2603.05637 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:07.946203Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:ff54977487594c6cdfb94b294e9e5be309fc713966bb66fc6a9c6e1185f30eb4","observation_id":"c619c1f4-b115-4199-9cb5-9d4413d0ffb9","resolution":{"observed_at":"2026-08-03T00:25:07.946203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.28093","last_updated":"2026-04-30T16:37:37Z","snapshot_observed_at":"2026-08-17T14:37:40.660646Z","submitted_at":"2026-04-30T16:37:37Z","title":"What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.28093","snapshot_observed_at":"2026-08-03T00:25:08.066021Z","title":"arXiv preprint arXiv:2604.28093 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:08.066021Z"},"links":{"cited_paper":"/paper/2604.28093","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:d043302d52cf90f964ef06ce671012069b53964c8e21b3a24bb5a0e4e5a149c7","observation_id":"03c64f5c-1682-4b91-a664-c94a02a0bffa","resolution":{"observed_at":"2026-08-03T00:25:08.066021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02825","last_updated":"2025-08-07T06:58:08Z","snapshot_observed_at":"2026-08-22T09:27:33.969418Z","submitted_at":"2025-07-03T17:35:31Z","title":"Establishing Best Practices for Building Rigorous Agentic Benchmarks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02825","snapshot_observed_at":"2026-08-03T00:25:08.204255Z","title":"arXiv preprint arXiv:2507.02825 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:08.204255Z"},"links":{"cited_paper":"/paper/2507.02825","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:ebf88d067fb1cc06bb903ed279becc623f1c1f8e2d3f6a8d1b72016eaf5df8a7","observation_id":"897a0c3a-b537-43ee-b4ea-d7abc981c559","resolution":{"observed_at":"2026-08-03T00:25:08.204255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26667","last_updated":"2026-05-26T08:03:55Z","snapshot_observed_at":"2026-08-06T23:02:47.089325Z","submitted_at":"2026-05-26T08:03:55Z","title":"MemFail: Stress-Testing Failure Modes of LLM Memory Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.26667","snapshot_observed_at":"2026-08-03T00:25:08.338386Z","title":"arXiv preprint arXiv:2605.26667 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:08.338386Z"},"links":{"cited_paper":"/paper/2605.26667","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:823efdba25bca787ce1b6b0c02eed83c9dd0b0b9b9421bf002a41d8707962fc6","observation_id":"4606b0a8-d698-4824-9621-87c8573a0ef8","resolution":{"observed_at":"2026-08-03T00:25:08.338386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06527","last_updated":"2026-05-07T16:31:15Z","snapshot_observed_at":"2026-08-12T20:35:19.129962Z","submitted_at":"2026-05-07T16:31:15Z","title":"STALE: Can LLM Agents Know When Their Memories Are No Longer Valid?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06527","snapshot_observed_at":"2026-08-03T00:25:08.519326Z","title":"arXiv preprint arXiv:2605.06527 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:08.519326Z"},"links":{"cited_paper":"/paper/2605.06527","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:a6f121d5675d6938db0fb1970746058d510194b5f30b0cb395c28272dd75c7e8","observation_id":"214a1e75-1d8b-47cc-9668-1daef57ea7cb","resolution":{"observed_at":"2026-08-03T00:25:08.519326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.11768","last_updated":"2026-05-19T14:48:44Z","snapshot_observed_at":"2026-08-17T23:18:18.632443Z","submitted_at":"2026-03-12T10:16:52Z","title":"Governing Evolving Memory in LLM Agents: Risks, Mechanisms, and the Stability and Safety Governed Memory (SSGM) Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.11768","snapshot_observed_at":"2026-08-03T00:25:08.718088Z","title":"arXiv preprint arXiv:2603.11768 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:08.718088Z"},"links":{"cited_paper":"/paper/2603.11768","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:61c7559428cc0576ac13e6f958bf7960d581defb2655aa53b9b324599eed197f","observation_id":"81f99a88-6e26-4084-af7d-d1289c92896e","resolution":{"observed_at":"2026-08-03T00:25:08.718088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13177","last_updated":"2026-06-11T10:46:17Z","snapshot_observed_at":"2026-08-14T19:59:06.890277Z","submitted_at":"2026-06-11T10:46:17Z","title":"MemRefine: LLM-Guided Compression for Long-Term Agent Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13177","snapshot_observed_at":"2026-08-03T00:25:08.907070Z","title":"arXiv preprint arXiv:2606.13177 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:08.907070Z"},"links":{"cited_paper":"/paper/2606.13177","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:55ba62031f3bb346547b8f22b41995a24b019fd35e02680ba8c0f697438da532","observation_id":"b00a0e19-035e-47ff-8a71-17b2937c8aa4","resolution":{"observed_at":"2026-08-03T00:25:08.907070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:09.058779Z","title":"arXiv preprint arXiv:2505.16067 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:09.058779Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:27adfbf9650e18ef958574d243b74924c12e2a3716355c62edbb7f6792cc6973","observation_id":"109f83ee-96e1-42e3-82d4-e734e673e140","resolution":{"observed_at":"2026-08-03T00:25:09.058779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.22388","last_updated":"2026-06-21T08:29:12Z","snapshot_observed_at":"2026-08-20T11:33:12.515914Z","submitted_at":"2026-06-21T08:29:12Z","title":"PlanBench-XL: Evaluating Long-Horizon Planning of LLM Tool-Use Agents in Large-Scale Tool Ecosystems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.22388","snapshot_observed_at":"2026-08-03T00:25:09.192444Z","title":"arXiv preprint arXiv:2606.22388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:09.192444Z"},"links":{"cited_paper":"/paper/2606.22388","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:ff74fd5d5cab6eaf8f2a1c97891efbbd13eab29cd6149effbc86e83f5d6b27cb","observation_id":"4c55b048-2a6e-479c-b5ef-dd71e086f905","resolution":{"observed_at":"2026-08-03T00:25:09.192444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:09.367045Z","title":"arXiv preprint arXiv:2510.03285 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:09.367045Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:134f4d43624fbdc18c864d0359f24efde3857ab26f5ba1a246071041204462d5","observation_id":"cb611b34-6123-4b48-9483-336d938703eb","resolution":{"observed_at":"2026-08-03T00:25:09.367045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.11098","last_updated":"2026-07-15T06:22:24Z","snapshot_observed_at":"2026-08-20T14:39:48.132608Z","submitted_at":"2026-07-13T05:14:12Z","title":"AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.11098","snapshot_observed_at":"2026-08-03T00:25:09.506399Z","title":"arXiv preprint arXiv:2607.11098 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:09.506399Z"},"links":{"cited_paper":"/paper/2607.11098","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:e6ddf0d2b4d25800d30ebd986a60a640f3cb96b2ecf35267b04056320e1fcf5e","observation_id":"b312f0a9-c5c7-4f79-bb3d-9ecc84cc6111","resolution":{"observed_at":"2026-08-03T00:25:09.506399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-17T21:47:44.029577Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.09063","snapshot_observed_at":"2026-08-03T00:25:09.639122Z","title":"arXiv preprint arXiv:2507.09063 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:09.639122Z"},"links":{"cited_paper":"/paper/2507.09063","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:f47ef6934fe1bdc612552f368a25f89711f99c876c759c2b8a6b1d9ad7be6787","observation_id":"e5abfd60-86ad-4964-a30f-6ce9e6e87fca","resolution":{"observed_at":"2026-08-03T00:25:09.639122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.31174","last_updated":"2026-07-02T07:39:52Z","snapshot_observed_at":"2026-08-05T22:06:03.511973Z","submitted_at":"2026-06-30T06:06:08Z","title":"ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.31174","snapshot_observed_at":"2026-08-03T00:25:09.831119Z","title":"arXiv preprint arXiv:2606.31174 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:09.831119Z"},"links":{"cited_paper":"/paper/2606.31174","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:e743b8f37a2176aef9f97a9b15219c53b4aefeb2cc0aff4a31825fe9beffeb70","observation_id":"756dd0b0-955d-4245-b2e2-073c3c04ad20","resolution":{"observed_at":"2026-08-03T00:25:09.831119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:09.966474Z","title":"Forty-third International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:09.966474Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:f09ae1e3c3e71dd2fd612a1e8959c7196940bdef38a2b6f702f77d71d21a5a2c","observation_id":"24e1938b-0704-4b73-b5e5-a7a79e9704bf","resolution":{"observed_at":"2026-08-03T00:25:09.966474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:10.114721Z","title":"arXiv preprint arXiv:2601.13295 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:10.114721Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:6fa0eec5c0f671c4ecefa4363aa008948298ac508b47ddb4b4004ff268a1c10a","observation_id":"e8a3fdd8-13e6-462a-8578-9e04548a9540","resolution":{"observed_at":"2026-08-03T00:25:10.114721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:10.278767Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:10.278767Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:412c1d3403d53b38631c4154096c4973509f231832aeb31b815a8af122aca4b2","observation_id":"83c3209f-ee86-4612-9f66-734b9ecfcc84","resolution":{"observed_at":"2026-08-03T00:25:10.278767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:10.471552Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:10.471552Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:f9f79b9f21031ab871a25de32d677146afd9f483661b10f0f79c241de858f760","observation_id":"94e97122-f7f9-4362-8741-c95b1ba29a1c","resolution":{"observed_at":"2026-08-03T00:25:10.471552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:10.629873Z","title":"2025 , howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:10.629873Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:80858828cc50a1f0e02179eb70a09fff04160de8150105353e1153779654d315","observation_id":"8928ac94-617f-4e4c-8bb2-ebd950810b10","resolution":{"observed_at":"2026-08-03T00:25:10.629873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:10.742537Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:10.742537Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:2ef2b2721aa68e56b1e6b849710bca1ee76630b6a9e42d7fd11df6fdfb69d8e8","observation_id":"7f41217d-6bf0-469b-8ffb-c95f3982e2df","resolution":{"observed_at":"2026-08-03T00:25:10.742537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:10.846242Z","title":"2025 , howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:10.846242Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:bb6926eccc404028d875d9a72a1ac56ab3fc9346c6edca797aabf1aaf94dd332","observation_id":"da4a8668-896a-4ff4-acd5-0277b222d459","resolution":{"observed_at":"2026-08-03T00:25:10.846242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:10.923340Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:10.923340Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:843ed4266a71a8378922de81873a52813ed46330c0d3749ade51bea5addb4f1d","observation_id":"0252f063-d58f-4eef-ac90-fef9d797054c","resolution":{"observed_at":"2026-08-03T00:25:10.923340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:10.968257Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:10.968257Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:0ff86ee2adaa0668baeffb4eac564d853e7a66a60461d9c896a59716e6916c9c","observation_id":"a20c1e05-2003-4c7a-a67c-184b3ce9b754","resolution":{"observed_at":"2026-08-03T00:25:10.968257Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:11.032443Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:11.032443Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:809f98331d24f47c398b177ea11a6a66c234fb13529ae22f985802ca18ceb2af","observation_id":"019c438c-5951-4859-87ab-77830c2dc542","resolution":{"observed_at":"2026-08-03T00:25:11.032443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:11.092254Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:11.092254Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:78b418f528250b5d671f6a7e207051f0334475a3293dfa54eeb6754af77554d6","observation_id":"225c31a7-69ec-4768-b0fa-e915eed0844a","resolution":{"observed_at":"2026-08-03T00:25:11.092254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:11.184594Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:11.184594Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:e8e0c0ddfdd4f3069638de85a712e83dfc2aa0ec8ef1c627e9fb0cbfbadfc874","observation_id":"0dff6d7c-1e3d-43ff-8ef7-5394305ea9cb","resolution":{"observed_at":"2026-08-03T00:25:11.184594Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:11.244221Z","title":"2025 , howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:11.244221Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:d6f2ec3c96c151947dc7992bec70df420c06524f1ff9bafcd3e5852720c53b94","observation_id":"a0917acc-ed59-4269-9af5-f1d5680310b3","resolution":{"observed_at":"2026-08-03T00:25:11.244221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:11.327448Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:11.327448Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:25cf75cbe9591ad09b42f9bf2cd09d63d0d718c8b7bd4caa1eb63971c7e97fcc","observation_id":"8431787a-ba0f-49b6-831b-efde24142c9a","resolution":{"observed_at":"2026-08-03T00:25:11.327448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.18754","last_updated":"2026-07-21T06:21:13Z","snapshot_observed_at":"2026-08-16T04:35:17.948360Z","submitted_at":"2026-07-21T06:21:13Z","title":"AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.18754","snapshot_observed_at":"2026-08-03T00:25:11.398515Z","title":"arXiv preprint arXiv:2607.18754 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:11.398515Z"},"links":{"cited_paper":"/paper/2607.18754","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:c6fef762afcb95f7853351c217c259dbf919d2ecd500cf7fbe190fa79248abdf","observation_id":"f2c401d1-7e08-4fe7-962c-360ed33686ad","resolution":{"observed_at":"2026-08-03T00:25:11.398515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10286","last_updated":"2026-05-11T09:46:41Z","snapshot_observed_at":"2026-08-16T16:24:10.295715Z","submitted_at":"2026-05-11T09:46:41Z","title":"AgentRx: A Benchmark Study of LLM Agents for Multimodal Clinical Prediction Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.10286","snapshot_observed_at":"2026-08-03T00:25:11.457757Z","title":"arXiv preprint arXiv:2605.10286 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:11.457757Z"},"links":{"cited_paper":"/paper/2605.10286","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:f39675f13bd0c4196a8d4226f479f5e0ad604bcc0406b6924753abd7bb52d529","observation_id":"135a7814-95d7-487d-8dd8-857f1181faa7","resolution":{"observed_at":"2026-08-03T00:25:11.457757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:11.511379Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:11.511379Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:c6c992be0c6c30fdd046d411efcd51667ceec70d9bdfc2b986ea36ef1dd407f1","observation_id":"026fb023-bda6-4b1e-ac42-a59715b6ee75","resolution":{"observed_at":"2026-08-03T00:25:11.511379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:11.573463Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:11.573463Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:54a7cb3ffeeafcaf10033b3f37613c2b3f9ce5147d5375fc46b5fd2c26afbdb7","observation_id":"5f10858b-afdc-4f39-826b-8000a587bc5e","resolution":{"observed_at":"2026-08-03T00:25:11.573463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00933","last_updated":"2026-05-19T23:26:22Z","snapshot_observed_at":"2026-08-13T12:20:20.135004Z","submitted_at":"2026-01-31T23:19:39Z","title":"MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.00933","snapshot_observed_at":"2026-08-03T00:25:11.628178Z","title":"arXiv preprint arXiv:2602.00933 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:11.628178Z"},"links":{"cited_paper":"/paper/2602.00933","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:71d77d0aa238ecf8b0842170787a151143fbd586fd788ce6a601086c998d77ed","observation_id":"7607b68a-a104-4ad1-bd7e-992966c5e7e7","resolution":{"observed_at":"2026-08-03T00:25:11.628178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:11.691443Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:11.691443Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:32c8fbc9e953cc6e5ac3ef50c8546c4f88ff290f686dc538f6fa95257f29f4ec","observation_id":"c48fb71d-b660-42f7-8365-4e6712b4d434","resolution":{"observed_at":"2026-08-03T00:25:11.691443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:11.745726Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:11.745726Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:6ee366ee7fd9ce643af8da508f1a90f722575e4ea9ff1f4c02132f016e7c7c76","observation_id":"64a38d62-9455-469b-9665-19f37639bf15","resolution":{"observed_at":"2026-08-03T00:25:11.745726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:11.812511Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:11.812511Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:7aa1703d7f9fff8b943b25cc38482b66f0cebd280ce2e8d701982f9277bcf175","observation_id":"9dedb088-73a0-40b1-9023-a2e15ac6f2e4","resolution":{"observed_at":"2026-08-03T00:25:11.812511Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:11.865872Z","title":"IEEE transactions on dependable and secure computing , volume=","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:11.865872Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:aa0b97612887b744bca0a62933eeec8e1e2704dc0509c210607d64749ee93cb1","observation_id":"a7374785-39a1-4f7c-a6d3-620878e5a3bd","resolution":{"observed_at":"2026-08-03T00:25:11.865872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:11.923475Z","title":"Safety science , volume=","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:11.923475Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:6922bcb2873ce4dd2285e8c080b09b9ba1d018ca379403ff4cfaf63e84ff9495","observation_id":"04c8b16d-7ac4-4437-a4fc-01ec09520144","resolution":{"observed_at":"2026-08-03T00:25:11.923475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:12.005586Z","title":"Findings of the association for computational linguistics: ACL 2023 , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:12.005586Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:24c2e1ae39a08c1f0a03e283129023b0614c4740928a61f8b83cf725fb1e19be","observation_id":"50c8272a-29a8-4ed4-a342-9c55fcf83c39","resolution":{"observed_at":"2026-08-03T00:25:12.005586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:12.069409Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:12.069409Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:935e107523670242ea3343850546808ae09b6262d45a7557e65a9a0305489731","observation_id":"833648ed-b6bc-4ab1-9be7-f101ad998731","resolution":{"observed_at":"2026-08-03T00:25:12.069409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:12.133758Z","title":"Specification Gaming: The Flip Side of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:12.133758Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:94ae4d8c4cf17f2cc413bcbb1f70fdc3f0df8a2f1016f1158d9640a33238f4e9","observation_id":"2a20a50e-0684-4b1a-8790-568349711610","resolution":{"observed_at":"2026-08-03T00:25:12.133758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:12.188724Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:12.188724Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:6dfa88d47de8ffa181f05fe20a1d561486df9f1a1d5b8c223951d2a121894ce6","observation_id":"437137de-83b2-40a0-a193-91596d0bdc3f","resolution":{"observed_at":"2026-08-03T00:25:12.188724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-03T00:25:12.239605Z","title":"arXiv preprint arXiv:1606.06565 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:12.239605Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:305ba9a3f01ac049f0d24b81502d23bdd324bd4a9797816c4214764f1b1e33b5","observation_id":"227e315f-c33f-48ac-8d2a-06a01186d438","resolution":{"observed_at":"2026-08-03T00:25:12.239605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:12.332739Z","title":"Proceedings of the 16th ACM workshop on artificial intelligence and security , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:12.332739Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:a2a6bfd717cd752810a72f50a66fc0f1cb4a6b94fe97518f5e5e15ba58d1bb29","observation_id":"ee2512dd-2eca-4023-9653-a2430f4171ed","resolution":{"observed_at":"2026-08-03T00:25:12.332739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-03T00:25:12.383258Z","title":"arXiv preprint arXiv:2505.23836 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:12.383258Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:d08dc49a6747070876ce066a5ef5ef31b1f1fad3c473ee15e196626a50e662dc","observation_id":"61b0ff3f-f4ab-4b02-87d9-3ba13e643245","resolution":{"observed_at":"2026-08-03T00:25:12.383258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:12.449852Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:12.449852Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:1cc1b43fa80a5f4d62f2fcf99cbfdbf7125b91c6a193f1512b6643a26faee14a","observation_id":"0823d884-4ee9-4afa-bc58-4381897f2731","resolution":{"observed_at":"2026-08-03T00:25:12.449852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02709","last_updated":"2025-05-05T15:06:09Z","snapshot_observed_at":"2026-08-19T14:24:21.147113Z","submitted_at":"2025-05-05T15:06:09Z","title":"Technical Report: Evaluating Goal Drift in Language Model Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02709","snapshot_observed_at":"2026-08-03T00:25:12.501077Z","title":"arXiv preprint arXiv:2505.02709 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:12.501077Z"},"links":{"cited_paper":"/paper/2505.02709","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:ebc97a720dc22b24bddea611d943f57617840f480a5f31dfb65c95b7c700d0e0","observation_id":"1581f39e-4b68-4f94-8709-489212d83ec1","resolution":{"observed_at":"2026-08-03T00:25:12.501077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:12.558783Z","title":"Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:12.558783Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:258067ef461fffcd3b45b02becf332b954db2584f451f2985fb24d4fdd2a2067","observation_id":"426ca00d-59a7-4e55-8dd9-1800cfcba30b","resolution":{"observed_at":"2026-08-03T00:25:12.558783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-03T00:25:12.607849Z","title":"arXiv preprint arXiv:2311.07911 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:12.607849Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:6c911ed4924cf5d5b5f09743a09ded9fd6560e23d800535281138f9d881e6df3","observation_id":"cafa2c1a-cb0e-486e-b1e6-4c4ceaf0148d","resolution":{"observed_at":"2026-08-03T00:25:12.607849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:12.666269Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:12.666269Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:012169a573fae69701191fe8d3bdf5cd07e014c0e630c660b2e8e84b48972f29","observation_id":"92e454cc-1376-42b2-8d33-0cad14761d23","resolution":{"observed_at":"2026-08-03T00:25:12.666269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:12.722078Z","title":", author=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:12.722078Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:d42d21d929d41efce9a79ae7f628e2c9f9a72906c54edfcee137cccdb8d24084","observation_id":"13c7893d-4764-48db-8909-4f6859f955e2","resolution":{"observed_at":"2026-08-03T00:25:12.722078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:12.775260Z","title":"ACM Transactions on Information Systems , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:12.775260Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:ea7c891c961e01621629305115fb5f68d4aaced33910ecef72131d50b1628e24","observation_id":"66311a3a-d7ac-4582-97c9-75902abdaa51","resolution":{"observed_at":"2026-08-03T00:25:12.775260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03172","last_updated":"2023-11-20T23:09:34Z","snapshot_observed_at":"2026-07-06T15:51:12.179086Z","submitted_at":"2023-07-06T17:54:11Z","title":"Lost in the Middle: How Language Models Use Long Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03172","snapshot_observed_at":"2026-08-03T00:25:12.837385Z","title":"arXiv preprint arXiv:2307.03172 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:12.837385Z"},"links":{"cited_paper":"/paper/2307.03172","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:66d5cc3f2e616f6ccf273555f8b4ba81309642780d43d43342518775539cddd4","observation_id":"078ea4ef-8180-446f-9e09-17db24165c3f","resolution":{"observed_at":"2026-08-03T00:25:12.837385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:12.919304Z","title":"2025 , note =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:12.919304Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:de40ebcf9bed85b27c30098b4779cef48bbd6c45b1011919f844c7d85952a499","observation_id":"1fd3f083-c263-4e1d-acf5-f4da04c3c2e6","resolution":{"observed_at":"2026-08-03T00:25:12.919304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:12.967292Z","title":"2601.06663 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:12.967292Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:88dcfd1859c81ea87480f1f77b69aaf6b578a32f3343afb74353cde6396eb331","observation_id":"360b9ff9-f2a9-4add-9f0c-3edf3c47fe0b","resolution":{"observed_at":"2026-08-03T00:25:12.967292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.27154","last_updated":"2026-06-30T11:12:24Z","snapshot_observed_at":"2026-08-02T04:51:44.182127Z","submitted_at":"2026-06-25T15:24:23Z","title":"OpenRCA 2.0: From Outcome Labels to Causal Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.27154","snapshot_observed_at":"2026-08-03T00:25:13.023996Z","title":"arXiv preprint arXiv:2606.27154 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:13.023996Z"},"links":{"cited_paper":"/paper/2606.27154","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:84da30cdfbd866d0e865d6733eed5c11ea5bda55e9db36229519ac11ab9e91c3","observation_id":"ed4fa056-18d9-48ce-a94d-f46e13d0c548","resolution":{"observed_at":"2026-08-03T00:25:13.023996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:13.070465Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:13.070465Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:2541c5c898859f3e924504264eb6d4abc14e858d5d4eead5211024627992b864","observation_id":"aaa9381f-7cc3-4ac4-8e51-17bad5493826","resolution":{"observed_at":"2026-08-03T00:25:13.070465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:13.118689Z","title":"2024 , month = sep, howpublished =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:13.118689Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:5b83e20ee340fd5bf8874000265db235f601efc43d873f984059cb63636d6bba","observation_id":"3e692184-5dcb-46be-bf0b-0d3c34dce401","resolution":{"observed_at":"2026-08-03T00:25:13.118689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:13.161290Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:13.161290Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:17816ec2f81592eede6692db6da96231cbb3b33c3781a563ed1229b78df72b0a","observation_id":"1bfd4c7b-7d2a-480e-8f9c-3e764ecd9d7f","resolution":{"observed_at":"2026-08-03T00:25:13.161290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10934","last_updated":"2024-10-16T17:54:12Z","snapshot_observed_at":"2026-08-21T16:42:55.877421Z","submitted_at":"2024-10-14T17:57:02Z","title":"Agent-as-a-Judge: Evaluate Agents with Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10934","snapshot_observed_at":"2026-08-03T00:25:13.222043Z","title":"arXiv preprint arXiv:2410.10934 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:13.222043Z"},"links":{"cited_paper":"/paper/2410.10934","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:09bb69d15fa37e176a300ebcd733890bc9f62575155dc440fee70acbcf4daa86","observation_id":"7942ac2e-8ae0-43fd-93c4-d34c08fddabd","resolution":{"observed_at":"2026-08-03T00:25:13.222043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12474","last_updated":"2026-05-12T17:54:25Z","snapshot_observed_at":"2026-08-11T10:04:43.760904Z","submitted_at":"2026-05-12T17:54:25Z","title":"Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12474","snapshot_observed_at":"2026-08-03T00:25:13.271006Z","title":"arXiv preprint arXiv:2605.12474 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:13.271006Z"},"links":{"cited_paper":"/paper/2605.12474","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:92c8d8e554ac2e6418f22513089c93e49d29845ec2b38da12a862b820bde072d","observation_id":"b9dab9a2-c9fc-4d2d-9bdf-719ea111b1d0","resolution":{"observed_at":"2026-08-03T00:25:13.271006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:13.324799Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:13.324799Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:2cf167bc8b48073303136b1145a407f0bc2f452829561fbf85ae8cfe017da32e","observation_id":"aaab3e92-d5e3-4356-ab81-c5553e15d8d4","resolution":{"observed_at":"2026-08-03T00:25:13.324799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:13.357909Z","title":"ACM Transactions on Information Systems , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:13.357909Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:0211d4f9e27352804b1407ef9bc932d98e3bf07260d2fe56029e30f8050e5eb4","observation_id":"05ade1e2-c737-43f8-9e01-888498cbdbc5","resolution":{"observed_at":"2026-08-03T00:25:13.357909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:13.414530Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:13.414530Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:0eb287077f37eb8c8a86ee1625133ea954219d46cfdea4a78a4cfd9eadb6edc7","observation_id":"a8b74c96-eeb7-472b-842a-8162a8938844","resolution":{"observed_at":"2026-08-03T00:25:13.414530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:13.466551Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:13.466551Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:1d07c0dc94f7d79f8842c4e9e053fc278922ee2865e28ca544e1cce733c74fba","observation_id":"3ca2a723-a98d-4270-9c1e-7cc987203283","resolution":{"observed_at":"2026-08-03T00:25:13.466551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:25:13.509415Z","title":"Proceedings of the 2023 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:13.509415Z"},"links":{"citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:c079d510821eae7f0b9cc48054881bab4319eb8c5d6f21a402211c2bc6992eda","observation_id":"6f23e680-a41b-4601-86f8-a1da7e1a1d83","resolution":{"observed_at":"2026-08-03T00:25:13.509415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-17T20:31:29.818313Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-03T00:25:13.572986Z","title":"2406.12045 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:13.572986Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:8e46df8c785a648300963d387bf576d14bff00e034c9e5f94ec0f94533fb3474","observation_id":"01afa4a2-5eee-4d95-a4fc-f236688a6c2c","resolution":{"observed_at":"2026-08-03T00:25:13.572986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13547","last_updated":"2025-06-26T01:05:54Z","snapshot_observed_at":"2026-08-19T23:11:14.083941Z","submitted_at":"2024-11-20T18:56:22Z","title":"ToolScan: A Benchmark for Characterizing Errors in Tool-Use LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13547","snapshot_observed_at":"2026-08-03T00:25:13.650167Z","title":"arXiv preprint arXiv:2411.13547 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:13.650167Z"},"links":{"cited_paper":"/paper/2411.13547","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:13453881df5ebae64e9c88127ca65eefff46690fbe735567be96fd73895fd2f4","observation_id":"545d884c-f081-49bc-a001-115e5b181e17","resolution":{"observed_at":"2026-08-03T00:25:13.650167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.23525","last_updated":"2026-07-10T18:13:00Z","snapshot_observed_at":"2026-08-16T03:48:07.324739Z","submitted_at":"2026-06-22T16:08:34Z","title":"Self-Compacting Language Model Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.23525","snapshot_observed_at":"2026-08-03T00:25:13.720444Z","title":"arXiv preprint arXiv:2606.23525 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:13.720444Z"},"links":{"cited_paper":"/paper/2606.23525","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:d3f2bf34df75e8277c454096063d738d7ab0536cb6c5a48416095e366e03d88d","observation_id":"d9e14444-f69e-4fcb-bec5-4a9bf3c3ad2d","resolution":{"observed_at":"2026-08-03T00:25:13.720444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.24601","last_updated":"2026-05-11T15:26:31Z","snapshot_observed_at":"2026-08-14T08:15:35.097689Z","submitted_at":"2025-12-31T03:43:41Z","title":"Recursive Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.24601","snapshot_observed_at":"2026-08-03T00:25:13.817483Z","title":"arXiv preprint arXiv:2512.24601 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:13.817483Z"},"links":{"cited_paper":"/paper/2512.24601","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:68e62973e8a874dc7bd9685addcca9ec1bf9e17d16f8b548d247bd0752a2465f","observation_id":"ae43892f-e841-4b56-af4a-c46dc19a2b19","resolution":{"observed_at":"2026-08-03T00:25:13.817483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":3,"unresolved":89,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 0 inbound Pith citation observations for arXiv:2607.28802."}