{"as_of":"2026-08-06T03:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc673cb2dd9f08053236410a1016087f62d1ffa6b60c95d43801d1e155f3366e","coverage":[{"denominator":2,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T10:51:01.483339Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T23:26:36.859251Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.27922","last_updated":"2026-05-27T03:47:35Z","snapshot_observed_at":"2026-08-05T01:33:47.362496Z","submitted_at":"2026-05-27T03:47:35Z","title":"Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows","version":1},"cited_work":{"arxiv_id":"2605.27922","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.27922","snapshot_observed_at":"2026-07-09T23:26:36.859251Z","title":"Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows","venue":"cs.AI","work_id":"20fe2270-cc99-4019-8456-7de7d0a81c8a","year":2026},"citing_paper":{"arxiv_id":"2606.03889","last_updated":"2026-06-05T09:38:21Z","snapshot_observed_at":"2026-08-02T13:33:31.496138Z","submitted_at":"2026-06-02T16:51:24Z","title":"RealClawBench: Live OpenClaw Benchmarks from Real Developer-Agent Sessions","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T09:56:36.860369Z"},"links":{"cited_paper":"/paper/2605.27922","citing_paper":"/paper/2606.03889"},"observation_digest":"sha256:83ff33e3de4285c973ff5f629489f72a07bc1128f8bf58736bd7df6211d168a3","observation_id":"a0b0d40a-e0c0-4065-9be1-386ae646d9a6","resolution":{"observed_at":"2026-07-02T03:36:29.209900Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27922","last_updated":"2026-05-27T03:47:35Z","snapshot_observed_at":"2026-08-05T01:33:47.362496Z","submitted_at":"2026-05-27T03:47:35Z","title":"Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27922","snapshot_observed_at":"2026-07-12T06:28:52.906906Z","title":"arXiv preprint arXiv:2605.27922 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02873","last_updated":"2026-07-03T02:20:04Z","snapshot_observed_at":"2026-08-04T04:44:59.376006Z","submitted_at":"2026-07-03T02:20:04Z","title":"Determinants and Limits of LLM Security-Tool Orchestration: A Study with HexStrike-AI","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T06:28:52.906906Z"},"links":{"cited_paper":"/paper/2605.27922","citing_paper":"/paper/2607.02873"},"observation_digest":"sha256:493db482d70324cd2c174f70ab5f628426faa0172ea245468621919ab17c26d6","observation_id":"fad251e8-db19-4c39-b790-b905800a307f","resolution":{"observed_at":"2026-07-12T06:28:52.906906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27922","last_updated":"2026-05-27T03:47:35Z","snapshot_observed_at":"2026-08-05T01:33:47.362496Z","submitted_at":"2026-05-27T03:47:35Z","title":"Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows","version":1},"cited_work":{"arxiv_id":"2605.27922","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.27922","snapshot_observed_at":"2026-07-09T23:26:36.859251Z","title":"Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows","venue":"cs.AI","work_id":"20fe2270-cc99-4019-8456-7de7d0a81c8a","year":2026},"citing_paper":{"arxiv_id":"2607.06906","last_updated":"2026-07-08T01:58:12Z","snapshot_observed_at":"2026-07-11T23:18:42.885129Z","submitted_at":"2026-07-08T01:58:12Z","title":"The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AI","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-09T23:24:07.130101Z"},"links":{"cited_paper":"/paper/2605.27922","citing_paper":"/paper/2607.06906"},"observation_digest":"sha256:ebf23d110861203e7b22063d24677684f0e2fb55d821d5e42950aecf0959eb0a","observation_id":"920c8117-e741-4813-8d5e-253d5b6cb730","resolution":{"observed_at":"2026-07-09T23:26:36.861144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27922","last_updated":"2026-05-27T03:47:35Z","snapshot_observed_at":"2026-08-05T01:33:47.362496Z","submitted_at":"2026-05-27T03:47:35Z","title":"Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27922","snapshot_observed_at":"2026-07-13T05:28:45.311405Z","title":"Harness-bench: Measuring harness effects across models in realistic agent workflows.arXiv preprint arXiv:2605.27922, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-07-16T23:18:48.719406Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T05:28:45.311405Z"},"links":{"cited_paper":"/paper/2605.27922","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:c4f6a822d1ebc297d494641732561e6f2bdb81fdf1b55ec9a1ccaa5d45ab43ac","observation_id":"36e6465c-0460-4ded-b775-0bc2ff6f29b0","resolution":{"observed_at":"2026-07-13T05:28:45.311405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27922","last_updated":"2026-05-27T03:47:35Z","snapshot_observed_at":"2026-08-05T01:33:47.362496Z","submitted_at":"2026-05-27T03:47:35Z","title":"Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27922","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Harness-bench: Measuring harness effects across models in realistic agent workflows.arXiv preprint arXiv:2605.27922, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-07-16T23:18:48.719406Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2605.27922","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:c3018a335ec247bb4e1c95a35b54b60b62a9fdc992fbc9981ad0392ecc2d38fa","observation_id":"1e3afeb1-d4eb-4dbd-85be-d2e879f716e7","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27922","last_updated":"2026-05-27T03:47:35Z","snapshot_observed_at":"2026-08-05T01:33:47.362496Z","submitted_at":"2026-05-27T03:47:35Z","title":"Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27922","snapshot_observed_at":"2026-07-14T13:32:31.523845Z","title":"Harness-Bench: Measuring harness effects across models in realistic agent workflows, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10202","last_updated":"2026-07-11T08:26:48Z","snapshot_observed_at":"2026-08-02T02:39:29.960840Z","submitted_at":"2026-07-11T08:26:48Z","title":"Two Confounds in Cross-Model Value Comparison: Response Determinism and the Access Harness","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T13:32:31.523845Z"},"links":{"cited_paper":"/paper/2605.27922","citing_paper":"/paper/2607.10202"},"observation_digest":"sha256:4d0c89c35d60348c70dc42f31dc921148e7511bdabcf70fd3e65c8e61be588c6","observation_id":"96eb98cb-443f-4d8b-826b-3e1da8ddcb0d","resolution":{"observed_at":"2026-07-14T13:32:31.523845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27922","last_updated":"2026-05-27T03:47:35Z","snapshot_observed_at":"2026-08-05T01:33:47.362496Z","submitted_at":"2026-05-27T03:47:35Z","title":"Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27922","snapshot_observed_at":"2026-08-01T10:51:01.483339Z","title":"Harness-bench: Measuring harness effects across models in realistic agent workflows.arXiv preprint arXiv:2605.27922,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20090","last_updated":"2026-07-22T12:45:04Z","snapshot_observed_at":"2026-08-02T19:07:03.687285Z","submitted_at":"2026-07-22T12:45:04Z","title":"Reinforcement Learning for Large Language Model Selective Evidence Adoption from Contaminated Retrieval Results","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-01T10:51:01.483339Z"},"links":{"cited_paper":"/paper/2605.27922","citing_paper":"/paper/2607.20090"},"observation_digest":"sha256:64d04e7bd498247189b41ffb5cd1aad33b437a8b807f3795735ffb93385b66f4","observation_id":"09084219-0f7d-47c0-9043-ba7a73ebd912","resolution":{"observed_at":"2026-08-01T10:51:01.483339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.27922/citation-record","integrity":"/paper/2605.27922/integrity","json":"/paper/2605.27922/citation-record.json","paper":"/paper/2605.27922"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11977","doi":"10.48550/arxiv.2510.11977","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic agent leaderboard: The missing infrastructure for ai agent evaluation","venue":"ArXiv.org","work_id":"dec804c2-eb85-4ee1-bae1-dfb23b87886d","year":2025},"citing_paper":{"arxiv_id":"2605.27922","last_updated":"2026-05-27T03:47:35Z","snapshot_observed_at":"2026-08-05T01:33:47.362496Z","submitted_at":"2026-05-27T03:47:35Z","title":"Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T12:52:19.145898Z"},"links":{"citing_paper":"/paper/2605.27922"},"observation_digest":"sha256:dec610d91683380864a513c58c0a0da3670b864f39a66d7e2c52ce0be2d07b5c","observation_id":"7c08f4d8-66a1-4162-878d-5249dfb3fea6","resolution":{"observed_at":"2026-06-29T12:53:26.437062Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T18:52:16.448662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T18:52:16.448662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06132","last_updated":"2026-05-07T14:06:23Z","snapshot_observed_at":"2026-07-06T22:54:40.349479Z","submitted_at":"2026-04-07T17:43:18Z","title":"Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents","version":3},"cited_work":{"arxiv_id":"2604.06132","doi":"10.48550/arxiv.2604.06132","metadata_source":"pith","pith_arxiv_id":"2604.06132","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents","venue":"cs.AI","work_id":"57acc3ec-f4c3-49ab-bd0f-5aab91002df9","year":2026},"citing_paper":{"arxiv_id":"2605.27922","last_updated":"2026-05-27T03:47:35Z","snapshot_observed_at":"2026-08-05T01:33:47.362496Z","submitted_at":"2026-05-27T03:47:35Z","title":"Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2604.06132","citing_paper":"/paper/2605.27922"},"observation_digest":"sha256:79deb62a2dfdb9d846936a0fe3abbae59851db8f8cd8e9afc311bd146c60baa5","observation_id":"0a41e618-6075-49b8-9be6-e83fe4f8838d","resolution":{"observed_at":"2026-06-29T12:53:26.226692Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.27922","last_updated":"2026-05-27T03:47:35Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-05T01:33:47.362496Z","submitted_at":"2026-05-27T03:47:35Z","title":"Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows"},"reference_resolution":{"displayed":2,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":2},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 2 of 2 outbound references and 7 inbound Pith citation observations for arXiv:2605.27922."}