{"as_of":"2026-08-17T19:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:11ea7a9d6d7766928e485a3feea123959798befc25a81609bfc3630434689e46","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T00:13:38.850570Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.26314/citation-record","integrity":"/paper/2607.26314/integrity","json":"/paper/2607.26314/citation-record.json","paper":"/paper/2607.26314"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-01T00:13:36.762325Z","title":"ReAct: Synergizing reasoning and acting in language models.arXiv preprint arXiv:2210.03629, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:36.762325Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:5c206a3033e7383edac4291a8b943c3a5973c1d48c0a42ee33ad1a1e6b71f692","observation_id":"0e80cefe-c5ec-46ef-9ce3-e925f7742d4a","resolution":{"observed_at":"2026-08-01T00:13:36.762325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04761","last_updated":"2023-02-09T16:49:57Z","snapshot_observed_at":"2026-07-06T14:50:07.491434Z","submitted_at":"2023-02-09T16:49:57Z","title":"Toolformer: Language Models Can Teach Themselves to Use Tools","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04761","snapshot_observed_at":"2026-08-01T00:13:36.832447Z","title":"Toolformer: Lan- guage models can teach themselves to use tools.arXiv preprint arXiv:2302.04761, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:36.832447Z"},"links":{"cited_paper":"/paper/2302.04761","citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:20625a957f3cd8b081149f8336477c9db2f7915e0a888a958c3d6bd737adc31a","observation_id":"2440576b-c5ce-4ad2-a8c2-a45c00c72c7f","resolution":{"observed_at":"2026-08-01T00:13:36.832447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01778","last_updated":"2024-12-02T18:28:18Z","snapshot_observed_at":"2026-08-14T18:01:24.453040Z","submitted_at":"2024-12-02T18:28:18Z","title":"HackSynth: LLM Agent and Evaluation Framework for Autonomous Penetration Testing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01778","snapshot_observed_at":"2026-08-01T00:13:36.891218Z","title":"HackSynth: LLM agent and evaluation framework for autonomous penetration testing.arXiv preprint arXiv:2412.01778, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:36.891218Z"},"links":{"cited_paper":"/paper/2412.01778","citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:f6bcb838919a01ba741a1248c9208baca2010089f1339f0a3676887b8723c884","observation_id":"9198dcf8-bd12-4b6a-a7ec-0677a79acbe1","resolution":{"observed_at":"2026-08-01T00:13:36.891218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18528","last_updated":"2025-02-24T21:16:31Z","snapshot_observed_at":"2026-08-16T12:55:34.553582Z","submitted_at":"2025-02-24T21:16:31Z","title":"ARACNE: An LLM-Based Autonomous Shell Pentesting Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18528","snapshot_observed_at":"2026-08-01T00:13:36.977658Z","title":"ARACNE: An LLM-based autonomous shell pentesting agent.arXiv preprint arXiv:2502.18528, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:36.977658Z"},"links":{"cited_paper":"/paper/2502.18528","citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:6279b448fc38bb0f35ec384309e367534b449621fe87de22919009b0f468eaae","observation_id":"e11cae00-7518-4d02-8a11-e96b8912a597","resolution":{"observed_at":"2026-08-01T00:13:36.977658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:37.065267Z","title":"ARTEMIS: Automated red teaming engine with multi-agent intelligent supervision.https://github.com/Stanford-Trinity/ARTEMIS, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:37.065267Z"},"links":{"citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:000e3fc04346679438831a32cb14325c524c1ab92799963be09cd639d5e2acd1","observation_id":"08feda12-dbee-4387-a49f-dfe6fbafe964","resolution":{"observed_at":"2026-08-01T00:13:37.065267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-16T13:26:12.007650Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-01T00:13:37.291705Z","title":"Zhang, Neil Perry, Riya Dulepet, Joey Ji, Celeste Menders, Justin W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:37.291705Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:f1f6f6c5bae86cfe9ab93e42079eb36e3da038a5037dec7763f576ab950f5453","observation_id":"8c75942d-277b-4329-a925-2a8d7343f2de","resolution":{"observed_at":"2026-08-01T00:13:37.291705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.14153","last_updated":"2026-05-13T22:08:05Z","snapshot_observed_at":"2026-08-16T08:24:32.940937Z","submitted_at":"2026-05-13T22:08:05Z","title":"ExploitBench: A Capability Ladder Benchmark for LLM Cybersecurity Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.14153","snapshot_observed_at":"2026-08-01T00:13:37.364940Z","title":"ExploitBench: A capability ladder benchmark for LLMcybersecurityagents.arXiv preprint arXiv:2605.14153, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:37.364940Z"},"links":{"cited_paper":"/paper/2605.14153","citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:b6390561b90e2a79762e4637767d49c07bcace9c9a2304533c46d7814dc52b14","observation_id":"05388b2e-8105-4398-86e9-51c3a55adb32","resolution":{"observed_at":"2026-08-01T00:13:37.364940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-16T14:35:39.430980Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-01T00:13:37.456860Z","title":"AI control: Im- proving safety despite intentional subversion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:37.456860Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:f5baee2e55bafb1dd1338a784f1e8b082bc6113830688eb989135768392e86d3","observation_id":"777c2d43-5634-4cbb-84bf-9866060db016","resolution":{"observed_at":"2026-08-01T00:13:37.456860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:37.532216Z","title":"The first confirmed instance of an LLM going rogue for real.https://www.lesswrong.com/posts/XRADGH4BpRKaoyqcs/ the-first-confirmed-instance-of-an-llm-going-rogue-for, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:37.532216Z"},"links":{"citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:457d14eac63976d54c31ed941d2127a5d5c31439de9ff3f84c501e5d2c084c3e","observation_id":"da79857c-91b2-4f6b-8768-3c0551638f7f","resolution":{"observed_at":"2026-08-01T00:13:37.532216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:37.604754Z","title":"Security incident disclosure — July 2026.https: //huggingface.co/blog/security-incident-july-2026, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:37.604754Z"},"links":{"citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:0d0920011480f54bce1eed67a7b0945ca9347e9b2022c20e2901945e71a0af25","observation_id":"2a698fc1-2c92-4c01-b15c-85e23f7d030e","resolution":{"observed_at":"2026-08-01T00:13:37.604754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:37.662490Z","title":"Hugging Face model evaluation security incident.https://openai.com/index/ hugging-face-model-evaluation-security-incident/, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:37.662490Z"},"links":{"citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:0de9ce437a3827d6a3a1e30419c64310c1aad012f476838cee17db98bcb1f754","observation_id":"05b8e5f5-8469-4d68-80f0-55952a6b0647","resolution":{"observed_at":"2026-08-01T00:13:37.662490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-01T00:13:37.719006Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:37.719006Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:78fb35b00bd299a735f8354201e7b0fe4e4a5086e9fe4cd9a7c45e83e5a79df6","observation_id":"0f980912-ee82-4f2e-97ba-596d77b2fe0c","resolution":{"observed_at":"2026-08-01T00:13:37.719006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.07774","last_updated":"2026-07-30T19:01:17Z","snapshot_observed_at":"2026-08-08T02:44:21.809151Z","submitted_at":"2026-07-08T16:46:06Z","title":"ScopeJudge: Cost-Aware Pre-Execution Gating for Offensive Security Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.07774","snapshot_observed_at":"2026-08-01T00:13:37.772309Z","title":"ScopeJudge: Cost-aware pre-execution gating for offensive-security agents","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:37.772309Z"},"links":{"cited_paper":"/paper/2607.07774","citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:4323208abce78a02a88c37f7dc82ec03a9472e112793309685b164bca935fba0","observation_id":"4fd87db3-b8be-480c-b0fc-8eee94595811","resolution":{"observed_at":"2026-08-01T00:13:37.772309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:37.844121Z","title":"Acoefficientofagreementfornominalscales.Educational and Psychological Measurement, 20(1):37–46, 1960","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:37.844121Z"},"links":{"citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:45dc60c6995d204d672133cbe4349ad5b2d670987a88dc616e8dca4b486a25f9","observation_id":"3924c511-0f88-4f10-9253-33db62c09527","resolution":{"observed_at":"2026-08-01T00:13:37.844121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:37.921821Z","title":null,"venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:37.921821Z"},"links":{"citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:5653425a164f12934ec7d103fc50db6b638db4d2e391ab5d2710957023aa7bd0","observation_id":"42314e25-6e06-468e-b2d9-1cae28b46b99","resolution":{"observed_at":"2026-08-01T00:13:37.921821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:37.986366Z","title":"Richard Landis and Gary G","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:37.986366Z"},"links":{"citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:d681331cedfc640c359aea274e8095b28088f041e44190ed62c39b389607fa67","observation_id":"45dd4561-280a-4deb-9da0-5abef8acc08c","resolution":{"observed_at":"2026-08-01T00:13:37.986366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.03540","last_updated":"2022-11-11T20:17:18Z","snapshot_observed_at":"2026-07-06T14:15:17.474527Z","submitted_at":"2022-11-04T17:03:49Z","title":"Measuring Progress on Scalable Oversight for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.03540","snapshot_observed_at":"2026-08-01T00:13:38.052542Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:38.052542Z"},"links":{"cited_paper":"/paper/2211.03540","citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:0197f0879f6452d7a24bfdabd7f9f87b771f395312d9cc9d841ab7073c47fbb0","observation_id":"9267c136-32a2-45fd-bbcc-21459b50cce3","resolution":{"observed_at":"2026-08-01T00:13:38.052542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23643","last_updated":"2025-09-03T12:30:47Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T16:50:41Z","title":"Securing AI Agents with Information-Flow Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23643","snapshot_observed_at":"2026-08-01T00:13:38.246732Z","title":"SecuringAIagents with information-flow control.arXiv preprint arXiv:2505.23643, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:38.246732Z"},"links":{"cited_paper":"/paper/2505.23643","citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:6fd279320127f5c785b8dae243238a56b01d119b5c16731316d0a9433a7f84de","observation_id":"e4affbfa-247f-4f03-a1b2-6b27d9230b78","resolution":{"observed_at":"2026-08-01T00:13:38.246732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.23374","last_updated":"2026-04-25T16:39:16Z","snapshot_observed_at":"2026-08-15T03:12:46.423691Z","submitted_at":"2026-04-25T16:39:16Z","title":"Ghost in the Agent: Redefining Information Flow Tracking for LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.23374","snapshot_observed_at":"2026-08-01T00:13:38.185153Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:38.185153Z"},"links":{"cited_paper":"/paper/2604.23374","citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:9a9fb9ec0e940048ba82542a901168f738fae9c45a1416c6b19b3e8c75865c4b","observation_id":"86876a7f-f4df-452d-ae8a-2cf2f825eee1","resolution":{"observed_at":"2026-08-01T00:13:38.185153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.22868","last_updated":"2026-05-08T19:13:57Z","snapshot_observed_at":"2026-08-12T23:14:46.333754Z","submitted_at":"2026-03-24T07:12:53Z","title":"Agent-Sentry: Bounding LLM Agents via Execution Provenance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.22868","snapshot_observed_at":"2026-08-01T00:13:38.358900Z","title":"Agent-Sentry: Bounding LLM agents via execution provenance.arXiv preprint arXiv:2603.22868, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:38.358900Z"},"links":{"cited_paper":"/paper/2603.22868","citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:96012757415fe5e2593174fd80b6d5a32738a739ca656dfbacb621d70e2d7853","observation_id":"d9493587-95d8-4caf-86f3-d8e75d47c0ca","resolution":{"observed_at":"2026-08-01T00:13:38.358900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.28345","last_updated":"2026-07-06T13:50:25Z","snapshot_observed_at":"2026-08-15T08:46:51.836299Z","submitted_at":"2026-03-30T12:14:24Z","title":"Reachability Across the NL/PL Boundary: A Taxonomy-Driven Dataflow Model for LLM-Integrated Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.28345","snapshot_observed_at":"2026-08-01T00:13:38.298962Z","title":"Reachability across the NL/PL boundary: A taxonomy-driven dataflow model for LLM-integrated applications.arXiv preprint arXiv:2603.28345, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:38.298962Z"},"links":{"cited_paper":"/paper/2603.28345","citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:bb2d7b11feeded5e3c129e2a5c41f557ec73211f762c14bcac79e708c24d2b86","observation_id":"29b83292-3333-4b34-a7b5-d45186900daf","resolution":{"observed_at":"2026-08-01T00:13:38.298962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03070","last_updated":"2026-06-19T04:47:04Z","snapshot_observed_at":"2026-08-17T11:54:26.188121Z","submitted_at":"2026-04-03T14:50:16Z","title":"How Your Credentials Are Leaked by LLM Agent Skills: An Empirical Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03070","snapshot_observed_at":"2026-08-01T00:13:38.473059Z","title":"How your credentials are leaked by LLM agent skills: An empirical study.arXiv preprint arXiv:2604.03070, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:38.473059Z"},"links":{"cited_paper":"/paper/2604.03070","citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:14af08607f780914e0b3b992d6a15cfe15c134ae4f8d93425dbfc2d46f1a8f84","observation_id":"9d5238f3-7892-4ff2-8de0-9bdc6fe62b34","resolution":{"observed_at":"2026-08-01T00:13:38.473059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:38.423705Z","title":"AgentLeak: A bench- mark for internal-channel privacy leakage in multi-agent LLM systems.arXiv preprint arXiv:2602.11510, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:38.423705Z"},"links":{"citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:f9b16e3daab9f5e7e2fedf1b4f5566a76a81e5b838a78e6d5aeda4d044216b47","observation_id":"641b64b0-470f-40e0-92a6-ca1272a37e96","resolution":{"observed_at":"2026-08-01T00:13:38.423705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:38.605015Z","title":"R-Judge: Benchmarking safety risk awareness for LLM agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:38.605015Z"},"links":{"citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:50434dbb7fb49759c8061ba13ff396b342e2c7ffaeacd4d9a37d79cd79416520","observation_id":"a2fa30d1-67cd-48f7-aa8e-2640c8efc208","resolution":{"observed_at":"2026-08-01T00:13:38.605015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:38.543533Z","title":"AgentRaft: Automated detection of data over-exposure in LLM agents.arXiv preprint arXiv:2603.07557, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:38.543533Z"},"links":{"citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:8d6c76933b1fb0affe88cf781e1f161f6c68fddfadbf42ee3471b937bc6159e6","observation_id":"0e5d497d-fcc8-4626-9813-2f09af110ba5","resolution":{"observed_at":"2026-08-01T00:13:38.543533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:38.723773Z","title":"ToolSafe: Enhancing tool invocation safety of LLM-based agents via proactive step-level guardrail and feedback.arXiv preprint arXiv:2601.10156, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:38.723773Z"},"links":{"citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:7a691bbfe7d5134a7a68242d96a0fa56278cc6c499771eea0d2114085fefd22d","observation_id":"df107a2f-a6d3-475a-b07c-c8e00779e2f2","resolution":{"observed_at":"2026-08-01T00:13:38.723773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14940","last_updated":"2026-06-28T22:17:10Z","snapshot_observed_at":"2026-08-14T04:57:44.030623Z","submitted_at":"2025-01-24T21:55:14Z","title":"CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14940","snapshot_observed_at":"2026-08-01T00:13:38.664431Z","title":"Woodland, and Jose Such","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:38.664431Z"},"links":{"cited_paper":"/paper/2501.14940","citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:127532cdc9087239db8df816a6cf33d9ca4f70b2e9e740b9fb12b237fd87c7cb","observation_id":"9abeb8cc-1606-46b7-a7bc-4ac28bb28e2e","resolution":{"observed_at":"2026-08-01T00:13:38.664431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:38.850570Z","title":"The state of secrets sprawl 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:38.850570Z"},"links":{"citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:4421158a2ba0d76595008038316f883526e47246485bbff8d2bba5b3989c0125","observation_id":"6fed7f13-aa82-4871-8cc2-b238786c407e","resolution":{"observed_at":"2026-08-01T00:13:38.850570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02921","last_updated":"2025-08-04T21:52:50Z","snapshot_observed_at":"2026-08-06T04:50:15.348549Z","submitted_at":"2025-08-04T21:52:50Z","title":"PentestJudge: Judging Agent Behavior Against Operational Requirements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02921","snapshot_observed_at":"2026-08-01T00:13:38.793264Z","title":"PentestJudge: Judging agent behavior against operational requirements.arXiv preprint arXiv:2508.02921, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:38.793264Z"},"links":{"cited_paper":"/paper/2508.02921","citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:ee225c16ef5b183d2ef73e0320bbc9f1b1b010c70aa900483672d0d7996d6370","observation_id":"ddbcb8ed-12d3-4099-8824-aec0b2e6093d","resolution":{"observed_at":"2026-08-01T00:13:38.793264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:37.205624Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:37.205624Z"},"links":{"citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:f42f68a17b84a37ac43ae5f6ef894c5ac4630b8b2c52bbf46cfd52c36b91ea22","observation_id":"2fde0c26-8131-4a68-aff5-cb8490ca0615","resolution":{"observed_at":"2026-08-01T00:13:37.205624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-13T03:58:36.368745Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2607.26314."}