{"as_of":"2026-08-19T18:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:55f4c6a6c532c31910b901f3275f5619cb8d34b6413ddb898356aeeb4ff6f6a1","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:31:15.767819Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06596/citation-record","integrity":"/paper/2607.06596/integrity","json":"/paper/2607.06596/citation-record.json","paper":"/paper/2607.06596"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:31:14.348277Z","title":"How does information access affect LLM monitors’ ability to detect sabotage? arXiv preprint arXiv:2601.21112,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06596","last_updated":"2026-07-20T21:34:34Z","snapshot_observed_at":"2026-08-18T20:55:28.554828Z","submitted_at":"2026-07-06T22:40:07Z","title":"Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T08:31:14.348277Z"},"links":{"citing_paper":"/paper/2607.06596"},"observation_digest":"sha256:16427015f52e772aa79b3501aee1553d28445957075fd8083a389e9991fa9bfa","observation_id":"dab11cf8-d596-4453-bad4-fefe8c47a1d7","resolution":{"observed_at":"2026-08-02T08:31:14.348277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-19T14:55:04.920923Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-02T08:31:14.785797Z","title":"AI control: Improving safety despite intentional subversion.arXiv preprint arXiv:2312.06942,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06596","last_updated":"2026-07-20T21:34:34Z","snapshot_observed_at":"2026-08-18T20:55:28.554828Z","submitted_at":"2026-07-06T22:40:07Z","title":"Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T08:31:14.785797Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2607.06596"},"observation_digest":"sha256:c5f498eca75ae95affd8d2468ee3c01bbf3d3322281970b91bf33a7d58c6c861","observation_id":"763b59fa-e211-41c2-96fb-65078c47324f","resolution":{"observed_at":"2026-08-02T08:31:14.785797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15377","last_updated":"2026-05-18T07:58:13Z","snapshot_observed_at":"2026-08-15T23:22:36.347748Z","submitted_at":"2026-05-14T20:06:52Z","title":"Ensemble Monitoring for AI Control: Diverse Signals Outweigh More Compute","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15377","snapshot_observed_at":"2026-08-02T08:31:15.211738Z","title":"Ensemble monitoring for AI control: Diverse signals outweigh more compute.arXiv preprint arXiv:2605.15377,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06596","last_updated":"2026-07-20T21:34:34Z","snapshot_observed_at":"2026-08-18T20:55:28.554828Z","submitted_at":"2026-07-06T22:40:07Z","title":"Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T08:31:15.211738Z"},"links":{"cited_paper":"/paper/2605.15377","citing_paper":"/paper/2607.06596"},"observation_digest":"sha256:9373767870a2e4c9f8cd706826b336fea8c2b921714fdcd62c36202913f337a7","observation_id":"e6158048-51e9-458e-be9c-969d67e3c4cc","resolution":{"observed_at":"2026-08-02T08:31:15.211738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:31:15.299709Z","title":"Evaluating control protocols for untrusted AI agents.arXiv preprint arXiv:2511.02997, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06596","last_updated":"2026-07-20T21:34:34Z","snapshot_observed_at":"2026-08-18T20:55:28.554828Z","submitted_at":"2026-07-06T22:40:07Z","title":"Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T08:31:15.299709Z"},"links":{"citing_paper":"/paper/2607.06596"},"observation_digest":"sha256:18d4734c50130d2a43af7ea7266556e25566fcdf580194338ba3169cc2ddb537","observation_id":"493ef4d2-8e05-4cc4-b936-8ec10d0b5609","resolution":{"observed_at":"2026-08-02T08:31:15.299709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12366","last_updated":"2026-05-12T16:34:03Z","snapshot_observed_at":"2026-08-11T08:27:46.519098Z","submitted_at":"2026-05-12T16:34:03Z","title":"Classifier Context Rot: Monitor Performance Degrades with Context Length","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12366","snapshot_observed_at":"2026-08-02T08:31:15.401329Z","title":"Classifier context rot: Monitor performance degrades with context length.arXiv preprint arXiv:2605.12366,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06596","last_updated":"2026-07-20T21:34:34Z","snapshot_observed_at":"2026-08-18T20:55:28.554828Z","submitted_at":"2026-07-06T22:40:07Z","title":"Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T08:31:15.401329Z"},"links":{"cited_paper":"/paper/2605.12366","citing_paper":"/paper/2607.06596"},"observation_digest":"sha256:2e2f324b76451b55e19a8f4bdb46facf83f333faaf6dcaa534a09d3699477644","observation_id":"f3de465b-cb9a-4b43-b6c6-ca1f8450edbb","resolution":{"observed_at":"2026-08-02T08:31:15.401329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:31:15.526563Z","title":"Cross-LLM generalization of behavioral backdoor detection in AI agent supply chains.arXiv preprint arXiv:2511.19874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06596","last_updated":"2026-07-20T21:34:34Z","snapshot_observed_at":"2026-08-18T20:55:28.554828Z","submitted_at":"2026-07-06T22:40:07Z","title":"Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T08:31:15.526563Z"},"links":{"citing_paper":"/paper/2607.06596"},"observation_digest":"sha256:4661d921905606d35cbc7b075bb524ff5dd7207fd33dcf1df5db827eb9769b8c","observation_id":"e903108f-7f4c-4262-ad39-ed7992f1a206","resolution":{"observed_at":"2026-08-02T08:31:15.526563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11063","last_updated":"2026-06-09T16:24:16Z","snapshot_observed_at":"2026-08-09T22:11:04.022394Z","submitted_at":"2026-06-09T16:24:16Z","title":"CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11063","snapshot_observed_at":"2026-08-02T08:31:15.644918Z","title":"Zimmermann","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06596","last_updated":"2026-07-20T21:34:34Z","snapshot_observed_at":"2026-08-18T20:55:28.554828Z","submitted_at":"2026-07-06T22:40:07Z","title":"Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T08:31:15.644918Z"},"links":{"cited_paper":"/paper/2606.11063","citing_paper":"/paper/2607.06596"},"observation_digest":"sha256:806299eb69a53acef1d7b23a27ba45dd5d0458552c485ce03fbc51a672ae8b57","observation_id":"b79f81db-5631-46ee-a289-75cb7097b01b","resolution":{"observed_at":"2026-08-02T08:31:15.644918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15877","last_updated":"2025-04-01T08:36:44Z","snapshot_observed_at":"2026-08-14T15:45:30.011625Z","submitted_at":"2024-06-22T15:52:04Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15877","snapshot_observed_at":"2026-08-02T08:31:15.767819Z","title":"BigCodeBench: Benchmarking code generation with diverse function calls and complex instructions.arXiv preprint arXiv:2406.15877,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06596","last_updated":"2026-07-20T21:34:34Z","snapshot_observed_at":"2026-08-18T20:55:28.554828Z","submitted_at":"2026-07-06T22:40:07Z","title":"Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T08:31:15.767819Z"},"links":{"cited_paper":"/paper/2406.15877","citing_paper":"/paper/2607.06596"},"observation_digest":"sha256:deab0176a6e4964bfa4ce518487047a6efe532f9d3987283aa6fa74dfbb68df7","observation_id":"07958441-11b1-4dda-b756-f7551ed8a738","resolution":{"observed_at":"2026-08-02T08:31:15.767819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19461","last_updated":"2025-08-26T22:29:31Z","snapshot_observed_at":"2026-08-13T22:40:03.202069Z","submitted_at":"2025-08-26T22:29:31Z","title":"Reliable Weak-to-Strong Monitoring of LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19461","snapshot_observed_at":"2026-08-02T08:31:15.118808Z","title":"Knight, and Zifan Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06596","last_updated":"2026-07-20T21:34:34Z","snapshot_observed_at":"2026-08-18T20:55:28.554828Z","submitted_at":"2026-07-06T22:40:07Z","title":"Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T08:31:15.118808Z"},"links":{"cited_paper":"/paper/2508.19461","citing_paper":"/paper/2607.06596"},"observation_digest":"sha256:b1b887a6d63b51e8331c86c77112dbfaad8f90283b10a4086fa61db619bacb2f","observation_id":"2ad8171b-e032-4109-ba0b-9ea2832d515e","resolution":{"observed_at":"2026-08-02T08:31:15.118808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-14T15:19:05.440904Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-02T08:31:15.011559Z","title":"Measuring coding challenge compe- tence with APPS.arXiv preprint arXiv:2105.09938,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06596","last_updated":"2026-07-20T21:34:34Z","snapshot_observed_at":"2026-08-18T20:55:28.554828Z","submitted_at":"2026-07-06T22:40:07Z","title":"Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T08:31:15.011559Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2607.06596"},"observation_digest":"sha256:ea2c68e52850d01d0de3235ea8aed23cc84787ce0edc80f3acbbb4c9583655c2","observation_id":"2074ba1d-b047-45d7-ae8c-8e3958682640","resolution":{"observed_at":"2026-08-02T08:31:15.011559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:31:14.654003Z","title":"Async control: Stress-testing asynchronous control measures for LLM agents.arXiv preprint arXiv:2512.13526,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06596","last_updated":"2026-07-20T21:34:34Z","snapshot_observed_at":"2026-08-18T20:55:28.554828Z","submitted_at":"2026-07-06T22:40:07Z","title":"Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T08:31:14.654003Z"},"links":{"citing_paper":"/paper/2607.06596"},"observation_digest":"sha256:03fbf6de868dc12f4d2281488825c85ccb410c8801a5119a62e3726152e5ebd1","observation_id":"65966e82-746a-4fc6-b627-184bdc0517f5","resolution":{"observed_at":"2026-08-02T08:31:14.654003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:31:14.454866Z","title":"CoT Red-Handed: Stress testing chain-of-thought monitoring.arXiv preprint arXiv:2505.23575,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06596","last_updated":"2026-07-20T21:34:34Z","snapshot_observed_at":"2026-08-18T20:55:28.554828Z","submitted_at":"2026-07-06T22:40:07Z","title":"Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T08:31:14.454866Z"},"links":{"citing_paper":"/paper/2607.06596"},"observation_digest":"sha256:c978dc1c30f4194e146f22e5f47c5ab3c8bb6e34fce0222434c738a8600ddc55","observation_id":"7ef7186b-a77a-4be1-8151-24b2fabcd622","resolution":{"observed_at":"2026-08-02T08:31:14.454866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.06596","last_updated":"2026-07-20T21:34:34Z","latest_version":2,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-18T20:55:28.554828Z","submitted_at":"2026-07-06T22:40:07Z","title":"Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2607.06596."}