{"as_of":"2026-08-08T02:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:78bc934521d7461c28309b7aec08083053bb9526bf3482cea848a28141d08a1d","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:43:33.763079Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T11:56:07.082215Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:37:37.332332Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"cited_work":{"arxiv_id":"2505.14300","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14300","snapshot_observed_at":"2026-07-13T00:17:01.038763Z","title":"Safetynet: Detecting harmful outputs in llms by modeling and monitoring deceptive behaviors","venue":null,"work_id":"2f5a2632-7f9b-43fc-a5c5-2e816a914430","year":2025},"citing_paper":{"arxiv_id":"2509.26238","last_updated":"2026-04-21T11:04:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-30T13:32:59Z","title":"Beyond Linear Probes: Dynamic Safety Monitoring for Language Models","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-18T12:41:48.620040Z"},"links":{"cited_paper":"/paper/2505.14300","citing_paper":"/paper/2509.26238"},"observation_digest":"sha256:9c82383dd3f028e92582a026edfd821157caa546cecd7906b0da5710eecec337","observation_id":"ffe7e012-7818-4a65-af1a-76856157ffe7","resolution":{"observed_at":"2026-07-13T00:17:01.038763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"cited_work":{"arxiv_id":"2505.14300","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14300","snapshot_observed_at":"2026-07-13T00:17:01.038763Z","title":"Safetynet: Detecting harmful outputs in llms by modeling and monitoring deceptive behaviors","venue":null,"work_id":"2f5a2632-7f9b-43fc-a5c5-2e816a914430","year":2025},"citing_paper":{"arxiv_id":"2606.11270","last_updated":"2026-06-26T21:36:00Z","snapshot_observed_at":"2026-08-06T05:24:29.870664Z","submitted_at":"2026-06-09T06:52:49Z","title":"Quantifying Subliminal Behavioral Transfer Ratios in Language Model Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:13.320426Z"},"links":{"cited_paper":"/paper/2505.14300","citing_paper":"/paper/2606.11270"},"observation_digest":"sha256:af1159f785ab363cf491a272f1a08d4abd3f49369720cd615d6ac19dfcb504b4","observation_id":"6abccfcf-ec33-4be3-9721-92104184f470","resolution":{"observed_at":"2026-07-13T00:17:01.038763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"cited_work":{"arxiv_id":"2505.14300","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14300","snapshot_observed_at":"2026-07-13T00:17:01.038763Z","title":"Safetynet: Detecting harmful outputs in llms by modeling and monitoring deceptive behaviors","venue":null,"work_id":"2f5a2632-7f9b-43fc-a5c5-2e816a914430","year":2025},"citing_paper":{"arxiv_id":"2606.11270","last_updated":"2026-06-26T21:36:00Z","snapshot_observed_at":"2026-08-06T05:24:29.870664Z","submitted_at":"2026-06-09T06:52:49Z","title":"Quantifying Subliminal Behavioral Transfer Ratios in Language Model Distillation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T11:15:21.946819Z"},"links":{"cited_paper":"/paper/2505.14300","citing_paper":"/paper/2606.11270"},"observation_digest":"sha256:a146ea19d7058c315a66996deb8dfd6b34ec09b4e20535499d2abeb07f20d509","observation_id":"7a9b3364-da71-4aba-8598-302f7bfb565e","resolution":{"observed_at":"2026-07-13T00:17:01.038763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14300","snapshot_observed_at":"2026-08-02T11:56:07.082215Z","title":"arXiv preprint arXiv:2505.14300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24769","last_updated":"2026-06-09T06:02:50Z","snapshot_observed_at":"2026-08-06T22:39:16.623207Z","submitted_at":"2026-06-09T06:02:50Z","title":"LLM Scheming Inversely Scales with Pretraining Language Coverage","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T11:56:07.082215Z"},"links":{"cited_paper":"/paper/2505.14300","citing_paper":"/paper/2607.24769"},"observation_digest":"sha256:b2042e66a045afacb4098fdcff702120cacad4ba43956f456690f51937a92043","observation_id":"41c58c6d-6c29-4331-ac13-93a62484fa0f","resolution":{"observed_at":"2026-08-02T11:56:07.082215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14300/citation-record","integrity":"/paper/2505.14300/integrity","json":"/paper/2505.14300/citation-record.json","paper":"/paper/2505.14300"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T15:43:28.543259Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:28.543259Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:24f2494d4e383da0ca14a0bdc10ddebad06d9c83d42e8245870fe671d254e39f","observation_id":"9cfadd81-d068-4024-a70c-ecc59ea4ab69","resolution":{"observed_at":"2026-08-07T15:43:28.543259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09565","last_updated":"2025-02-08T23:58:36Z","snapshot_observed_at":"2026-07-06T20:06:09.333397Z","submitted_at":"2024-12-12T18:49:53Z","title":"Obfuscated Activations Bypass LLM Latent-Space Defenses","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09565","snapshot_observed_at":"2026-08-07T15:43:30.275006Z","title":"Mechanistic anomaly dataset huggingface repository, December 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.275006Z"},"links":{"cited_paper":"/paper/2412.09565","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:5646f63ce8f86d1f3aabe478fe0c9566ce278ffe1287fde438dad8a2a98bd3de","observation_id":"5149911b-abee-4c46-9cbc-ff6d294fcf87","resolution":{"observed_at":"2026-08-07T15:43:30.275006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03336","last_updated":"2024-11-07T09:18:26Z","snapshot_observed_at":"2026-07-06T19:45:44.484683Z","submitted_at":"2024-10-29T17:55:29Z","title":"Towards evaluations-based safety cases for AI scheming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03336","snapshot_observed_at":"2026-08-07T15:43:30.414746Z","title":"Towards evaluations-based safety cases for ai scheming, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.414746Z"},"links":{"cited_paper":"/paper/2411.03336","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:575b252e9906cc76b0b43d42774db48c49d1624408deb4cfc8888fd596c0ab2b","observation_id":"06bb95d0-789c-442c-a834-1485bcff7de0","resolution":{"observed_at":"2026-08-07T15:43:30.414746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.05991","last_updated":"2021-04-03T11:18:12Z","snapshot_observed_at":"2026-07-06T09:04:19.750585Z","submitted_at":"2020-03-12T19:38:47Z","title":"Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.05991","snapshot_observed_at":"2026-08-07T15:43:30.498720Z","title":"Autoencoders, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.498720Z"},"links":{"cited_paper":"/paper/2003.05991","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:0c72be741724b2151b8947b3e792effa593ba45288494ea5eb6246e5e8dd8682","observation_id":"d161dd7e-dea4-4a28-9099-57735193d468","resolution":{"observed_at":"2026-08-07T15:43:30.498720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00667","last_updated":"2023-09-01T17:27:37Z","snapshot_observed_at":"2026-08-06T23:40:57.486399Z","submitted_at":"2023-09-01T17:27:37Z","title":"Taken out of context: On measuring situational awareness in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00667","snapshot_observed_at":"2026-08-07T15:43:30.616157Z","title":"Taken out of context: On measuring situational awareness in llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.616157Z"},"links":{"cited_paper":"/paper/2309.00667","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:76b800a0178b59a66f5f53b0f9f0365b68ff0f681504eb5abd13eee0e2ce6d09","observation_id":"1a98e376-f4db-4820-a492-b0f9960b93bd","resolution":{"observed_at":"2026-08-07T15:43:30.616157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21572","last_updated":"2024-10-28T22:08:28Z","snapshot_observed_at":"2026-07-06T19:41:10.332290Z","submitted_at":"2024-10-28T22:08:28Z","title":"Safety cases for frontier AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21572","snapshot_observed_at":"2026-08-07T15:43:30.714748Z","title":"Safety cases for frontier ai, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.714748Z"},"links":{"cited_paper":"/paper/2410.21572","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:4eae7180a037ef78c3ef1d7500e5cc24b2b5e57b15f5d7eee4a36bd75aa2c11f","observation_id":"fb07f58a-a39f-4c14-91d0-5bac347e7115","resolution":{"observed_at":"2026-08-07T15:43:30.714748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08379","last_updated":"2023-11-27T19:30:35Z","snapshot_observed_at":"2026-08-05T18:30:31.616984Z","submitted_at":"2023-11-14T18:42:40Z","title":"Scheming AIs: Will AIs fake alignment during training in order to get power?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08379","snapshot_observed_at":"2026-08-07T15:43:30.785732Z","title":"Scheming ais: Will ais fake alignment during training in order to get power?, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.785732Z"},"links":{"cited_paper":"/paper/2311.08379","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:a1e29fcb1ec1064f4c72100c822beab4dce2f74cd82bc79b3cb8812bf9c56d8c","observation_id":"d262e28e-47f4-4895-8452-53709453a4fd","resolution":{"observed_at":"2026-08-07T15:43:30.785732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16851","last_updated":"2023-07-31T17:11:35Z","snapshot_observed_at":"2026-08-05T18:39:32.797947Z","submitted_at":"2023-07-31T17:11:35Z","title":"Towards Trustworthy and Aligned Machine Learning: A Data-centric Survey with Causality Perspectives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16851","snapshot_observed_at":"2026-08-07T15:43:30.890006Z","title":"Towards trustworthy and aligned machine learning: A data-centric survey with causality perspectives, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.890006Z"},"links":{"cited_paper":"/paper/2307.16851","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:a0fbdebcf0dd3dcdaa96682023afb3946b11ea7c403b69f4110f5a8076c520e3","observation_id":"f15c433a-b791-443d-8867-e8415ea2486a","resolution":{"observed_at":"2026-08-07T15:43:30.890006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4230/lipics.itcs.2025.38","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:33.896642Z","title":"Backdoor defense, learnability and obfuscation, 2025","venue":null,"work_id":"34110402-f4b4-48ac-aecc-2bd13963f02e","year":2025},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.988869Z"},"links":{"citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:adcc022606b077314d458d5570e13cbe93218d7b0fbbe76543852b962b505d31","observation_id":"27927f34-c2c6-4f08-bc6d-efe71bd82580","resolution":{"observed_at":"2026-08-07T15:43:33.973035Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10462","last_updated":"2024-03-18T18:11:46Z","snapshot_observed_at":"2026-08-07T12:53:57.992660Z","submitted_at":"2024-03-15T16:53:13Z","title":"Safety Cases: How to Justify the Safety of Advanced AI Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10462","snapshot_observed_at":"2026-08-07T15:43:31.143723Z","title":"Safety cases: How to justify the safety of advanced ai systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.143723Z"},"links":{"cited_paper":"/paper/2403.10462","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:95db7e2cd2c0c55fbb0d3c2301f6b12dc7b6656a41d850ab1820157217479322","observation_id":"458fbeb4-4769-4618-a27c-d68c9e721794","resolution":{"observed_at":"2026-08-07T15:43:31.143723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:36.569938Z","title":"Industrial monitoring system, 2025","venue":null,"work_id":"0aae2fb3-c601-48ee-9608-90967d91a932","year":2025},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.253688Z"},"links":{"citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:d9372ee3aba6bcc316f289110b4100b87608b48a33d5ef0de880a55856114b1f","observation_id":"3053807f-71d0-48d8-930e-5bfb833a9279","resolution":{"observed_at":"2026-08-07T15:43:36.646763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17618","last_updated":"2024-12-23T14:43:41Z","snapshot_observed_at":"2026-07-06T20:12:13.548098Z","submitted_at":"2024-12-23T14:43:41Z","title":"Dynamic safety cases for frontier AI","version":1},"cited_work":{"arxiv_id":"2412.17618","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.17618","snapshot_observed_at":"2026-08-07T15:43:34.588715Z","title":"Dynamic safety cases for frontier AI","venue":"cs.CY","work_id":"fe31093c-3652-4be7-9eb6-c2aabed88c5b","year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.377089Z"},"links":{"cited_paper":"/paper/2412.17618","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:cc0d8a1f3d66846f1e260d36f29cec59f63d67f991011efdb3b5ebc2da0fabf6","observation_id":"ed1e148c-abaa-4d1d-8bf4-ae87b7a95e22","resolution":{"observed_at":"2026-08-07T15:43:34.679398Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10029","last_updated":"2023-12-18T16:43:35Z","snapshot_observed_at":"2026-08-04T14:36:26.025717Z","submitted_at":"2023-12-15T18:49:43Z","title":"Challenges with unsupervised LLM knowledge discovery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10029","snapshot_observed_at":"2026-08-07T15:43:31.484748Z","title":"Challenges with unsupervised llm knowledge discovery, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.484748Z"},"links":{"cited_paper":"/paper/2312.10029","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:fc83ebebffd3306f4c6e65f771dc53bc417f80f86c5a0b9a28e2e5d574078cab","observation_id":"eca34920-2c90-4037-aaea-21f704550070","resolution":{"observed_at":"2026-08-07T15:43:31.484748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04709","last_updated":"2025-05-08T23:00:37Z","snapshot_observed_at":"2026-08-07T20:10:01.593677Z","submitted_at":"2023-01-11T20:42:41Z","title":"Causal Abstraction: A Theoretical Foundation for Mechanistic Interpretability","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04709","snapshot_observed_at":"2026-08-07T15:43:31.583205Z","title":"Causal abstraction: A theoretical foundation for mechanistic interpretability, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.583205Z"},"links":{"cited_paper":"/paper/2301.04709","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:ac93c6a6a52086980a79372d4af5da77fd68678e82c94e4d31a63382457c8e99","observation_id":"60e2b358-386b-40d1-b04e-197bf857f57f","resolution":{"observed_at":"2026-08-07T15:43:31.583205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:43:31.645292Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.645292Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:5d3c790db40338a715093dffedbec343497a8cf361ec07219a447c6109720860","observation_id":"b24a5d12-50fd-4626-bcc3-8ce9ecdfd7c5","resolution":{"observed_at":"2026-08-07T15:43:31.645292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-07T15:43:31.745601Z","title":"Bowman, and Evan Hubinger","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.745601Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:171a064d567f831caa600feb385a0e7a3019bf2e2f4d3b38bbbae19afd3d53e1","observation_id":"baccc249-5cf1-47a5-9688-517136c1f0f1","resolution":{"observed_at":"2026-08-07T15:43:31.745601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T15:43:31.832025Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.832025Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:e016f3524925676a2305390df37065da2a70bec26efbb5898bc2905dc1ef9dd0","observation_id":"b74ddfec-d8c7-476c-a6dd-91b303de2238","resolution":{"observed_at":"2026-08-07T15:43:31.832025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T15:43:31.900336Z","title":"Auto-encoding variational bayes, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.900336Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:85b6e118159713570d09d84966d074ce24eb55c4277d6db2743c552d80161786","observation_id":"c6009f29-91d0-4614-81f5-447ec34b5200","resolution":{"observed_at":"2026-08-07T15:43:31.900336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19384","last_updated":"2025-06-16T10:21:00Z","snapshot_observed_at":"2026-07-06T18:38:05.229292Z","submitted_at":"2024-06-27T17:57:03Z","title":"The Remarkable Robustness of LLMs: Stages of Inference?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19384","snapshot_observed_at":"2026-08-07T15:43:31.973605Z","title":"The remarkable robustness of llms: Stages of inference?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.973605Z"},"links":{"cited_paper":"/paper/2406.19384","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:0cdb43abe09f32f9a359c646a1a7b380d0ed017ca500ec32821ec27d58e6e3e9","observation_id":"61a54966-ee67-49b2-a9fb-331a09beded8","resolution":{"observed_at":"2026-08-07T15:43:31.973605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:36.378033Z","title":"Me, myself, and ai: The situational awareness dataset (sad) for llms","venue":null,"work_id":"af0cca56-0839-4e5e-903c-3ffc5babf412","year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.113134Z"},"links":{"citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:4a96e6dc585d9c5e297ddb684ab5b6d576c2a9826dc1112eb32dd5c098b18301","observation_id":"df9ad0c5-094e-4e51-92d1-bc206ceb6ae0","resolution":{"observed_at":"2026-08-07T15:43:36.456599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-07T15:43:32.241219Z","title":"Sgdr: Stochastic gradient descent with warm restarts, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.241219Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:966237af8c513412039da9a05405c1f1f3a7926ddcbaaebc69d99db4c817d24b","observation_id":"0e0f2d5d-5f7f-49fd-9d31-7072f6bb4463","resolution":{"observed_at":"2026-08-07T15:43:32.241219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T15:43:32.358776Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.358776Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:71f8962b5ec5f9a0a8d1bcc5619e1efefff048283750e9ed56e15e57b3209f44","observation_id":"fc00e302-4b40-4362-b740-9f094539f6e9","resolution":{"observed_at":"2026-08-07T15:43:32.358776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11715","last_updated":"2022-12-19T04:02:37Z","snapshot_observed_at":"2026-07-06T13:55:41.552052Z","submitted_at":"2022-09-23T16:47:19Z","title":"The \"Beatrix'' Resurrections: Robust Backdoor Detection via Gram Matrices","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11715","snapshot_observed_at":"2026-08-07T15:43:32.438935Z","title":"The \" Beatrix '' Resurrections : Robust Backdoor Detection via Gram Matrices , December 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.438935Z"},"links":{"cited_paper":"/paper/2209.11715","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:b942393cef24985e2d5e71a1716192c0a29f8f5a28c0239710b95221bac7d471","observation_id":"2e5e159f-8a11-45a7-8260-98f7d073d15f","resolution":{"observed_at":"2026-08-07T15:43:32.438935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:36.170687Z","title":"On the generalized distance in statistics","venue":null,"work_id":"a0ae1f1e-461e-4181-a1a2-e92af9fa820f","year":1936},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.555486Z"},"links":{"citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:071577f4a563abaa0ce0bc47067ce2aa1a624d2f5a7bcbd1d6588e228f8c775d","observation_id":"d8264b3d-2e10-4e6b-84ce-9cc0183e17f6","resolution":{"observed_at":"2026-08-07T15:43:36.255458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04984","last_updated":"2025-01-14T20:16:01Z","snapshot_observed_at":"2026-07-29T23:20:20.918596Z","submitted_at":"2024-12-06T12:09:50Z","title":"Frontier Models are Capable of In-context Scheming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04984","snapshot_observed_at":"2026-08-07T15:43:32.674783Z","title":"Frontier models are capable of in-context scheming, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.674783Z"},"links":{"cited_paper":"/paper/2412.04984","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:bfcf218864adad606e3b79aeac6f4c034a8f8a76adf49593c45acf5ae5523252","observation_id":"70868715-3306-4e10-b4ff-b6e9c50b84ab","resolution":{"observed_at":"2026-08-07T15:43:32.674783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:35.939174Z","title":"Ai models can be dangerous before public deployment","venue":null,"work_id":"0396cb86-e338-4ea2-a29f-a3315a50544d","year":2025},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.785394Z"},"links":{"citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:a083458b9de16a993148b6d831aef7b793b9a1f0bfe0c9d66d24a47cfd2dd112","observation_id":"5f790046-e524-4b48-bad2-23c3587a4ddd","resolution":{"observed_at":"2026-08-07T15:43:36.055262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:35.739786Z","title":"Metr’s gpt-4.5 pre-deployment evaluations","venue":null,"work_id":"065f5318-80c8-4658-b8d6-cdeb4b4d9263","year":2025},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.938172Z"},"links":{"citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:a7f452d1a506072fdd1dc9f1a6f15d71a85f8ba83e437c70a801547da1b27c20","observation_id":"3853cfd3-2e59-471b-903c-a948c8436cb1","resolution":{"observed_at":"2026-08-07T15:43:35.836871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12768","last_updated":"2025-06-11T12:40:14Z","snapshot_observed_at":"2026-07-06T19:52:46.580689Z","submitted_at":"2024-11-18T07:52:12Z","title":"CROW: Eliminating Backdoors from Large Language Models via Internal Consistency Regularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12768","snapshot_observed_at":"2026-08-07T15:43:33.051071Z","title":"Pham, Yige Li, and Jun Sun","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.051071Z"},"links":{"cited_paper":"/paper/2411.12768","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:a8a6f9a65dfcdeb822251da42e1044657bcd7a7e6421893d975254ce5e04046c","observation_id":"1e2c06e0-4ff8-4b4a-b33f-420a00403184","resolution":{"observed_at":"2026-08-07T15:43:33.051071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02673","last_updated":"2023-12-05T11:29:12Z","snapshot_observed_at":"2026-07-06T16:57:05.781222Z","submitted_at":"2023-12-05T11:29:12Z","title":"Robust Backdoor Detection for Deep Learning via Topological Evolution Dynamics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02673","snapshot_observed_at":"2026-08-07T15:43:33.167602Z","title":"Robust Backdoor Detection for Deep Learning via Topological Evolution Dynamics , December 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.167602Z"},"links":{"cited_paper":"/paper/2312.02673","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:11ce13d46d9a275564febab407a2c44aa56584a5d13f7dbf90110e187ed65480","observation_id":"1477b547-3d38-4021-8299-0c3e9ddf5e5f","resolution":{"observed_at":"2026-08-07T15:43:33.167602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:35.526428Z","title":"Rail track monitoring system, 2025","venue":null,"work_id":"1588f90b-a4ca-4460-9ee2-b2f1a93ac579","year":2025},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.296688Z"},"links":{"citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:16316bfb5a75ff178d57487bddeec2ed90575f30180e978c9a6bbb22d1b0d4bb","observation_id":"9112b6eb-cb91-4c29-96db-c6593e38f6d1","resolution":{"observed_at":"2026-08-07T15:43:35.640638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-06T08:16:16.062348Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-08-07T15:43:33.389364Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback , April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.389364Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:cd74919e646069a437c281d8c12870b2ae2ee3f44350bbfed2e2edde9e07d89b","observation_id":"33bf3e96-e499-4ef8-9020-f5c5256b1d61","resolution":{"observed_at":"2026-08-07T15:43:33.389364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:35.355893Z","title":"Aviation safety monitoring system, 2025","venue":null,"work_id":"8eae0cec-65c0-48ee-a570-5e0452d4471a","year":2025},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.492380Z"},"links":{"citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:6fa6e3728f35e774537d6d22d7968685042fcdd5dd9493388e2f63db3aa62108","observation_id":"de4001fd-d646-49fe-a541-54d33e7daedc","resolution":{"observed_at":"2026-08-07T15:43:35.419024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:35.173501Z","title":"The Black Swan: The Impact of the Highly Improbable","venue":null,"work_id":"48c6dba0-c722-4749-afd1-52268954ec2d","year":2007},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.599145Z"},"links":{"citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:6bc8670b8af3185995e09ee76a2a8c03a591d7c2d3d8a9c65c94ad26f7e6cd03","observation_id":"91657c50-6cce-4055-9586-22d287e48c43","resolution":{"observed_at":"2026-08-07T15:43:35.233064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T15:43:33.696833Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.696833Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:8c8285c5f9c243eefacf245d0c330bf0ac13a3313f0d0f22c1ab242a6ba34f64","observation_id":"9650b709-c852-4e4a-8ce9-b4e35eb16c1c","resolution":{"observed_at":"2026-08-07T15:43:33.696833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18166","last_updated":"2024-06-14T07:27:26Z","snapshot_observed_at":"2026-07-06T18:21:18.150567Z","submitted_at":"2024-05-28T13:26:12Z","title":"Defending Large Language Models Against Jailbreak Attacks via Layer-specific Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18166","snapshot_observed_at":"2026-08-07T15:43:33.763079Z","title":"Defending large language models against jailbreak attacks via layer-specific editing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.763079Z"},"links":{"cited_paper":"/paper/2405.18166","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:3425549532271c646a5c4da144cac78d15de2cd69e65ca0d2ad8b07191a56a07","observation_id":"968a4e6f-0bb3-495f-b052-a572df396cbc","resolution":{"observed_at":"2026-08-07T15:43:33.763079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T15:34:44.521975Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":2,"verified_fuzzy":8},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 4 inbound Pith citation observations for arXiv:2505.14300."}