{"as_of":"2026-07-22T05:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ff40723e666197b20e7ec94a2ae419dc42ba7aade187a46c3fba0393e237d8a0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-21T06:31:05.380196+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-15T05:51:54.267975Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":null,"work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2512.05742","last_updated":"2026-05-20T12:16:41Z","snapshot_observed_at":"2026-07-06T22:37:54.987339Z","submitted_at":"2025-12-05T14:21:02Z","title":"Internal Deployment in the AI Act","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-21T17:51:47.841707Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2512.05742"},"observation_digest":"sha256:846be42816d32f90c9ecd1a94699b4b7fc411bcfc607cef8e2bec8568df849e7","observation_id":"1f8e93d7-8c25-406e-ad64-0b7e8daba457","resolution":{"observed_at":"2026-05-21T17:54:18.534920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":null,"work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2604.11061","last_updated":"2026-04-13T06:42:24Z","snapshot_observed_at":"2026-07-06T22:59:32.051572Z","submitted_at":"2026-04-13T06:42:24Z","title":"Pando: Do Interpretability Methods Work When Models Won't Explain Themselves?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:07.939420Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2604.11061"},"observation_digest":"sha256:9b5569519bdb78a66d75608aea059873895cefaae0e38f23e77a3e97af6ae69c","observation_id":"e2285006-db6a-4264-814f-b9b95cfdf594","resolution":{"observed_at":"2026-05-11T10:26:02.378367Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":null,"work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:546dc390b9e6187e5b6d8529d736e17bf308bdee00cfa075a02b9bf7298aea46","observation_id":"ecabf288-40ff-4f20-8eee-4284d200fcb7","resolution":{"observed_at":"2026-05-10T14:00:28.385565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":null,"work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2605.00994","last_updated":"2026-06-29T16:38:47Z","snapshot_observed_at":"2026-07-06T23:14:20.123289Z","submitted_at":"2026-05-01T18:00:55Z","title":"Most Current Model Organisms Are Leaky: Perplexity Differencing Often Reveals Finetuning Objectives","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-09T18:47:41.188989Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2605.00994"},"observation_digest":"sha256:40fa6eb2a6155b1fcbbd2dc22d73794bc94665eefedaa3fd0551e8617b9cbda7","observation_id":"7919d241-d8ef-400d-a631-0f3936192d04","resolution":{"observed_at":"2026-05-11T16:06:07.697769Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":null,"work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2605.00994","last_updated":"2026-06-29T16:38:47Z","snapshot_observed_at":"2026-07-06T23:14:20.123289Z","submitted_at":"2026-05-01T18:00:55Z","title":"Most Current Model Organisms Are Leaky: Perplexity Differencing Often Reveals Finetuning Objectives","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-01T07:45:18.365192Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2605.00994"},"observation_digest":"sha256:dce103b4b833b7047c8629c812d09522f4171de34318aa2d4ca053925ec700b0","observation_id":"5ce426cb-d4e5-4ef4-960a-c6d84b54944b","resolution":{"observed_at":"2026-07-01T07:55:31.599646Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":null,"work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2605.06846","last_updated":"2026-06-02T16:52:04Z","snapshot_observed_at":"2026-07-06T23:19:15.382283Z","submitted_at":"2026-05-07T18:48:09Z","title":"Narrow Secret Loyalty Dodges Black-Box Audits","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T00:53:49.010929Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2605.06846"},"observation_digest":"sha256:e151cc3833d6d60d28d51805f27a83c24a3b70eacd5a2f669874020ebd593b52","observation_id":"56fdb4a2-ef28-4146-ba4a-8e4e09a98f61","resolution":{"observed_at":"2026-05-11T05:00:57.070015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":null,"work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2605.06846","last_updated":"2026-06-02T16:52:04Z","snapshot_observed_at":"2026-07-06T23:19:15.382283Z","submitted_at":"2026-05-07T18:48:09Z","title":"Narrow Secret Loyalty Dodges Black-Box Audits","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T06:07:42.567241Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2605.06846"},"observation_digest":"sha256:207c78c613abed3286850418f9eac7a18220e402dfab3aeabe9902b5d8a15506","observation_id":"12f71361-56e3-40e4-b345-1c4336b2f5b3","resolution":{"observed_at":"2026-05-13T06:12:22.905126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":null,"work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2605.06846","last_updated":"2026-06-02T16:52:04Z","snapshot_observed_at":"2026-07-06T23:19:15.382283Z","submitted_at":"2026-05-07T18:48:09Z","title":"Narrow Secret Loyalty Dodges Black-Box Audits","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T23:02:20.906168Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2605.06846"},"observation_digest":"sha256:9ecf8a1e37549cf5069ed37d7e09d967a63fe7ba3f71d7a9e706a3acb51f5007","observation_id":"d3c0b841-123a-4bde-a163-775c7ade017e","resolution":{"observed_at":"2026-06-30T23:05:07.322088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":null,"work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2605.10310","last_updated":"2026-06-19T14:35:47Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:11:08Z","title":"Positive Alignment: Artificial Intelligence for Human Flourishing","version":2},"reference_index":125,"source":"arxiv_source","source_observed_at":"2026-05-15T05:56:56.902705Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2605.10310"},"observation_digest":"sha256:69bc87784a6824be91a86bc0c64ab0d266f11ac0b13ccc096915cb08e83da71b","observation_id":"41e33e97-cf37-43ac-b5a3-0e315219a3de","resolution":{"observed_at":"2026-05-15T05:59:47.974215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":null,"work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2605.11448","last_updated":"2026-05-12T02:59:44Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T02:59:44Z","title":"Deep Minds and Shallow Probes","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T02:19:42.346071Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2605.11448"},"observation_digest":"sha256:2dc13d7d9fa15285ece40b5398ff1cdf7b8b1e87219f47a343e4b561ae952421","observation_id":"f9e9e36c-bd9e-4583-b4c1-7b602369d35d","resolution":{"observed_at":"2026-05-13T02:22:06.365710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":null,"work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2605.12813","last_updated":"2026-05-31T17:51:51Z","snapshot_observed_at":"2026-07-06T23:24:27.821980Z","submitted_at":"2026-05-12T23:13:50Z","title":"REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-14T20:13:10.814899Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2605.12813"},"observation_digest":"sha256:8b96ab3debdd3ad64d4a9c15919ca3ce9b29a08a9833de53546f2124ad16ec9d","observation_id":"3aa6eb90-0c30-46f6-9c73-13884c2f24f5","resolution":{"observed_at":"2026-05-14T20:17:56.941027Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":null,"work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2605.15164","last_updated":"2026-05-14T17:54:28Z","snapshot_observed_at":"2026-07-06T23:26:28.006734Z","submitted_at":"2026-05-14T17:54:28Z","title":"Position: Behavioural Assurance Cannot Verify the Safety Claims Governance Now Demands","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T20:53:04.274840Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2605.15164"},"observation_digest":"sha256:61c7560c2eddc738a13fb44ad42b2375f318b10cea1a8a813e53b88a7d6580ee","observation_id":"5e6652c7-54d7-4f01-a9f2-a4d661157ebc","resolution":{"observed_at":"2026-06-30T20:55:03.932936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":null,"work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2605.21602","last_updated":"2026-05-24T21:06:51Z","snapshot_observed_at":"2026-07-06T23:32:01.202542Z","submitted_at":"2026-05-20T18:08:21Z","title":"Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-22T09:38:04.387777Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2605.21602"},"observation_digest":"sha256:8d0be2b9dd312e834983e4b046ca7a8fdf6c098daa50272e44a7c8a0a870c564","observation_id":"3550bd84-1b41-4078-bf8e-2a075683e031","resolution":{"observed_at":"2026-05-22T09:41:21.485724Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":null,"work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2606.09563","last_updated":"2026-06-08T14:37:46Z","snapshot_observed_at":"2026-07-06T23:48:53.420827Z","submitted_at":"2026-06-08T14:37:46Z","title":"PRISM: Recovering Instruction Sets from Language Model Activations","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-27T16:52:02.948457Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2606.09563"},"observation_digest":"sha256:c3599dce150a66d80600a56d21bbef4e0fb5527c58583d3df479c523a93bb976","observation_id":"819b93fe-de95-498a-9cb6-748d9e3e96e5","resolution":{"observed_at":"2026-06-27T17:01:08.024529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":null,"work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":250,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:3eeed46f7c05166d84cd954273304717ea522bad83ecf7592e63006bc5763db2","observation_id":"6c3f657a-63bc-48ee-90d3-6563d1ff96a7","resolution":{"observed_at":"2026-07-03T01:37:30.478939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":null,"work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2606.12618","last_updated":"2026-06-17T16:15:20Z","snapshot_observed_at":"2026-07-06T23:51:31.502574Z","submitted_at":"2026-06-10T19:21:12Z","title":"\"Did you lie?\" Evaluating Lie Detectors across Model Scale and Belief-Verified Model Organisms","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-06-27T09:51:16.969884Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2606.12618"},"observation_digest":"sha256:77af15e674120f49ebe39d820087ad71bc047fa97996263a5bf6b60f48854649","observation_id":"4eadd4bd-af71-4321-9a60-26aa20c3d2ec","resolution":{"observed_at":"2026-07-03T10:48:02.294364Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":null,"work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2606.13310","last_updated":"2026-06-11T13:07:02Z","snapshot_observed_at":"2026-07-06T23:52:04.574604Z","submitted_at":"2026-06-11T13:07:02Z","title":"RogueAI: A Reverse Turing Test for Detecting Licensed AI Deception in Dialogue","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T06:34:39.457798Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2606.13310"},"observation_digest":"sha256:1f931991f97ddab444b017daa960ed7e76aef62587039f16577eb41ebd97e6a5","observation_id":"7be5d1e9-cb3f-4c8b-a787-ba932cf5e064","resolution":{"observed_at":"2026-07-03T15:18:33.682490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":null,"work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2606.18327","last_updated":"2026-06-16T17:59:40Z","snapshot_observed_at":"2026-07-06T23:53:49.904730Z","submitted_at":"2026-06-16T17:59:40Z","title":"Self-CTRL: Self-Consistency Training with Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T01:38:48.296421Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2606.18327"},"observation_digest":"sha256:28ed6adc32c393184e468aaa5681056dce8f5c6c58e2bdd2459376230f90bf11","observation_id":"093f88b0-768b-456a-a7c9-f556eb286e15","resolution":{"observed_at":"2026-07-03T20:08:56.002103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":null,"work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2606.22019","last_updated":"2026-06-20T12:48:31Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T12:48:31Z","title":"Channel Location Constrains the Auditability of Subliminal Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T11:52:03.948568Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2606.22019"},"observation_digest":"sha256:26aeba2329ab934ef7875830b9cc247bcc0a51be00cb3c4ea0969a3376e82de9","observation_id":"1444b25b-1bd5-4a3d-b6ea-21c396c7ad16","resolution":{"observed_at":"2026-07-04T08:19:44.415684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":null,"work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2607.01033","last_updated":"2026-07-01T15:01:30Z","snapshot_observed_at":"2026-07-07T00:06:39.908636Z","submitted_at":"2026-07-01T15:01:30Z","title":"The Model Organism Lottery: Model Organism Interpretability Strongly Depends on Training Methodology","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-02T15:57:48.589980Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2607.01033"},"observation_digest":"sha256:9ddd69ec8d6568c5ffdabcb7093455cb4ac6e567719cb3c9838ee743d5069556","observation_id":"f52bdd47-9f53-4350-a462-8c2dd4ed46d3","resolution":{"observed_at":"2026-07-02T16:07:08.170512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.155078+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-07-15T05:51:54.267975Z","title":"Frontier Models are Capable of In-context Scheming","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12469","last_updated":"2026-07-14T07:54:37Z","snapshot_observed_at":"2026-07-17T23:18:36.898369Z","submitted_at":"2026-07-14T07:54:37Z","title":"Agent-Safety Evaluations as Load-Bearing Evidence: A Vendor-Neutral, Cross-Harness Reconstructability Metric","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-15T05:51:54.267975Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2607.12469"},"observation_digest":"sha256:9299541fd83520d806441d4c7628910da4ef0574c149d023396b5da5851e7706","observation_id":"3b2d4f8e-a49e-47ed-9b54-1dc75367f11d","resolution":{"observed_at":"2026-07-15T05:51:54.267975Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.10965/citation-record","integrity":"/paper/2503.10965/integrity","json":"/paper/2503.10965/citation-record.json","paper":"/paper/2503.10965"},"outbound":[],"paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"thesis":"As of 22 July 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2503.10965."}