{"as_of":"2026-08-04T11:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:140e8b27f35f07be87d56daf902c86db88a237dd82a61aa818245ae822733b4c","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T20:26:37.914522Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T21:44:25.201514Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.17408","snapshot_observed_at":"2026-07-30T21:44:25.201514Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23458","last_updated":"2026-07-26T04:43:53Z","snapshot_observed_at":"2026-07-30T23:55:40.335733Z","submitted_at":"2026-07-26T04:43:53Z","title":"Two Regimes of Chain-of-Thought Unfaithfulness: Behavioral Detection Fails Where Models Are Wrong","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-30T21:44:25.201514Z"},"links":{"cited_paper":"/paper/2511.17408","citing_paper":"/paper/2607.23458"},"observation_digest":"sha256:a9ce668a67eb0ef2f37ed9c2b4fb09eea1bc886cb2d4839e871eb2f15e11fd07","observation_id":"f6d7ce6b-f995-4274-8788-22a11b04f80c","resolution":{"observed_at":"2026-07-30T21:44:25.201514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.17408/citation-record","integrity":"/paper/2511.17408/integrity","json":"/paper/2511.17408/citation-record.json","paper":"/paper/2511.17408"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.14617","doi":"10.48550/arxiv.2505.14617","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Linear Control of Test Awareness Reveals Differential Compliance in Reasoning Models , May 2025","venue":null,"work_id":"93a7cb6d-dad5-4a87-be0e-0b8103691e71","year":2025},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:93e2025f12ee775e11d3f562014ef08a266f33e58154741b6b9bc3937ba5a5fe","observation_id":"4a8a3a90-05a4-40f9-b188-114f64780575","resolution":{"observed_at":"2026-05-17T20:30:11.631056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.02893","last_updated":"2020-03-27T19:07:58Z","snapshot_observed_at":"2026-07-06T08:05:24.076802Z","submitted_at":"2019-07-05T15:26:26Z","title":"Invariant Risk Minimization","version":3},"cited_work":{"arxiv_id":"1907.02893","doi":"10.1038/s41591-023-02608-w","metadata_source":"pith","pith_arxiv_id":"1907.02893","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Invariant Risk Minimization","venue":"stat.ML","work_id":"d76c6842-b84d-44ec-bcea-b80cd8d07981","year":2019},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/1907.02893","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:bf2941d53634f44d1749a5c2affe35a4d890caf2f370d4e153253bc0dac8fff1","observation_id":"c4ee3199-3bb7-4bf7-a877-572424067f4d","resolution":{"observed_at":"2026-05-17T20:30:11.624218Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2204.05862","doi":"10.1016/j.respol.2005.01.014","metadata_source":"pith","pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","venue":"cs.CL","work_id":"a1f2574b-a899-4713-be60-c87ba332656c","year":2022},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:2ec8ebf23a5e99785dd98fa17448d92ba257fc298fa057573844858d3811a3d7","observation_id":"a0976b27-f64c-4805-9076-84da2d039a73","resolution":{"observed_at":"2026-05-17T20:30:11.683687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16513","last_updated":"2025-01-30T08:00:14Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T21:26:37Z","title":"Deception in LLMs: Self-Preservation and Autonomous Goals in Large Language Models","version":2},"cited_work":{"arxiv_id":"2501.16513","doi":"10.48550/arxiv.2501.16513","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16513","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Deception in","venue":null,"work_id":"ebcdcd3d-59da-4f72-9dab-265383ae6be5","year":2025},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2501.16513","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:e27260160f6f38029f44d9ac8cb1d5192f0ebe5c27b1fd0374b9fbef3f467eea","observation_id":"a909a741-651d-4fb4-8881-87be77fe645a","resolution":{"observed_at":"2026-05-17T20:30:11.686788Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21514","last_updated":"2024-10-28T20:34:51Z","snapshot_observed_at":"2026-07-06T19:41:10.332290Z","submitted_at":"2024-10-28T20:34:51Z","title":"Sabotage Evaluations for Frontier Models","version":1},"cited_work":{"arxiv_id":"2410.21514","doi":"10.48550/arxiv.2410.21514","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21514","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"and Duvenaud, David , urldate =","venue":null,"work_id":"695ec6fa-c23c-4b40-b4ef-1d6a6d5107bc","year":2024},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2410.21514","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:6bdc3b3b63f770c37182308084240776b1bf384f6bde1e6c02a4e6fa39dc14f3","observation_id":"6c0a7faa-e46b-40ab-bb19-68de55c9c107","resolution":{"observed_at":"2026-05-17T20:30:11.717804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-15T10:49:59.945692+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T10:49:59.945692+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15740","last_updated":"2025-01-27T03:06:06Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T03:06:06Z","title":"Propositional Interpretability in Artificial Intelligence","version":1},"cited_work":{"arxiv_id":"2501.15740","doi":"10.48550/arxiv.2501.15740","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15740","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Propositional interpretability in artificial intelligence","venue":null,"work_id":"ce93b765-fd3b-4d26-b0ed-c233ab33e1e7","year":2025},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2501.15740","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:5b51668fcb91cb91a807ffdf5cdb9ea013661652661b83956514fb5b91c295bf","observation_id":"82feaba0-7f2d-4d2e-b478-82de071c8d7a","resolution":{"observed_at":"2026-05-17T20:30:11.678096Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.12428","doi":"10.48550/arxiv.2507.12428","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"month = jul, year =","venue":null,"work_id":"7e59426e-18a8-4ce1-a24e-fd884f3e9214","year":2025},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:f709b81b348640babe348c2d5ca210cfd0b5567a3c9a1ebee746c71f6fe0c48a","observation_id":"0909cc93-57ac-4aaf-a3a8-5145ba3e81bd","resolution":{"observed_at":"2026-05-17T20:30:11.720919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cost-effective constitutional classifiers via representation re-use","venue":null,"work_id":"b153b928-303c-4365-8c0d-8761d6b8780a","year":2025},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:5e85c3f8ccb3b905f9f601e5c07d417659cce8e998d3e9e9c00cc5d666875413","observation_id":"0a07bec9-ee27-4f4c-89cc-d95e5b19e0d5","resolution":{"observed_at":"2026-05-17T20:32:05.634244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:242753723b8f854a0259e9fce1f5ac6343f7af6b4a29928f36bdd1e1ab6b2e27","observation_id":"d7b924d5-dd2e-415e-83b2-c5c32941f2bf","resolution":{"observed_at":"2026-05-17T20:30:11.723980Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":"2305.14233","doi":"10.48550/arxiv.2305.14233","metadata_source":"pith","pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","venue":"cs.CL","work_id":"5b264119-de53-49d1-b7be-d172bf51c834","year":2023},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:68b12f442c88f96f5556e48961c76891ebab843ef15de6052dffc4ccc3945834","observation_id":"a002ea0c-53d2-4133-9796-41a052437ee4","resolution":{"observed_at":"2026-05-17T20:30:11.731506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:27.379194+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:27.379194+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.04833","last_updated":"2018-05-13T07:07:08Z","snapshot_observed_at":"2026-07-06T06:38:48.758485Z","submitted_at":"2018-05-13T07:07:08Z","title":"Hierarchical Neural Story Generation","version":1},"cited_work":{"arxiv_id":"1805.04833","doi":"10.48550/arxiv.1805.04833","metadata_source":"pith","pith_arxiv_id":"1805.04833","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Hierarchical Neural Story Generation","venue":"cs.CL","work_id":"5e06c7f2-e43a-4c73-b898-2848e095ff14","year":2018},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/1805.04833","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:fce27addaab3679bec515f74cb6733971c4916f118cd5ed6cf7eab995a4e5f98","observation_id":"7aa3136f-6cee-4b02-b2ee-c536505dc6db","resolution":{"observed_at":"2026-05-17T20:30:11.680944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T06:23:41.809346+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T06:23:41.809346+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19501","last_updated":"2024-12-06T21:58:12Z","snapshot_observed_at":"2026-07-06T18:38:13.900206Z","submitted_at":"2024-06-27T19:28:43Z","title":"Monitoring Latent World States in Language Models with Propositional Probes","version":2},"cited_work":{"arxiv_id":"2406.19501","doi":"10.48550/arxiv.2406.19501","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.19501","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Monitoring","venue":null,"work_id":"31ec6c91-d3e2-48a1-ae61-c1e281cac943","year":2024},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2406.19501","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:2e7c3ceca04278dbcf9e9584b5cb3d468a525c9374f7e3ef80f2dcbdfa13d16c","observation_id":"959b5e21-c011-42e8-b79d-07922309fb87","resolution":{"observed_at":"2026-05-17T20:30:11.741041Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03407","last_updated":"2025-02-05T17:49:40Z","snapshot_observed_at":"2026-07-06T20:31:46.181066Z","submitted_at":"2025-02-05T17:49:40Z","title":"Detecting Strategic Deception Using Linear Probes","version":1},"cited_work":{"arxiv_id":"2502.03407","doi":"10.48550/arxiv.2502.03407","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03407","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"De- tecting strategic deception using linear probes","venue":null,"work_id":"e384658d-a249-4c29-9389-02c5ee507c5a","year":2025},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2502.03407","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:96af1069c7b6e161209bf1f75a817cb9f9fb6ee8bac97ea47784dc938b0738a4","observation_id":"a94f196f-6b16-4e25-af5c-d6b9431a1a50","resolution":{"observed_at":"2026-05-17T20:30:11.634956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-07-06T21:44:38.383532Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"cited_work":{"arxiv_id":"2506.16078","doi":"10.48550/arxiv.2506.16078","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16078","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Probing the","venue":null,"work_id":"0404596f-ccca-4ce3-ace6-7c27c9fc3a48","year":2025},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2506.16078","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:823a83f04dfd6c6d783bbe19f50d5893e97fafa2429e9a2c0017842fc573a46c","observation_id":"02cf7c9a-d832-48d7-b219-06c3e5ffc297","resolution":{"observed_at":"2026-05-17T20:30:11.710099Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What makes a convincing argument? Empirical analysis and detecting attributes of convincingness in Web argumentation","venue":null,"work_id":"93640bcc-9969-495b-acc4-9c5f6474da53","year":2016},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:da72b99adcfca3ccf3518e49a6e7ad3f30811c0f2fc25a3a4f259a9830d99f37","observation_id":"d3bfb3de-ec41-4833-afea-76c02aa7920b","resolution":{"observed_at":"2026-05-17T20:32:05.631651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-07-11T01:37:42.666395Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:b4a0495a349e1f4fdc416b217e4012941b94f3d9b68fe8dddd013f9dcbedf6f2","observation_id":"79ac2412-2d6f-42c6-b198-7b381d400692","resolution":{"observed_at":"2026-05-17T20:30:11.751114Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ministral-8b-instruct-2410 model card","venue":null,"work_id":"6e0eaad8-c190-4e26-bf85-324b568cb516","year":2024},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:92d1668a514325172581189f208b1d959b40acf6a22a5ca57b8f9a3602bb851f","observation_id":"bd0d3745-0d29-4e4f-b4ab-99c548b7221d","resolution":{"observed_at":"2026-05-17T20:32:05.636187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":"2310.06825","doi":"10.48550/arxiv.2310.06825","metadata_source":"pith","pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-07-10T14:47:14.537301Z","title":"Mistral 7B","venue":"cs.CL","work_id":"eb5e1305-ad11-4875-ad8d-ad8b8f697599","year":2023},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:0390b846094c40c1e6a085c7fb3a72465d7c1dfeacc94c0c1bf95119cb4a1623","observation_id":"1eb8a53c-45f6-4076-b224-cb1d80a8e7b5","resolution":{"observed_at":"2026-05-17T20:30:11.734593Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":"2401.04088","doi":"10.48550/arxiv.2401.04088","metadata_source":"pith","pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-07-11T03:27:47.028679Z","title":"Mixtral of Experts","venue":"cs.LG","work_id":"0de8c352-9daa-4e1e-8c7b-3d0dec69f369","year":2024},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:46ddbd26150fa843d630e3eec9d0733d057a7bc5e35632cae3280d797c94835e","observation_id":"25a73da2-530c-4daa-ab37-c870c76670f1","resolution":{"observed_at":"2026-05-17T20:30:11.696061Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18510","last_updated":"2024-06-26T17:31:22Z","snapshot_observed_at":"2026-07-06T18:37:26.588451Z","submitted_at":"2024-06-26T17:31:22Z","title":"WildTeaming at Scale: From In-the-Wild Jailbreaks to (Adversarially) Safer Language Models","version":1},"cited_work":{"arxiv_id":"2406.18510","doi":"10.48550/arxiv.2406.18510","metadata_source":"pith","pith_arxiv_id":"2406.18510","snapshot_observed_at":"2026-07-10T15:37:20.409076Z","title":"Wildteaming at scale: From in-the-wild jailbreaks to (adversarially) safer language models","venue":"cs.CL","work_id":"e435e1d0-3a48-4281-9add-80b0725037b7","year":2024},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2406.18510","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:deedfd2d4a2505b42e48509053387e4b88235d2024cb3dec341230c7c0fec812","observation_id":"1b81dfbf-c725-44ca-b6bf-bb259fa14fd8","resolution":{"observed_at":"2026-05-17T20:30:11.690062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14744","last_updated":"2025-06-23T06:11:32Z","snapshot_observed_at":"2026-07-06T20:39:57.316580Z","submitted_at":"2025-02-20T17:14:34Z","title":"HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States","version":4},"cited_work":{"arxiv_id":"2502.14744","doi":"10.48550/arxiv.2502.14744","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.14744","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"doi:10.48550/arXiv.2502.14744 , abstract =","venue":null,"work_id":"4d6f7ddf-c9fe-4735-9fbd-61213ae88b45","year":2025},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2502.14744","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:6f452c11affc7dadc2e85a1ee877fffa439805f88a623053113c6f1ac59f9ebc","observation_id":"ca1cfab4-bcff-43a4-87ba-f32f77a1ec62","resolution":{"observed_at":"2026-05-17T20:30:11.638926Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.03343","doi":"10.48550/arxiv.2411.03343","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"What Features in Prompts Jailbreak LLMs ? Investigating the Mechanisms Behind Attacks , May 2025","venue":null,"work_id":"fc4fc113-6d12-4a9a-b646-ddbb250ded0a","year":2025},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:f3b672c847dd5bd55660a88fc53630e28f304be7937089d31ae74211a3c3c60c","observation_id":"70b657d8-d71f-47a7-bc9c-175570f96ead","resolution":{"observed_at":"2026-05-17T20:30:11.693163Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03218","last_updated":"2024-05-15T19:16:09Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:59:35Z","title":"The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning","version":7},"cited_work":{"arxiv_id":"2403.03218","doi":"10.48550/arxiv.2403.03218","metadata_source":"pith","pith_arxiv_id":"2403.03218","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning","venue":"cs.LG","work_id":"d05f8523-8089-4fdb-9c07-463952166528","year":2024},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2403.03218","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:34080e57891f951a6dbda8008d9e95f9117f70b81b6936a96cafd85c5b9f7a42","observation_id":"92aa5abd-c7f2-492e-b7c8-0e560de0b304","resolution":{"observed_at":"2026-05-17T20:30:11.702463Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:22.693969+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:22.693969+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simple probes can catch sleeper agents, April 2024","venue":null,"work_id":"97d15bb3-5046-48f1-ae72-69757d58dcb7","year":2024},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:a91c5a2889d63469227716abb1e08733de44ed8ea7b2f251986537b87e96c489","observation_id":"3a8746ac-936c-4f88-acec-c7b24dccc6ad","resolution":{"observed_at":"2026-05-17T20:32:05.628778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":"2402.04249","doi":"10.48550/arxiv.2402.04249","metadata_source":"pith","pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-07-10T15:27:20.028353Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","venue":"cs.LG","work_id":"b0b0303f-2444-4789-a979-8153624312ff","year":2024},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:2d2b410340f4955a62c88a0094a66a548711ebeb8144bdaa8e8694ac3b3d7c7e","observation_id":"e24a5014-e9cf-435f-93f7-3f24e5e0918a","resolution":{"observed_at":"2026-05-17T20:30:11.668116Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.10805","doi":"10.48550/arxiv.2506.10805","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Detecting","venue":null,"work_id":"3b6b435c-607c-4040-b2ab-4e0fb2c5f72b","year":2025},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:9a62cd6a8b25d586681912f198809db6054b1fc7621d90c8bd58594b9364d0c0","observation_id":"ca924539-86f7-4c76-a6dd-40580c9414ac","resolution":{"observed_at":"2026-05-17T20:30:11.713833Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama 3.2: Revolutionizing edge ai and vision (connect 2024)","venue":null,"work_id":"427dae03-b97f-44f1-a605-8a7952184ba2","year":2024},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:448c0017403c92fff92b58dc5017735473ec1341d122f2be1b4ba444400b1870","observation_id":"fefb9d7f-eb7c-40cd-a25d-02dd83fb947e","resolution":{"observed_at":"2026-05-17T20:32:05.638155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01786","last_updated":"2025-07-09T08:46:58Z","snapshot_observed_at":"2026-07-06T21:51:10.033007Z","submitted_at":"2025-07-02T15:12:43Z","title":"Probing and Steering Evaluation Awareness of Language Models","version":2},"cited_work":{"arxiv_id":"2507.01786","doi":"10.48550/arxiv.2507.01786","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Probing and","venue":null,"work_id":"d9b3faf6-46cb-4e37-aef5-c67c4687b4d8","year":2025},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2507.01786","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:92ee91e6d79a83a08f5cd357c43a98016957f89d2b3cc6eb6af6f843044190d4","observation_id":"d7c3d801-dbdc-4dd5-9ac4-4c72dc6b0793","resolution":{"observed_at":"2026-05-17T20:30:11.674796Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-5 system card","venue":null,"work_id":"eb4a7c76-5111-4c6d-ba93-3cd852c79049","year":2025},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:eed89cbe6c809aa48b293dfe60f363377312ebc2327f8fd52c52120252022190","observation_id":"01f125d5-1082-46f1-b19c-2b2f1616d802","resolution":{"observed_at":"2026-05-17T20:32:05.626578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.12691","doi":"10.48550/arxiv.2507.12691","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Benchmarking","venue":null,"work_id":"05a066d3-98df-43f0-8d74-bcc8aedaf5b6","year":2025},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:c8942fd7baba546104e3bc0aec18439c02e957147bb9a59450f1b47c0962b9e6","observation_id":"af0a14e1-a378-45be-91e4-1e257955858b","resolution":{"observed_at":"2026-05-17T20:30:11.748270Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:d4fb0caf712b38a5524c76fc565ca77b373792dd52da562ad5708b250200e140","observation_id":"ef8021db-546e-45e2-a846-846b8b0e1d7e","resolution":{"observed_at":"2026-05-17T20:30:11.671475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Coup probes: Catching catastrophes with probes trained off-policy, November 2023","venue":null,"work_id":"f1d8754f-b601-4a09-946a-09e8f18b31fb","year":2023},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:d1b2a0557767eb27bac45fa634bdc6c9c91d4ce7d433820bf73873c1fb607935","observation_id":"3079e435-eeb2-4085-b96d-83efcdc32f64","resolution":{"observed_at":"2026-05-17T20:32:05.624238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07590","last_updated":"2024-07-15T08:51:52Z","snapshot_observed_at":"2026-07-06T16:46:57.403995Z","submitted_at":"2023-11-09T17:12:44Z","title":"Large Language Models can Strategically Deceive their Users when Put Under Pressure","version":4},"cited_work":{"arxiv_id":"2311.07590","doi":"10.48550/arxiv.2311.07590","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.07590","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Large Language Models can Strategically Deceive their Users when Put Under Pressure , url =","venue":null,"work_id":"3e028505-9578-4597-baf3-0a871f478f3a","year":2024},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2311.07590","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:d666ab313686f776f23571c0f3760d387b6ee483b023c1067f1c19748f28b099","observation_id":"7ae73266-38ec-4e72-9fd0-ace740a1501b","resolution":{"observed_at":"2026-05-17T20:30:11.706210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.15541","doi":"10.48550/arxiv.2509.15541","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Stress Testing Deliberative Alignment for Anti-Scheming Training , url =","venue":null,"work_id":"c7e5c203-4279-4bcc-9d8f-65ca27bb5dd4","year":2025},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:209b06c7a29fa363b97aa5ea74e16bfbca9710df5a0921e8e3cd66b6042b7c4e","observation_id":"9d2b4a8a-7ebf-4385-9d97-733ebfd00c4b","resolution":{"observed_at":"2026-05-17T20:30:11.661669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:38.241743+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:38.241743+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13548","last_updated":"2025-05-10T07:10:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-20T14:46:48Z","title":"Towards Understanding Sycophancy in Language Models","version":4},"cited_work":{"arxiv_id":"2310.13548","doi":"10.48550/arxiv.2310.13548","metadata_source":"pith","pith_arxiv_id":"2310.13548","snapshot_observed_at":"2026-07-10T18:47:31.495616Z","title":"Towards Understanding Sycophancy in Language Models","venue":"cs.CL","work_id":"aeefec9a-6ad5-4743-92b9-de6983895e21","year":2023},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2310.13548","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:434f462e96b91284b352cc5a4e4b394c4b32af17993de6a037c94ab9ac2142c4","observation_id":"c1cba9f9-b963-402d-8ddd-a3f1ccecf800","resolution":{"observed_at":"2026-05-17T20:30:11.664946Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T14:50:19.716954+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T14:50:19.716954+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18837","last_updated":"2025-01-31T01:09:32Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T01:09:32Z","title":"Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming","version":1},"cited_work":{"arxiv_id":"2501.18837","doi":"10.48550/arxiv.2501.18837","metadata_source":"pith","pith_arxiv_id":"2501.18837","snapshot_observed_at":"2026-07-10T18:47:31.449107Z","title":"Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming","venue":"cs.CL","work_id":"a2405e47-1ce4-4dfe-b7ce-5ae2a384f34b","year":2025},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2501.18837","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:8751aab6a017346e3b9958a7407612e86a1e56040f03f4579b132c2e1db85dd2","observation_id":"7f9011f4-d26a-4d53-ae5d-8758c55f0b39","resolution":{"observed_at":"2026-05-17T22:20:43.320085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:36.418865+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:36.418865+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":"2503.19786","doi":"10.1007/978-3-540-48085-3_36","metadata_source":"pith","pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Gemma 3 Technical Report","venue":"cs.CL","work_id":"f93e08bf-9e96-409b-8ac6-b8385fd17fd7","year":2025},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:97f22e07131f8ebc2c58373123acaff857122d89ecbb2aa8f3d02e43508e5cc0","observation_id":"ea023788-c5a2-4826-a689-1a9d9fcefc7f","resolution":{"observed_at":"2026-05-17T20:30:11.627465Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20271","last_updated":"2025-04-28T21:28:17Z","snapshot_observed_at":"2026-07-06T21:16:09.031481Z","submitted_at":"2025-04-28T21:28:17Z","title":"Investigating task-specific prompts and sparse autoencoders for activation monitoring","version":1},"cited_work":{"arxiv_id":"2504.20271","doi":"10.48550/arxiv.2504.20271","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.20271","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Investigating task-specific prompts and sparse autoencoders for activation monitoring , url =","venue":null,"work_id":"f6e15861-af73-413a-9222-0e001e016936","year":2025},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2504.20271","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:07673c8f1136690ef397ecea91ff8a722aaca48bc6335de0176c93dab61c4f63","observation_id":"13e64531-f004-44ad-ad14-43ff8a01c0cc","resolution":{"observed_at":"2026-05-17T20:30:11.699412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12833","last_updated":"2021-07-27T14:22:44Z","snapshot_observed_at":"2026-08-02T19:53:19.198113Z","submitted_at":"2021-02-25T13:18:32Z","title":"Diffusion Earth Mover's Distance and Distribution Embeddings","version":2},"cited_work":{"arxiv_id":"2102.12833","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.12833","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion earth mover's distance and distribution embeddings","venue":null,"work_id":"92f7def1-d987-47ba-a326-63d5ab4e451a","year":2021},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2102.12833","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:c122e9aec2bf5090ca654714924a8f4973723c2f1431dced275dedcdaa0dac26","observation_id":"cc3be326-0d17-47e5-a29b-fbdb71077bad","resolution":{"observed_at":"2026-05-17T20:30:11.655190Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02483","last_updated":"2023-07-05T17:58:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-05T17:58:10Z","title":"Jailbroken: How Does LLM Safety Training Fail?","version":1},"cited_work":{"arxiv_id":"2307.02483","doi":"10.48550/arxiv.2307.02483","metadata_source":"pith","pith_arxiv_id":"2307.02483","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Jailbroken: How Does LLM Safety Training Fail?","venue":"cs.LG","work_id":"a0b5df13-7a81-4b15-afb4-c715e6b400bc","year":2023},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2307.02483","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:18461e8b2cc1f1631a211eee762c7a1af15739510a47a8974d5ebdfe9ecd60c4","observation_id":"fe206e23-4a62-4278-9380-06c4394ddcae","resolution":{"observed_at":"2026-05-17T20:30:11.651388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:25.377799+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:25.377799+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07358","last_updated":"2025-02-06T20:58:43Z","snapshot_observed_at":"2026-07-06T18:29:00.001236Z","submitted_at":"2024-06-11T15:26:57Z","title":"AI Sandbagging: Language Models can Strategically Underperform on Evaluations","version":4},"cited_work":{"arxiv_id":"2406.07358","doi":"10.48550/arxiv.2406.07358","metadata_source":"pith","pith_arxiv_id":"2406.07358","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"and Ward, Francis Rhys , month = feb, year =","venue":"cs.AI","work_id":"37d1dcb3-68ff-43ea-b3da-cb0a4bb30284","year":2024},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2406.07358","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:face438af95d4f835ce9d216d2b4422cd6054f213e393022b01c1dcc72437b13","observation_id":"f1888f08-cb37-4685-97a3-ca519fe7e19f","resolution":{"observed_at":"2026-05-17T20:30:11.658351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-15T10:50:06.12198+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T10:50:06.12198+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12822","last_updated":"2024-12-08T04:06:53Z","snapshot_observed_at":"2026-07-06T19:18:12.969683Z","submitted_at":"2024-09-19T14:50:34Z","title":"Language Models Learn to Mislead Humans via RLHF","version":3},"cited_work":{"arxiv_id":"2409.12822","doi":"10.48550/arxiv.2409.12822","metadata_source":"pith","pith_arxiv_id":"2409.12822","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Language models learn to mislead humans via rlhf","venue":"cs.CL","work_id":"4e7ac831-1344-4b1d-910b-7698f7d1c019","year":2024},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2409.12822","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:c13a9ab4620a3776e957e74892ae841f85a4d97994a4bca579d86930822993f2","observation_id":"9503af87-6367-4937-aa1b-b0679ca36d34","resolution":{"observed_at":"2026-05-17T20:30:11.646597Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:82086916ce102ccd59d6e908ca1590ebedd6a10585ed5be65ea35b92edca0644","observation_id":"42fce047-3444-4496-ace5-7163134d68ad","resolution":{"observed_at":"2026-05-17T20:30:11.642685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14026","last_updated":"2025-03-20T20:41:32Z","snapshot_observed_at":"2026-08-03T20:07:46.456695Z","submitted_at":"2024-09-21T05:58:07Z","title":"Uncovering Latent Chain of Thought Vectors in Language Models","version":3},"cited_work":{"arxiv_id":"2409.14026","doi":"10.48550/arxiv.2409.14026","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14026","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv:2409.14026 [cs]","venue":null,"work_id":"bb06c4a9-3fee-41b3-868f-212707c2715f","year":2025},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2409.14026","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:6043e92830930a1e84c524c08ad1929c11c84782158e95e7917d529efd998c6f","observation_id":"242bea42-9b0c-4cb5-a049-7ed2e177a98a","resolution":{"observed_at":"2026-05-17T20:30:11.727486Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":"2310.01405","doi":"10.1609/aaai.v36i9.21196","metadata_source":"pith","pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","venue":"cs.LG","work_id":"45b326e2-e962-41a5-a542-2559e103a19b","year":2023},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:7996331c4a46b6af5c18d276b48a83df8e082207e2fe070a834f964099c94f1e","observation_id":"d506ccca-0558-4d99-a37f-5f0ee8994d3b","resolution":{"observed_at":"2026-05-17T20:30:11.744338Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","latest_version":4,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T14:39:39.386350Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":13,"parse_uncertain":0,"unresolved":0,"verified_exact":25,"verified_fuzzy":7},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2511.17408."}