{"as_of":"2026-08-07T17:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:25a43f32f343e245a55c0f6ae8cc9160c4f6686b01c6fe794d1abeb0a9d912b2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":79,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:26:12.003241Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":12,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:f9c9ad301dbcac6726cf41736402c7554c23f8a829bf0aab4359737503d0610f","observation_id":"6ef9a4ad-f9b4-4eed-abe4-dde4c5d50bf1","resolution":{"observed_at":"2026-05-16T06:15:46.165967Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2503.02574","last_updated":"2026-05-18T17:54:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-04T12:55:07Z","title":"LLM-Safety Evaluations Lack Robustness","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T01:26:45.402983Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2503.02574"},"observation_digest":"sha256:b2c1c169e2e92333a3a249890ebb552b261a5e2576531dfbcf366fb485defef6","observation_id":"797b4cde-8920-4277-8e1e-9c7bd552206a","resolution":{"observed_at":"2026-05-23T01:27:21.396795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-21T07:24:12.845841Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2503.11926"},"observation_digest":"sha256:7ff7ceaad6259ef4d1a50f28b7286e3b0a736103321c746fd38193baed0e6478","observation_id":"b5cb668e-a047-436e-8f98-c11c3d112395","resolution":{"observed_at":"2026-05-21T07:24:12.967449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T15:26:12.003241Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15242","last_updated":"2025-05-22T06:10:20Z","snapshot_observed_at":"2026-08-07T15:19:11.447714Z","submitted_at":"2025-05-21T08:18:41Z","title":"Adaptive Plan-Execute Framework for Smart Contract Security Auditing","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:26:12.003241Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.15242"},"observation_digest":"sha256:02698eceba8602f536a3922d56222966e1bbd45038612ff47dfe161d8f740076","observation_id":"736ec2ca-2f0d-4f7a-a40b-c03748cba596","resolution":{"observed_at":"2026-08-07T15:26:12.003241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T14:32:29.074711Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T14:27:20.977237Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:29.074711Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:a096d85fe2f5bc3e69c7e47245707f4df32137ea51d593a2da67246a13964b2d","observation_id":"a2b84897-36d2-4d2b-84ef-9eaac98ee83e","resolution":{"observed_at":"2026-08-07T14:32:29.074711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T14:27:03.474448Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.474448Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:90db0d78c9629d09e45ef67c8ba25dbc7002353372526644af4fddb90a874fe0","observation_id":"428190b1-bbfa-4d5d-bc45-1d9bbdbd8c59","resolution":{"observed_at":"2026-08-07T14:27:03.474448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T14:13:54.133916Z","title":"Deliberative alignment: Reasoning enables safer language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-07T14:05:59.333561Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:54.133916Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:c6de973763dc200e54b348ddbf893588270911072efbd59890cdd771218e75d9","observation_id":"7c674e3d-7334-4773-91d8-1318731fe9a6","resolution":{"observed_at":"2026-08-07T14:13:54.133916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T14:00:05.091365Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:05.091365Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:4b7b6b04aabf4ff6a2f51e7110beb056ff738326375af88ca4ea57541bcf085f","observation_id":"45941abb-072d-4929-8b1a-afb08a0d0b05","resolution":{"observed_at":"2026-08-07T14:00:05.091365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T12:45:30.366747Z","title":"Deliberative alignment: Reasoning enables safer language models.arXiv preprint CoRR, abs/2412.16339, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23646","last_updated":"2025-05-29T16:53:41Z","snapshot_observed_at":"2026-08-07T12:38:52.756749Z","submitted_at":"2025-05-29T16:53:41Z","title":"Are Reasoning Models More Prone to Hallucination?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:30.366747Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.23646"},"observation_digest":"sha256:4b5a89d3b962ee5e509cc3577e2cf5df64d74d807206b28dcce40bfd51b9d42f","observation_id":"a3316b4b-0177-4d54-a433-db6f8f99dade","resolution":{"observed_at":"2026-08-07T12:45:30.366747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T12:45:25.860418Z","title":"Y., Joglekar, M., Wallace, E., Jain, S., Barak, B., Helyar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T12:35:18.922739Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:25.860418Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:ae61901bf909cbb532e79cce122ba5a7ee5bfe55afbece1bcb04a4365b3722ec","observation_id":"73fccd74-5a99-4ea2-acf7-9c161fd76513","resolution":{"observed_at":"2026-08-07T12:45:25.860418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T12:40:18.665783Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24119","last_updated":"2025-05-30T01:32:44Z","snapshot_observed_at":"2026-08-07T12:32:02.074409Z","submitted_at":"2025-05-30T01:32:44Z","title":"The State of Multilingual LLM Safety Research: From Measuring the Language Gap to Mitigating It","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:18.665783Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.24119"},"observation_digest":"sha256:9b0286c84db38dabdf6cb7c17da07532e3b0a94cacab0137649d27e2f5d1bbb4","observation_id":"87506f66-df2f-47ce-a3e4-7b48fdf1c126","resolution":{"observed_at":"2026-08-07T12:40:18.665783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T12:13:21.052638Z","title":"https://arxiv.org/abs/2412.16339","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00242","last_updated":"2025-05-30T21:16:25Z","snapshot_observed_at":"2026-08-07T12:07:09.597904Z","submitted_at":"2025-05-30T21:16:25Z","title":"Whispers of Many Shores: Cultural Alignment through Collaborative Cultural Expertise","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:13:21.052638Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2506.00242"},"observation_digest":"sha256:c4924e658c9c6ac05b14d3d238258a3e8c4ba3b59a398ec725afa62ceb8e71ee","observation_id":"0764566c-4bae-4790-a32f-5248f95636f0","resolution":{"observed_at":"2026-08-07T12:13:21.052638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T12:14:26.266557Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00307","last_updated":"2025-08-20T23:19:57Z","snapshot_observed_at":"2026-08-07T16:06:15.633861Z","submitted_at":"2025-05-30T23:32:57Z","title":"Lossless Token Sequence Compression via Meta-Tokens","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:14:26.266557Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2506.00307"},"observation_digest":"sha256:899c265b0564df2e0d16577f4e2d81ae3da467434fc233b0f27fcc4149a93a6b","observation_id":"9d95336f-2acc-4672-83ab-f461671f1728","resolution":{"observed_at":"2026-08-07T12:14:26.266557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T12:10:30.276451Z","title":"InProceedings of the 17th International Conference on Mining Software Repositories, MSR ’20, page 508–512, New York, NY , USA","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00419","last_updated":"2025-09-10T16:01:21Z","snapshot_observed_at":"2026-08-07T12:03:26.790475Z","submitted_at":"2025-05-31T06:48:12Z","title":"Teaching an Old LLM Secure Coding: Localized Preference Optimization on Distilled Preferences","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T12:10:30.276451Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2506.00419"},"observation_digest":"sha256:db4679526ec0f481312ea62e3e1be56b9a8154901059c7eabc8c37cb1b187425","observation_id":"0573b213-1033-4801-bd25-b42495bbc261","resolution":{"observed_at":"2026-08-07T12:10:30.276451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T12:11:19.235153Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05376","last_updated":"2025-06-09T05:48:22Z","snapshot_observed_at":"2026-08-07T12:39:09.825243Z","submitted_at":"2025-05-30T22:58:54Z","title":"A Red Teaming Roadmap Towards System-Level Safety","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:19.235153Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2506.05376"},"observation_digest":"sha256:e2add3c88f3e33fd1942ff4127be00984ecc36e5f666ec6eb00ae78cf088ee25","observation_id":"567b6b7a-433b-4046-8802-41b02ea292ce","resolution":{"observed_at":"2026-08-07T12:11:19.235153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T05:19:00.051825Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08399","last_updated":"2025-06-11T06:57:37Z","snapshot_observed_at":"2026-08-07T05:09:47.707278Z","submitted_at":"2025-06-10T03:13:50Z","title":"SafeCoT: Improving VLM Safety with Minimal Reasoning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:19:00.051825Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2506.08399"},"observation_digest":"sha256:344f8d84bb9e6881f43d2f1fa27b37d424387b99af6df0134b0ad158529bd8ed","observation_id":"d690aabc-7d87-4f24-929f-34c3c953e1ee","resolution":{"observed_at":"2026-08-07T05:19:00.051825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T01:02:28.553458Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12274","last_updated":"2025-06-13T23:03:11Z","snapshot_observed_at":"2026-08-07T00:52:06.958006Z","submitted_at":"2025-06-13T23:03:11Z","title":"InfoFlood: Jailbreaking Large Language Models with Information Overload","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T01:02:28.553458Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2506.12274"},"observation_digest":"sha256:e008cbc240234e7e801781075f461d5b1f18dc3363017d2aa4159af376d783bd","observation_id":"a952a564-86e3-4215-84b1-0e5002fc8b9b","resolution":{"observed_at":"2026-08-07T01:02:28.553458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T00:15:00.611082Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14922","last_updated":"2025-06-24T19:55:23Z","snapshot_observed_at":"2026-08-07T04:49:42.432527Z","submitted_at":"2025-06-17T19:08:02Z","title":"FORTRESS: Frontier Risk Evaluation for National Security and Public Safety","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:00.611082Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2506.14922"},"observation_digest":"sha256:24720616b1082fdc6e83e094ba7540b313db49bb53b479e50c807d80ec683c65","observation_id":"f2513c89-8d5f-42a1-a973-4811b3530d72","resolution":{"observed_at":"2026-08-07T00:15:00.611082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T21:50:24.108617Z","title":"Y., Joglekar, M., Wallace, E., Jain, S., Barak, B., Helyar, A., Dias, R., Vallone, A., Ren, H., Wei, J., Chung, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.108617Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:adc237ec8b103ac145c02f47838fd42cc8f61569753c99cc4a679741e4afa1ec","observation_id":"d78fe336-7b68-4781-a6de-0a99ff02065d","resolution":{"observed_at":"2026-08-06T21:50:24.108617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T18:47:19.985383Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07441","last_updated":"2025-08-20T22:10:48Z","snapshot_observed_at":"2026-08-06T18:38:28.555846Z","submitted_at":"2025-07-10T05:38:15Z","title":"SAND: Boosting LLM Agents with Self-Taught Action Deliberation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:47:19.985383Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2507.07441"},"observation_digest":"sha256:f7c0a664ea097b166ed49f48ed36e2fb2e9c77a8f6b5cd02f62c5ced5c5c7d1a","observation_id":"e922bb64-c738-4675-aed0-39776862d27a","resolution":{"observed_at":"2026-08-06T18:47:19.985383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T00:23:17.986195Z","title":"Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shi- rong Ma, Peiyi Wang, Xiao Bi, and 1 others","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08806","last_updated":"2025-06-17T06:04:01Z","snapshot_observed_at":"2026-08-07T11:41:33.046626Z","submitted_at":"2025-06-17T06:04:01Z","title":"Think Clearly: Improving Reasoning via Redundant Token Pruning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:17.986195Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2507.08806"},"observation_digest":"sha256:8d8d6811d21ce39a11600499f6b7bd53c53fe41bd91a8c0c23f6d5400463a7ac","observation_id":"209be614-bf2f-4e4a-8152-18d0bb36ce4b","resolution":{"observed_at":"2026-08-07T00:23:17.986195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T15:53:17.551777Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14805","last_updated":"2025-07-20T03:51:13Z","snapshot_observed_at":"2026-08-07T11:42:09.990444Z","submitted_at":"2025-07-20T03:51:13Z","title":"Subliminal Learning: Language models transmit behavioral traits via hidden signals in data","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T15:53:17.551777Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2507.14805"},"observation_digest":"sha256:65da1622f678e89ba42970259f96d5d389337ad95ffb51c1cdc8f8b6eba8f910","observation_id":"efeff014-0da3-4387-89e2-6fc3a28658e7","resolution":{"observed_at":"2026-08-06T15:53:17.551777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T15:48:01.386002Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-06T15:41:01.200040Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.386002Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:1028c43dbbdfd95cfa1dd06ef2ad7d30ef5b79950e6419fd54accfc491d17c68","observation_id":"449e52f3-1076-4415-b5b0-64a3b80315c0","resolution":{"observed_at":"2026-08-06T15:48:01.386002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T14:13:07.297537Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19672","last_updated":"2025-07-25T20:52:58Z","snapshot_observed_at":"2026-08-07T12:02:14.124506Z","submitted_at":"2025-07-25T20:52:58Z","title":"Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges","version":1},"reference_index":283,"source":"arxiv_source","source_observed_at":"2026-08-06T14:13:07.297537Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2507.19672"},"observation_digest":"sha256:26dc42d036ab9a06b022bd1998283c3677264cbea2c0ac138ebd337d43a728c6","observation_id":"415de428-35f3-4565-9940-7ce12511a372","resolution":{"observed_at":"2026-08-06T14:13:07.297537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T12:17:38.663630Z","title":"arXiv preprint arXiv:2412.16339 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21929","last_updated":"2025-07-29T15:45:50Z","snapshot_observed_at":"2026-08-06T12:17:38.344060Z","submitted_at":"2025-07-29T15:45:50Z","title":"Libra: Large Chinese-based Safeguard for AI Content","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:17:38.663630Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2507.21929"},"observation_digest":"sha256:01f0cd847b736446fe8fce1ebd15dec23c27a15a286b047a5c775b2c725d8b7a","observation_id":"7b23d923-fb9a-45b2-9e6d-cf79ef6937c9","resolution":{"observed_at":"2026-08-06T12:17:38.663630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T10:18:24.466989Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00324","last_updated":"2025-08-01T05:14:13Z","snapshot_observed_at":"2026-08-07T06:44:51.882467Z","submitted_at":"2025-08-01T05:14:13Z","title":"R1-ACT: Efficient Reasoning Model Safety Alignment by Activating Safety Knowledge","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T10:18:24.466989Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2508.00324"},"observation_digest":"sha256:d258435cea5524acdf98d9dbace9ca068fc4efd5e518ee2a5c16623e155c0eba","observation_id":"a5a3d952-e6d6-49f3-a72c-8cf9204b488b","resolution":{"observed_at":"2026-08-06T10:18:24.466989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T04:47:25.538461Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03054","last_updated":"2025-08-05T03:58:15Z","snapshot_observed_at":"2026-08-06T15:30:46.727768Z","submitted_at":"2025-08-05T03:58:15Z","title":"Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning","version":1},"reference_index":155,"source":"arxiv_source","source_observed_at":"2026-08-06T04:47:25.538461Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2508.03054"},"observation_digest":"sha256:ca606b211da6c4db0057b6fdab41cc00a1355db769720f7601d85d78d2d26e6b","observation_id":"078762c1-6d06-4376-85a0-197877d02b1d","resolution":{"observed_at":"2026-08-06T04:47:25.538461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T01:03:50.244026Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03933","last_updated":"2025-08-05T21:55:14Z","snapshot_observed_at":"2026-08-06T01:03:47.654410Z","submitted_at":"2025-08-05T21:55:14Z","title":"Towards terahertz nanomechanics","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T01:03:50.244026Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2508.03933"},"observation_digest":"sha256:e609a4278eabe0faa1a322ce8c5381c15fe62369deca4b06f089010aad52ec7f","observation_id":"ef1a2ba5-1e30-4db3-88ed-19856cf9274d","resolution":{"observed_at":"2026-08-06T01:03:50.244026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T01:04:33.591580Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03936","last_updated":"2025-08-05T21:57:52Z","snapshot_observed_at":"2026-08-06T01:04:15.739216Z","submitted_at":"2025-08-05T21:57:52Z","title":"ASTRA: Autonomous Spatial-Temporal Red-teaming for AI Software Assistants","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T01:04:33.591580Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2508.03936"},"observation_digest":"sha256:081b97ebfa6d7560f8ad9f2a7c8c1560137b098e026cdd1730b701a8e0a9914a","observation_id":"7ef559a2-84e8-49b2-81d8-62ea5359e245","resolution":{"observed_at":"2026-08-06T01:04:33.591580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T23:23:31.962576Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05432","last_updated":"2025-08-07T14:21:33Z","snapshot_observed_at":"2026-08-06T11:13:03.566935Z","submitted_at":"2025-08-07T14:21:33Z","title":"Whose Truth? Pluralistic Geo-Alignment for (Agentic) AI","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T23:23:31.962576Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2508.05432"},"observation_digest":"sha256:7b2b3b545a8413cc6544d6d23c89c37eb8b7e20ae684c4b51e8edb5e93a820a4","observation_id":"a1c86dd5-b54c-4c70-b9d3-856187e3ec0a","resolution":{"observed_at":"2026-08-05T23:23:31.962576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T12:22:54.633089Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2508.10925"},"observation_digest":"sha256:b52e865989be4a0414e00ee2f735efe4fe5ffef537998b8f6469c0aa2bcbfcbb","observation_id":"11e7454a-7858-43d9-98a1-03d479d9b806","resolution":{"observed_at":"2026-05-10T12:22:54.679028Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T15:20:14.188064Z","title":"arXiv preprint arXiv:2412.16339","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20151","last_updated":"2025-08-27T16:47:31Z","snapshot_observed_at":"2026-08-05T15:20:13.280384Z","submitted_at":"2025-08-27T16:47:31Z","title":"IntentionReasoner: Facilitating Adaptive LLM Safeguards through Intent Reasoning and Selective Query Refinement","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:20:14.188064Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2508.20151"},"observation_digest":"sha256:33f3102f4f472d66371c5088289f6f45f10eded4702d47c1f14a86ad714b7464","observation_id":"80137bcd-470a-400a-b79a-4e705dcc8b32","resolution":{"observed_at":"2026-08-05T15:20:14.188064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T12:52:54.701047Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01186","last_updated":"2025-09-01T07:10:22Z","snapshot_observed_at":"2026-08-07T17:53:55.167768Z","submitted_at":"2025-09-01T07:10:22Z","title":"Statutory Construction and Interpretation for Artificial Intelligence","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:54.701047Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2509.01186"},"observation_digest":"sha256:07b902ee4a00af5c482a3caf0073b3d89e6642b7b13b5b9514250a91f7f60eba","observation_id":"73b85185-a26e-4f6f-abc8-c828b1299b94","resolution":{"observed_at":"2026-08-05T12:52:54.701047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T10:39:07.027988Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-06T11:50:02.157285Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":152,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:07.027988Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:4495c56912a13385b20985084293a5594d87a508509499d851cd4da8d248d627","observation_id":"717369dd-b535-4414-a90e-5ed197e818ed","resolution":{"observed_at":"2026-08-05T10:39:07.027988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2509.05367","last_updated":"2026-05-30T08:23:37Z","snapshot_observed_at":"2026-08-05T10:36:13.650340Z","submitted_at":"2025-09-04T05:53:20Z","title":"Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T19:36:23.882344Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2509.05367"},"observation_digest":"sha256:03630241642c2d1d4a54b54928c9bf630a2da97c344ca3d91653bd638fbb739c","observation_id":"f910b908-634e-4eb7-8108-e78f6441d5d2","resolution":{"observed_at":"2026-05-18T19:36:47.435169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T10:36:15.617560Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05367","last_updated":"2026-05-30T08:23:37Z","snapshot_observed_at":"2026-08-05T10:36:13.650340Z","submitted_at":"2025-09-04T05:53:20Z","title":"Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:15.617560Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2509.05367"},"observation_digest":"sha256:4424bd2892e1fe1db207fdcd5aa99613cdd8eb6e52ef4a148d58d8f7b3719cca","observation_id":"812cb2d2-f762-48b8-92ff-288ab0b62199","resolution":{"observed_at":"2026-08-05T10:36:15.617560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-04T14:43:49.835349Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23694","last_updated":"2026-06-03T04:13:57Z","snapshot_observed_at":"2026-08-04T14:43:33.365212Z","submitted_at":"2025-09-28T07:05:17Z","title":"SafeSearch: Automated Red-Teaming of LLM-Based Search Agents","version":6},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:49.835349Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2509.23694"},"observation_digest":"sha256:39c5a51de02632b004da06c2a88a81cc267ced2203f648c3e03b543ab733b97f","observation_id":"7661fd46-165e-4792-9ccc-10ba8412cae6","resolution":{"observed_at":"2026-08-04T14:43:49.835349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-04T07:07:52.834565Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.04694","last_updated":"2026-07-01T16:09:28Z","snapshot_observed_at":"2026-08-04T07:07:51.334462Z","submitted_at":"2025-10-30T22:13:31Z","title":"Reasoning Up the Instruction Ladder for Controllable Language Models","version":5},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T07:07:52.834565Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2511.04694"},"observation_digest":"sha256:d25b7e39f8c250625e70f437144a3a9eb074bf94ffbfe13a5d58895758ecb1b4","observation_id":"ce52139d-2018-4134-8251-1252b0e2ce92","resolution":{"observed_at":"2026-08-04T07:07:52.834565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2602.07892","last_updated":"2026-05-12T03:21:50Z","snapshot_observed_at":"2026-07-06T22:45:00.816348Z","submitted_at":"2026-02-08T09:53:46Z","title":"Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T06:39:17.785715Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2602.07892"},"observation_digest":"sha256:50a72ed0596826903301d12b22b772c2260483f935d38b17a614412cb0353eef","observation_id":"76760757-a24b-4d92-be01-fe907de2fc53","resolution":{"observed_at":"2026-05-16T06:40:42.343205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2603.17305","last_updated":"2026-05-19T16:22:05Z","snapshot_observed_at":"2026-07-06T22:49:28.866886Z","submitted_at":"2026-03-18T03:00:42Z","title":"Contrastive Reasoning Alignment: Reinforcement Learning from Hidden Representations","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T11:23:26.852673Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2603.17305"},"observation_digest":"sha256:fc55071b5a58d26cb4d12950d2b18b17ae36400b146b8d016f13691c8f748447","observation_id":"b26cf182-2e61-46b3-a1f3-1629fa03bffc","resolution":{"observed_at":"2026-05-21T11:24:08.445919Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2604.05339","last_updated":"2026-04-07T02:23:48Z","snapshot_observed_at":"2026-07-06T22:54:04.491386Z","submitted_at":"2026-04-07T02:23:48Z","title":"Human Values Matter: Investigating How Misalignment Shapes Collective Behaviors in LLM Agent Communities","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T19:52:16.543718Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2604.05339"},"observation_digest":"sha256:b8b937cfc33b7f1f40758c7194e31195220c7a32f693b57917d97882fe2004cc","observation_id":"ed444e7a-71c3-4c47-a1fc-47ab4227d11f","resolution":{"observed_at":"2026-05-10T22:25:51.877085Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2604.12088","last_updated":"2026-07-30T19:39:21Z","snapshot_observed_at":"2026-08-05T23:10:35.381305Z","submitted_at":"2026-04-13T21:52:57Z","title":"Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T15:44:50.762366Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2604.12088"},"observation_digest":"sha256:731c8cb27ba4be4e83cc20a33c868f1e23aaaefb58a145b0940aeab287de7dfe","observation_id":"414ce9e4-f3f5-49b9-a2fe-8e74c4f7c7a2","resolution":{"observed_at":"2026-05-11T09:56:03.213083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-03T00:19:56.880861Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.12088","last_updated":"2026-07-30T19:39:21Z","snapshot_observed_at":"2026-08-05T23:10:35.381305Z","submitted_at":"2026-04-13T21:52:57Z","title":"Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T00:19:56.880861Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2604.12088"},"observation_digest":"sha256:3c9e594711d491985dc7fa0b89b5fb28afe40088d3f393194a470cb84e283dad","observation_id":"26d3d840-1830-414c-9e64-2f30f50431db","resolution":{"observed_at":"2026-08-03T00:19:56.880861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2604.16654","last_updated":"2026-04-21T17:02:41Z","snapshot_observed_at":"2026-08-02T19:26:51.122713Z","submitted_at":"2026-04-17T19:19:57Z","title":"IYKYK (But AI Doesn't): Automated Content Moderation Does Not Capture Communities' Heterogeneous Attitudes Towards Reclaimed Language","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T08:19:50.909364Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2604.16654"},"observation_digest":"sha256:98ba4ada47fb491fa8ede045011b8d061bef2ce0943e424f698b68449febc715","observation_id":"f5fbc12d-ebfa-4525-a4d1-a21615b3988b","resolution":{"observed_at":"2026-05-10T08:22:37.099023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2604.17596","last_updated":"2026-04-19T20:04:02Z","snapshot_observed_at":"2026-07-06T23:04:41.564912Z","submitted_at":"2026-04-19T20:04:02Z","title":"Terminal Wrench: A Dataset of 331 Reward-Hackable Environments and 3,632 Exploit Trajectories","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T05:48:44.687520Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2604.17596"},"observation_digest":"sha256:5eee59b8576ceb9e0e97230b9f77adb1ae1ba028ab7d4bda254d4e31f5c382a6","observation_id":"17fe05f8-fa6c-4f9a-957e-3e1ef5b721d5","resolution":{"observed_at":"2026-05-10T05:51:10.098655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2604.18946","last_updated":"2026-04-21T00:50:13Z","snapshot_observed_at":"2026-07-06T23:05:39.724237Z","submitted_at":"2026-04-21T00:50:13Z","title":"Reasoning Structure Matters for Safety Alignment of Reasoning Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-10T02:36:57.093584Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2604.18946"},"observation_digest":"sha256:333c3ad12c3b5c526f4cdbd9a635ae6a833b4eda8301c289a6ae9b18c84b88d3","observation_id":"27bc220b-5f2e-4b0e-8fcc-df1df3f8a7af","resolution":{"observed_at":"2026-05-11T12:56:04.339490Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2605.03900","last_updated":"2026-05-05T15:55:19Z","snapshot_observed_at":"2026-07-06T23:16:44.876986Z","submitted_at":"2026-05-05T15:55:19Z","title":"Contextual Multi-Objective Optimization: Rethinking Objectives in Frontier AI Systems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-07T16:26:04.152045Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2605.03900"},"observation_digest":"sha256:68382513793651caf236442e354c260754c065346ec83fce275c32670eb69cd7","observation_id":"c8701d36-fcba-4409-85cc-d5bb4047210b","resolution":{"observed_at":"2026-05-11T23:41:18.981416Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2605.05630","last_updated":"2026-05-12T16:52:21Z","snapshot_observed_at":"2026-08-02T19:44:06.033074Z","submitted_at":"2026-05-07T03:35:31Z","title":"One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T11:17:19.079380Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2605.05630"},"observation_digest":"sha256:44ad30a1059e3552bbf905c12f47204ac3d92fd745eaa1d4fbc967245eb17b15","observation_id":"e64a7095-35c2-462c-b0ae-e9560148d988","resolution":{"observed_at":"2026-05-11T19:41:09.007290Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2605.05630","last_updated":"2026-05-12T16:52:21Z","snapshot_observed_at":"2026-08-02T19:44:06.033074Z","submitted_at":"2026-05-07T03:35:31Z","title":"One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T07:53:06.928500Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2605.05630"},"observation_digest":"sha256:aa39fb2fb6ac62d0a09239b9eaee5361e946716a47b1b9b18999abe964a44eed","observation_id":"e132bfc6-f458-4968-bb02-2054c8aeab10","resolution":{"observed_at":"2026-05-13T07:57:31.670860Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2605.05678","last_updated":"2026-05-07T05:12:56Z","snapshot_observed_at":"2026-08-02T07:12:00.817422Z","submitted_at":"2026-05-07T05:12:56Z","title":"Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T11:49:47.994456Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2605.05678"},"observation_digest":"sha256:8975f04d2b22905e92e93f404ab7b28b6b6a24d15279b235806f55ba69e8557f","observation_id":"35d8e2ed-d827-4192-9da9-8eaedc0b0e00","resolution":{"observed_at":"2026-05-11T19:31:08.576351Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2605.08930","last_updated":"2026-05-09T13:05:00Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:05:00Z","title":"Internalizing Safety Understanding in Large Reasoning Models via Verification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T01:50:59.283409Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2605.08930"},"observation_digest":"sha256:55f75f42b444f1159950a124b483e2a7f60845dbe129c52be34ed07436beb3ac","observation_id":"479779e5-6147-404b-84aa-3e672a7f678a","resolution":{"observed_at":"2026-05-12T01:51:14.318720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2605.23565","last_updated":"2026-05-22T12:31:18Z","snapshot_observed_at":"2026-07-06T23:33:44.335185Z","submitted_at":"2026-05-22T12:31:18Z","title":"Understanding Goal Generalisation in Sequential Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-25T04:49:50.034743Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2605.23565"},"observation_digest":"sha256:b96c83da545904c6f6221054d2e814a7d3d60c224194ef1bb9841fc85d3fa953","observation_id":"272fc79d-4ef2-4ae5-ba07-222ec5920666","resolution":{"observed_at":"2026-05-25T04:50:20.921471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2605.24229","last_updated":"2026-05-22T21:17:16Z","snapshot_observed_at":"2026-08-07T11:18:28.951204Z","submitted_at":"2026-05-22T21:17:16Z","title":"How Well Do Models Follow Their Constitutions?","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-30T15:33:43.569710Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2605.24229"},"observation_digest":"sha256:28ac695366f34102219a5c08d83a3b4148ce46fdf16b4ed54a1cd2b4c78db345","observation_id":"7f4d29f4-5a4d-4ba7-a7c7-0bbc2ddd70f1","resolution":{"observed_at":"2026-06-30T15:34:47.874528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2605.24834","last_updated":"2026-05-24T02:58:21Z","snapshot_observed_at":"2026-07-06T23:34:52.129354Z","submitted_at":"2026-05-24T02:58:21Z","title":"Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T00:29:50.433221Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2605.24834"},"observation_digest":"sha256:db901b0706088f356fddcb6a97cfa697052b6c95c6cb7dcc9c890d217b61cb0a","observation_id":"cdfbb531-120e-466a-b884-6941277f5414","resolution":{"observed_at":"2026-07-01T16:35:50.610720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2605.28467","last_updated":"2026-05-27T13:33:26Z","snapshot_observed_at":"2026-08-05T22:05:24.662345Z","submitted_at":"2026-05-27T13:33:26Z","title":"Mitigating Adaptive Attacks against Reasoning Models with Activation Consistency Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T14:18:16.033063Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2605.28467"},"observation_digest":"sha256:4bf50797e17bf6a69e007787c065a0bf2d8d88dce96d5702371ad9e42afb0139","observation_id":"ba830e08-2ec1-429e-ba58-0d5e4ad252e6","resolution":{"observed_at":"2026-06-29T14:23:30.706723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2606.06840","last_updated":"2026-06-05T02:32:24Z","snapshot_observed_at":"2026-08-05T15:03:33.373071Z","submitted_at":"2026-06-05T02:32:24Z","title":"Characterize Then Distill: Mechanistic Reasoning in Large Output Spaces","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-06-27T22:22:52.690010Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2606.06840"},"observation_digest":"sha256:b82d196381e369e5e3d8738da84893e1e5f5d19f9c8373e470f87925a7bb43cd","observation_id":"261b5b94-bf0f-4a3a-b4cb-96c188b31576","resolution":{"observed_at":"2026-06-27T22:31:21.526096Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2606.08682","last_updated":"2026-06-07T15:34:59Z","snapshot_observed_at":"2026-08-06T16:55:07.383031Z","submitted_at":"2026-06-07T15:34:59Z","title":"Activation Steering Induces Emergent Misalignment: A More Comprehensive Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T18:35:21.388956Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2606.08682"},"observation_digest":"sha256:37afd6d61eb536b6553e67ff698c893a1b8174da55526e81d15a40c0f9c3d7a8","observation_id":"9967d366-91e4-4062-8624-8761f1e45cc6","resolution":{"observed_at":"2026-07-02T22:57:26.124147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":244,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:8095bed3b7213f3e03a28b31ce4bc8c3f2e83ece05387a0b85ea5c1fa7afc9b5","observation_id":"0a3bd05e-3e5b-42b0-866e-0586952688a2","resolution":{"observed_at":"2026-07-03T01:37:30.453603Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2606.15531","last_updated":"2026-06-16T14:29:31Z","snapshot_observed_at":"2026-08-01T19:11:56.873454Z","submitted_at":"2026-06-14T01:18:53Z","title":"Greedy Coordinate Diffusion: Effective and Semantically Coherent Adversarial Attacks via Diffusion Guidance","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T04:35:35.594085Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2606.15531"},"observation_digest":"sha256:2392d68bc66d69cb5bf2f8bac338243dff2983b4167e79d477eebde1e6744bce","observation_id":"bd46bb0c-007c-4699-a9ec-b322b81061fc","resolution":{"observed_at":"2026-07-03T17:08:43.430699Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2606.20470","last_updated":"2026-06-26T21:12:34Z","snapshot_observed_at":"2026-08-06T05:00:49.716669Z","submitted_at":"2026-06-18T16:50:28Z","title":"Analyzing Defensive Misdirection Against Model-Guided Automated Attacks on Agentic AI Systems","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T17:04:38.863201Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2606.20470"},"observation_digest":"sha256:2fc9a0463d689550c5963cd17f19c136a28435c3793dd1f6eef16abbdbd31287","observation_id":"adb4d015-68ac-43f9-bbdb-4708714ccbe5","resolution":{"observed_at":"2026-07-04T04:19:34.767260Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2606.20470","last_updated":"2026-06-26T21:12:34Z","snapshot_observed_at":"2026-08-06T05:00:49.716669Z","submitted_at":"2026-06-18T16:50:28Z","title":"Analyzing Defensive Misdirection Against Model-Guided Automated Attacks on Agentic AI Systems","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T10:30:03.047181Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2606.20470"},"observation_digest":"sha256:d18d71304eb5e9c3b1d9bcc79db847e219936055a9e09dfdbf26f18f9bf40356","observation_id":"043c0c62-8bf8-42ae-b1ee-ea97acc3187d","resolution":{"observed_at":"2026-06-30T10:34:36.560267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2606.25013","last_updated":"2026-06-23T17:59:01Z","snapshot_observed_at":"2026-08-03T16:39:59.297765Z","submitted_at":"2026-06-23T17:59:01Z","title":"Do Thinking Tokens Help with Safety?","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-25T23:37:49.412578Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2606.25013"},"observation_digest":"sha256:3ca4db3d27df4b87384dc0868bec0caf38c67895b28fe1bec689136a8920bb0f","observation_id":"125b2c5f-13ce-4795-8bb9-9e81e6ad67a1","resolution":{"observed_at":"2026-07-04T17:30:00.639214Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-08-07T08:27:53.838717Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:7c782fff7a33483a3e7875fd9c932871aca44d20a296fe383965fc9e8d6c7f31","observation_id":"8e26d784-e1d1-4784-a47d-feedb03f575d","resolution":{"observed_at":"2026-07-04T19:40:06.722457Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2606.28739","last_updated":"2026-06-27T05:26:43Z","snapshot_observed_at":"2026-08-05T17:30:24.601737Z","submitted_at":"2026-06-27T05:26:43Z","title":"Agent Safety Is Action Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T09:50:45.759936Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2606.28739"},"observation_digest":"sha256:fe8fe7cf79cd606ba061b46c65a487a572e091924e30c62198c57c0dc971b4fa","observation_id":"872dc00c-6b2b-4f47-8a70-0014c8a804a7","resolution":{"observed_at":"2026-06-30T09:54:35.001200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-02T12:57:00.805343Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:64cd0426b0aa3bb3d7b3847e38750878efa383796b56951cf1dcda2ad61818a5","observation_id":"1d0be5d4-c9cd-4fef-8161-6bc4d6f3d461","resolution":{"observed_at":"2026-07-02T13:06:58.846398Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Deliberative alignment: Reasoning enables safer language models.arXiv preprint arXiv:2412.16339, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:5a02788bb1b4a9de7f60ee80500b4964dece5483cbdeea3189e617aa18b55fd4","observation_id":"9b2a054d-3b7f-4ee8-bccf-a3d47cd92f47","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2607.01277","last_updated":"2026-07-01T06:36:29Z","snapshot_observed_at":"2026-08-05T18:03:53.977353Z","submitted_at":"2026-07-01T06:36:29Z","title":"Cognitive Firewall: A Proactive, Zero-Trust, Multi-Gate Framework for LLM Safety","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-03T20:38:16.610310Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.01277"},"observation_digest":"sha256:e3fc5f8085f44d3858fd14419145c422eb4af6fc5cd38acef1eccb848cfe5fae","observation_id":"c34d92c6-d355-4da5-a9f0-5f14463cc273","resolution":{"observed_at":"2026-07-03T20:38:54.934420Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Deliberative alignment: Reasoning enables safer language models.arXiv preprint arXiv:2412.16339, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-06T07:16:16.960857Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:6cc4c2853fc57b98331f05f2b68d73b759bfc24d9f2880ca78a5bfb7c5a1fd23","observation_id":"b9561dc8-97ce-42f3-af4f-499781103678","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-07-12T14:28:50.627444Z","title":"arXiv preprint arXiv:2412.16339 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05407","last_updated":"2026-06-09T03:22:53Z","snapshot_observed_at":"2026-08-07T08:54:21.406314Z","submitted_at":"2026-06-09T03:22:53Z","title":"Position: Preventing AI-Generated CSAM Necessitates New Approaches to AI Safety","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-07-12T14:28:50.627444Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.05407"},"observation_digest":"sha256:01b53704864238e7e8a0a4dabe96f88fd04943a571be77cfde29f3af2b28093b","observation_id":"5be75692-127e-4334-b317-c72f709d75c2","resolution":{"observed_at":"2026-07-12T14:28:50.627444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-07-14T14:12:44.286699Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10114","last_updated":"2026-07-11T04:30:43Z","snapshot_observed_at":"2026-08-06T06:37:58.749586Z","submitted_at":"2026-07-11T04:30:43Z","title":"Cost of Reasoning in non-English Languages: A Case Study on Japanese","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-14T14:12:44.286699Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.10114"},"observation_digest":"sha256:8dd7edcf98ecae19c3d3b2df3a8eb17df119419d8305eef4fb6cc8aecce11098","observation_id":"7c8e5ee8-1db0-4ee8-b32e-b1651172bed9","resolution":{"observed_at":"2026-07-14T14:12:44.286699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-07-15T08:35:47.870083Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11999","last_updated":"2026-07-15T02:43:14Z","snapshot_observed_at":"2026-08-02T23:32:24.396963Z","submitted_at":"2026-07-13T17:48:25Z","title":"Underwriting the Agent Economy: The Blueprint for an AI Insurance Stack","version":1},"reference_index":230,"source":"pdf_text","source_observed_at":"2026-07-15T08:35:47.870083Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.11999"},"observation_digest":"sha256:c5120b6168bc0c50572a8693e2c02979475de821e97a0ac817c092509709cd27","observation_id":"d6aed98b-cb00-497b-991a-2288d69fe821","resolution":{"observed_at":"2026-07-15T08:35:47.870083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-02T06:46:40.391719Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11999","last_updated":"2026-07-15T02:43:14Z","snapshot_observed_at":"2026-08-02T23:32:24.396963Z","submitted_at":"2026-07-13T17:48:25Z","title":"Underwriting the Agent Economy: The Blueprint for an AI Insurance Stack","version":2},"reference_index":231,"source":"pdf_text","source_observed_at":"2026-08-02T06:46:40.391719Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.11999"},"observation_digest":"sha256:91324ad122352b6323df589c62d6d1e92ab467ed55a3018586f73c954622d5da","observation_id":"a01fcd39-8be5-4f88-84ba-1f363099a19e","resolution":{"observed_at":"2026-08-02T06:46:40.391719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-01T23:15:23.274320Z","title":"Guan, Manas Joglekar, Eric Wallace, Saachi Jain, Boaz Barak, Alec Helyar, Rachel Dias, Andrea Vallone, Hongyu Ren, Jason Wei, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15495","last_updated":"2026-07-16T22:54:30Z","snapshot_observed_at":"2026-08-07T08:22:43.917790Z","submitted_at":"2026-07-16T22:54:30Z","title":"Verbalizable Representations Form a Global Workspace in Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T23:15:23.274320Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.15495"},"observation_digest":"sha256:c7be662778be94c2599d28e1ed441b71b55c841223baccdce5883e8220ab1276","observation_id":"d406d612-cdeb-4712-a465-bb94445022c3","resolution":{"observed_at":"2026-08-01T23:15:23.274320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-01T16:35:30.952522Z","title":"arXiv preprint arXiv:2412.16339 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17946","last_updated":"2026-07-20T13:46:47Z","snapshot_observed_at":"2026-08-06T07:04:27.489300Z","submitted_at":"2026-07-20T13:46:47Z","title":"A Geometric Perspective on Stabilizing Value Conflict Resolution","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T16:35:30.952522Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.17946"},"observation_digest":"sha256:92917d133c1fa22dcd6866900ccb1e59d3a17e06146d5894f411e34e08cb44ff","observation_id":"4492457e-d1d8-4fe6-ac1c-0f87fa2c6a30","resolution":{"observed_at":"2026-08-01T16:35:30.952522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-01T08:38:55.560417Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21063","last_updated":"2026-07-23T08:56:11Z","snapshot_observed_at":"2026-08-07T01:50:19.863208Z","submitted_at":"2026-07-23T08:56:11Z","title":"QuantiBias: Benchmarking Quantization-Induced Bias in LLMs","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T08:38:55.560417Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.21063"},"observation_digest":"sha256:b7b75b67b0cf34c965764288d5e7c0609f2056482629c1537623a03787bce7e5","observation_id":"79cea9df-6c32-4571-bcc4-7adcd1b3fb91","resolution":{"observed_at":"2026-08-01T08:38:55.560417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-01T00:38:41.667721Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26173","last_updated":"2026-07-28T18:29:45Z","snapshot_observed_at":"2026-08-06T23:21:22.894740Z","submitted_at":"2026-07-28T18:29:45Z","title":"Shared SFT Lessons Across Alignment, Model Organisms, and Toy Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T00:38:41.667721Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.26173"},"observation_digest":"sha256:5c95c249465687d7c26e1b319d42ca7e37410f6745fffd3f5e50e9f388f1e583","observation_id":"d4c5bf99-e663-4e71-8425-5902ed995ed8","resolution":{"observed_at":"2026-08-01T00:38:41.667721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-01T11:35:00.225163Z","title":"arXiv preprint arXiv:2412.16339 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26654","last_updated":"2026-07-30T16:11:54Z","snapshot_observed_at":"2026-08-04T17:33:06.194750Z","submitted_at":"2026-07-29T09:15:40Z","title":"Constitutional Midtraining: Content Presence Drives Alignment Gains","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T11:35:00.225163Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.26654"},"observation_digest":"sha256:c51617a9dacb69782d29dc7f9cd8015ec905adab5ba729aed441dd4902584b48","observation_id":"78a191ed-6886-4149-8e7f-11aeed5beb12","resolution":{"observed_at":"2026-08-01T11:35:00.225163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-03T00:55:26.100966Z","title":"2024 , author=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28636","last_updated":"2026-05-19T13:56:13Z","snapshot_observed_at":"2026-08-06T00:38:04.006327Z","submitted_at":"2026-05-19T13:56:13Z","title":"Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-03T00:55:26.100966Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.28636"},"observation_digest":"sha256:6b1ccb6ff8503d190fcb165e49360143cf121d447e3dc3bea3f94409823a4aa0","observation_id":"db5790cb-4fa6-40dc-a93d-2b4355464f2f","resolution":{"observed_at":"2026-08-03T00:55:26.100966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-03T14:38:56.180832Z","title":"Deliberative alignment: Reasoning enables safer language models.arXiv preprint arXiv:2412.16339, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29052","last_updated":"2026-07-31T06:10:24Z","snapshot_observed_at":"2026-08-05T23:12:28.428158Z","submitted_at":"2026-07-31T06:10:24Z","title":"Outcome-Guided Distillation: A Teacher-Student Framework to Advance VLM Reasoning in Autonomous Driving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T14:38:56.180832Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.29052"},"observation_digest":"sha256:58d507af41687af391b43c723c2a017de0fd13138272d337df71cc33c9189480","observation_id":"77fe7ada-8310-426f-8ddf-ff0fc104378d","resolution":{"observed_at":"2026-08-03T14:38:56.180832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.16339/citation-record","integrity":"/paper/2412.16339/integrity","json":"/paper/2412.16339/citation-record.json","paper":"/paper/2412.16339"},"outbound":[],"paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 79 inbound Pith citation observations for arXiv:2412.16339."}