{"as_of":"2026-08-10T18:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e9376ee360dda9b4ce5494e66bd934a91e0539b3a414a1537e16c1e7411ffa13","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:46:29.654391Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":"2401.01967","doi":"10.48550/arxiv.2401.01967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., and Mihalcea, R","venue":"arXiv (Cornell University)","work_id":"65acf7c4-2180-4e71-b561-080e22f3f4d1","year":2024},"citing_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"reference_index":145,"source":"arxiv_source","source_observed_at":"2026-05-13T10:47:55.934081Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2406.11717"},"observation_digest":"sha256:c586a490f813dac669bb890fc03be3bdb84948576cdbfcc26ae5591ccfe31645","observation_id":"39a753dc-e3e7-4ba2-b3fb-147aff02c503","resolution":{"observed_at":"2026-05-13T10:47:56.007880Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-08T14:46:29.654391Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.654391Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:69b0af616cd030150a6c6434b75ca62fb659feaaf8b8b73f2e3a7af1c481e3ce","observation_id":"a1f7d08c-4030-4d6a-8592-d22be6238419","resolution":{"observed_at":"2026-08-08T14:46:29.654391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-07T23:08:02.292674Z","title":"K., and Mihalcea, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.292674Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:05e090e71d83797a4ae360fa79388ab8e1310cbbd025176a0878fdb5a4202fb2","observation_id":"7646f38f-246d-4cbe-8366-4d53756e1f44","resolution":{"observed_at":"2026-08-07T23:08:02.292674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-07T15:01:16.715517Z","title":"Bo Li, Peiyuan Zhang, Kaichen Zhang, Fanyi Pu, Xinrun Du, Yuhao Dong, Haotian Liu, Yuanhan Zhang, Ge Zhang, Chunyuan Li, and Ziwei Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16703","last_updated":"2025-05-22T14:04:43Z","snapshot_observed_at":"2026-08-10T15:49:13.242015Z","submitted_at":"2025-05-22T14:04:43Z","title":"Locate-then-Merge: Neuron-Level Parameter Fusion for Mitigating Catastrophic Forgetting in Multimodal LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:01:16.715517Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2505.16703"},"observation_digest":"sha256:1fd156e5ac68e46c8ed6fb9eaa65ac7f0a7e6db8deefecceaa154a045613c6c2","observation_id":"f36f4cbe-ae25-4a6e-bb70-b6b9ea3c6815","resolution":{"observed_at":"2026-08-07T15:01:16.715517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":"2401.01967","doi":"10.48550/arxiv.2401.01967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., and Mihalcea, R","venue":"arXiv (Cornell University)","work_id":"65acf7c4-2180-4e71-b561-080e22f3f4d1","year":2024},"citing_paper":{"arxiv_id":"2506.00166","last_updated":"2026-04-30T20:54:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-30T19:11:52Z","title":"Disentangled Safety Adapters Enable Efficient Guardrails and Flexible Inference-Time Alignment","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T11:52:36.688263Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2506.00166"},"observation_digest":"sha256:ca5112eabfac97e396f10ee4da3971384b68cc5868a12cf2eeb82d22b1a580a7","observation_id":"c7d9fbcc-b2c3-4b1e-9051-d532b70b21de","resolution":{"observed_at":"2026-05-19T11:53:03.589127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-07T12:13:17.735447Z","title":"Kummerfeld, and Rada Mihalcea","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00253","last_updated":"2025-06-08T23:37:10Z","snapshot_observed_at":"2026-08-07T21:55:20.181434Z","submitted_at":"2025-05-30T21:41:44Z","title":"Aligned but Blind: Alignment Increases Implicit Bias by Reducing Awareness of Race","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:17.735447Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2506.00253"},"observation_digest":"sha256:95762c08b86355b7ec8dde119bd269403060974218fef9d0b5db56c025d68f8b","observation_id":"e8c1a24c-31d4-49f9-8c43-df6bbe522c10","resolution":{"observed_at":"2026-08-07T12:13:17.735447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-05T18:01:19.652668Z","title":"Kum- merfeld, and Rada Mihalcea","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15875","last_updated":"2025-08-21T10:36:00Z","snapshot_observed_at":"2026-08-08T12:29:06.386568Z","submitted_at":"2025-08-21T10:36:00Z","title":"NEAT: Concept driven Neuron Attribution in LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T18:01:19.652668Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2508.15875"},"observation_digest":"sha256:26b1f30d0b56907df48a1aa8a96a6dcabc9be466adaccd4b3befd6522e7344bd","observation_id":"49cceb30-af28-4b3a-b8f0-90f368234dec","resolution":{"observed_at":"2026-08-05T18:01:19.652668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":"2401.01967","doi":"10.48550/arxiv.2401.01967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., and Mihalcea, R","venue":"arXiv (Cornell University)","work_id":"65acf7c4-2180-4e71-b561-080e22f3f4d1","year":2024},"citing_paper":{"arxiv_id":"2509.24169","last_updated":"2026-04-30T20:29:05Z","snapshot_observed_at":"2026-08-02T15:57:00.595959Z","submitted_at":"2025-09-29T01:33:20Z","title":"Task Vectors, Learned Not Extracted: Performance Gains and Mechanistic Insight","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T13:21:18.699465Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2509.24169"},"observation_digest":"sha256:574519abb29de76b69d5ca38e786a2247ebaee109688cbe918f3ede9cf3c7094","observation_id":"d9769c2f-bf46-42c4-b8b9-c147b6fdeca4","resolution":{"observed_at":"2026-05-18T13:21:23.755068Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-04T14:43:48.897724Z","title":"Jiwei Li, Michel Galley, Chris Brockett, Jianfeng Gao, and Bill Dolan","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.24319","last_updated":"2026-05-29T03:25:46Z","snapshot_observed_at":"2026-08-08T01:28:28.007746Z","submitted_at":"2025-09-29T05:57:00Z","title":"Dual Mechanisms of Value Expression: Intrinsic vs. Prompted Values in Large Language Models","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T14:43:48.897724Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2509.24319"},"observation_digest":"sha256:20bff6ede17e198cc40e148267852636c8c7579d7d0b91829c87ecba1e5b0a9d","observation_id":"4dd04c29-8bed-4f24-b922-26441193a6e9","resolution":{"observed_at":"2026-08-04T14:43:48.897724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-04T08:49:33.106792Z","title":"Kummerfeld, and Rada Mihalcea","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18874","last_updated":"2026-06-26T02:22:44Z","snapshot_observed_at":"2026-08-09T10:21:52.218853Z","submitted_at":"2025-10-21T17:59:41Z","title":"Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T08:49:33.106792Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2510.18874"},"observation_digest":"sha256:3696e6774cb4f9cd4dbfa72bbb0bccf7eff60033c3c05b1a3f4ccf846b26dd88","observation_id":"96001828-996e-494c-92ac-e730bc7f142d","resolution":{"observed_at":"2026-08-04T08:49:33.106792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":"2401.01967","doi":"10.48550/arxiv.2401.01967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., and Mihalcea, R","venue":"arXiv (Cornell University)","work_id":"65acf7c4-2180-4e71-b561-080e22f3f4d1","year":2024},"citing_paper":{"arxiv_id":"2602.07340","last_updated":"2026-05-21T07:39:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-07T03:46:33Z","title":"Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T11:17:03.104902Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2602.07340"},"observation_digest":"sha256:6457e13a530cd089ed528ad49425c2de776b3a8f01ad0cfd927dc987a0b15e2b","observation_id":"3569a863-06fd-4737-bdcf-5c53a2b1b5c7","resolution":{"observed_at":"2026-05-22T11:21:28.951146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":"2401.01967","doi":"10.48550/arxiv.2401.01967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., and Mihalcea, R","venue":"arXiv (Cornell University)","work_id":"65acf7c4-2180-4e71-b561-080e22f3f4d1","year":2024},"citing_paper":{"arxiv_id":"2604.11663","last_updated":"2026-04-13T16:11:38Z","snapshot_observed_at":"2026-07-06T22:59:59.220594Z","submitted_at":"2026-04-13T16:11:38Z","title":"Why Do Large Language Models Generate Harmful Content?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:31:13.545599Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2604.11663"},"observation_digest":"sha256:9e3314b99ffb2657efbc9fa6e790ed7c74690b8ba3c07ad7e7c5d95c65db8a31","observation_id":"9f4cb83e-1551-45f3-b03c-ff7da9755cbe","resolution":{"observed_at":"2026-05-11T10:21:04.435702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":"2401.01967","doi":"10.48550/arxiv.2401.01967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., and Mihalcea, R","venue":"arXiv (Cornell University)","work_id":"65acf7c4-2180-4e71-b561-080e22f3f4d1","year":2024},"citing_paper":{"arxiv_id":"2604.14602","last_updated":"2026-04-16T04:19:48Z","snapshot_observed_at":"2026-08-10T15:05:42.475452Z","submitted_at":"2026-04-16T04:19:48Z","title":"CausalDetox: Causal Head Selection and Intervention for Language Model Detoxification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T12:04:13.987667Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2604.14602"},"observation_digest":"sha256:e94b5bf27933bd92bcf644c581ec4109eaed9f7978b64f52fca0c920cfdad1c3","observation_id":"35c5450e-e424-4d72-96eb-05b67664760f","resolution":{"observed_at":"2026-05-10T12:05:21.995701Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":"2401.01967","doi":"10.48550/arxiv.2401.01967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., and Mihalcea, R","venue":"arXiv (Cornell University)","work_id":"65acf7c4-2180-4e71-b561-080e22f3f4d1","year":2024},"citing_paper":{"arxiv_id":"2604.27401","last_updated":"2026-04-30T04:13:33Z","snapshot_observed_at":"2026-07-06T23:12:52.141592Z","submitted_at":"2026-04-30T04:13:33Z","title":"Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T08:34:14.310656Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2604.27401"},"observation_digest":"sha256:0bd767e99cde55e491379d6bd448b60f722ab6fe0ecd901c30da2ac99f6c1de3","observation_id":"9dbf1532-b749-464d-87f9-222186cb1dd1","resolution":{"observed_at":"2026-05-12T10:01:27.498678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":"2401.01967","doi":"10.48550/arxiv.2401.01967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., and Mihalcea, R","venue":"arXiv (Cornell University)","work_id":"65acf7c4-2180-4e71-b561-080e22f3f4d1","year":2024},"citing_paper":{"arxiv_id":"2605.09967","last_updated":"2026-05-11T04:18:43Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:18:43Z","title":"Tensor Product Representation Probes Reveal Shared Structure Across Linear Directions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T03:31:40.195348Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2605.09967"},"observation_digest":"sha256:fa2ab9f1aa3a41426f91739b7d9f934e0c267341ebb36df18abf3e7c87a7335c","observation_id":"3dc7a409-db2d-4c2c-bbd3-d78c2cdd19e2","resolution":{"observed_at":"2026-05-12T07:16:30.228824Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":"2401.01967","doi":"10.48550/arxiv.2401.01967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., and Mihalcea, R","venue":"arXiv (Cornell University)","work_id":"65acf7c4-2180-4e71-b561-080e22f3f4d1","year":2024},"citing_paper":{"arxiv_id":"2605.13329","last_updated":"2026-05-13T10:44:23Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T10:44:23Z","title":"Tracing Persona Vectors Through LLM Pretraining","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T20:28:17.086117Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2605.13329"},"observation_digest":"sha256:79dafb4d2fc57d5f60994d0d86bcbabf282e68e4544f886a0244d7f71a53d548","observation_id":"1d6b79df-6825-44b4-9e58-0f800a339e40","resolution":{"observed_at":"2026-05-14T20:29:27.871025Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":"2401.01967","doi":"10.48550/arxiv.2401.01967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., and Mihalcea, R","venue":"arXiv (Cornell University)","work_id":"65acf7c4-2180-4e71-b561-080e22f3f4d1","year":2024},"citing_paper":{"arxiv_id":"2606.01060","last_updated":"2026-06-07T07:03:09Z","snapshot_observed_at":"2026-08-02T21:46:05.814578Z","submitted_at":"2026-05-31T07:05:51Z","title":"MENTIS: What Belief Changes Under Alignment? Measuring Multi-Scale Latent Torsion in Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T17:23:52.388431Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2606.01060"},"observation_digest":"sha256:b82b5e4d0ad06bfe1cfe26a05f912fbec19541be62f46490b4dd3850b58ad6ae","observation_id":"c509664a-987b-47ec-b0eb-42feb21884fc","resolution":{"observed_at":"2026-07-01T21:16:13.711820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":"2401.01967","doi":"10.48550/arxiv.2401.01967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., and Mihalcea, R","venue":"arXiv (Cornell University)","work_id":"65acf7c4-2180-4e71-b561-080e22f3f4d1","year":2024},"citing_paper":{"arxiv_id":"2606.06333","last_updated":"2026-06-04T16:08:25Z","snapshot_observed_at":"2026-08-02T07:30:20.394633Z","submitted_at":"2026-06-04T16:08:25Z","title":"Subspace-Aware Sparse Autoencoders for Effective Mechanistic Interpretability","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T02:07:18.198225Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2606.06333"},"observation_digest":"sha256:478fdb475bcf30d4c89e529bbe03f88600af96e075db126381044ae735a5a478","observation_id":"bcc42c2c-c0f5-4d3d-9cc5-a17265b858cd","resolution":{"observed_at":"2026-06-28T02:11:29.059463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":"2401.01967","doi":"10.48550/arxiv.2401.01967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., and Mihalcea, R","venue":"arXiv (Cornell University)","work_id":"65acf7c4-2180-4e71-b561-080e22f3f4d1","year":2024},"citing_paper":{"arxiv_id":"2606.12360","last_updated":"2026-06-10T17:31:16Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:31:16Z","title":"Anatomy of Post-Training: Using Interpretability to Characterize Data and Shape the Learning Signal","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-27T10:32:57.295159Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2606.12360"},"observation_digest":"sha256:33a6b037412765d27a4db5b1955d2a388d94af5055f6e06177c5c4c37c1cefa9","observation_id":"ac599741-e851-4fce-803a-7f96c139ecba","resolution":{"observed_at":"2026-07-03T09:07:47.949014Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":"2401.01967","doi":"10.48550/arxiv.2401.01967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., and Mihalcea, R","venue":"arXiv (Cornell University)","work_id":"65acf7c4-2180-4e71-b561-080e22f3f4d1","year":2024},"citing_paper":{"arxiv_id":"2606.17168","last_updated":"2026-06-20T10:01:32Z","snapshot_observed_at":"2026-08-08T12:13:21.907844Z","submitted_at":"2026-06-15T18:06:59Z","title":"RepSelect: Robust LLM Unlearning via Representation Selectivity","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-27T03:34:32.388152Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2606.17168"},"observation_digest":"sha256:c3cfa660c3a8e56f90f80a58a17a50852089f9618ce57a32d29d536c09084446","observation_id":"c6a21310-61a7-4cab-873d-3f68b75b92a5","resolution":{"observed_at":"2026-07-03T17:58:47.166430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":"2401.01967","doi":"10.48550/arxiv.2401.01967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., and Mihalcea, R","venue":"arXiv (Cornell University)","work_id":"65acf7c4-2180-4e71-b561-080e22f3f4d1","year":2024},"citing_paper":{"arxiv_id":"2606.18284","last_updated":"2026-06-10T02:04:29Z","snapshot_observed_at":"2026-07-06T23:53:45.117607Z","submitted_at":"2026-06-10T02:04:29Z","title":"Breaking the Solver Bottleneck: Training Task Generators at the Learnable Frontier","version":1},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-06-27T10:36:09.211639Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2606.18284"},"observation_digest":"sha256:486452afaa2ec11b455df05136f38304e37027991630358f8e1e8cee281d144c","observation_id":"d45aad08-ea90-46c5-83e3-9014c53f1898","resolution":{"observed_at":"2026-07-03T08:57:48.279218Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":"2401.01967","doi":"10.48550/arxiv.2401.01967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., and Mihalcea, R","venue":"arXiv (Cornell University)","work_id":"65acf7c4-2180-4e71-b561-080e22f3f4d1","year":2024},"citing_paper":{"arxiv_id":"2606.19542","last_updated":"2026-06-17T19:35:10Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:35:10Z","title":"Tracking Representation Dynamics in Large Language Models with Persistent Homology","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T21:03:07.253265Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2606.19542"},"observation_digest":"sha256:017dffdbafddd44380491986845c234e01f12bbc0a44768714630fc6faf46188","observation_id":"4b136081-fd06-4b5c-8f8e-060067cc56a6","resolution":{"observed_at":"2026-07-04T00:39:17.225595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-07-12T07:33:43.015966Z","title":"A mechanistic understanding of alignment algorithms: A case study on DPO and toxicity.arXiv preprint arXiv:2401.01967,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02714","last_updated":"2026-07-07T12:39:55Z","snapshot_observed_at":"2026-08-07T02:57:17.862073Z","submitted_at":"2026-07-02T19:05:07Z","title":"Not All Refusals Are Equal: How Safety Alignment Fails Cybersecurity at Scale","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T07:33:43.015966Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2607.02714"},"observation_digest":"sha256:4c699304a902eade3fc47ba6d8740b1a224fd9fbede6ae9c822bd617733298c1","observation_id":"739358e2-e78f-449e-9bf9-e17a8ffacc08","resolution":{"observed_at":"2026-07-12T07:33:43.015966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-03T16:32:04.215688Z","title":"A mechanistic understanding of alignment algorithms: A case study on dpo and toxicity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:04.215688Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:e6561f3450efcdfae756191e42967846fa6088d9fb5edc538b17239df5a6defb","observation_id":"365eb461-c285-4511-9f18-379cb93a83d8","resolution":{"observed_at":"2026-08-03T16:32:04.215688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.01967/citation-record","integrity":"/paper/2401.01967/integrity","json":"/paper/2401.01967/citation-record.json","paper":"/paper/2401.01967"},"outbound":[],"paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 24 inbound Pith citation observations for arXiv:2401.01967."}