{"as_of":"2026-08-22T01:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7331453c7491eba6432e995b2be42dad053f7f4c13c102b2e68a869e6d3176cd","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T14:53:38.598955Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18639/citation-record","integrity":"/paper/2607.18639/integrity","json":"/paper/2607.18639/citation-record.json","paper":"/paper/2607.18639"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-08-17T07:39:23.832733Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-01T14:53:34.227426Z","title":"Refusal in language models is mediated by a single direction, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:34.227426Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:a0092b1a37af4f6a0e85cf1900ac327c30c68dfdf432f44c5213a9048e985a6f","observation_id":"444dbfca-f879-4ed4-a121-ca6b4395482e","resolution":{"observed_at":"2026-08-01T14:53:34.227426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-01T14:53:34.361223Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:34.361223Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:84c80222de295c973d15f5eac3824bb48ae2a6ae4c0e08f30368a43819b805c5","observation_id":"cb80ffa3-8839-4e76-894b-dd020ab469a8","resolution":{"observed_at":"2026-08-01T14:53:34.361223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-01T14:53:34.467584Z","title":"Constitutional AI: Harmlessness from AI feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:34.467584Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:151831293578cf6c42bb5e6d114039fe61712f752782f09f46e1a2e318e41279","observation_id":"cd17fe38-7a04-4712-9771-1cf485a19edb","resolution":{"observed_at":"2026-08-01T14:53:34.467584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:34.577673Z","title":"Enhancing model safety through pre- training data filtering.Anthropic Alignment Science Blog, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:34.577673Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:2cee4fee135b4920c24c08c51ae399c4d36ecff65fc3209941fc6869629a2885","observation_id":"80a00ca4-c2b6-487c-be80-0485d5453710","resolution":{"observed_at":"2026-08-01T14:53:34.577673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-01T14:53:34.706600Z","title":"Think you have solved question answering? Try ARC, the AI2 reasoning challenge, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:34.706600Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:fa74604f274da456358dd9c63aff32b7fa589fcb18f32e6f247e400f5a5d7d9b","observation_id":"1244f305-bf11-4938-96b2-f4dc70955c44","resolution":{"observed_at":"2026-08-01T14:53:34.706600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:34.814161Z","title":"Deepseek-v4: Towards highly efficient million-token context intelligence","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:34.814161Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:3ce891e79c2b1d69f958da89c0389e782ccfb76c00149f9dd80a7697d40c3c7d","observation_id":"09c6a1cd-f04b-423a-921c-7674476e87e5","resolution":{"observed_at":"2026-08-01T14:53:34.814161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-08-18T05:06:04.678949Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-01T14:53:34.921912Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:34.921912Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:c1220f530e8f93032f2a7d4b44996e925a82e2548faba57f25f9f5c193a96b11","observation_id":"68dbdcca-fd6d-4d4e-b49a-fb0196182764","resolution":{"observed_at":"2026-08-01T14:53:34.921912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:35.010601Z","title":"Simplicity prevails: Rethinking negative preference optimization for LLM unlearning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:35.010601Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:c57ce775ac7a93620f2d27a4a64536501f0ca210b3d99f04d185ad597bb50a5c","observation_id":"b9df7b92-6c97-427e-8d6d-04a38ef312cd","resolution":{"observed_at":"2026-08-01T14:53:35.010601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01504","last_updated":"2022-12-19T11:52:40Z","snapshot_observed_at":"2026-08-16T16:27:04.380829Z","submitted_at":"2022-10-04T10:18:11Z","title":"Knowledge Unlearning for Mitigating Privacy Risks in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01504","snapshot_observed_at":"2026-08-01T14:53:35.176942Z","title":"Knowledge unlearning for mitigating privacy risks in language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:35.176942Z"},"links":{"cited_paper":"/paper/2210.01504","citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:950cb88c7eb031c681330a545f2ae397004f7b3398ba06bc22325a5693b63f5a","observation_id":"c24c9987-d7be-40cb-9926-9c66b537912b","resolution":{"observed_at":"2026-08-01T14:53:35.176942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:35.273327Z","title":"Pretraining language models with human preferences","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:35.273327Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:c24f1062237e31e82eeca0afc565ebbb6a5d5025e1fc6579ee802ff1b01fcf76","observation_id":"ec717d17-c815-4534-9e02-8c88cda9c970","resolution":{"observed_at":"2026-08-01T14:53:35.273327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04741","last_updated":"2025-05-07T19:17:49Z","snapshot_observed_at":"2026-08-18T12:50:37.530871Z","submitted_at":"2025-05-07T19:17:49Z","title":"When Bad Data Leads to Good Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04741","snapshot_observed_at":"2026-08-01T14:53:35.432279Z","title":"When bad data leads to good models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:35.432279Z"},"links":{"cited_paper":"/paper/2505.04741","citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:fd7c714db964de13f05ff6a0dfe3d54c06ac25916802b689bae83d638a49a3be","observation_id":"e0b15acf-3aab-4fff-a4fe-63fb8b27140c","resolution":{"observed_at":"2026-08-01T14:53:35.432279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03218","last_updated":"2024-05-15T19:16:09Z","snapshot_observed_at":"2026-08-15T06:18:34.739211Z","submitted_at":"2024-03-05T18:59:35Z","title":"The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03218","snapshot_observed_at":"2026-08-01T14:53:35.534123Z","title":"The WMDP benchmark: Measuring and reducing malicious use with unlearning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:35.534123Z"},"links":{"cited_paper":"/paper/2403.03218","citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:2364a1e82ca822f59abf3b23e2c7e2f6711270503a7df58f0e507eccdc6bd0e4","observation_id":"584cac2e-0329-4c0b-8cc7-002e18f935de","resolution":{"observed_at":"2026-08-01T14:53:35.534123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:35.702950Z","title":"A pretrainer’s guide to training data: Measuring the effects of data age, domain coverage, quality, and toxicity, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:35.702950Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:504f6f0e102ca645ff24d60dde32f8b9559ccab14e3362a3d9f7a4b5f1d19536","observation_id":"8a8e1ad1-08c7-4e3e-bc27-0c003420b32e","resolution":{"observed_at":"2026-08-01T14:53:35.702950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:35.832281Z","title":"Natural emergent misalignment from reward hacking in production RL, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:35.832281Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:6d7c4adc4eed7770a209cc0eb093443d629f34c7cba5cf538c40696d6ce32853","observation_id":"e448b515-4511-4777-bb21-809a7b8125b4","resolution":{"observed_at":"2026-08-01T14:53:35.832281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:35.966930Z","title":"Safety pretraining: Toward the next generation of safe AI, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:35.966930Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:ba867eb2c075744d302efd8ca483c552b2d0943397d71611748a08c9c1fdda53","observation_id":"7e02ffd9-b228-4c99-b640-ac15bb012e33","resolution":{"observed_at":"2026-08-01T14:53:35.966930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:36.088747Z","title":"Mouton, Caleb Lucas, and Ella Guest","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:36.088747Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:0322694865541dfde825f3a70f46f99c9f126aacafeda9f7b9eb50d4e5159755","observation_id":"49c94a80-fe4f-4cee-af5e-f75bb70bbad1","resolution":{"observed_at":"2026-08-01T14:53:36.088747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:36.152750Z","title":"Interpreting GPT: the logit lens.LessWrong, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:36.152750Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:791b887bc8cefdfdfbd901cb1da4fc1308988ce0835498f059c19f5a066f8966","observation_id":"d3628455-8d5c-4e4c-9b7e-5a9c7b204b64","resolution":{"observed_at":"2026-08-01T14:53:36.152750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:36.227610Z","title":"Real-time detection of hallucinated entities in long-form generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:36.227610Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:66f82097b6976051b079573e386e966d3697444767faa483975b1cfb2da3e0aa","observation_id":"a8845198-a3b4-43f7-95b2-86dbada39a28","resolution":{"observed_at":"2026-08-01T14:53:36.227610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:36.361261Z","title":"Deep ignorance: Filtering pretraining data builds tamper-resistant safeguards into open-weight LLMs","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:36.361261Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:5606e159d362ec43f89e257af73255017ca74f780a9f045da04d29f5f6f920d5","observation_id":"6fb618c0-7040-458e-8428-80261a9a637b","resolution":{"observed_at":"2026-08-01T14:53:36.361261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-01T14:53:36.485307Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:36.485307Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:b1702d2e36fca03ed350208de5e4c93952eba061f94fd995bac9bc8d80c70690","observation_id":"0f0dba82-0e16-40ae-8abc-47ba4135b2c8","resolution":{"observed_at":"2026-08-01T14:53:36.485307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:36.586451Z","title":"Cambridge University Press, 2nd edition, 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:36.586451Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:85b5872e137d5eeb50affc14a3e1292c54ce1525b9528ca5454f19b697f3a874","observation_id":"c57ee244-f289-4452-b72c-afbc95ba04e7","resolution":{"observed_at":"2026-08-01T14:53:36.586451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-01T14:53:36.784511Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:36.784511Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:d331052fdc32c6bac900f163b8ea2c6c0bd6dd4df523bbd0c7ad5b5086c73b5d","observation_id":"7c1ff182-4433-4943-b305-afe7a589cf53","resolution":{"observed_at":"2026-08-01T14:53:36.784511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:36.919268Z","title":"Shaping capabilities with token-level data filtering, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:36.919268Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:7afb5826e59a2edc87a347dd804655b6b66cc0a898104a9704e3831e2be63d03","observation_id":"2faad02f-4cb5-42a8-98fc-905c9c277096","resolution":{"observed_at":"2026-08-01T14:53:36.919268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-01T14:53:37.000099Z","title":"Sentence-BERT: Sentence embeddings using Siamese BERT-networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:37.000099Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:85cca4c9e200289179746d1e78977222dbe61e0597c097b098fe5a5aada006d4","observation_id":"d362c5d2-bd84-473f-b4c7-ccc9c490fedd","resolution":{"observed_at":"2026-08-01T14:53:37.000099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:37.138703Z","title":"Conditionalization confounds inoculation prompting re- sults.LessWrong, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:37.138703Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:2a1cad4e71b2e0f309cccde7ed9a18b720a98bed77881c2cbe7591f25e0ef464","observation_id":"c386292e-083b-429b-92eb-6f107a78bb9a","resolution":{"observed_at":"2026-08-01T14:53:37.138703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:37.313903Z","title":"XSTest: A test suite for identifying exaggerated safety behaviours in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:37.313903Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:3b969077726863c51c46c69870d6cc230f068e8ba27bc6c15d92eff12c563c68","observation_id":"050a5240-0bdd-45b7-998a-1447bef44979","resolution":{"observed_at":"2026-08-01T14:53:37.313903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:37.584937Z","title":"Believe it or not: How deeply do LLMs believe implanted facts?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:37.584937Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:997453e4fa209aef59e812890dbacd0536f19fde0e88d4740f598631d4921f4f","observation_id":"989254db-67d1-4205-bb50-07a495d6c18e","resolution":{"observed_at":"2026-08-01T14:53:37.584937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-20T20:40:13.172297Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-08-01T14:53:37.662023Z","title":"CommonsenseQA: A question answering challenge targeting commonsense knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:37.662023Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:78f6ab041d60601eef47a6edd8d4a4cb708e8074e954de71fa7c6c71e205d72f","observation_id":"63132adf-9a33-44f3-b25a-dd1434dbb749","resolution":{"observed_at":"2026-08-01T14:53:37.662023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01263","last_updated":"2024-04-01T11:50:35Z","snapshot_observed_at":"2026-08-20T18:53:27.304270Z","submitted_at":"2023-08-02T16:30:40Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01263","snapshot_observed_at":"2026-08-01T14:53:37.460437Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:37.460437Z"},"links":{"cited_paper":"/paper/2308.01263","citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:99e96a733fd73c8268d058d9303c550893644f1e6b411a37764f800dd544eedd","observation_id":"db844b0a-5742-4963-875d-c57907349149","resolution":{"observed_at":"2026-08-01T14:53:37.460437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-01T14:53:38.039459Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:38.039459Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:1d40699e7ab7c0747889e5229cc316088469deb164e540d575e3498fa84a6c4a","observation_id":"1e336ee7-f367-44f9-b29f-4aeba1f5364f","resolution":{"observed_at":"2026-08-01T14:53:38.039459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:38.174577Z","title":"Inoculation prompting: Instructing LLMs to misbehave at train-time improves test-time alignment, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:38.174577Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:aab7f005e563564385a0ebdce1f9e618031219a8a958c2cde59f037a5ca525d0","observation_id":"b3d3fa3a-80ba-4c38-999c-129bbe549623","resolution":{"observed_at":"2026-08-01T14:53:38.174577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:37.800194Z","title":"Inoculation prompting: Eliciting traits from LLMs during training can suppress them at test-time,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:37.800194Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:ab81557dad27efe80a3a8d5e495ab5e3423c57224ef004c74e0d6903c4860868","observation_id":"5fd31803-2c7a-474f-995a-7a50544ca50d","resolution":{"observed_at":"2026-08-01T14:53:37.800194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14586","last_updated":"2024-09-22T20:28:40Z","snapshot_observed_at":"2026-08-21T17:27:02.971927Z","submitted_at":"2024-09-22T20:28:40Z","title":"Backtracking Improves Generation Safety","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14586","snapshot_observed_at":"2026-08-01T14:53:38.598955Z","title":"The following are multiple choice questions (with answers) about {subject}","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:38.598955Z"},"links":{"cited_paper":"/paper/2409.14586","citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:cd003be3100041bcdccf6d54541b3e16d9e2f406f018c2109990cfc351dc0d1f","observation_id":"3c6167c6-8280-4ade-8adf-9ea50608b08a","resolution":{"observed_at":"2026-08-01T14:53:38.598955Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:38.309348Z","title":"Negative preference optimization: From catastrophic collapse to effective unlearning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:38.309348Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:cbc155994b0341b0575c5c161bcac83401029520e3d4af4a52c437f0677dee8a","observation_id":"f2bc8321-2376-417b-962f-2cf4a28326a9","resolution":{"observed_at":"2026-08-01T14:53:38.309348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05868","last_updated":"2024-10-10T22:00:41Z","snapshot_observed_at":"2026-07-06T17:57:27.510162Z","submitted_at":"2024-04-08T21:05:42Z","title":"Negative Preference Optimization: From Catastrophic Collapse to Effective Unlearning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05868","snapshot_observed_at":"2026-08-01T14:53:38.441310Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:38.441310Z"},"links":{"cited_paper":"/paper/2404.05868","citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:39bab43adff433736ecdbd6d8a66a4e3dd7411ccfe3459eabcdde021ac5d098a","observation_id":"01bbc548-db08-44e9-adcc-13cd1ed490d2","resolution":{"observed_at":"2026-08-01T14:53:38.441310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08582","last_updated":"2023-06-14T13:27:58Z","snapshot_observed_at":"2026-08-16T15:54:45.720889Z","submitted_at":"2023-02-16T21:03:33Z","title":"Pretraining Language Models with Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08582","snapshot_observed_at":"2026-08-01T14:53:35.351104Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:35.351104Z"},"links":{"cited_paper":"/paper/2302.08582","citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:cf4827481022cf127b68a2eab36a1f4ab31f5a0a1ae3455cc8b93fc547df92cc","observation_id":"9e353af1-7d29-4645-9bee-5683ee82a53d","resolution":{"observed_at":"2026-08-01T14:53:35.351104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:35.111220Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:35.111220Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:d3e740ed624fd75f55be089f385f5835220c7c1f55fcdc341e055e68c9b4ee7c","observation_id":"2973579c-f06a-452d-b117-139cdebdeb78","resolution":{"observed_at":"2026-08-01T14:53:35.111220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:53:37.897211Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T14:53:37.897211Z"},"links":{"citing_paper":"/paper/2607.18639"},"observation_digest":"sha256:5aec0f24825bf8a2b5b34b9500af821d687a29b95d2aa74a3c63640567dc67c3","observation_id":"a3252bb0-ab43-4ed0-b646-43438f7c088b","resolution":{"observed_at":"2026-08-01T14:53:37.897211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18639","last_updated":"2026-07-21T02:15:39Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T12:07:36.562632Z","submitted_at":"2026-07-21T02:15:39Z","title":"Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2607.18639."}