{"as_of":"2026-08-06T13:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c04081a8cdc9838c1fe776a0745125bcc8bb2e02f34e4a9f3cf19895919da206","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T12:16:16.104176Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.06632/citation-record","integrity":"/paper/2605.06632/integrity","json":"/paper/2605.06632/citation-record.json","paper":"/paper/2605.06632"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.555721Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744","venue":null,"work_id":"aa3e2ba7-4265-495b-8612-615b2ddc9991","year":2022},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:37248e9ec069cde04cb1585dbc2480764d8dc72daf879f1dcaeff78edb5df793","observation_id":"212cdefd-ab25-4d43-a896-082f513fb478","resolution":{"observed_at":"2026-05-26T13:32:26.118398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:d94763cdb752d27af2556d9c7e8362ebe9c8953853b0d79ff8d516d963774e81","observation_id":"90dba320-60ff-4b57-afb0-efacd5f239e4","resolution":{"observed_at":"2026-05-11T19:21:07.404236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":"2212.08073","doi":"10.48550/arxiv.2212.08073","metadata_source":"pith","pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Constitutional AI: Harmlessness from AI Feedback","venue":"cs.CL","work_id":"faaaa4e0-2676-4fac-a0b4-99aef10d2095","year":2022},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:a1db5705990163aa09818bf71c7f2decd783ca8185c18919e2a58eae08eed62c","observation_id":"4c6a3390-5255-4fca-8d7a-37e77c6fe711","resolution":{"observed_at":"2026-05-11T19:21:07.371175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:15.114855+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:15.114855+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lima: Less is more for alignment.Advances in Neural Information Processing Systems, 36:55006–55021","venue":null,"work_id":"fcd1e458-347d-4dd7-afdb-10d2bf0d0588","year":2023},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:0fb6147f8086d05ab947facfb895cd5c95282e691999fdbd971e8f8c19722640","observation_id":"cb8e3a34-17c1-4e03-95ac-82b2e70782a3","resolution":{"observed_at":"2026-05-26T13:32:26.177787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00213","last_updated":"2024-04-02T20:09:45Z","snapshot_observed_at":"2026-07-06T17:53:19.196215Z","submitted_at":"2024-03-30T01:56:07Z","title":"Injecting New Knowledge into Large Language Models via Supervised Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2404.00213","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00213","snapshot_observed_at":"2026-06-30T12:44:40.243888Z","title":"arXiv preprint arXiv:2404.00213 , year=","venue":null,"work_id":"38ec846e-7c63-491a-9ab1-0a94e466559d","year":2024},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"cited_paper":"/paper/2404.00213","citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:257c2d5e2282546a6c1f843198a712d9762052fa0ce495337e95eae0f109a34a","observation_id":"a65cce11-f0b7-4f7e-ba3d-98bab8616417","resolution":{"observed_at":"2026-05-11T19:21:07.395858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A mathematical framework for transformer circuits.Transformer Circuits Thread, 1(1):12","venue":null,"work_id":"c3bebcf0-815c-4107-9a0c-caedcd25ec91","year":2021},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:e975e325347bf6574982ec88bcac49f423def16409e983dd0d081908445be0cc","observation_id":"5ccce7eb-640a-45f7-9be5-5d5d8433e00e","resolution":{"observed_at":"2026-05-26T13:32:26.169146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:47:23.631754Z","title":"Zoom in: An introduction to circuits.Distill, 5(3):e00024–001","venue":null,"work_id":"0704cafb-daa1-4659-822d-453f7b112373","year":2020},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:d63f984cd42eb001611fcd04466fe8dbaabaf8293644a04a076c80328b2f0a4b","observation_id":"18288c93-ae68-4879-a13e-c728050440cc","resolution":{"observed_at":"2026-05-26T13:32:26.173112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.10862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Superficial safety alignment hypothesis","venue":null,"work_id":"89e9fc00-9e1d-46c7-959a-5b8422e67654","year":2024},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:f9f9451cbc16e7ea01a8975d045bdc57184d3f68030485e6ecd925160f5bb70f","observation_id":"e740ec2a-57c6-4e27-903c-8f3cc2052f42","resolution":{"observed_at":"2026-05-11T19:21:07.425920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11838","last_updated":"2026-04-12T12:57:12Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-12T12:57:12Z","title":"A Layer-wise Analysis of Supervised Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2604.11838","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.11838","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A Layer-wise Analysis of Supervised Fine-Tuning","venue":"cs.LG","work_id":"c40dd3e4-c7fb-425e-ac8c-227d60f39e60","year":2026},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"cited_paper":"/paper/2604.11838","citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:2688d9ec33d9128f716fc6f2e8147adb76a0c4e91a62c2c212a21a8313143183","observation_id":"1fb1d1fe-3c8d-48e7-927d-832f92214025","resolution":{"observed_at":"2026-05-11T19:21:07.289378Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15820","last_updated":"2024-10-18T04:38:47Z","snapshot_observed_at":"2026-07-06T19:20:59.607725Z","submitted_at":"2024-09-24T07:34:50Z","title":"Supervised Fine-Tuning Achieve Rapid Task Adaption Via Alternating Attention Head Activation Patterns","version":2},"cited_work":{"arxiv_id":"2409.15820","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15820","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Supervised fine-tuning achieve rapid task adaption via alternating attention head activation patterns","venue":null,"work_id":"c585522c-6e6f-44bb-9ab6-71f2628d7337","year":2024},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"cited_paper":"/paper/2409.15820","citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:d00a7d8e631ae3abc2b7c681ef381c6a3e57dffc4cdba71faf52e1cddd2f2a3f","observation_id":"e998f420-3d1f-48a3-8d52-0df82a4aa6f4","resolution":{"observed_at":"2026-05-11T19:21:07.296496Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09428","last_updated":"2025-06-28T02:26:03Z","snapshot_observed_at":"2026-07-06T21:40:11.748343Z","submitted_at":"2025-06-11T06:23:50Z","title":"Improved Supervised Fine-Tuning for Large Language Models to Mitigate Catastrophic Forgetting","version":2},"cited_work":{"arxiv_id":"2506.09428","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09428","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved supervised fine-tuning for large language models to mitigate catastrophic forgetting","venue":null,"work_id":"2134b0cf-13f3-4707-b051-6cc3168088ab","year":2025},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"cited_paper":"/paper/2506.09428","citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:0c868f522f20afed96d59af22b1977916fa3f0e3035c8eb4f11eeef0ca7fff47","observation_id":"1991c15c-c5da-44ed-bfc2-23ccbf076010","resolution":{"observed_at":"2026-05-11T19:21:07.320848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.20162","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Talking to yourself: Defying forgetting in large language models","venue":null,"work_id":"5fc242ad-244c-44d6-b7fe-2ec1568e4a5a","year":2026},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:ddec934e8b41f63d586ec00ffa13f82081455db50f696bf8c0bc995c74997aaf","observation_id":"6ea2c7dc-3824-4aa3-b692-d98d60b5a604","resolution":{"observed_at":"2026-05-11T19:21:07.422105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21438","last_updated":"2026-05-07T19:45:35Z","snapshot_observed_at":"2026-07-06T19:41:06.495019Z","submitted_at":"2024-10-28T18:34:25Z","title":"UFT: Unifying Fine-Tuning of SFT and RLHF/DPO/UNA through a Generalized Implicit Reward Function","version":3},"cited_work":{"arxiv_id":"2410.21438","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.21438","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"UFT: Unifying Fine-Tuning of SFT and RLHF/DPO/UNA through a Generalized Implicit Reward Function","venue":"cs.CL","work_id":"74923039-4a54-4a44-8232-d7000e8d9503","year":2024},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"cited_paper":"/paper/2410.21438","citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:51f5343cc00b7df4b98a422e106738a23fdf6098f756568f06b166f4ac81dba1","observation_id":"4892f287-79a0-4f44-9379-3d1721e0090e","resolution":{"observed_at":"2026-05-11T19:21:07.387461Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:47:23.609552Z","title":"Towards automated circuit discovery for mechanistic interpretability.Advances in Neural Information Processing Systems, 36:16318–16352","venue":null,"work_id":"575623b8-3beb-4d2d-a291-ba1ce05f573a","year":2023},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:281c8809d1714c99f9e230b6c2a7dec5f9894102642bf88db8f4e3d49c55e471","observation_id":"23dbe324-e913-475f-a7a1-128b78ff4bb7","resolution":{"observed_at":"2026-05-26T13:32:26.181721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attribution patching outperforms automated circuit discovery","venue":null,"work_id":"b526540e-1056-4ac9-8a3e-9d4cc40eba33","year":2024},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:52cfed2dcb052247967c4be7618d089f0aa5997fe02170d885c1adcaff110830","observation_id":"aa4ca53f-db40-4674-8057-fff431629457","resolution":{"observed_at":"2026-05-26T13:32:26.185413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19647","last_updated":"2025-03-27T05:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T17:56:07Z","title":"Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models","version":3},"cited_work":{"arxiv_id":"2403.19647","doi":"10.48550/arxiv.2403.19647","metadata_source":"pith","pith_arxiv_id":"2403.19647","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models","venue":"cs.LG","work_id":"fb24e7e7-f336-4706-bc2d-62d656b28d74","year":2024},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"cited_paper":"/paper/2403.19647","citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:0586a5c9e73ab939ae5f836095db2c0e726f00d37244a3c60a96fbdd5955201d","observation_id":"659057b9-81c7-4631-a39f-844ffc75e535","resolution":{"observed_at":"2026-05-13T13:15:10.863432Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.23268","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Safeseek: Universal attribution of safety circuits in language models","venue":null,"work_id":"b47a4db1-baf6-40a7-971e-b299b1688bc6","year":2026},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:0675817757354f41f281311309a65c458703432c3eb18eff1f41c642ff571e43","observation_id":"e5455b24-f7ab-4342-919f-4ee47cc19831","resolution":{"observed_at":"2026-05-11T19:21:07.356055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.13653","doi":"10.48550/arxiv.2511.13653","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2511.13653 , year =","venue":"ArXiv.org","work_id":"012dbb2b-bb80-42ff-bfef-d95637ba178b","year":2025},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:b8c2c9f80b89bced27ec5bd750a176d57311076358fc42b27aed31d3efc28799","observation_id":"06d07e09-72d9-431d-8302-f06b2f15887d","resolution":{"observed_at":"2026-05-11T19:21:07.439104Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10652","last_updated":"2022-09-21T20:49:26Z","snapshot_observed_at":"2026-07-06T13:54:56.779166Z","submitted_at":"2022-09-21T20:49:26Z","title":"Toy Models of Superposition","version":1},"cited_work":{"arxiv_id":"2209.10652","doi":"10.48550/arxiv.2209.10652","metadata_source":"pith","pith_arxiv_id":"2209.10652","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Toy Models of Superposition","venue":"cs.LG","work_id":"43875dbe-bc2d-4ab5-af63-744411533ff7","year":2022},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"cited_paper":"/paper/2209.10652","citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:8060da168c3316b0f79d1cbc6860bf85fa349a499e1e7121259d20380657abd9","observation_id":"f84eb357-4982-4076-bcb0-657654d712f1","resolution":{"observed_at":"2026-05-11T22:44:43.591728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-03T22:12:27.993418Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":"2212.04089","doi":"10.48550/arxiv.2212.04089","metadata_source":"pith","pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Editing Models with Task Arithmetic","venue":"cs.LG","work_id":"28899541-90d9-4f1f-b938-8b0f6410c843","year":2022},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:f8d3018e200f2044936c4a8efddb90260dce356fe933405b8dbe43fe7aa4d6f4","observation_id":"1d593131-372a-430c-8133-b1ab58d834b6","resolution":{"observed_at":"2026-05-13T08:09:13.515542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Task arithmetic in the tangent space: Improved editing of pre-trained models.Advances in Neural Information Processing Systems, 36:66727–66754","venue":null,"work_id":"bf0a4cfe-ef71-46a7-84bf-7c9a452e3fa9","year":2023},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:42cb8a7f8dd5af11ebe21fa58ba011957f53e940ad2ec186d1d99e497bab2e1c","observation_id":"8a7e203f-707d-4472-96a2-5a111773921a","resolution":{"observed_at":"2026-05-26T13:32:26.189441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Causal scrubbing: A method for rigorously testing interpretability hy- potheses","venue":null,"work_id":"44003f39-c188-468a-84a5-d5aad634a870","year":2022},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:249f38c15ff3a0836870bc1b32183a5fae8d1ff2a9ffb7cc9519c0dcd12fd04c","observation_id":"1f383852-6c70-4a86-bd40-829a667ea313","resolution":{"observed_at":"2026-05-26T13:32:26.145858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Badnets: Evaluating backdooring attacks on deep neural networks.Ieee Access, 7:47230–47244","venue":null,"work_id":"50988b5e-f2ea-498d-b136-cd8c0ff8b553","year":2019},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:4e27d100d44bf012d774d54532bc5d707914bada558aa0b7f780242f8671f78a","observation_id":"38972c5f-4ead-450b-993f-caf458c50ca3","resolution":{"observed_at":"2026-05-26T13:32:26.149313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.05772","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Depth charge: Jailbreak large language models from deep safety attention heads","venue":null,"work_id":"a06d2b3d-29cd-4b74-ba88-f3b09df6b41a","year":2026},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:b8dee53488dcc43d75c91f9411359493244f9fbcc8e05dd3b6d4e45b1df7c0cc","observation_id":"484f6eb9-50e4-49e1-8cfe-6b2a792ea1f1","resolution":{"observed_at":"2026-05-11T19:21:07.341152Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Piggyback: Adapting a single network to multiple tasks by learning to mask weights","venue":null,"work_id":"39741d51-1be8-4686-9ca1-492da7c50d6f","year":2018},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:bab7dc26dcfc5bdcaddeeeab978a48d9fe428eb280c0ce0e3389f0554c95e625","observation_id":"0ce29a2c-ee2b-4fa1-8261-2d2ea214c04e","resolution":{"observed_at":"2026-05-26T13:32:26.160180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01312","last_updated":"2018-06-22T14:54:59Z","snapshot_observed_at":"2026-07-06T06:12:42.842258Z","submitted_at":"2017-12-04T19:20:27Z","title":"Learning Sparse Neural Networks through $L_0$ Regularization","version":2},"cited_work":{"arxiv_id":"1712.01312","doi":"10.48550/arxiv.1712.01312","metadata_source":"pith","pith_arxiv_id":"1712.01312","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Sparse Neural Networks through $L_0$ Regularization","venue":"stat.ML","work_id":"e3c85729-78e6-4c45-86f6-2663073468fb","year":2017},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"cited_paper":"/paper/1712.01312","citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:51e106e609af095421ea95df4ba40b9777512ea193597e84ed538db15bff54ce","observation_id":"44b45d82-b79a-495b-8e22-8678d711f958","resolution":{"observed_at":"2026-05-11T19:21:07.312678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Low-complexity probing via finding subnet- works","venue":null,"work_id":"3bbc953d-245f-4bf4-b6f7-61f81bc78568","year":2021},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:c5fd703e5d3f4384494eb4c464499a2fd2a153d1c056475b27fd8351d64363d8","observation_id":"1e97eeff-f62a-431b-be18-cbb34a5abf0f","resolution":{"observed_at":"2026-05-26T13:32:26.130187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:55:53.827539Z","title":"Hashimoto","venue":null,"work_id":"35104f7e-ffc3-488e-b66a-a4d3d230e657","year":2023},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:d4daf70dc0da500f11309e0a93d780442a55b3e2a2927d1945f2d539154734e6","observation_id":"ee53de27-c53f-4149-bd56-4220e7a66f91","resolution":{"observed_at":"2026-05-26T13:32:26.133590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wildteaming at scale: From in-the-wild jailbreaks to (adversarially) safer language models.Advances in Neural Information Processing Systems, 37:47094–47165","venue":null,"work_id":"eda73738-0f50-417e-b5ea-ed46673880ff","year":2024},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:7a99484386f0881dfbb15ffbdad09e6cfd9a398079239168f0bc71a3518cc4a2","observation_id":"271da2ca-dc8c-4368-b01b-05b9660aa03a","resolution":{"observed_at":"2026-05-26T13:32:26.137673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shakespearean and modern english conversa- tional dataset","venue":null,"work_id":"086181c2-e6fa-4b06-abbb-d6c7ebd4bcd8","year":2023},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:f33b63e77f223e7e677644bfa8c8bc350a975fb6efcb26f2e593dfce18fc6933","observation_id":"acdb678b-5f67-4b9a-a839-61082dae3b10","resolution":{"observed_at":"2026-05-26T13:32:26.141703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:b551fc8e1f3503d2a734065144dd6d46f380289b6a1cb1be0e5d7b3d63a80c3e","observation_id":"06e4be68-cbbb-466f-a7cc-ea4839982861","resolution":{"observed_at":"2026-05-11T19:21:07.348643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:f36154034f8400d0f4ad4adaa07e1b93ca96ceccc12dcb56a8f451cd17f52618","observation_id":"d20c2cd6-21fe-4d8b-8021-f62a5a12ac57","resolution":{"observed_at":"2026-05-11T19:21:07.333193Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":"2310.06825","doi":"10.48550/arxiv.2310.06825","metadata_source":"pith","pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mistral 7B","venue":"cs.CL","work_id":"eb5e1305-ad11-4875-ad8d-ad8b8f697599","year":2023},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:2a09ec502a4d449cf70abb58fe8f587550503be1ce0ed97acf6762213b411efa","observation_id":"012ebb21-4f98-49aa-a3dc-693b21475650","resolution":{"observed_at":"2026-05-11T19:21:07.306114Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:56:18.729506Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in neural information processing systems, 36:46595–46623","venue":null,"work_id":"b509e457-b4ed-40f1-a7f4-893bc84cf1f1","year":2023},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:ca462fe31004982773ac5f704d493712d76f97f41c6f12f97fbc340ce015a2b0","observation_id":"a1e189f5-fda2-46ac-b562-c4befa0e316a","resolution":{"observed_at":"2026-05-26T13:32:26.153708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:36:22.350700Z","title":"Wildguard: Open one-stop moderation tools for safety risks, jailbreaks, and refusals of llms.Advances in neural information processing systems, 37:8093–8131","venue":null,"work_id":"3dbd9c60-8cc2-44f1-aa40-e27abe56bbf3","year":2024},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:7520485aafcd26473a5aeb374a4c26cb1056b9d7a919e367866262c1028bf038","observation_id":"fcb1a335-6b1f-4a98-a3de-0c06f509f439","resolution":{"observed_at":"2026-05-26T13:32:26.164843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":"2402.04249","doi":"10.48550/arxiv.2402.04249","metadata_source":"pith","pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","venue":"cs.LG","work_id":"b0b0303f-2444-4789-a979-8153624312ff","year":2024},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:c22e66ca3e41a233b3fb6ec42ac8b0060a460760e381991672511d1cbdf25a5c","observation_id":"83842c3e-3f6a-48a8-ba8d-9464410eb82b","resolution":{"observed_at":"2026-05-11T19:21:07.429034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:d24352286460bd6b9a15bbb727a3148b0a092f73b255921dd41775de6467108e","observation_id":"02c1b365-b199-4629-aeb3-99c5f8015018","resolution":{"observed_at":"2026-05-11T19:21:07.414568Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:04:25.243929Z","title":"Hellaswag: Can a machine really finish your sentence? InProceedings of the 57th annual meeting of the association for computational linguistics, pages 4791–4800","venue":null,"work_id":"40e9d896-75dd-4672-b1eb-9a8bf6290ccb","year":2019},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:82bc64fff665c877e860b5cb4409c3429b07ace184c20baf1f5f04c1c6f1972f","observation_id":"cf97c592-83b0-40ca-97ef-7203e2ff7296","resolution":{"observed_at":"2026-05-26T13:32:26.122206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:23:48.777018Z","title":"Modeling by shortest data description.Automatica, 14(5):465–471","venue":null,"work_id":"1257289f-fbb2-44fe-844e-872ffe28b818","year":1978},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:0706a31b1f61468692dbbb93e9e75bc88314605f76b412b8a78b097d245a2416","observation_id":"b30aa9f4-834b-4d6d-a90c-b7a56785b16d","resolution":{"observed_at":"2026-05-26T13:32:26.126947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":"1308.3432","doi":"10.48550/arxiv.1308.3432","metadata_source":"pith","pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","venue":"cs.LG","work_id":"1fe8c7c8-aff7-4b94-9096-e549d7e60789","year":2013},"citing_paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:16.104176Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2605.06632"},"observation_digest":"sha256:b80b3278fb0713ce0543bf39d85c088ec584ab0753c4998b9d3e9a5a864b359d","observation_id":"80d95ea0-c554-450a-b223-8f4359fd07f8","resolution":{"observed_at":"2026-05-11T19:21:07.383433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:27.235199+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:27.235199+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.06632","last_updated":"2026-05-07T17:44:07Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-30T07:26:22.311737Z","submitted_at":"2026-05-07T17:44:07Z","title":"Crafting Reversible SFT Behaviors in Large Language Models"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":22,"verified_fuzzy":18},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2605.06632."}