{"as_of":"2026-08-09T20:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:480ccc398f7ac8ddb822ad2ac9ed0e7f6257e2dd55d5ae44238ee362060e080b","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:44:12.908742Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.22676/citation-record","integrity":"/paper/2607.22676/integrity","json":"/paper/2607.22676/citation-record.json","paper":"/paper/2607.22676"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-02T07:44:08.300365Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:08.300365Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:3e2b6f8b9d529f01aaf052d7515852ce01149e27753521e3a8919c5a8b94fd55","observation_id":"15c20bf2-6b42-4332-97ca-365fa69fed23","resolution":{"observed_at":"2026-08-02T07:44:08.300365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21046","snapshot_observed_at":"2026-08-02T07:44:08.456270Z","title":"A survey of self-evolving agents: What, when, how, and where to evolve on the path to artificial super intelligence.arXiv preprint arXiv:2507.21046,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:08.456270Z"},"links":{"cited_paper":"/paper/2507.21046","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:2c1b1e44b29fc4d25b6f6be88eeb30bf427af15d0bf9ad2f49406c9b54933347","observation_id":"0b9ed988-c8cd-455e-86de-0ffd23a790bc","resolution":{"observed_at":"2026-08-02T07:44:08.456270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:08.575041Z","title":"Shashwat Goel, Rishi Hazra, Dulhan Jayalath, Timon Willi, Parag Jain, William F Shen, Ilias Leontiadis, Francesco Barbieri, Yoram Bachrach, Jonas Geiping, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:08.575041Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:f7dc438b6befc4e4d093a46f3222b7b30de254750a23fca28dce2391acaf5dbb","observation_id":"4db81838-fe98-44f2-b42a-6cf38c5448e7","resolution":{"observed_at":"2026-08-02T07:44:08.575041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18864","last_updated":"2025-02-26T06:17:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T06:17:13Z","title":"Towards an AI co-scientist","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18864","snapshot_observed_at":"2026-08-02T07:44:08.709873Z","title":"Towards an ai co-scientist.arXiv preprint arXiv:2502.18864,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:08.709873Z"},"links":{"cited_paper":"/paper/2502.18864","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:fc876a7419d20dbf4452cd44f1a2f2a819d2f3f7ff9f1fd4328a05c71e7dad4e","observation_id":"e1d13e2b-96d8-4e02-8bde-7704aebf7b2f","resolution":{"observed_at":"2026-08-02T07:44:08.709873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-02T07:44:08.843992Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:08.843992Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:82273e9ba92369a43da7881a3534922eeb8c15732dafb4c97b7f9eee0c5550a0","observation_id":"893a902e-5c71-448f-b6ab-b9601a943054","resolution":{"observed_at":"2026-08-02T07:44:08.843992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-02T07:44:08.964328Z","title":"Alignment faking in large language models.arXiv preprint arXiv:2412.14093,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:08.964328Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:074aaecb1d44d5fa366182f13f711e38a2ef07fbcf41b568ae1315661e0c0c97","observation_id":"f1c8b897-c2c1-455b-bbcd-af557fd70f26","resolution":{"observed_at":"2026-08-02T07:44:08.964328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-08-02T07:44:09.041384Z","title":"Rubrics as rewards: Reinforcement learning beyond verifiable domains.arXiv preprint arXiv:2507.17746,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.041384Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:b86fe5f3c299c6da2a52e3450ebc94edd58e09b661291e08a2ff0e085528e794","observation_id":"b686f350-5d9c-45fd-b691-3b5b48c10978","resolution":{"observed_at":"2026-08-02T07:44:09.041384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-02T07:44:09.145063Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.145063Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:d742a682497f1053961947d2b12b9874b7f4d20c60a054b564e4bc43eb82efe6","observation_id":"67bbd316-71c9-4e0c-aa08-37a9e75ccdb4","resolution":{"observed_at":"2026-08-02T07:44:09.145063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:09.221267Z","title":"Val-bench: Measuring value alignment in language models.arXiv preprint arXiv:2510.05465,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.221267Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:020648516ae5d20e47955eb16dd1513a589630ee5a917bc1aa1e0d5372ef69d2","observation_id":"a95bba1c-e718-4851-bb67-d551f67aa950","resolution":{"observed_at":"2026-08-02T07:44:09.221267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01099","last_updated":"2024-08-20T17:54:08Z","snapshot_observed_at":"2026-08-07T19:50:06.174279Z","submitted_at":"2024-04-01T13:12:30Z","title":"What is in Your Safe Data? Identifying Benign Data that Breaks Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01099","snapshot_observed_at":"2026-08-02T07:44:09.310328Z","title":"10 Dan Hendrycks, Collin Burns, Steven Basart, Andy Zou, Mantas Mazeika, Dawn Song, and Jacob Steinhardt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.310328Z"},"links":{"cited_paper":"/paper/2404.01099","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:d4b5b8dfd218e661d6f0039b272e5c82542c91ccabbc11bbcc2f4d563e81c038","observation_id":"60817586-e035-49c2-9647-8334b689781a","resolution":{"observed_at":"2026-08-02T07:44:09.310328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:09.409877Z","title":"Understanding catastrophic forgetting in language models via implicit inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.409877Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:432abe19a0b353dbd4e7289e3a5c3d28d7f8656aad7076abd2483dd66873c9bd","observation_id":"93edbb92-ec61-45e5-a8d3-97889d1de0cf","resolution":{"observed_at":"2026-08-02T07:44:09.409877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-02T07:44:09.563432Z","title":"LoRA fine-tuning efficiently undoes safety training in Llama 2-chat 70b.arXiv preprint arXiv:2310.20624,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.563432Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:1eae778be49bdb9ed40d24700ab7f0ccb8efb3fd3f80f34a3fd7bed82bd301f5","observation_id":"ed4e70e1-67fb-424a-937f-79b556eadb57","resolution":{"observed_at":"2026-08-02T07:44:09.563432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-02T07:44:09.803411Z","title":"Holistic evaluation of language models.arXiv preprint arXiv:2211.09110,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.803411Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:515079e7c68992159f5d35e05197b542144f0b0d949310ef5094dfce3fe57c8c","observation_id":"cd3fdea8-e9d5-448b-8413-30ca16bb3482","resolution":{"observed_at":"2026-08-02T07:44:09.803411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-02T07:44:09.929971Z","title":"TruthfulQA: Measuring how models mimic human falsehoods.arXiv preprint arXiv:2109.07958,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.929971Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:35c0c621594215644034f91fd4c59f68b3d0c93c956c4e20165d4c341d6a9816","observation_id":"fa646ea2-3a36-4082-bb39-13ac93b65480","resolution":{"observed_at":"2026-08-02T07:44:09.929971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:10.066489Z","title":"Natural emergent misalignment from reward hacking in production RL.arXiv preprint arXiv:2511.18397,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:10.066489Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:28213b9b9912259a7ff1a6c8c46dd80327eb240719f9d1b336b8867caf9b619d","observation_id":"7f1373da-6470-4aa8-8236-455916a01d57","resolution":{"observed_at":"2026-08-02T07:44:10.066489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-02T07:44:10.182971Z","title":"HarmBench: A standardized evaluation framework for automated red teaming and robust refusal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:10.182971Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:2fee0c77d3a95bbc17e002373028b868c8ecec5e30c0e8cc5697995e32d35c89","observation_id":"ac092efd-0bf9-41b7-8ef4-d2f87a8cea56","resolution":{"observed_at":"2026-08-02T07:44:10.182971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.00133","last_updated":"2020-09-30T22:38:40Z","snapshot_observed_at":"2026-08-01T09:26:19.649537Z","submitted_at":"2020-09-30T22:38:40Z","title":"CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.00133","snapshot_observed_at":"2026-08-02T07:44:10.447865Z","title":"Long Ouyang, Jeffrey Wu, Xu Jiang, Diogo Almeida, Carroll L","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:10.447865Z"},"links":{"cited_paper":"/paper/2010.00133","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:e4ed3bcfc73431a5c7b84d6798309330d7504fcc31292e026804ec3673f7b2a1","observation_id":"da97eac8-1fb3-4ae9-8c6b-0d23d3ed6c0e","resolution":{"observed_at":"2026-08-02T07:44:10.447865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06681","last_updated":"2024-07-05T15:30:45Z","snapshot_observed_at":"2026-08-07T14:28:06.805424Z","submitted_at":"2023-12-09T04:40:46Z","title":"Steering Llama 2 via Contrastive Activation Addition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06681","snapshot_observed_at":"2026-08-02T07:44:10.618734Z","title":"Steering Llama 2 via contrastive activation addition.arXiv preprint arXiv:2312.06681,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:10.618734Z"},"links":{"cited_paper":"/paper/2312.06681","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:11d76d1d2e21c0bba87b2ed82f1dd130b0fea87a61c80f688295305e11947bd6","observation_id":"18ae449e-e1b3-4d26-bef0-54597ca2b9c6","resolution":{"observed_at":"2026-08-02T07:44:10.618734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08193","last_updated":"2022-03-16T01:35:45Z","snapshot_observed_at":"2026-07-06T11:58:21.596920Z","submitted_at":"2021-10-15T16:43:46Z","title":"BBQ: A Hand-Built Bias Benchmark for Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08193","snapshot_observed_at":"2026-08-02T07:44:10.724281Z","title":"11 Ethan Perez, Sam Ringer, Kamile Lukosiute, Karina Nguyen, Edwin Chen, Scott Heiner, Craig Pettit, Catherine Olsson, Sandipan Kundu, and Saurav Kadavath","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:10.724281Z"},"links":{"cited_paper":"/paper/2110.08193","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:8b469af4bd43131a1b44257b425fff2d4125a941fa8573343df7de033d484cfd","observation_id":"2a7d4085-942d-4811-a70d-16f853adca04","resolution":{"observed_at":"2026-08-02T07:44:10.724281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01420","last_updated":"2025-07-03T17:52:47Z","snapshot_observed_at":"2026-08-07T15:56:59.017435Z","submitted_at":"2025-05-02T17:57:14Z","title":"Evaluating Frontier Models for Stealth and Situational Awareness","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01420","snapshot_observed_at":"2026-08-02T07:44:10.876626Z","title":"Evaluating frontier models for stealth and situational awareness.arXiv preprint arXiv:2505.01420,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:10.876626Z"},"links":{"cited_paper":"/paper/2505.01420","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:ab1d560e424350d66a35353fdc99c02c7c53f60979c37bdfb62425039df6a589","observation_id":"e611791f-350a-4d55-914d-eda50aacda53","resolution":{"observed_at":"2026-08-02T07:44:10.876626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-02T07:44:10.978883Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to!arXiv preprint arXiv:2310.03693,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:10.978883Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:90de7b33419f9cf698f16316e2b02e054d91b7ffc2445f6dc728c724ed9f409a","observation_id":"a909cb6d-3143-4ced-a1df-19e32ac9708d","resolution":{"observed_at":"2026-08-02T07:44:10.978883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T07:44:11.097152Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.097152Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:4ac8ff672888c123491235683fe44272188aebfd0edd4a00beed2b83137b285a","observation_id":"2d90204a-e197-4ddb-829f-a2dc575a1c93","resolution":{"observed_at":"2026-08-02T07:44:11.097152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:11.291461Z","title":"Towards understanding sycophancy in language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.291461Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:617783dc796fa79e88c8d9e8a43702967b1ac77865df2f984e9d728964792b54","observation_id":"faa928a4-7c31-4015-a6e7-8f38383d3c1d","resolution":{"observed_at":"2026-08-02T07:44:11.291461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14387","last_updated":"2026-04-20T20:19:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-17T10:33:23Z","title":"SEAT: Sparse Entity-Aware Tuning for Knowledge Adaptation while Preserving Epistemic Abstention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14387","snapshot_observed_at":"2026-08-02T07:44:11.373496Z","title":"Llm unlearning via neural activation redirection.Advances in Neural Information Processing Systems, 38:44253–44290, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.373496Z"},"links":{"cited_paper":"/paper/2506.14387","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:2a5f57ba4953d268d78c24777f99af365cc4146a5823aa54c5e6f34d2c87d456","observation_id":"9799853d-1213-49ec-9fed-4a72e5596838","resolution":{"observed_at":"2026-08-02T07:44:11.373496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:11.472483Z","title":"Rethinking rubric generation for improving llm judge and reward modeling for open-ended tasks.arXiv preprint arXiv:2602.05125, 2026b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.472483Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:c092554777ac74e48db6805f4e60a2daea1ea85cb383e7c22c3cf79f28c08151","observation_id":"ecc72661-25ad-4704-bebd-5a06674b1d0d","resolution":{"observed_at":"2026-08-02T07:44:11.472483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:11.574118Z","title":"Efficiency vs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.574118Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:7d0872bffc3acd0e563fdf79327fe9efe5e925dc2c75a6f7bda938fa2e0a24e1","observation_id":"f4383b94-2b9f-4d14-9b4a-b5ffc5bd0505","resolution":{"observed_at":"2026-08-02T07:44:11.574118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.29358","last_updated":"2026-05-28T04:57:47Z","snapshot_observed_at":"2026-07-06T23:38:46.361360Z","submitted_at":"2026-05-28T04:57:47Z","title":"Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.29358","snapshot_observed_at":"2026-08-02T07:44:11.683306Z","title":"Scaling monosemanticity: Extracting interpretable features from claude 3 sonnet.arXiv preprint arXiv:2605.29358,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.683306Z"},"links":{"cited_paper":"/paper/2605.29358","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:d22dc41fa6dc1b744f9d851f85c004cf69698971f23fe2627dbda74c54e4c715","observation_id":"2a576681-4e36-4855-a189-130589f46210","resolution":{"observed_at":"2026-08-02T07:44:11.683306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-02T07:44:11.904578Z","title":"Reinforcement learning with verifiable rewards implicitly incentivizes correct reasoning in base llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.904578Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:d09857090b988e71762827342b625a07f256114f2415b9aeccea36817053ed52","observation_id":"2ccb2f31-6291-4be4-81d2-34523d9259e8","resolution":{"observed_at":"2026-08-02T07:44:11.904578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01364","last_updated":"2024-02-07T07:14:39Z","snapshot_observed_at":"2026-08-04T18:35:41.659861Z","submitted_at":"2024-02-02T12:34:09Z","title":"Continual Learning for Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01364","snapshot_observed_at":"2026-08-02T07:44:11.986628Z","title":"Continual learning for large language models: A survey.arXiv preprint arXiv:2402.01364,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.986628Z"},"links":{"cited_paper":"/paper/2402.01364","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:e9fb411c071bec527b7e9047cf3e6ae5f13d05ade31dd8564bdb116a17a3bc03","observation_id":"44ce3f33-e5bb-444d-b68f-21fc76dd0456","resolution":{"observed_at":"2026-08-02T07:44:11.986628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-02T07:44:12.128064Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.128064Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:99a7cb64b9f846099dd5fe551dc521a6c6766e9342593c655a19631c04cf4638","observation_id":"c758f0d3-8683-4048-894a-f186754125ba","resolution":{"observed_at":"2026-08-02T07:44:12.128064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T07:44:12.204085Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.204085Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:84d3a1af67f20fd8b0b4b9185e7859ec51c8ae9f4b4e58835e838ed2927732e6","observation_id":"3282e5e5-ac55-46e1-aca2-a48f7d1b8956","resolution":{"observed_at":"2026-08-02T07:44:12.204085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02949","last_updated":"2023-10-04T16:39:31Z","snapshot_observed_at":"2026-08-07T11:20:01.991656Z","submitted_at":"2023-10-04T16:39:31Z","title":"Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02949","snapshot_observed_at":"2026-08-02T07:44:12.284016Z","title":"Shadow alignment: The ease of subverting safely-aligned language models.arXiv preprint arXiv:2310.02949,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.284016Z"},"links":{"cited_paper":"/paper/2310.02949","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:709897d6b84e0482266ed2069645f2194acaf953878056fbd8fd88ae87dc4245","observation_id":"6dc0aa6b-640a-4bd9-8fbc-554c13c04373","resolution":{"observed_at":"2026-08-02T07:44:12.284016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-02T07:44:12.338931Z","title":"Junhao Zheng, Shengjie Qiu, Chengming Shi, and Qianli Ma","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.338931Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:ebf8c8194c56d5a81d1a224cc6800cb363e7746bf877f7c611db294efa7387c9","observation_id":"0bc464dc-398e-45a6-a3c0-388d06036cc7","resolution":{"observed_at":"2026-08-02T07:44:12.338931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-02T07:44:12.407447Z","title":"Instruction-following evaluation for large language models.arXiv preprint arXiv:2311.07911,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.407447Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:14e6176e3206a65d8a504c947ba2ce0db4c9d54e1171e852b57890f083e83e68","observation_id":"af3ebd5a-7c02-4ae3-8603-1ef177ca39df","resolution":{"observed_at":"2026-08-02T07:44:12.407447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:12.507333Z","title":"The path not taken: RLVR provably learns off the principals.arXiv preprint arXiv:2511.08567,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.507333Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:0cfe75de52981ae86c39e7fe1acd9c998ac45e27d846d57c277337c2285f661a","observation_id":"67ea0e6d-4bc8-479c-8011-a47dc483ee69","resolution":{"observed_at":"2026-08-02T07:44:12.507333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-02T07:44:12.594577Z","title":"Representation engineering: A top-down approach to ai transparency.arXiv preprint arXiv:2310.01405,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.594577Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:99fceb6253b783118da4a21e58a885a56b4e957261ad90f969896959a629d1c5","observation_id":"dd97763e-1c09-4b9f-824d-79d1451e595e","resolution":{"observed_at":"2026-08-02T07:44:12.594577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:12.714401Z","title":"15 A.2 KL-Regularized SFT","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.714401Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:466498f1a3abcd0c33a75d96fff07ee66a0239b9403695b9cb1ee27b8d8909dc","observation_id":"0bb0f0b0-23d6-40c2-a88b-c47c2bfe9f17","resolution":{"observed_at":"2026-08-02T07:44:12.714401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:12.794413Z","title":"GRPO-based RLVR is trained to a fixed number of steps with almost all reaching reward saturation, while SFT and KL-SFT use the fixed epoch budgets in Table","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.794413Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:1e53f4fb17f637773049ae232c4563f9bbfc4707b27249da0fe4f16cd9713f0a","observation_id":"29f6243c-f362-4ae0-8bd9-ab00a9b7110f","resolution":{"observed_at":"2026-08-02T07:44:12.794413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:12.861870Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.861870Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:b657bd95b861a3e5c2384ac5a43e269a965509cb9047695c9bbe11cff766f781","observation_id":"21c96e9d-c54a-45a6-873c-e0280e23026d","resolution":{"observed_at":"2026-08-02T07:44:12.861870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:12.908742Z","title":"We report the headline metric, the preferred direction, and the aggregation procedure used when benchmarks contain multiple subtasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.908742Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:f6ee59c9bb3dc1b947bb546ae45264e56efae40e075817541046d9cc9b53deb5","observation_id":"240f51fc-e227-4227-86ff-10f2289e7486","resolution":{"observed_at":"2026-08-02T07:44:12.908742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T07:44:11.200447Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.200447Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:b8fa972a57361534a782a0074e1706dcc1b684c19942582148654c17377c4869","observation_id":"e9305019-ea83-44a8-a90a-13cdd5fe1d29","resolution":{"observed_at":"2026-08-02T07:44:11.200447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:10.281592Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:10.281592Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:10a95c3ef08477531ccbb5775e19acae0e87826e69cf5181e8633f3b98518b77","observation_id":"47ed0b9f-43c9-4d4a-b30e-33b65240793b","resolution":{"observed_at":"2026-08-02T07:44:10.281592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:08.124547Z","title":"Breaking the safety-capability tradeoff: Reinforcement learning with verifiable rewards maintains safety guardrails in LLMs.arXiv preprint arXiv:2511.21050,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:08.124547Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:b0e11339ce97f524146fc770ebd3a8af3c726fbe61cd64aa9ba8e1223832ce12","observation_id":"53feb5b4-32ca-43f4-b1cf-38789ac341f3","resolution":{"observed_at":"2026-08-02T07:44:08.124547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14852","last_updated":"2023-12-27T10:09:18Z","snapshot_observed_at":"2026-07-06T17:07:14.412645Z","submitted_at":"2023-12-22T17:25:42Z","title":"TACO: Topics in Algorithmic COde generation dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14852","snapshot_observed_at":"2026-08-02T07:44:09.658983Z","title":"Taco: Topics in algorithmic code generation dataset.arXiv preprint arXiv:2312.14852,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.658983Z"},"links":{"cited_paper":"/paper/2312.14852","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:fc6f19f692704ac2d0dfc16afc2b5f6f4f09ec557044841d8a641439a52a1267","observation_id":"2f170256-bcb4-45cb-b0a5-042892823d5f","resolution":{"observed_at":"2026-08-02T07:44:09.658983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05386","last_updated":"2026-06-29T17:47:49Z","snapshot_observed_at":"2026-08-06T19:25:14.929252Z","submitted_at":"2025-07-07T18:17:06Z","title":"Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05386","snapshot_observed_at":"2026-08-02T07:44:09.499800Z","title":"Reinforcement fine-tuning naturally mitigates forgetting in continual post-training.arXiv preprint arXiv:2507.05386,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.499800Z"},"links":{"cited_paper":"/paper/2507.05386","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:69ee0c792bc774dfbcce325575ccd0986469dd2a2c38dc672951a278772bfd63","observation_id":"715f6f3d-a357-440f-8bbd-1efd2c690acf","resolution":{"observed_at":"2026-08-02T07:44:09.499800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-02T07:44:07.870753Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:07.870753Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:b005d39fbfa86e66b372b4745507a73f59cb634aa68b95b9fda8f9369ba888c6","observation_id":"c2b3e20b-dbc5-4ab0-8f0f-77258d1ed2fb","resolution":{"observed_at":"2026-08-02T07:44:07.870753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-02T07:44:07.946955Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:07.946955Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:fefb98c3cdc819c72064fd7b76d20dcaffae842875602b7d5f389afeb4ccdbf1","observation_id":"be94e655-cd29-4999-9bef-8b9fb268711a","resolution":{"observed_at":"2026-08-02T07:44:07.946955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:11.838709Z","title":"Persona features control emergent misalignment.arXiv preprint arXiv:2506.19823,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.838709Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:bf05335ea138fc9742c595419f328274a1e3cac143c43b7b5db9943294539275","observation_id":"ca54fa19-a4f1-410c-986d-48769cb5dcee","resolution":{"observed_at":"2026-08-02T07:44:11.838709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2607.22676."}