{"as_of":"2026-08-08T18:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:690ffe75273e909550991e9ea2b4b0265f6a10bd6b6921786ce7d2db3881c6f5","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:43:21.314750Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T05:01:31.560963Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T05:05:23.125298Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"cited_work":{"arxiv_id":"2509.23982","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.23982","snapshot_observed_at":"2026-06-11T02:09:25.231208Z","title":"arXiv preprint arXiv:2509.23982 , year=","venue":null,"work_id":"cb0b089a-dfe3-4a29-83d5-6fdd233c5ffb","year":null},"citing_paper":{"arxiv_id":"2605.23244","last_updated":"2026-05-22T05:25:00Z","snapshot_observed_at":"2026-08-01T14:10:27.190441Z","submitted_at":"2026-05-22T05:25:00Z","title":"Convex Optimization for Alignment and Preference Learning on a Single GPU","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-25T05:01:31.560963Z"},"links":{"cited_paper":"/paper/2509.23982","citing_paper":"/paper/2605.23244"},"observation_digest":"sha256:de1652d48f325fa7a6ab580f14b833fdde0419b529ea0fbf93fbdf3c08b8032d","observation_id":"2d53874f-e7fb-4f91-81b1-79e2043f9197","resolution":{"observed_at":"2026-06-11T02:09:25.231208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.23982/citation-record","integrity":"/paper/2509.23982/integrity","json":"/paper/2509.23982/citation-record.json","paper":"/paper/2509.23982"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:12.143999Z","title":"Refusal in language models is mediated by a single direction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:12.143999Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:1b7d3eaa19c271bc0f0474a54daafebb77f047aa1e1201977eeddedf1f2147d7","observation_id":"a7066031-e74f-455a-ac42-96f14ad64a3a","resolution":{"observed_at":"2026-08-04T14:43:12.143999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-04T14:43:12.267212Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:12.267212Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:0bf8ea4eaf751ff37df22aa6d0d363327773dcf850091d30806e3c861b437192","observation_id":"53860acd-dc0b-4902-8e5d-b863240d7234","resolution":{"observed_at":"2026-08-04T14:43:12.267212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:12.464748Z","title":"Steering large language model activations in sparse spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:12.464748Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:08aea747558e2879d5e6ebc98e48e60c2f9dcb89e0ea589c779e7d621615f1be","observation_id":"81c04a43-bacc-4e83-a1c8-54a8cb859a74","resolution":{"observed_at":"2026-08-04T14:43:12.464748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:12.557998Z","title":"LEACE: perfect linear concept erasure in closed form","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:12.557998Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:53ca45bf84504099f07c3236e1ffcd053b62659e9b18efc0e3a8940342d23793","observation_id":"cbc1bf02-1480-43e3-a56e-5845f910b198","resolution":{"observed_at":"2026-08-04T14:43:12.557998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:12.644750Z","title":"Diff-in-means concept editing is worst-case optimal: Explaining a result by Sam Marks and Max Tegmark , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:12.644750Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:c22a9496d8e4677d55feb06ce5518342e5b1d2d6216fd36e13dfb34da3305ff8","observation_id":"79fb6bcf-b1ae-45ca-9f9d-1bea87fb9b93","resolution":{"observed_at":"2026-08-04T14:43:12.644750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.03315","last_updated":"2021-02-05T17:41:43Z","snapshot_observed_at":"2026-08-04T00:22:28.888492Z","submitted_at":"2021-02-05T17:41:43Z","title":"Think you have Solved Direct-Answer Question Answering? Try ARC-DA, the Direct-Answer AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.03315","snapshot_observed_at":"2026-08-04T14:43:12.724861Z","title":"Think you have solved direct-answer question answering? try arc-da, the direct-answer AI2 reasoning challenge","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:12.724861Z"},"links":{"cited_paper":"/paper/2102.03315","citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:67cbe3d342f1b6e40804162cdac7681254382bacad0c682f9d906f92e9b3ec5c","observation_id":"93b1b66c-fcb1-4b37-b0a3-e71106b7986c","resolution":{"observed_at":"2026-08-04T14:43:12.724861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:12.824752Z","title":"Discovering latent knowledge in language models without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:12.824752Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:ff741ca55ea407d109bba0676b6d7922188824d7b7f5010e68eadf8aa76cc2bd","observation_id":"7fcab025-31aa-4e6c-9a80-1a423dbc3d41","resolution":{"observed_at":"2026-08-04T14:43:12.824752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:12.974928Z","title":"Personalized steering of large language models: Versatile steering vectors through bi-directional preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:12.974928Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:c6c8db8112781f1d2c6dff18c6426a7e83badd20f84727f70e047a028f403787","observation_id":"1e6d257d-25aa-41b1-a6b3-84ef18312515","resolution":{"observed_at":"2026-08-04T14:43:12.974928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-04T14:43:13.209027Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:13.209027Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:b7a08cac4d6cc43401cb3b7e103ce9d941b1b34586f20fb5c582d5e416f12933","observation_id":"fad29e6a-2439-4a5d-b368-a508aab4ba19","resolution":{"observed_at":"2026-08-04T14:43:13.209027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:13.409349Z","title":"Parallel structures in pre-training data yield in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:13.409349Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:dcbdd80c94b2a784b43ea1184ac488ccebae86ebfd9c3d0b977632beb1ad1fb2","observation_id":"d7d4c956-8082-4345-a93a-7cc84eff10b1","resolution":{"observed_at":"2026-08-04T14:43:13.409349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21509","last_updated":"2025-09-05T07:44:31Z","snapshot_observed_at":"2026-07-31T17:57:12.284928Z","submitted_at":"2025-07-29T05:20:14Z","title":"Persona Vectors: Monitoring and Controlling Character Traits in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21509","snapshot_observed_at":"2026-08-04T14:43:13.544748Z","title":"Persona vectors: Monitoring and controlling character traits in language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:13.544748Z"},"links":{"cited_paper":"/paper/2507.21509","citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:5eb31eb0c22523987ca8b1027d52f975939877801e1310f464c8cff0405827b4","observation_id":"308757df-3df9-4a29-b1f1-ca5d0e7799c5","resolution":{"observed_at":"2026-08-04T14:43:13.544748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T14:43:13.683380Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:13.683380Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:88db684182629e4ac05631be2374cba10496dbb8ff9d3ef354db63f40301efa4","observation_id":"bfc6b6e5-971a-44ac-b6cd-f96a35498b64","resolution":{"observed_at":"2026-08-04T14:43:13.683380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T14:43:13.887790Z","title":"The Llama 3 Herd of Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:13.887790Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:bd27e0005323bacd6de6a81d9b5757093c6fc7af69643e9f0bd537e0e3408191","observation_id":"e4cff832-77cb-417d-897f-6cb8392e6a17","resolution":{"observed_at":"2026-08-04T14:43:13.887790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10652","last_updated":"2022-09-21T20:49:26Z","snapshot_observed_at":"2026-07-06T13:54:56.779166Z","submitted_at":"2022-09-21T20:49:26Z","title":"Toy Models of Superposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10652","snapshot_observed_at":"2026-08-04T14:43:14.064746Z","title":"Toy models of superposition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:14.064746Z"},"links":{"cited_paper":"/paper/2209.10652","citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:51c2b491c87b3ec88316ffb137d4fa004a25016bf1642c7ba6038af7d8b784f4","observation_id":"4ea6cd76-a948-420e-9a44-749d40a393fe","resolution":{"observed_at":"2026-08-04T14:43:14.064746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:14.254757Z","title":"The language model evaluation harness, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:14.254757Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:eec5a3c9680ebb946980efbae71075fb501be66c91991d3acd1e5bf17c23d130","observation_id":"70b8e7d6-bf7a-4837-a42a-f6d4e5999812","resolution":{"observed_at":"2026-08-04T14:43:14.254757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:14.434762Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:14.434762Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:9944be2ebbda35b5d5261df61244923ea4e76e07f16216a52322bdde222164aa","observation_id":"88198547-a9b0-4c5f-9827-30a2996c8b06","resolution":{"observed_at":"2026-08-04T14:43:14.434762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:14.594748Z","title":"The low-dimensional linear geometry of contextualized word representations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:14.594748Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:ec205edff526061260ca9c948adda49d2afcf428d7a3878baa7c0efdf8021af0","observation_id":"4a2dbd9f-48c3-434c-8c7f-bb105eef19c9","resolution":{"observed_at":"2026-08-04T14:43:14.594748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:14.704843Z","title":"ORPO : Monolithic preference optimization without reference model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:14.704843Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:50f65502cf364bb558347b6ac1e2d3412b46cba4d09c31a4867354948c6fa519","observation_id":"ae43ee9f-22be-4d38-ad16-5a6dc0b5b37a","resolution":{"observed_at":"2026-08-04T14:43:14.704843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:14.875750Z","title":"Sparse autoencoders find highly interpretable features in language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:14.875750Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:305518ee0530f3bb34d49d86cc98c6e76458e0aa6435b5f65ae311738aa8ff23","observation_id":"d91f008a-f6fe-461b-8b17-f99be0565563","resolution":{"observed_at":"2026-08-04T14:43:14.875750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-04T14:43:15.054748Z","title":"Jiang, Alexandre Sablayrolles, Arthur Mensch, and et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:15.054748Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:239c1848bb8c57e33ac339c3bc13a1709eb70def2c83a062615c82849ee6f720","observation_id":"d828aca1-dacb-47ea-a1b7-aaf22f829161","resolution":{"observed_at":"2026-08-04T14:43:15.054748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:15.184754Z","title":"LMD 3: Language model data density dependence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:15.184754Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:e20e2a0519e61e5279dc3f66a4a0ed343196344042c3c40a9255e477ffb65ce7","observation_id":"ebf5bc74-e24a-44e4-90e2-a0a6b39cf570","resolution":{"observed_at":"2026-08-04T14:43:15.184754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:15.361603Z","title":"o pf, Yannic Kilcher, Dimitri von R \\","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:15.361603Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:892a1c45e1b54ed899ffc07caeece2e87680056781491d40bbaa9074a1be92ab","observation_id":"79422e0a-7acd-4d2f-b4c3-dbe52f5adca3","resolution":{"observed_at":"2026-08-04T14:43:15.361603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06981","last_updated":"2025-05-21T00:01:46Z","snapshot_observed_at":"2026-08-07T14:16:41.337428Z","submitted_at":"2024-10-09T15:18:57Z","title":"Quantifying Feature Space Universality Across Large Language Models via Sparse Autoencoders","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06981","snapshot_observed_at":"2026-08-04T14:43:15.444750Z","title":"Quantifying feature space universality across large language models via sparse autoencoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:15.444750Z"},"links":{"cited_paper":"/paper/2410.06981","citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:49b532bb3a8a7b5e11f4243ae95c76088cb354ca94dadb60d14c0a071af167a4","observation_id":"0702b72c-a1bd-4e7f-8bff-6e7e8eaa4cd0","resolution":{"observed_at":"2026-08-04T14:43:15.444750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:15.644877Z","title":"Li, Maxwell Nye, and Jacob Andreas","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:15.644877Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:51294554ccb9af91133020c1e3d9acc431dd1995dd6c2cacbaad9dcd7e90fc14","observation_id":"1b81097b-bd36-49f7-ac2b-dd113474472b","resolution":{"observed_at":"2026-08-04T14:43:15.644877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:15.774753Z","title":"Vi \\' e gas, and et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:15.774753Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:55b2aeed484aa7190513a75ee74a41b198ff36bb269172af5e4ac34551bf5090","observation_id":"144fb43e-21ca-4e76-8233-a559922e3fee","resolution":{"observed_at":"2026-08-04T14:43:15.774753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:16.134752Z","title":"Fundamental capabilities and applications of large language models: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:16.134752Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:20269b736e287594b4ce87726f5c8397cae522648f21589105438f2867a86b6b","observation_id":"db5ad6e3-b19c-4156-b97f-150516ef1319","resolution":{"observed_at":"2026-08-04T14:43:16.134752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:16.315534Z","title":"T ruthful QA : Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:16.315534Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:40a4b8b2b3280eb7d9558cb106a7622803c236485a36cf5cf96021f284fd7776","observation_id":"c05607f3-0148-471f-8d49-674894a6d486","resolution":{"observed_at":"2026-08-04T14:43:16.315534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:16.561775Z","title":"Aligning large language models with human preferences through representation engineering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:16.561775Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:4f06da84ae840f401051485fa75dc42e25dce63fb2cb6081bca310e8affc6e2e","observation_id":"fd3602db-1976-4a9d-ab23-b1e2fa136f63","resolution":{"observed_at":"2026-08-04T14:43:16.561775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:16.795032Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:16.795032Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:19dd55e3108e1e987ef517490608a3a5e57b478c785d20c2702d10f70c8096a9","observation_id":"46232db0-ecbd-4603-b717-3cf494164c19","resolution":{"observed_at":"2026-08-04T14:43:16.795032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:16.994750Z","title":"Emergent linear representations in world models of self-supervised sequence models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:16.994750Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:facf836debab0eb43b1ffae534eb7db01e45e6420cf3d93c4f394dbdccc4800d","observation_id":"f3418d53-1c4a-482d-9a50-0af3de03c489","resolution":{"observed_at":"2026-08-04T14:43:16.994750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-04T14:43:17.173482Z","title":"2 OLMo 2 Furious","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:17.173482Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:3f71847c0f8e9e621e0efd3ba92c99d053a407aee0fd831b7629177e84010472","observation_id":"c1c33619-4d4f-49d3-a22b-f65c2f731370","resolution":{"observed_at":"2026-08-04T14:43:17.173482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:17.394752Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:17.394752Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:185c8d95f2a81c1f21d5b028572d708444cae11a2f6fe68596563b9b392d8ffe","observation_id":"b687dfa6-ada5-4291-89bb-763c0a15ba51","resolution":{"observed_at":"2026-08-04T14:43:17.394752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:17.528077Z","title":"The linear representation hypothesis and the geometry of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:17.528077Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:7fa03417eaeeb6e6e5a5e1a488c3da6ef93654f05e557bd7767f3ecb7ecbe551","observation_id":"35565024-5e6a-4aaa-bf2b-d375c635f2d8","resolution":{"observed_at":"2026-08-04T14:43:17.528077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:17.824932Z","title":"tinyBenchmarks: evaluating LLMs with fewer examples","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:17.824932Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:7a6d44364b0e24812aa822f8b779dd87e2f042c5d4b0be9b49e158e30c39cacd","observation_id":"865360a5-6247-4fe1-ae79-ceba8e5774cc","resolution":{"observed_at":"2026-08-04T14:43:17.824932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:18.005111Z","title":"Manning, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:18.005111Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:be21e7101cdba4da34824f8f5721facb68df3c3c6ab92b88ee7c31f77df75464","observation_id":"bf62e150-484b-417a-a4a2-21b94c10a541","resolution":{"observed_at":"2026-08-04T14:43:18.005111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:18.294744Z","title":"Steering llama 2 via contrastive activation addition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:18.294744Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:4aeca9e46a71f89753fc4bb8992256e6b04e7110a3a04a23c80ca42addde3243","observation_id":"a5a1b8a8-7a7d-470d-8626-f37f722e63d6","resolution":{"observed_at":"2026-08-04T14:43:18.294744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:18.525598Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:18.525598Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:f374d4da1a666cc44d7e91e19349ae6adb0f29764b7d979500e3d9a9aad19de1","observation_id":"5810186a-a2da-4be2-87ce-31d1ec6678d3","resolution":{"observed_at":"2026-08-04T14:43:18.525598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:18.684758Z","title":"Detection and measurement of syntactic templates in generated text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:18.684758Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:f17f954b967f34e74f6e9929a1739dd14b1c946ad7cb641803d0ca58a4e58f72","observation_id":"72010ca9-59cd-4097-9f61-d4d4c9ec3fed","resolution":{"observed_at":"2026-08-04T14:43:18.684758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15025","last_updated":"2023-09-26T15:49:23Z","snapshot_observed_at":"2026-07-06T16:23:53.247204Z","submitted_at":"2023-09-26T15:49:23Z","title":"Large Language Model Alignment: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15025","snapshot_observed_at":"2026-08-04T14:43:18.824756Z","title":"Large language model alignment: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:18.824756Z"},"links":{"cited_paper":"/paper/2309.15025","citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:6e98d07633df3d5dd8029a7a0bc406fd2249ff4fa693c3c409bdc1f225695413","observation_id":"4e8b61c0-0c8b-4831-af0b-c82385093b46","resolution":{"observed_at":"2026-08-04T14:43:18.824756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:18.924873Z","title":"A survey on sparse autoencoders: Interpreting the internal mechanisms of large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:18.924873Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:3ebaf82b41eadebed5bcfe50b3bc4ab9be22ad81e14214dd19812b824d003378","observation_id":"d640ac31-b7a3-443d-ab2d-580c908be2ec","resolution":{"observed_at":"2026-08-04T14:43:18.924873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:19.144752Z","title":"Learning to summarize with human feedback","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:19.144752Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:fb2a5fd83faf916b562937f9a78ec6c04e661465f5d76995a52c1bcf37a6bf1d","observation_id":"b433cce3-906b-48bf-81fb-7309d8d40feb","resolution":{"observed_at":"2026-08-04T14:43:19.144752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:19.393688Z","title":"Hollinsworth, Atticus Geiger, and Neel Nanda","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:19.393688Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:68de67dfd1b9dc535303c715e9c6ac374f08615f6d641d519db1df4504568a85","observation_id":"09a566d0-9bda-4445-b51a-bb13fa396788","resolution":{"observed_at":"2026-08-04T14:43:19.393688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-04T14:43:19.610006Z","title":"Steering language models with activation engineering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:19.610006Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:7e2d4dea42f6cb482a1acd98039987ece5264805fdbc4af65bbed956678560d0","observation_id":"821e0b59-0ad4-4bdb-bafc-cdfb2c97d404","resolution":{"observed_at":"2026-08-04T14:43:19.610006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12966","last_updated":"2023-07-24T17:44:58Z","snapshot_observed_at":"2026-07-06T15:57:57.167169Z","submitted_at":"2023-07-24T17:44:58Z","title":"Aligning Large Language Models with Human: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12966","snapshot_observed_at":"2026-08-04T14:43:19.875156Z","title":"Aligning large language models with human: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:19.875156Z"},"links":{"cited_paper":"/paper/2307.12966","citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:e53d2ff575ee76f790ff38941d6d0af921e55e07cb266228958b39fbba2798b7","observation_id":"deaaa5d5-8995-4668-994d-06a8fac37e73","resolution":{"observed_at":"2026-08-04T14:43:19.875156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:20.014570Z","title":"Beyond prompt engineering: Robust behavior control in LLM s via steering target atoms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:20.014570Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:41750298f90a1fc36de09d3b6110a126740bde12f25d711425ea594e26805bb3","observation_id":"1ceb96b0-9f8b-430c-9200-967ca2c7e115","resolution":{"observed_at":"2026-08-04T14:43:20.014570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:20.214767Z","title":"Surgical, cheap, and flexible: Mitigating false refusal in language models via single vector ablation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:20.214767Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:2f1a8bad07ae38d26bc8f61b6cc68997382bc470276e6ceef0d52e7747c46ce7","observation_id":"ad6bd5f0-081f-4f96-874c-54d299b1e61c","resolution":{"observed_at":"2026-08-04T14:43:20.214767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:20.394762Z","title":"Generalization v.s","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:20.394762Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:52a215c5f06f22a89430b9ec8c1fb784aa4facb16363212e55d37c341d211a46","observation_id":"a9906af5-d761-4b23-b467-e090e82befde","resolution":{"observed_at":"2026-08-04T14:43:20.394762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:20.764759Z","title":"H ella S wag: Can a machine really finish your sentence? In Proc","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:20.764759Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:aa6c95192b11cdb6957cfe5a5c131e3723c5f1e84b5fdd76bccefc3d00f812b0","observation_id":"3ef2c149-b0eb-4d06-be40-08bda14f1821","resolution":{"observed_at":"2026-08-04T14:43:20.764759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:21.054749Z","title":"Towards best practices of activation patching in language models: Metrics and methods","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:21.054749Z"},"links":{"citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:2a1229043797ca6f52cc5e5fd5f4ce46b58c8b69a0349f719219631d0c67f87e","observation_id":"1b5e7c8f-fa56-41d5-a870-6d1aeb4794dd","resolution":{"observed_at":"2026-08-04T14:43:21.054749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-04T14:43:21.314750Z","title":"Representation engineering: A top-down approach to AI transparency","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:21.314750Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2509.23982"},"observation_digest":"sha256:3b52a8165fdac4f55b20583fd8cc8406c4928b2f3380a62e99c6b17318f93ebe","observation_id":"04735ae7-d6cb-4e15-8027-d9165c427c76","resolution":{"observed_at":"2026-08-04T14:43:21.314750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.23982","last_updated":"2026-06-10T12:58:24Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T19:47:22.064191Z","submitted_at":"2025-09-28T17:16:16Z","title":"Toward Preference-aligned Large Language Models via Residual-based Model Steering"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2509.23982."}