{"as_of":"2026-08-07T21:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7841240b744dada9d13b9c81e0532af6d46ea97f7c1643f18b14b2454ba7cae3","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:10:08.895546Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T11:08:17.571722Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:49:57.002506Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"cited_work":{"arxiv_id":"2505.22637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22637","snapshot_observed_at":"2026-07-04T15:49:57.002506Z","title":"Understanding (un)reliability of steering vectors in language models","venue":null,"work_id":"de563140-cf5f-4bd9-bcc9-8cdc63c5aab8","year":2025},"citing_paper":{"arxiv_id":"2605.02946","last_updated":"2026-05-01T11:54:55Z","snapshot_observed_at":"2026-07-31T02:35:59.178763Z","submitted_at":"2026-05-01T11:54:55Z","title":"RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T19:22:00.217729Z"},"links":{"cited_paper":"/paper/2505.22637","citing_paper":"/paper/2605.02946"},"observation_digest":"sha256:6c6adf8a3b63097ca94b020b80940c02ada8cb0e2b77431b2aa96b5f7f6dc021","observation_id":"70274d98-43c8-4562-bdd8-b51bc6ccbdfe","resolution":{"observed_at":"2026-05-11T15:46:13.825157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"cited_work":{"arxiv_id":"2505.22637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22637","snapshot_observed_at":"2026-07-04T15:49:57.002506Z","title":"Understanding (un)reliability of steering vectors in language models","venue":null,"work_id":"de563140-cf5f-4bd9-bcc9-8cdc63c5aab8","year":2025},"citing_paper":{"arxiv_id":"2605.10664","last_updated":"2026-05-14T04:08:33Z","snapshot_observed_at":"2026-08-06T18:09:17.820445Z","submitted_at":"2026-05-11T14:44:32Z","title":"Prompt-Activation Duality: Improving Activation Steering via Attention-Level Interventions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:27:15.490694Z"},"links":{"cited_paper":"/paper/2505.22637","citing_paper":"/paper/2605.10664"},"observation_digest":"sha256:ee11c15ee464e250b687ec85c08fa308ff2b76309ae0ff1c43c4b39b3bef9650","observation_id":"69162c32-1c61-409f-b86e-267231d7d9cd","resolution":{"observed_at":"2026-05-12T06:16:25.939080Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"cited_work":{"arxiv_id":"2505.22637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22637","snapshot_observed_at":"2026-07-04T15:49:57.002506Z","title":"Understanding (un)reliability of steering vectors in language models","venue":null,"work_id":"de563140-cf5f-4bd9-bcc9-8cdc63c5aab8","year":2025},"citing_paper":{"arxiv_id":"2605.10664","last_updated":"2026-05-14T04:08:33Z","snapshot_observed_at":"2026-08-06T18:09:17.820445Z","submitted_at":"2026-05-11T14:44:32Z","title":"Prompt-Activation Duality: Improving Activation Steering via Attention-Level Interventions","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T05:27:59.011749Z"},"links":{"cited_paper":"/paper/2505.22637","citing_paper":"/paper/2605.10664"},"observation_digest":"sha256:0fce29a92210b900cc1cacfa36c310e45ca3bbcce9f5af1cfcee30c06351a30a","observation_id":"71c24dca-f1f9-44a7-b847-9c1a5afd1c8e","resolution":{"observed_at":"2026-05-15T05:29:47.076007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"cited_work":{"arxiv_id":"2505.22637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22637","snapshot_observed_at":"2026-07-04T15:49:57.002506Z","title":"Understanding (un)reliability of steering vectors in language models","venue":null,"work_id":"de563140-cf5f-4bd9-bcc9-8cdc63c5aab8","year":2025},"citing_paper":{"arxiv_id":"2605.16362","last_updated":"2026-05-20T21:23:48Z","snapshot_observed_at":"2026-07-06T23:27:29.931962Z","submitted_at":"2026-05-09T14:26:49Z","title":"When Is Rank-1 Steering Cheap? Geometry, Granularity, and Budgeted Search","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T22:36:12.466550Z"},"links":{"cited_paper":"/paper/2505.22637","citing_paper":"/paper/2605.16362"},"observation_digest":"sha256:370d301c675e79c4721dd20df429d940c3ba65562f6448e9cfde11d0dfcd3227","observation_id":"1e77b7e1-96eb-4d6f-92e0-237f38dca4b5","resolution":{"observed_at":"2026-05-20T22:39:10.703623Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"cited_work":{"arxiv_id":"2505.22637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22637","snapshot_observed_at":"2026-07-04T15:49:57.002506Z","title":"Understanding (un)reliability of steering vectors in language models","venue":null,"work_id":"de563140-cf5f-4bd9-bcc9-8cdc63c5aab8","year":2025},"citing_paper":{"arxiv_id":"2605.16362","last_updated":"2026-05-20T21:23:48Z","snapshot_observed_at":"2026-07-06T23:27:29.931962Z","submitted_at":"2026-05-09T14:26:49Z","title":"When Is Rank-1 Steering Cheap? Geometry, Granularity, and Budgeted Search","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T09:59:32.201925Z"},"links":{"cited_paper":"/paper/2505.22637","citing_paper":"/paper/2605.16362"},"observation_digest":"sha256:29b55e5bf25e25b779a0159dc4eb3a1d42f44911115b2b1710a850c01517e67f","observation_id":"b48fd55b-ee3c-4512-a253-0d40a3b82cbb","resolution":{"observed_at":"2026-05-22T10:01:23.525559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"cited_work":{"arxiv_id":"2505.22637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22637","snapshot_observed_at":"2026-07-04T15:49:57.002506Z","title":"Understanding (un)reliability of steering vectors in language models","venue":null,"work_id":"de563140-cf5f-4bd9-bcc9-8cdc63c5aab8","year":2025},"citing_paper":{"arxiv_id":"2606.05194","last_updated":"2026-07-08T19:54:16Z","snapshot_observed_at":"2026-08-06T06:51:53.907927Z","submitted_at":"2026-05-11T21:09:00Z","title":"Temporal Preference Concepts and their Functions in a Large Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T22:16:47.743387Z"},"links":{"cited_paper":"/paper/2505.22637","citing_paper":"/paper/2606.05194"},"observation_digest":"sha256:e78f1fe665b68ce027d6b3d5ebffca9ebaf595c06a1844e384c0b6c1989b82f9","observation_id":"3f421cf8-48ca-41b2-a447-55420c0c24c7","resolution":{"observed_at":"2026-07-01T14:05:47.215257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22637","snapshot_observed_at":"2026-07-12T17:03:44.315006Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05194","last_updated":"2026-07-08T19:54:16Z","snapshot_observed_at":"2026-08-06T06:51:53.907927Z","submitted_at":"2026-05-11T21:09:00Z","title":"Temporal Preference Concepts and their Functions in a Large Language Model","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T17:03:44.315006Z"},"links":{"cited_paper":"/paper/2505.22637","citing_paper":"/paper/2606.05194"},"observation_digest":"sha256:c770e4866033c8996d57fc5349af9d4799219ad6eb5356474e8cc4b167d43fca","observation_id":"19796388-a601-4242-a1c8-02fb3a196a44","resolution":{"observed_at":"2026-07-12T17:03:44.315006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"cited_work":{"arxiv_id":"2505.22637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22637","snapshot_observed_at":"2026-07-04T15:49:57.002506Z","title":"Understanding (un)reliability of steering vectors in language models","venue":null,"work_id":"de563140-cf5f-4bd9-bcc9-8cdc63c5aab8","year":2025},"citing_paper":{"arxiv_id":"2606.07696","last_updated":"2026-06-05T07:40:34Z","snapshot_observed_at":"2026-08-07T11:50:33.434267Z","submitted_at":"2026-06-05T07:40:34Z","title":"Adversarial Robustness of Activation Steering in Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-27T22:30:36.839964Z"},"links":{"cited_paper":"/paper/2505.22637","citing_paper":"/paper/2606.07696"},"observation_digest":"sha256:5618e24a3cbf3987d05994cb1f119ac7d94eccd99148e896df5f87c7e8227d35","observation_id":"d460774b-6a78-4912-8e56-f903b96b75df","resolution":{"observed_at":"2026-07-02T16:37:09.432517Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"cited_work":{"arxiv_id":"2505.22637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22637","snapshot_observed_at":"2026-07-04T15:49:57.002506Z","title":"Understanding (un)reliability of steering vectors in language models","venue":null,"work_id":"de563140-cf5f-4bd9-bcc9-8cdc63c5aab8","year":2025},"citing_paper":{"arxiv_id":"2606.26155","last_updated":"2026-06-23T20:10:53Z","snapshot_observed_at":"2026-08-05T06:51:46.075567Z","submitted_at":"2026-06-23T20:10:53Z","title":"Detecting and Controlling Sycophancy with Cascading Linear Features","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T01:24:56.600219Z"},"links":{"cited_paper":"/paper/2505.22637","citing_paper":"/paper/2606.26155"},"observation_digest":"sha256:995d70d7c7efde7a46313c5f42d59fb5ed7857c8d62be6de99911cefdbe837ca","observation_id":"4d6c0238-a48e-4825-ae00-cabcc32cf3ed","resolution":{"observed_at":"2026-07-04T15:49:57.005467Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22637","snapshot_observed_at":"2026-07-14T11:08:17.571722Z","title":"Understanding (un) reliability of steering vectors in language models.arXiv preprint arXiv:2505.22637,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10517","last_updated":"2026-07-12T00:36:46Z","snapshot_observed_at":"2026-08-04T04:06:03.775953Z","submitted_at":"2026-07-12T00:36:46Z","title":"Conditional Optimal Bridge for Riemannian Activation Steering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T11:08:17.571722Z"},"links":{"cited_paper":"/paper/2505.22637","citing_paper":"/paper/2607.10517"},"observation_digest":"sha256:98f85fb3d260345bb0e3b1decb8ac8ac70adc4122a2b28eeafc8513943294599","observation_id":"ab15ab25-369b-452d-91c7-3fb5f45bc50c","resolution":{"observed_at":"2026-07-14T11:08:17.571722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22637/citation-record","integrity":"/paper/2505.22637/integrity","json":"/paper/2505.22637/citation-record.json","paper":"/paper/2505.22637"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:03.289827Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:03.289827Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:cade30b52d47d4a23dd69ec2ddb029acf15df77719d28089c2b2bbfc080a91ac","observation_id":"bd450999-42e0-4f54-877d-862e670f8720","resolution":{"observed_at":"2026-08-07T13:10:03.289827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-07T13:10:03.419878Z","title":"Refusal in language models is mediated by a single direction, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:03.419878Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:5f43c4e92922331e9ecb000a6c5b6f5a883742f6e954e52b3d675250c1e504ee","observation_id":"b12abee5-3591-465f-a777-29e583a26be2","resolution":{"observed_at":"2026-08-07T13:10:03.419878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:03.548101Z","title":"Cats: Customizable abstractive topic-based summarization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:03.548101Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:d5415ac21e6f9c6c12ad4fd580ce0435a38f2dd511a018e0bfbcdee173e22584","observation_id":"4955598a-7f3d-400c-ae32-003701625648","resolution":{"observed_at":"2026-08-07T13:10:03.548101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:03.715918Z","title":"NEWTS : A corpus for news topic-focused summarization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:03.715918Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:c094566dbe26a2699f87d8038a06b6f710e0131df7d9552d4d4b1343a1a80e76","observation_id":"6d857f70-6587-4148-a88f-847eab514349","resolution":{"observed_at":"2026-08-07T13:10:03.715918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06724","last_updated":"2023-11-12T03:51:38Z","snapshot_observed_at":"2026-07-06T16:46:10.142093Z","submitted_at":"2023-11-12T03:51:38Z","title":"Controllable Topic-Focused Abstractive Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06724","snapshot_observed_at":"2026-08-07T13:10:03.927972Z","title":"Controllable topic-focused abstractive summarization, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:03.927972Z"},"links":{"cited_paper":"/paper/2311.06724","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:59691e456a73a70b1bc2d55bb5e0c09838bb009a0f10ec960c950b269b653b82","observation_id":"8ae392d8-655e-4c49-a154-3e3524d501bf","resolution":{"observed_at":"2026-08-07T13:10:03.927972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl.392","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:09.460424Z","title":"Text simplification via adaptive teaching","venue":null,"work_id":"703f1aa1-fb49-4c54-a5be-b742917ee57d","year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:04.074437Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:aab8bff8edf055ce37e5b60cf5ee7197f7f111d9dafe48170cd153b1601304f4","observation_id":"7062c719-3fd9-49f0-ac2d-cf6212c10207","resolution":{"observed_at":"2026-08-07T13:10:09.638480Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.552","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:09.155155Z","title":"SIMSUM : Document-level text simplification via simultaneous summarization","venue":null,"work_id":"3c612327-657b-47fd-a3ff-fa1fe82e3969","year":2023},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:04.258231Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:6aa95ff5232bc6755310377fc8272d9a6d723786fcb0a2a83bcf71d14555a32a","observation_id":"e5da340c-198b-477c-b853-a1b095413748","resolution":{"observed_at":"2026-08-07T13:10:09.260944Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:12.150362Z","title":"A sober look at steering vectors for llms","venue":null,"work_id":"b0b8b4a7-3a1b-4ad8-9d7e-6b119340a6a2","year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:04.453529Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:35d0eb4d5608232d724ae59cba03d0a4c8d2025309d28ec9af9961158170764f","observation_id":"2a3eaa2a-7361-4b48-a088-8e8edad3ab5a","resolution":{"observed_at":"2026-08-07T13:10:12.329122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07213","last_updated":"2024-11-11T18:36:17Z","snapshot_observed_at":"2026-07-06T19:48:36.508447Z","submitted_at":"2024-11-11T18:36:17Z","title":"Comparing Bottom-Up and Top-Down Steering Approaches on In-Context Learning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07213","snapshot_observed_at":"2026-08-07T13:10:04.575056Z","title":"Comparing bottom-up and top-down steering approaches on in-context learning tasks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:04.575056Z"},"links":{"cited_paper":"/paper/2411.07213","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:4b9feb3dbd54c1a6d5873458127a1790470bf6e31b7d9ba90df3351f2da67dde","observation_id":"7110b613-adc6-48fa-a5cd-ec86b0bfb4b0","resolution":{"observed_at":"2026-08-07T13:10:04.575056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00045","last_updated":"2024-07-29T18:19:35Z","snapshot_observed_at":"2026-08-07T01:32:56.141077Z","submitted_at":"2024-05-28T05:10:40Z","title":"Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00045","snapshot_observed_at":"2026-08-07T13:10:04.717862Z","title":"Personalized steering of large language models: Versatile steering vectors through bi-directional preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:04.717862Z"},"links":{"cited_paper":"/paper/2406.00045","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:62cf43eaafbae5670d19f7b0ce54370d5adb456fae3d4c64f12b4be7bde607ff","observation_id":"30fa9f24-32c4-46c4-b4aa-88e21828886b","resolution":{"observed_at":"2026-08-07T13:10:04.717862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:04.898405Z","title":"In-context learning creates task vectors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:04.898405Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:b6d887a2f442bd865f7dc4b1d78112a065e367fce6d1f8f686b56b2c335b15fe","observation_id":"3701d840-1f93-448f-a62d-ef5ace6f7da4","resolution":{"observed_at":"2026-08-07T13:10:04.898405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:04.974038Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:04.974038Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:7c2c2d736fe0278a353a95f2df4e4341a0cdc12c08262a7455c9ea43caa4aee1","observation_id":"11affa31-d0f5-42b0-847d-02f596676574","resolution":{"observed_at":"2026-08-07T13:10:04.974038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:11.801266Z","title":"Style Vectors for Steering Generative Large Language Models","venue":null,"work_id":"b87764b3-177f-47f5-b033-b23764dd10b8","year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:05.093975Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:9c65a5671effffb7863d48471a438e15a9804aa6a2f17bfd760994930cf7ff90","observation_id":"87fc6599-bc67-431b-ba03-3660781afacb","resolution":{"observed_at":"2026-08-07T13:10:11.949019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:11.512303Z","title":"Steering clear: A systematic study of activation steering in a toy setup","venue":null,"work_id":"0433d6c5-bed1-480a-96b9-eafbfbf9fa7b","year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:05.218312Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:dae28f79f3318bab41ee6f0b9e5785dda4c3a9d0df45f50b6c4217b6b8ad6995","observation_id":"514b7c2d-d754-4bc9-8e5e-7bd005f009f9","resolution":{"observed_at":"2026-08-07T13:10:11.664519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:05.387255Z","title":"Inference-time intervention: Eliciting truthful answers from a language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:05.387255Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:673f790bff7de76aa0c78b6f844899c85837e081d8aed700c666689eeaf25466","observation_id":"7da431f6-36ab-49cf-a44e-f9ce9e74cf2a","resolution":{"observed_at":"2026-08-07T13:10:05.387255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06824","last_updated":"2024-08-19T01:18:41Z","snapshot_observed_at":"2026-07-06T16:30:37.867641Z","submitted_at":"2023-10-10T17:54:39Z","title":"The Geometry of Truth: Emergent Linear Structure in Large Language Model Representations of True/False Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06824","snapshot_observed_at":"2026-08-07T13:10:05.520729Z","title":"The geometry of truth: Emergent linear structure in large language model representations of true/false datasets, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:05.520729Z"},"links":{"cited_paper":"/paper/2310.06824","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:2f8dfe706e4464df7e3fe919d92731d4746fce996770bee3f05747113c0c56c4","observation_id":"49a3bbf8-7c4b-4cd6-bbe5-b215a7fb408f","resolution":{"observed_at":"2026-08-07T13:10:05.520729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:11.154250Z","title":"The geometry of truth: Emergent linear structure in large language model representations of true/false datasets","venue":null,"work_id":"7efb5d14-198f-465d-af3e-ee94db168cac","year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:05.648088Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:8c96967ea4923aa48f6fc1debc354dea4d9f394e7ee47b6fe5c820715ef64c5e","observation_id":"58eb0b15-9f5f-4252-a074-fa17f2772e13","resolution":{"observed_at":"2026-08-07T13:10:11.347820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09003","last_updated":"2025-01-28T03:59:40Z","snapshot_observed_at":"2026-08-05T22:07:10.175145Z","submitted_at":"2024-11-13T20:12:55Z","title":"Refusal in LLMs is an Affine Function","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09003","snapshot_observed_at":"2026-08-07T13:10:05.846705Z","title":"Refusal in llms is an affine function","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:05.846705Z"},"links":{"cited_paper":"/paper/2411.09003","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:b3a9c7eca7a83beb3d49dc49f8fab76502d5ac272870c29af15ca1f056b24a05","observation_id":"0bc45b64-edcd-4965-a435-cc549a2067eb","resolution":{"observed_at":"2026-08-07T13:10:05.846705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17245","last_updated":"2024-10-22T17:59:39Z","snapshot_observed_at":"2026-07-06T19:38:00.663759Z","submitted_at":"2024-10-22T17:59:39Z","title":"Towards Reliable Evaluation of Behavior Steering Interventions in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17245","snapshot_observed_at":"2026-08-07T13:10:06.057729Z","title":"Towards reliable evaluation of behavior steering interventions in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:06.057729Z"},"links":{"cited_paper":"/paper/2410.17245","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:07461d1395e054b53bbdb878059aaeb860a9330a64b4808ede1b553d4a528141","observation_id":"89d8d63f-d64f-4a5e-93a8-1b2ced9f909a","resolution":{"observed_at":"2026-08-07T13:10:06.057729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:06.173597Z","title":"Steering llama 2 via contrastive activation addition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:06.173597Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:f7169c9ce12e0c07a0820df697eb2b29d34a4839eae97ed01eaaedcf0c5e9f98","observation_id":"116acc5e-5900-466e-bca0-86616e6a68de","resolution":{"observed_at":"2026-08-07T13:10:06.173597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:06.293291Z","title":"Discovering Language Model Behaviors with Model-Written Evaluations, Toronto, Canada, July 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:06.293291Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:94f576c6d6fdd14bb5ff81ba7c7928baf8229c206527ec72f1980ecc38f61d6c","observation_id":"dad2db02-e247-492c-b995-e6a20608a38d","resolution":{"observed_at":"2026-08-07T13:10:06.293291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:10.780685Z","title":"Representation surgery: Theory and practice of affine steering","venue":null,"work_id":"8cc5bff3-bdc0-43ff-8dc1-b620153e6196","year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:06.461530Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:7abfac3e3d7dbc30ccf60b45c73b46b5db913df99dafc50e4938c334e1172a94","observation_id":"83e09f5f-6664-46c3-bb9c-07f5ade319fd","resolution":{"observed_at":"2026-08-07T13:10:10.985849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:10.460457Z","title":null,"venue":null,"work_id":"98d23739-0307-456b-b695-44e4ff3824b2","year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:06.605117Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:c5bb8d30030c2ade6fb5014100654be6d38cf95d4c19e9830a896c9912c9572f","observation_id":"e234c100-7387-4af3-943b-c7b0bbf7c2df","resolution":{"observed_at":"2026-08-07T13:10:10.614343Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:06.744243Z","title":"Extracting Latent Steering Vectors from Pretrained Language Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:06.744243Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:5316c7e2492084a4219e8f40a3599957d0fee6c15cc6e8f6ffb00060cd1fd7e9","observation_id":"df5ab5eb-3fdb-4ef0-95a3-796919775ffb","resolution":{"observed_at":"2026-08-07T13:10:06.744243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:06.928187Z","title":"Analysing the generalisation and reliability of steering vectors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:06.928187Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:8848d61aa415c348a23becf9df4c3a17d353e1f23b2978cfd29e2c6d949d09d6","observation_id":"e27cad75-e919-4e0a-968b-829da0f359a5","resolution":{"observed_at":"2026-08-07T13:10:06.928187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15154","last_updated":"2023-10-23T17:55:31Z","snapshot_observed_at":"2026-07-06T16:37:19.963994Z","submitted_at":"2023-10-23T17:55:31Z","title":"Linear Representations of Sentiment in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15154","snapshot_observed_at":"2026-08-07T13:10:07.072130Z","title":"Linear representations of sentiment in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:07.072130Z"},"links":{"cited_paper":"/paper/2310.15154","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:ac10e895a62cdc7d7ce57f3b10a3748d1dac54a3183e9903875516a847cb49ae","observation_id":"012e9b4e-7a8b-4feb-b47d-7865abd582f6","resolution":{"observed_at":"2026-08-07T13:10:07.072130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:07.202080Z","title":"Hollinsworth, Atticus Geiger, and Neel Nanda","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:07.202080Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:70c055ec4875a20eb2e5611e6a8f29ede835e05c5f0adb75f56df43e442f24ec","observation_id":"0b1763f6-acb5-41dc-871c-d36007e80b69","resolution":{"observed_at":"2026-08-07T13:10:07.202080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15213","last_updated":"2024-02-25T18:32:18Z","snapshot_observed_at":"2026-07-06T16:37:23.707569Z","submitted_at":"2023-10-23T17:55:24Z","title":"Function Vectors in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15213","snapshot_observed_at":"2026-08-07T13:10:07.335261Z","title":"Function vectors in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:07.335261Z"},"links":{"cited_paper":"/paper/2310.15213","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:a8b0bd90643605a33972faac83b62bad89f838d54156e16adb4edf467e54736a","observation_id":"96dbf721-bcbc-4538-8d96-a39327a76187","resolution":{"observed_at":"2026-08-07T13:10:07.335261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:07.486495Z","title":"Function vectors in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:07.486495Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:9158e3759531935dddef7c274e2416780e093b39f164cc31dc9f252fa64f818e","observation_id":"1608ff49-3205-4878-9d8d-633a7ba8e9d4","resolution":{"observed_at":"2026-08-07T13:10:07.486495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T13:10:07.663220Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:07.663220Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:c73b40b60f3a27e7920c69f64510f245b395b0d6f299f9b25d5d1a8fa3e29b98","observation_id":"71d1e75e-8ae7-4697-9eaf-bf08c20d67c3","resolution":{"observed_at":"2026-08-07T13:10:07.663220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:10.296609Z","title":"Activation addition: Steering language models without optimization","venue":null,"work_id":"68d31813-dff7-469f-a9a1-83370bf7a2ab","year":2023},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:07.830192Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:634ded646446d479fd5bf301b90480e126701f3477947d313a08a9c949deec02","observation_id":"f0ddce0c-bb20-4bec-a1c4-608a2c6799e3","resolution":{"observed_at":"2026-08-07T13:10:10.366568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:07.935345Z","title":"Controllable text summarization: Unraveling challenges, approaches, and prospects - a survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:07.935345Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:f18f3fe0abb46e06657ab2028357227a39c7bad38cd212c822d2896e16704dc4","observation_id":"b11d6994-d56f-4cb9-ba92-94582b225ee5","resolution":{"observed_at":"2026-08-07T13:10:07.935345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:08.060573Z","title":"A comprehensive survey on process-oriented automatic text summarization with exploration of llm-based methods, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:08.060573Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:fd960f1e410206e7eccae02e3f23914d8cea1c9812fbd4e849a5e153279c7d0d","observation_id":"e52a79ce-8217-4802-8fe8-e87911df09bb","resolution":{"observed_at":"2026-08-07T13:10:08.060573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-07T13:10:08.399853Z","title":"Byun, Zifan Wang, Alex Mallen, Steven Basart, Sanmi Koyejo, Dawn Song, Matt Fredrikson, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:08.399853Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:1415f2eb001e6fda707515e0e254d26d95a0afab233ac2bbf1e0fba6ae74f427","observation_id":"30e6f97d-3aac-4854-8e10-5df3e4d72504","resolution":{"observed_at":"2026-08-07T13:10:08.399853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:08.563640Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:08.563640Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:c199ad76d01d653bf9d41c9c405df5a6594e1be4aaa9c890b5eee68be5d4f47c","observation_id":"8b8eca33-f2ad-4632-8d6c-55f6e08636e5","resolution":{"observed_at":"2026-08-07T13:10:08.563640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:08.737088Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:08.737088Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:08f329361b68eed28e27b12afe3e4888b66f0693c697fdbd7f2c98601561b284","observation_id":"400ebaa9-c888-45ae-ae67-5b09f2f630c2","resolution":{"observed_at":"2026-08-07T13:10:08.737088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:08.895546Z","title":"3!( 4˜ \"3!( 4˒","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:08.895546Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:7764bbbb2b699d205108b16faee3fba9fbd5a1f5cafc20c83f8368e7b80efc36","observation_id":"d56fbc92-ed8d-4e88-b60b-b678e757acee","resolution":{"observed_at":"2026-08-07T13:10:08.895546Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T13:00:15.570378Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 10 inbound Pith citation observations for arXiv:2505.22637."}