{"as_of":"2026-08-22T23:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d334de2c11b2a1491e43f91f2b93127289e73b4799e5883d0f2e7cedc962068e","coverage":[{"denominator":11,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:28:15.771544Z","state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.01162/citation-record","integrity":"/paper/2505.01162/integrity","json":"/paper/2505.01162/citation-record.json","paper":"/paper/2505.01162"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:28:15.711620Z","title":"doi: 10.1162/coli a 00524","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.01162","last_updated":"2025-05-02T10:08:34Z","snapshot_observed_at":"2026-08-19T09:31:44.919026Z","submitted_at":"2025-05-02T10:08:34Z","title":"On the Limitations of Steering in Language Model Alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:28:15.711620Z"},"links":{"citing_paper":"/paper/2505.01162"},"observation_digest":"sha256:9e9499d1c5d84d697e8fea253b6c9b95df0c81022dc8e7d9ec9aa5fa033882f0","observation_id":"c05723da-31b9-471a-98b9-1656e057ca42","resolution":{"observed_at":"2026-08-16T04:28:15.711620Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03341","last_updated":"2024-06-26T14:11:53Z","snapshot_observed_at":"2026-08-13T19:18:46.730073Z","submitted_at":"2023-06-06T01:26:53Z","title":"Inference-Time Intervention: Eliciting Truthful Answers from a Language Model","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03341","snapshot_observed_at":"2026-08-16T04:28:15.717431Z","title":"org/abs/2306.03341","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01162","last_updated":"2025-05-02T10:08:34Z","snapshot_observed_at":"2026-08-19T09:31:44.919026Z","submitted_at":"2025-05-02T10:08:34Z","title":"On the Limitations of Steering in Language Model Alignment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:28:15.717431Z"},"links":{"cited_paper":"/paper/2306.03341","citing_paper":"/paper/2505.01162"},"observation_digest":"sha256:6854d89f9d0a990f53ccfdcd6bab1661343a5e229cc400887bec684967a3f116","observation_id":"4515535e-a1c2-4bb0-b119-0f5fa459dc6c","resolution":{"observed_at":"2026-08-16T04:28:15.717431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T04:28:15.733955Z","title":"Nina Panickssery, Nick Gabrieli, Julian Schulz, Meg Tong, Evan Hubinger, and Alexander Matt Turner","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01162","last_updated":"2025-05-02T10:08:34Z","snapshot_observed_at":"2026-08-19T09:31:44.919026Z","submitted_at":"2025-05-02T10:08:34Z","title":"On the Limitations of Steering in Language Model Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:28:15.733955Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.01162"},"observation_digest":"sha256:5678c0dce9c4861f3ceaae09094891c83c8b89367fb7e0d034eb8d9ea667d60a","observation_id":"1192d930-f012-4348-9a68-32f66b94a243","resolution":{"observed_at":"2026-08-16T04:28:15.733955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06681","last_updated":"2024-07-05T15:30:45Z","snapshot_observed_at":"2026-08-15T08:04:06.283165Z","submitted_at":"2023-12-09T04:40:46Z","title":"Steering Llama 2 via Contrastive Activation Addition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06681","snapshot_observed_at":"2026-08-16T04:28:15.740063Z","title":"org/abs/2312.06681","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01162","last_updated":"2025-05-02T10:08:34Z","snapshot_observed_at":"2026-08-19T09:31:44.919026Z","submitted_at":"2025-05-02T10:08:34Z","title":"On the Limitations of Steering in Language Model Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:28:15.740063Z"},"links":{"cited_paper":"/paper/2312.06681","citing_paper":"/paper/2505.01162"},"observation_digest":"sha256:0b6951d75f25cdcd0f2b5856512b4852e8824d380fe1f3a05e9f7a9a36c6223f","observation_id":"398dc27f-9d53-4db4-8c3a-33d8e5365e88","resolution":{"observed_at":"2026-08-16T04:28:15.740063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-16T04:28:15.746137Z","title":"Daniel Tan, David Chanin, Aengus Lynch, Dimitrios Kanoulas, Brooks Paige, Adria Garriga - Alonso, and Robert Kirk","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01162","last_updated":"2025-05-02T10:08:34Z","snapshot_observed_at":"2026-08-19T09:31:44.919026Z","submitted_at":"2025-05-02T10:08:34Z","title":"On the Limitations of Steering in Language Model Alignment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:28:15.746137Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2505.01162"},"observation_digest":"sha256:412114686b1ff8d3cf87298b8238ba31d184821d3b707ecda36148ee0b220725","observation_id":"241c311f-3d57-4722-8623-ca7a38771e41","resolution":{"observed_at":"2026-08-16T04:28:15.746137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15154","last_updated":"2023-10-23T17:55:31Z","snapshot_observed_at":"2026-08-08T01:44:57.952179Z","submitted_at":"2023-10-23T17:55:31Z","title":"Linear Representations of Sentiment in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15154","snapshot_observed_at":"2026-08-16T04:28:15.759209Z","title":"Alexander Matt Turner, Lisa Thiergart, Gavin Leech, David Udell, Juan J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01162","last_updated":"2025-05-02T10:08:34Z","snapshot_observed_at":"2026-08-19T09:31:44.919026Z","submitted_at":"2025-05-02T10:08:34Z","title":"On the Limitations of Steering in Language Model Alignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:28:15.759209Z"},"links":{"cited_paper":"/paper/2310.15154","citing_paper":"/paper/2505.01162"},"observation_digest":"sha256:4c992b57b2213f9429d888739c20ad48f03235451f64a6f611e131381cfa8433","observation_id":"8b7f8c90-dd6e-4271-94a0-89c99fd1d291","resolution":{"observed_at":"2026-08-16T04:28:15.759209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-16T04:28:15.765005Z","title":"Zhuoyan Xu, Zhenmei Shi, and Yingyu Liang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01162","last_updated":"2025-05-02T10:08:34Z","snapshot_observed_at":"2026-08-19T09:31:44.919026Z","submitted_at":"2025-05-02T10:08:34Z","title":"On the Limitations of Steering in Language Model Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:28:15.765005Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2505.01162"},"observation_digest":"sha256:139409c120d5e3a2966ac5025a27037801ee931df346737714d963be2d1de92a","observation_id":"f22ec94c-9dbf-4981-86c2-00301e31649c","resolution":{"observed_at":"2026-08-16T04:28:15.765005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15720","last_updated":"2024-08-11T04:39:16Z","snapshot_observed_at":"2026-08-18T22:25:45.504271Z","submitted_at":"2024-07-22T15:22:34Z","title":"Do Large Language Models Have Compositional Ability? An Investigation into Limitations and Scalability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15720","snapshot_observed_at":"2026-08-16T04:28:15.771544Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01162","last_updated":"2025-05-02T10:08:34Z","snapshot_observed_at":"2026-08-19T09:31:44.919026Z","submitted_at":"2025-05-02T10:08:34Z","title":"On the Limitations of Steering in Language Model Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:28:15.771544Z"},"links":{"cited_paper":"/paper/2407.15720","citing_paper":"/paper/2505.01162"},"observation_digest":"sha256:83e279f398637f1da7b852fa48643b3fe4967c8f2d7dfadb1dd12966a568a088","observation_id":"e1567efb-18eb-43b9-914e-45dd97395275","resolution":{"observed_at":"2026-08-16T04:28:15.771544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18438","last_updated":"2023-07-03T13:08:46Z","snapshot_observed_at":"2026-08-22T06:05:46.483404Z","submitted_at":"2023-05-29T01:18:39Z","title":"Reinforcement Learning with Human Feedback: Learning Dynamic Choices via Pessimism","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18438","snapshot_observed_at":"2026-08-16T04:28:15.727690Z","title":"OpenAI, Josh Achiam, Steven Adler, Sandhini Agarwal, Lama Ahmad, and Ilge Akkaya et al.(275 additional authors not shown)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01162","last_updated":"2025-05-02T10:08:34Z","snapshot_observed_at":"2026-08-19T09:31:44.919026Z","submitted_at":"2025-05-02T10:08:34Z","title":"On the Limitations of Steering in Language Model Alignment","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T04:28:15.727690Z"},"links":{"cited_paper":"/paper/2305.18438","citing_paper":"/paper/2505.01162"},"observation_digest":"sha256:81aa04d310c9056d470a49d3fafa3e990ba1de0004438a21779aed470c9acced","observation_id":"3da1400d-4fe1-460d-b28c-821007d36f2a","resolution":{"observed_at":"2026-08-16T04:28:15.727690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-08-17T07:39:23.832733Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-16T04:28:15.705041Z","title":"5 Isabel O","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01162","last_updated":"2025-05-02T10:08:34Z","snapshot_observed_at":"2026-08-19T09:31:44.919026Z","submitted_at":"2025-05-02T10:08:34Z","title":"On the Limitations of Steering in Language Model Alignment","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T04:28:15.705041Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2505.01162"},"observation_digest":"sha256:50bc11e067be57dd46a7eca0ff8144864e156eeb6b1118e91df0911b6b75d943","observation_id":"26caa330-1b9d-4c81-bdb1-de15e44dad8a","resolution":{"observed_at":"2026-08-16T04:28:15.705041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12404","last_updated":"2025-05-04T23:07:56Z","snapshot_observed_at":"2026-08-18T06:51:37.465225Z","submitted_at":"2024-07-17T08:32:03Z","title":"Analyzing the Generalization and Reliability of Steering Vectors","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12404","snapshot_observed_at":"2026-08-16T04:28:15.752786Z","title":"Curt Tigges, Oskar John Hollinsworth, Atticus Geiger, and Neel Nanda","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01162","last_updated":"2025-05-02T10:08:34Z","snapshot_observed_at":"2026-08-19T09:31:44.919026Z","submitted_at":"2025-05-02T10:08:34Z","title":"On the Limitations of Steering in Language Model Alignment","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-16T04:28:15.752786Z"},"links":{"cited_paper":"/paper/2407.12404","citing_paper":"/paper/2505.01162"},"observation_digest":"sha256:c8c27e4a9154cac1a4c4499add3761b964f9d86bc48e00d13ce31118491e3b70","observation_id":"7e38e289-cb8c-403c-bb84-12372feb1afe","resolution":{"observed_at":"2026-08-16T04:28:15.752786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.01162","last_updated":"2025-05-02T10:08:34Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T09:31:44.919026Z","submitted_at":"2025-05-02T10:08:34Z","title":"On the Limitations of Steering in Language Model Alignment"},"reference_resolution":{"displayed":11,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":11},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 11 of 11 outbound references and 0 inbound Pith citation observations for arXiv:2505.01162."}