{"as_of":"2026-08-08T07:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb8dad8f66c3ac0550969659856b764a162764fdc0f30d325c3130ebc2cfcc5e","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:03:47.041540Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23848/citation-record","integrity":"/paper/2505.23848/integrity","json":"/paper/2505.23848/citation-record.json","paper":"/paper/2505.23848"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:45.980612Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23848","last_updated":"2025-05-28T20:25:24Z","snapshot_observed_at":"2026-08-07T12:56:42.860647Z","submitted_at":"2025-05-28T20:25:24Z","title":"Derailing Non-Answers via Logit Suppression at Output Subspace Boundaries in RLHF-Aligned Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:03:45.980612Z"},"links":{"citing_paper":"/paper/2505.23848"},"observation_digest":"sha256:1abbcb7ad3f9e60e51b14ded2dcc327ba0721f86a912c0420c624b38dea047d4","observation_id":"e0ddc226-decf-4f84-ba19-0708e4af53c3","resolution":{"observed_at":"2026-08-07T13:03:45.980612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:48.353715Z","title":null,"venue":null,"work_id":"bc93442d-1558-4367-b8f0-14f5da5ac100","year":2024},"citing_paper":{"arxiv_id":"2505.23848","last_updated":"2025-05-28T20:25:24Z","snapshot_observed_at":"2026-08-07T12:56:42.860647Z","submitted_at":"2025-05-28T20:25:24Z","title":"Derailing Non-Answers via Logit Suppression at Output Subspace Boundaries in RLHF-Aligned Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:03:46.078644Z"},"links":{"citing_paper":"/paper/2505.23848"},"observation_digest":"sha256:bb0914d83d95424a85d28eba3730ba144e72045928502a1dbe5307db845680af","observation_id":"c39aefa8-d924-4707-8109-808146d524b4","resolution":{"observed_at":"2026-08-07T13:03:48.398558Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-07T13:03:46.199051Z","title":"and Mitchell, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23848","last_updated":"2025-05-28T20:25:24Z","snapshot_observed_at":"2026-08-07T12:56:42.860647Z","submitted_at":"2025-05-28T20:25:24Z","title":"Derailing Non-Answers via Logit Suppression at Output Subspace Boundaries in RLHF-Aligned Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:03:46.199051Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2505.23848"},"observation_digest":"sha256:1bd89c4601ab7ccf9e547d40eab72790bdaa04efac5c8d94a0a542701c6e9bb0","observation_id":"c3ea496a-5d97-4c03-abf6-9e4b01f4d6d3","resolution":{"observed_at":"2026-08-07T13:03:46.199051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:46.283063Z","title":"F., Choquette-Choo, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23848","last_updated":"2025-05-28T20:25:24Z","snapshot_observed_at":"2026-08-07T12:56:42.860647Z","submitted_at":"2025-05-28T20:25:24Z","title":"Derailing Non-Answers via Logit Suppression at Output Subspace Boundaries in RLHF-Aligned Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:03:46.283063Z"},"links":{"citing_paper":"/paper/2505.23848"},"observation_digest":"sha256:756f521ba1cda67a33097204dc164e89327955def0ac83ed7aab9eda275954da","observation_id":"d0d2fa7d-8e81-4141-8722-ba0624a7a5d3","resolution":{"observed_at":"2026-08-07T13:03:46.283063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:48.240173Z","title":"Deepseek-r1 technical report","venue":null,"work_id":"ad57205e-0ba3-470b-a697-537571e0edc7","year":2025},"citing_paper":{"arxiv_id":"2505.23848","last_updated":"2025-05-28T20:25:24Z","snapshot_observed_at":"2026-08-07T12:56:42.860647Z","submitted_at":"2025-05-28T20:25:24Z","title":"Derailing Non-Answers via Logit Suppression at Output Subspace Boundaries in RLHF-Aligned Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:03:46.377240Z"},"links":{"citing_paper":"/paper/2505.23848"},"observation_digest":"sha256:b3f45d0574006a50201c065b0e73ffad043861a61fed3ac98e01254d3caa1a17","observation_id":"db73d0d4-39be-4e70-bdfb-1c46b48afac5","resolution":{"observed_at":"2026-08-07T13:03:48.276316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14680","last_updated":"2022-10-12T18:01:23Z","snapshot_observed_at":"2026-08-03T05:22:23.916601Z","submitted_at":"2022-03-28T12:26:00Z","title":"Transformer Feed-Forward Layers Build Predictions by Promoting Concepts in the Vocabulary Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14680","snapshot_observed_at":"2026-08-07T13:03:46.414487Z","title":"R., and Goldberg, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23848","last_updated":"2025-05-28T20:25:24Z","snapshot_observed_at":"2026-08-07T12:56:42.860647Z","submitted_at":"2025-05-28T20:25:24Z","title":"Derailing Non-Answers via Logit Suppression at Output Subspace Boundaries in RLHF-Aligned Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:03:46.414487Z"},"links":{"cited_paper":"/paper/2203.14680","citing_paper":"/paper/2505.23848"},"observation_digest":"sha256:dbf5617b95a04f738f29785dc8f7d6a0f0a7a285833dfa18032a8820226a2982","observation_id":"ee66c62b-36a4-476d-8a76-c3032a5e2c42","resolution":{"observed_at":"2026-08-07T13:03:46.414487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T13:03:46.504667Z","title":"L., Fei-Fei, L., Hajishirzi, H., Zettlemoyer, L., Liang, P., Cand \\`e s, E., and Hashimoto, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23848","last_updated":"2025-05-28T20:25:24Z","snapshot_observed_at":"2026-08-07T12:56:42.860647Z","submitted_at":"2025-05-28T20:25:24Z","title":"Derailing Non-Answers via Logit Suppression at Output Subspace Boundaries in RLHF-Aligned Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:03:46.504667Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.23848"},"observation_digest":"sha256:2513c23fe4f94e5fd3f1515b721ce450aa3ae686f773e7e902e1b8ba8c31232d","observation_id":"7f90695a-20cc-4d63-a1e6-f203562b49a1","resolution":{"observed_at":"2026-08-07T13:03:46.504667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12625","last_updated":"2025-05-19T02:16:56Z","snapshot_observed_at":"2026-08-07T15:43:31.255437Z","submitted_at":"2025-05-19T02:16:56Z","title":"R1dacted: Investigating Local Censorship in DeepSeek's R1 Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12625","snapshot_observed_at":"2026-08-07T13:03:46.603474Z","title":"Investigating local censorship in deepseek's R1 language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23848","last_updated":"2025-05-28T20:25:24Z","snapshot_observed_at":"2026-08-07T12:56:42.860647Z","submitted_at":"2025-05-28T20:25:24Z","title":"Derailing Non-Answers via Logit Suppression at Output Subspace Boundaries in RLHF-Aligned Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:03:46.603474Z"},"links":{"cited_paper":"/paper/2505.12625","citing_paper":"/paper/2505.23848"},"observation_digest":"sha256:ff550608ad60358983d40432357e6f565d1afbfde28f81675133b05b1678c528","observation_id":"eeb1ba44-158f-4dd8-9a2b-48555e675a92","resolution":{"observed_at":"2026-08-07T13:03:46.603474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"articles/5247780","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:47.411336Z","title":"Using logit bias to alter token probability","venue":null,"work_id":"528a4b08-18be-4a27-b3b5-d0807392c06b","year":2024},"citing_paper":{"arxiv_id":"2505.23848","last_updated":"2025-05-28T20:25:24Z","snapshot_observed_at":"2026-08-07T12:56:42.860647Z","submitted_at":"2025-05-28T20:25:24Z","title":"Derailing Non-Answers via Logit Suppression at Output Subspace Boundaries in RLHF-Aligned Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:03:46.681899Z"},"links":{"citing_paper":"/paper/2505.23848"},"observation_digest":"sha256:f413e6bb5cfed000bd4ac56bffdfc21ae5cd93d326d094d705d74da35ff672e4","observation_id":"4e4b8aaf-a78b-4ca9-b52b-dce9da988cb2","resolution":{"observed_at":"2026-08-07T13:03:47.498322Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:48.125718Z","title":"Ccp-sensitive-prompts","venue":null,"work_id":"cd1dbddd-9b55-42cd-a443-0dae61791447","year":2024},"citing_paper":{"arxiv_id":"2505.23848","last_updated":"2025-05-28T20:25:24Z","snapshot_observed_at":"2026-08-07T12:56:42.860647Z","submitted_at":"2025-05-28T20:25:24Z","title":"Derailing Non-Answers via Logit Suppression at Output Subspace Boundaries in RLHF-Aligned Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:03:46.717518Z"},"links":{"citing_paper":"/paper/2505.23848"},"observation_digest":"sha256:75dd720fd654e51b204a346c39f1bf74d32ba0501382be48c710811dfd0898da","observation_id":"c916b80e-3370-448d-8ca6-18a8d4ba30a7","resolution":{"observed_at":"2026-08-07T13:03:48.174607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:47.943823Z","title":"Qwq: Reflect deeply on the boundaries of the unknown, November 2024","venue":null,"work_id":"5bf8a3b7-70c4-4326-bf57-56134bb22daa","year":2024},"citing_paper":{"arxiv_id":"2505.23848","last_updated":"2025-05-28T20:25:24Z","snapshot_observed_at":"2026-08-07T12:56:42.860647Z","submitted_at":"2025-05-28T20:25:24Z","title":"Derailing Non-Answers via Logit Suppression at Output Subspace Boundaries in RLHF-Aligned Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:03:46.831461Z"},"links":{"citing_paper":"/paper/2505.23848"},"observation_digest":"sha256:9d6f6daaf7dd1eb3bb14824d999f0a9190c8c0a870e30de6b73a80c219ac446d","observation_id":"35a1f9f0-aae3-4f87-8542-5bfd1fd1e306","resolution":{"observed_at":"2026-08-07T13:03:48.052222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08383","last_updated":"2022-10-23T17:44:01Z","snapshot_observed_at":"2026-08-05T11:09:18.061567Z","submitted_at":"2022-03-16T04:12:20Z","title":"Iteratively Prompt Pre-trained Language Models for Chain of Thought","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08383","snapshot_observed_at":"2026-08-07T13:03:46.877533Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23848","last_updated":"2025-05-28T20:25:24Z","snapshot_observed_at":"2026-08-07T12:56:42.860647Z","submitted_at":"2025-05-28T20:25:24Z","title":"Derailing Non-Answers via Logit Suppression at Output Subspace Boundaries in RLHF-Aligned Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:03:46.877533Z"},"links":{"cited_paper":"/paper/2203.08383","citing_paper":"/paper/2505.23848"},"observation_digest":"sha256:013780786bb3c3d2b4b982125f589a6597ae7b59c540e07c8ac94b008c44e766","observation_id":"65f3e038-b85a-4f19-bad6-adc47acf9889","resolution":{"observed_at":"2026-08-07T13:03:46.877533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:46.949139Z","title":"L., Gugger, S., Drame, M., Lhoest, Q., and Rush, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23848","last_updated":"2025-05-28T20:25:24Z","snapshot_observed_at":"2026-08-07T12:56:42.860647Z","submitted_at":"2025-05-28T20:25:24Z","title":"Derailing Non-Answers via Logit Suppression at Output Subspace Boundaries in RLHF-Aligned Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:03:46.949139Z"},"links":{"citing_paper":"/paper/2505.23848"},"observation_digest":"sha256:33b8d976e1617410d06465637d136f5dafe41c297385f524e3c918b01b0dfbf0","observation_id":"54febf91-7b01-4851-9e92-e1ec99fa8183","resolution":{"observed_at":"2026-08-07T13:03:46.949139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-07T13:03:47.041540Z","title":"Representation engineering: A top-down approach to AI transparency","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23848","last_updated":"2025-05-28T20:25:24Z","snapshot_observed_at":"2026-08-07T12:56:42.860647Z","submitted_at":"2025-05-28T20:25:24Z","title":"Derailing Non-Answers via Logit Suppression at Output Subspace Boundaries in RLHF-Aligned Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:03:47.041540Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2505.23848"},"observation_digest":"sha256:6a767fbb05260c7e1a03fb52d5d06444f890714a4a64f9c82e946db621e20839","observation_id":"c766c2b2-dd79-47a3-938f-a8d48cf70a05","resolution":{"observed_at":"2026-08-07T13:03:47.041540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23848","last_updated":"2025-05-28T20:25:24Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:56:42.860647Z","submitted_at":"2025-05-28T20:25:24Z","title":"Derailing Non-Answers via Logit Suppression at Output Subspace Boundaries in RLHF-Aligned Language Models"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2505.23848."}