{"as_of":"2026-08-07T21:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:625b26fa5276ce8e4ca971049b437e21ceb1a0955fb1906a92beece24332b0c0","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:27:35.040995Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T05:52:53.880521Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T05:53:04.283223Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"cited_work":{"arxiv_id":"2507.00239","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00239","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Linearly decoding refused knowledge in aligned language models","venue":null,"work_id":"3c5085eb-90b8-4cef-afdf-eef09a80fbc6","year":2025},"citing_paper":{"arxiv_id":"2605.19341","last_updated":"2026-05-19T04:29:03Z","snapshot_observed_at":"2026-08-02T09:32:52.742127Z","submitted_at":"2026-05-19T04:29:03Z","title":"HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:53.880521Z"},"links":{"cited_paper":"/paper/2507.00239","citing_paper":"/paper/2605.19341"},"observation_digest":"sha256:a80c2e600090fcdca642ab6aaf82e5fda33428c32611139b15630f28af8d0606","observation_id":"dbcb59b9-70ef-4595-91e4-d4fff01c1fd4","resolution":{"observed_at":"2026-05-20T05:53:04.285500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00239/citation-record","integrity":"/paper/2507.00239/integrity","json":"/paper/2507.00239/citation-record.json","paper":"/paper/2507.00239"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.931557Z","title":"Yi-6b-chat","venue":null,"work_id":"35432c4e-9161-4ec8-a03c-828e5c06dfc5","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.845006Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:756523620f3f067f9a23c07e33508ba110e999a9843c792753dc3628bccc0ec6","observation_id":"c5a2a791-7579-49c3-88f6-b2715a52fc5a","resolution":{"observed_at":"2026-08-06T21:27:35.934291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.922062Z","title":"Fine-grained analysis of sentence embeddings using auxiliary prediction tasks","venue":null,"work_id":"db6de212-7ee8-424d-8b91-b87e228045b4","year":2017},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.848651Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:baef151f944c5aeb1e341d4138ed0ebc2e8e411a7774a8be13f04305a0e66502","observation_id":"60715637-4fce-4c16-a3de-03f09fe8e2c7","resolution":{"observed_at":"2026-08-06T21:27:35.925686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.851907Z","title":"Understanding intermediate layers using linear classifier probes, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.851907Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:bfd27f273c5d4ac1e864dbc390c1f78e6110b50ad85d9bb6913dfb4380955be0","observation_id":"8969fc5d-c558-4fd1-8a32-157c314a5060","resolution":{"observed_at":"2026-08-06T21:27:34.851907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.909119Z","title":"Bowman, Ethan Perez, Roger Baker Grosse, and David Duve- naud","venue":null,"work_id":"7075373b-29f5-42f8-8c80-1a0a831af1af","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.854780Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:68f362538f4dd75950e6d96604a22b62cccc16c6b33b1291afd27d6ad8584835","observation_id":"69d7fd01-27f0-4eb8-9c1e-9955d628c309","resolution":{"observed_at":"2026-08-06T21:27:35.911881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.901008Z","title":"Refusal in language models is mediated by a single direction","venue":null,"work_id":"e05a9dc4-5333-4906-a728-8e6caeea0bf1","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.857729Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:a2777296ded12da59283ff3cc67af487c9c0805176f7100bf330f68f1916aedb","observation_id":"37a6811c-38e0-4a5e-9068-f4c2007e0ea5","resolution":{"observed_at":"2026-08-06T21:27:35.904069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.860566Z","title":"Language models can predict their own behavior","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.860566Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:647d55f8e622875c407d0e350293426656c0b0d2735dfc79aa85edf662bfb355","observation_id":"9c846136-d36f-414a-a8f2-ef648efbce58","resolution":{"observed_at":"2026-08-06T21:27:34.860566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T21:27:34.863565Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.863565Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:eb0efd9c9f44ddeab79f38bde7ad07c016d9be313a32932e5c9d89bec6159075","observation_id":"485bfb6e-dec1-4c15-9d9b-1a77e5774d35","resolution":{"observed_at":"2026-08-06T21:27:34.863565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.866492Z","title":"Probing classifiers: Promises, shortcomings, and advances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.866492Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:f12b72df707b2ed660672f149a84ee0eb94abbc4f365ff5ee6e35140064f5078","observation_id":"2498cc3d-3119-430c-99e0-fa4527e14201","resolution":{"observed_at":"2026-08-06T21:27:34.866492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.869282Z","title":"Emergent misalignment: Narrow finetuning can produce broadly misaligned llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.869282Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:c597764392a237e53f323ee1f00ccb2ff7d69d09d4e353a06d1551a78d83ef00","observation_id":"e12569d5-02ac-4d67-b948-992ae2bca332","resolution":{"observed_at":"2026-08-06T21:27:34.869282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.892929Z","title":"Wedded to prosperity? informal influence and regional favoritism","venue":null,"work_id":"8efd810a-dde7-4b0b-b928-64801144610c","year":2025},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.871895Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:3ad11513f2ef6a18f709441502f023c74c1a252414fb48c8d054eda8f491a182","observation_id":"31e68641-64d1-482b-96b7-34c604c2b306","resolution":{"observed_at":"2026-08-06T21:27:35.895949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.874834Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.874834Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:2869452743629aa84ed941c604f4ca36dc2cdac668cd4720dc1d49daa98399fc","observation_id":"f0016ce6-8359-43f6-85ea-e5843884496d","resolution":{"observed_at":"2026-08-06T21:27:34.874834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.885064Z","title":"List of countries | Britannica","venue":null,"work_id":"a488a348-f853-4af2-8da3-318ad37b4ff2","year":2025},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.877444Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:570e4848988aa59b2da7b88efc5a959485fc05e4c149aab6f7bc30a0312c2413","observation_id":"c2aa32b7-6cc5-4ae0-9e33-b4778e0f59a0","resolution":{"observed_at":"2026-08-06T21:27:35.887726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18819","last_updated":"2024-10-24T15:08:17Z","snapshot_observed_at":"2026-08-06T02:37:44.176568Z","submitted_at":"2024-10-24T15:08:17Z","title":"From Imitation to Introspection: Probing Self-Consciousness in Language Models","version":1},"cited_work":{"arxiv_id":"2410.18819","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.18819","snapshot_observed_at":"2026-08-06T21:27:35.498272Z","title":"From Imitation to Introspection: Probing Self-Consciousness in Language Models","venue":"cs.CL","work_id":"494c6141-5972-49f9-8ee6-c3c2741875d6","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.880028Z"},"links":{"cited_paper":"/paper/2410.18819","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:c4022ceec180efcbdc53506d44e7ef042a1b1ed0ea10be71e8409e20e44d3410","observation_id":"439e7a25-52f9-4974-a467-8996553ed81c","resolution":{"observed_at":"2026-08-06T21:27:35.503514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v36i10.21294","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.108932Z","title":"Probing linguistic information for logical inference in pre-trained language models","venue":null,"work_id":"6c4e14c4-8c12-4445-b6bd-05978399937f","year":2022},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.883871Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:f53de09cec071d93744cc22c9441de071aa5e89f02ce98da14f8fadbe07f3113","observation_id":"950eb059-ec69-4cd0-a671-ddaaba6b4324","resolution":{"observed_at":"2026-08-06T21:27:35.112492Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09177","last_updated":"2024-10-02T10:43:07Z","snapshot_observed_at":"2026-08-01T16:03:38.510223Z","submitted_at":"2024-02-14T13:45:19Z","title":"Leveraging the Context through Multi-Round Interactions for Jailbreaking Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09177","snapshot_observed_at":"2026-08-06T21:27:34.886612Z","title":"Leverag- ing the context through multi-round interactions for jailbreaking attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.886612Z"},"links":{"cited_paper":"/paper/2402.09177","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:65c0a1ab7df4b40516c8a89ed0630320adf63c3fbe1ef6ead593e241c634cb45","observation_id":"eefa3a7d-cae6-4863-a024-f84dc69db856","resolution":{"observed_at":"2026-08-06T21:27:34.886612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.889561Z","title":"Breaking down the defenses: A comparative survey of attacks on large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.889561Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:bb75b16eca355f04291831b828465e182734b670e561888a7a73494b2b10f960","observation_id":"fe531612-2443-4d1a-aa94-e4a8fd5900df","resolution":{"observed_at":"2026-08-06T21:27:34.889561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05668","last_updated":"2025-05-26T12:56:04Z","snapshot_observed_at":"2026-07-06T17:27:24.955378Z","submitted_at":"2024-02-08T13:42:50Z","title":"JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05668","snapshot_observed_at":"2026-08-06T21:27:34.892626Z","title":"Com- prehensive assessment of jailbreak attacks against llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.892626Z"},"links":{"cited_paper":"/paper/2402.05668","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:a80cebfbe16a8a0bb1981fbdaa3d97b5881648e503b15abb522b433c12a1d0d5","observation_id":"01705d48-dbcf-4a46-bc10-2a5b4228527b","resolution":{"observed_at":"2026-08-06T21:27:34.892626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.895935Z","title":"Scaling instruction-finetuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.895935Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:b92fb1556b3733970b06dcc9842ecc080750b9b043a865b043e1775422c74100","observation_id":"526a21f6-bf23-4ce8-80df-4186450bc962","resolution":{"observed_at":"2026-08-06T21:27:34.895935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.872487Z","title":"Pawan Kumar, and Adel Bibi","venue":null,"work_id":"d30a3a57-79a6-4060-bd9e-439c4baedb51","year":2025},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.898752Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:ddc3b86f1efc6a20825b8ec6c1720e3d81ed5fb46e1793eada4cedf4b6ba22df","observation_id":"f180b5d0-bf86-48b5-9d09-b5531dafd636","resolution":{"observed_at":"2026-08-06T21:27:35.875007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.901466Z","title":"Dissecting recall of factual associations in auto-regressive language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.901466Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:416fa1ca0ee9385a57e2eb668665d5b16ab312089f1069fe36aef0413f9e71a7","observation_id":"b092e29e-e050-4f37-a99e-6c79a296a0d8","resolution":{"observed_at":"2026-08-06T21:27:34.901466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.905010Z","title":"Estimating knowledge in large language models without generating a single token","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.905010Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:be636eb5d94abd20ff88320b0d9d51a39f73c932b1fc5478856dd0036aceb0a4","observation_id":"06d3705b-e684-468a-9d09-dfba78d41227","resolution":{"observed_at":"2026-08-06T21:27:34.905010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.908262Z","title":"Not what you’ve signed up for: Compromising real-world llm-integrated applications with indirect prompt injection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.908262Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:9070e16e54ed50d768907170b4627278fe2d070d73bab1d39f4077e4e03db8d0","observation_id":"6fae92c4-ed83-4aa5-b882-635b997b8616","resolution":{"observed_at":"2026-08-06T21:27:34.908262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.864484Z","title":"Language models represent space and time","venue":null,"work_id":"8de3c109-940a-47c0-8c2d-be51e9fc95c1","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.910913Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:56f03b4a658b7530d031b15be40e41839da6d4b9e3ee282390a4a5d0e6edc50e","observation_id":"cfa06f62-615f-40ca-9ed9-45d4fdd293ab","resolution":{"observed_at":"2026-08-06T21:27:35.867466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.855557Z","title":"The Elements of Statistical Learning: Data Mining, Inference, and Prediction, volume 2","venue":null,"work_id":"c3cdc236-3d9c-41a2-b02e-eb5c7a9b4f84","year":2009},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.913521Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:c003e7dd0a39f7657d78a20f828ac55c8c729aa5b3f0b3c7750cc65f7638c7bf","observation_id":"646a3c4b-2bd7-4830-8711-db5f719a9414","resolution":{"observed_at":"2026-08-06T21:27:35.859326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.846421Z","title":"Do LLMs “know” internally when they follow instructions? In The Thirteenth International Conference on Learning Representations, 2025","venue":null,"work_id":"465027c2-c67f-4b6b-9ecd-89d266747ded","year":2025},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.916396Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:ff2391da138d42cb062f479dc684bf2df4676a9f72301c5d89e7cdcaaa6eab33","observation_id":"c3ac457d-fb07-4073-bd67-6fd10c97a6b4","resolution":{"observed_at":"2026-08-06T21:27:35.849401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.919014Z","title":"Linearity of relation decoding in transformer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.919014Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:d1f6a10f2e1e0dbb9f16727086be64d4616265bf1f622afe6601dd62a1b2dec5","observation_id":"759b8f54-cd1d-4747-854f-355b875cf830","resolution":{"observed_at":"2026-08-06T21:27:34.919014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.921758Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.921758Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:197090c6d2fccd73b2d4d9e1a5018876f61895d74669d8592721eb009fb9dc71","observation_id":"8430ffe5-7061-4fc7-9eef-39105ff4c5cf","resolution":{"observed_at":"2026-08-06T21:27:34.921758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06748","last_updated":"2025-08-29T17:08:59Z","snapshot_observed_at":"2026-08-03T11:03:45.331021Z","submitted_at":"2024-12-09T18:40:44Z","title":"Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06748","snapshot_observed_at":"2026-08-06T21:27:34.924646Z","title":"Refusal tokens: A simple way to calibrate refusals in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.924646Z"},"links":{"cited_paper":"/paper/2412.06748","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:3e205d25cf66c9fa3afd81a37be29dc29a93712b6b3b97d1fa5597e592d303ca","observation_id":"c01ad35f-d372-4f9f-b395-75534335cdf1","resolution":{"observed_at":"2026-08-06T21:27:34.924646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.833623Z","title":null,"venue":null,"work_id":"426c9be0-b554-4217-85d7-dcabb40d0e4c","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.927770Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:884f40b06fa73507ea4be3ae352347771c9e21bc7ac8e736bbd1d0f6a1984ca8","observation_id":"3336f87e-aea9-41c8-a87f-3a981ccda430","resolution":{"observed_at":"2026-08-06T21:27:35.836329Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.930716Z","title":"Jailbreakzoo: Survey, landscapes, and horizons in jailbreaking large language and vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.930716Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:1d133eb316c7e1c83ff721f679a8e0671e8fb49cad9203f7693fa23a38b2860a","observation_id":"cfda084d-86b9-4854-91d3-8374c95541d7","resolution":{"observed_at":"2026-08-06T21:27:34.930716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14659","last_updated":"2021-03-26T18:01:48Z","snapshot_observed_at":"2026-07-06T10:53:51.296957Z","submitted_at":"2021-03-26T18:01:48Z","title":"Alignment of Language Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.14659","snapshot_observed_at":"2026-08-06T21:27:34.933507Z","title":"Alignment of language agents","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.933507Z"},"links":{"cited_paper":"/paper/2103.14659","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:eaadf72e656ac52a879ffd7d6ddbdc722669e415270e847fa4624f949f60486c","observation_id":"4bbaf33b-6b53-4065-8505-50fe0f78aa21","resolution":{"observed_at":"2026-08-06T21:27:34.933507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.936952Z","title":"Linear representations of political perspective emerge in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.936952Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:76bc856f18b8e251bc9a59c9eaa0a47b418014f0f08d8a0731bad9f7eeb3ff57","observation_id":"21901eb9-72ba-4d6c-903f-2f333a024a6a","resolution":{"observed_at":"2026-08-06T21:27:34.936952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-06T21:27:34.939664Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.939664Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:28a35e909c4d675c6340e723792320af0b46dc57d8f2820ead877da271894b51","observation_id":"7baf0ade-4903-4696-9913-52d67c38e2f1","resolution":{"observed_at":"2026-08-06T21:27:34.939664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05050","last_updated":"2025-06-03T00:32:13Z","snapshot_observed_at":"2026-08-07T16:07:59.195016Z","submitted_at":"2025-04-07T13:20:17Z","title":"Revealing the Intrinsic Ethical Vulnerability of Aligned Large Language Models","version":4},"cited_work":{"arxiv_id":"2504.05050","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.05050","snapshot_observed_at":"2026-08-06T21:27:35.228718Z","title":"Revealing the Intrinsic Ethical Vulnerability of Aligned Large Language Models","venue":"cs.CL","work_id":"d489bc54-96a7-4be6-945b-ff84a9cc21dc","year":2025},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.942636Z"},"links":{"cited_paper":"/paper/2504.05050","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:5f29dda37f047b32013713c1f4d8718052ace7470ab3da9a381c520a8a17dcb1","observation_id":"bcc200e2-fc7b-4a7c-aa80-f5ae16cb250e","resolution":{"observed_at":"2026-08-06T21:27:35.231753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.820715Z","title":"The unlocking spell on base LLMs: Rethinking alignment via in-context learning","venue":null,"work_id":"cd728be0-0c63-4090-999b-1aeb1f3846e4","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.945645Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:d512267d8a14fdc7b58ae6f5df17fa13609a1c18aef5a59d1cc29c3d54921462","observation_id":"e8c6d6a0-da41-49f0-b24a-5a9ff6d632cb","resolution":{"observed_at":"2026-08-06T21:27:35.823624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10794","last_updated":"2024-12-02T21:48:47Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T03:38:48Z","title":"Towards Understanding Jailbreak Attacks in LLMs: A Representation Space Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10794","snapshot_observed_at":"2026-08-06T21:27:34.948426Z","title":"Towards understanding jailbreak attacks in llms: A representation space analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.948426Z"},"links":{"cited_paper":"/paper/2406.10794","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:869a4b4319899f334dd48e4d34c9c870aa78208f60c7b9269b9c8ac23b06d2cc","observation_id":"1dabd6f2-50a8-44ae-8f45-764cd3e04cc0","resolution":{"observed_at":"2026-08-06T21:27:34.948426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.812217Z","title":"Formalizing and benchmarking prompt injection attacks and defenses","venue":null,"work_id":"b4952575-9cfe-441c-9a7c-d07a53b87719","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.951313Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:7fae1cea469ab4b151e0e07d3b7bf7408590013dd4e4ed703bea726989469045","observation_id":"74188ff8-dbf6-4b71-9309-9484a5e2fb27","resolution":{"observed_at":"2026-08-06T21:27:35.815303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18540","last_updated":"2025-01-17T01:43:21Z","snapshot_observed_at":"2026-07-06T17:36:56.979448Z","submitted_at":"2024-02-28T18:23:49Z","title":"Keeping LLMs Aligned After Fine-tuning: The Crucial Role of Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18540","snapshot_observed_at":"2026-08-06T21:27:34.954267Z","title":"Keep- ing llms aligned after fine-tuning: The crucial role of prompt templates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.954267Z"},"links":{"cited_paper":"/paper/2402.18540","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:1a06e50489b92935a0a1fcbc09887e9a8cd6628f865a0ea4cc0b332b3fc9f0b1","observation_id":"70fcb23a-e528-4821-9f89-888045f82745","resolution":{"observed_at":"2026-08-06T21:27:34.954267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.803768Z","title":"The geometry of truth: Emergent linear structure in large lan- guage model representations of true/false datasets","venue":null,"work_id":"14db4249-35d2-477a-b105-6bdfb501db9c","year":null},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.957079Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:dc24f3a96ce7f1d4feed51cfef26801bfd99526269f598be399fa8eee717bda4","observation_id":"86438a36-a411-4441-a471-54d8bed4c87d","resolution":{"observed_at":"2026-08-06T21:27:35.806655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.787074Z","title":"Occupation Data - O*NET 29.2 Data Dictionary at O*NET Re- source Center","venue":null,"work_id":"9cc9e9b8-630e-471f-836e-0afc0a94a8a3","year":2025},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.962407Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:de6a3971e91c6de57d4528de0a67dfad108384e53d8a7d4279c61cc840f9a2d4","observation_id":"6c34073d-86c8-4a1e-89c7-b423059d414c","resolution":{"observed_at":"2026-08-06T21:27:35.789994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.778734Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"3dd3c747-3037-4033-8b9a-88b64093b2e4","year":2022},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.965216Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:c336c5ccf8f09129194897b0dbb7a5c23ffe581df7ec96b20eb32f0d5ee0f8da","observation_id":"b186f49c-7811-4216-8e8b-7da273136424","resolution":{"observed_at":"2026-08-06T21:27:35.781795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.769727Z","title":"The linear representation hypothesis and the geometry of large language models","venue":null,"work_id":"872cff9b-47fc-4790-a0a9-8c636a8fa48f","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.967915Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:f5d2974f43f30e495e94d1d628366b930e89b40cd65edc291a522e378dbc4851","observation_id":"d3d0f1e2-31dd-4717-8934-f78e7e3e7546","resolution":{"observed_at":"2026-08-06T21:27:35.773466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09527","last_updated":"2022-11-17T13:43:20Z","snapshot_observed_at":"2026-07-06T14:19:47.424778Z","submitted_at":"2022-11-17T13:43:20Z","title":"Ignore Previous Prompt: Attack Techniques For Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09527","snapshot_observed_at":"2026-08-06T21:27:34.970768Z","title":"Ignore previous prompt: Attack techniques for language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.970768Z"},"links":{"cited_paper":"/paper/2211.09527","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:7b1872db239ce59609173d0985844bc0de376138c458bdbcc1d42849283a59a8","observation_id":"5096fc8d-d834-4727-8e4f-34e49c62aa1b","resolution":{"observed_at":"2026-08-06T21:27:34.970768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.973853Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to! In The Twelfth International Conference on Learning Representations , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.973853Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:e5e56bfa3929bbd9a3aa15f88d91f52f8aeff900630fad8735cd781ac3c23105","observation_id":"a17f31f2-5cce-4416-a8d5-5f571d90d4fd","resolution":{"observed_at":"2026-08-06T21:27:34.973853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.977277Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.977277Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:d34758fbeb69dc44aa06146c37221595f0272ba7e1ec124f425d2f6673bd298f","observation_id":"67379375-b768-4557-a664-7adce87c13e5","resolution":{"observed_at":"2026-08-06T21:27:34.977277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.980167Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.980167Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:edf169369143df16a83cb65cd6a148a8ac189f64a8a9ab06357c6116bad5542c","observation_id":"fb4c71d6-3951-4f95-a5a5-ad814441f6bc","resolution":{"observed_at":"2026-08-06T21:27:34.980167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.746301Z","title":"Multi- task prompted training enables zero-shot task generalization","venue":null,"work_id":"d943cc7b-c2a8-4e67-969c-a9b9d5bc8d3e","year":2022},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.982721Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:1b3bb7c2cb6f325236d76de95aaa6cdb6a14d9750b4e562d6f1fc75c8d5a0ee9","observation_id":"1c158573-9d21-4878-b441-ee83b5fc65c0","resolution":{"observed_at":"2026-08-06T21:27:35.749217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-06T21:27:34.985261Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.985261Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:343d5d352637d097a8008558bc7f8583e32c33c8d0aef49b92490dd097eebf0d","observation_id":"74e33e9a-f10b-4f6d-88cb-9af4f587b0f0","resolution":{"observed_at":"2026-08-06T21:27:34.985261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.738166Z","title":"do anything now","venue":null,"work_id":"1a860ccb-20d7-4756-a95f-ba71549b0164","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.988437Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:dd4759aec62dc1ed9f7f5b6adf7e05822fd6edd85f20b2da14245d6d19893f5e","observation_id":"8e459ab7-d98c-43af-9a8b-2b7768a272c4","resolution":{"observed_at":"2026-08-06T21:27:35.740959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13204","last_updated":"2024-10-17T04:12:17Z","snapshot_observed_at":"2026-08-06T03:45:28.741090Z","submitted_at":"2024-10-17T04:12:17Z","title":"Measuring Free-Form Decision-Making Inconsistency of Language Models in Military Crisis Simulations","version":1},"cited_work":{"arxiv_id":"2410.13204","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.13204","snapshot_observed_at":"2026-08-06T21:27:35.194364Z","title":"Measuring Free-Form Decision-Making Inconsistency of Language Models in Military Crisis Simulations","venue":"cs.CL","work_id":"12149a54-cc8f-44cb-9ec8-2682fd05a894","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.991094Z"},"links":{"cited_paper":"/paper/2410.13204","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:f67ce57c99fdb672bf2d5d8fc30c91e5f26d995d487469c6a48e43dcb3f80706","observation_id":"8ccd69e5-4941-4fa4-ac29-f2fcc1404203","resolution":{"observed_at":"2026-08-06T21:27:35.197892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01724","last_updated":"2024-05-02T20:42:28Z","snapshot_observed_at":"2026-08-06T07:01:20.735410Z","submitted_at":"2024-05-02T20:42:28Z","title":"Large Language Models are Inconsistent and Biased Evaluators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01724","snapshot_observed_at":"2026-08-06T21:27:34.994224Z","title":"Large language models are incon- sistent and biased evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.994224Z"},"links":{"cited_paper":"/paper/2405.01724","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:34b8ef31afbc102d0726dc13bb89bd08bb6c4a5710e3a0078125633f8f2fe064","observation_id":"89b52122-a299-46f1-ac45-1adf19bcba0f","resolution":{"observed_at":"2026-08-06T21:27:34.994224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-06T21:27:34.997511Z","title":"Gemma 2: Improving open language models at a practical size","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.997511Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:27d0149dff24663fe7ba27ffe4a4a76d370e30dd39280f40a5536ba42a70140d","observation_id":"a88fe132-d912-464b-adb0-575e52fb0356","resolution":{"observed_at":"2026-08-06T21:27:34.997511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.06316","last_updated":"2019-05-15T17:48:56Z","snapshot_observed_at":"2026-08-07T09:02:14.264924Z","submitted_at":"2019-05-15T17:48:56Z","title":"What do you learn from context? Probing for sentence structure in contextualized word representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.06316","snapshot_observed_at":"2026-08-06T21:27:35.000447Z","title":"What do you learn from context? probing for sentence structure in contextualized word representations","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.000447Z"},"links":{"cited_paper":"/paper/1905.06316","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:e5b599e46440b831346e6f8f83f8e286d3d20e7912c015a4d6a9ca5833a8367a","observation_id":"358b4c94-e01b-4aea-9bf5-e6661b3756af","resolution":{"observed_at":"2026-08-06T21:27:35.000447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.730148Z","title":"Attention is all you need","venue":null,"work_id":"edc41dbe-51c4-472b-9964-5d5306dbe5a2","year":2017},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.003388Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:122dd452767fffebeb3f11758fb99f59e1b8314117e838a13673297f1c4eded4","observation_id":"d4edba58-579f-41fa-95c9-c325e80519d1","resolution":{"observed_at":"2026-08-06T21:27:35.732940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.721553Z","title":"White-box multimodal jailbreaks against large vision-language models","venue":null,"work_id":"e99e6085-e53b-49c5-9c60-12266ac97623","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.005888Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:f5e2d201047dc8e8bab9e19f0a922628930dada80774e755530ded4210bb4e33","observation_id":"f93403d1-7fd8-425f-b47d-251dcb60d155","resolution":{"observed_at":"2026-08-06T21:27:35.724603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.712429Z","title":"Jailbroken: How does LLM safety training fail? In Thirty-seventh Conference on Neural Information Processing Systems, 2023","venue":null,"work_id":"c8f0624f-b36f-486c-839b-bd8cf665f1b4","year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.008684Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:f74d70a5c73a54b293bd262fd593e59685fc9de8d48e5435308b8d69a11154fa","observation_id":"8a797ac8-2e88-4f95-8733-6c1002f776bd","resolution":{"observed_at":"2026-08-06T21:27:35.715626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05162","last_updated":"2024-10-24T19:21:52Z","snapshot_observed_at":"2026-08-02T21:32:36.729604Z","submitted_at":"2024-02-07T18:34:38Z","title":"Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05162","snapshot_observed_at":"2026-08-06T21:27:35.011420Z","title":"Assessing the brittleness of safety alignment via pruning and low-rank modifications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.011420Z"},"links":{"cited_paper":"/paper/2402.05162","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:952e2992d408b6c874e2282dfa39b00d35912aae8a691804f3a1081fab558c3e","observation_id":"e52b27ab-0ec8-40c8-8109-dde23d632199","resolution":{"observed_at":"2026-08-06T21:27:35.011420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-06T21:27:35.014424Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.014424Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:e8bdb7cb4acd8b932014b6929c7ecd8954a8202347dfdd9404876566b8520fb9","observation_id":"c8564b34-057e-407c-bf81-6ed1135155b4","resolution":{"observed_at":"2026-08-06T21:27:35.014424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.017387Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.017387Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:8e2e67a23d820281dc51bffae1ffa7d9b89a4db653ade94b77eda0ad2e7ed97d","observation_id":"e8c3f6af-81dd-40ef-ab5a-21b0092acb6e","resolution":{"observed_at":"2026-08-06T21:27:35.017387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10235","last_updated":"2023-08-30T04:32:36Z","snapshot_observed_at":"2026-07-06T15:28:40.452146Z","submitted_at":"2023-05-15T15:44:51Z","title":"Assessing Hidden Risks of LLMs: An Empirical Study on Robustness, Consistency, and Credibility","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10235","snapshot_observed_at":"2026-08-06T21:27:35.020100Z","title":"Assessing hidden risks of llms: an empirical study on robustness, consistency, and credibility","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.020100Z"},"links":{"cited_paper":"/paper/2305.10235","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:02427fda59c3566f61aca0da1629d873e38156f56a268d3a1f206aa6a53d6215","observation_id":"f17e0bc1-e48f-4aac-ab21-9c93e8167193","resolution":{"observed_at":"2026-08-06T21:27:35.020100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl.549","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.069041Z","title":"On the vulnerability of safety alignment in open-access LLMs","venue":null,"work_id":"3b71ee97-80e4-427f-bc6b-acc6b86c8f2a","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.022967Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:0d5f3dc21762f5fe436e09f7e482fcaf578bd1a0f586ab2c83b632c2465854c1","observation_id":"a33b0e54-ad19-4232-89ae-fc87d627e05a","resolution":{"observed_at":"2026-08-06T21:27:35.073634Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-04T23:34:13.332065Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04295","snapshot_observed_at":"2026-08-06T21:27:35.025865Z","title":"Jailbreak attacks and defenses against large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.025865Z"},"links":{"cited_paper":"/paper/2407.04295","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:2463323aa9a1fa028e394173e4710d0bd398275383d20048a978c2b9a8b58db9","observation_id":"549a16a1-0b82-45bf-83b0-0e8a7a9e5e49","resolution":{"observed_at":"2026-08-06T21:27:35.025865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-06T21:27:35.028823Z","title":"Yi: Open foundation models by 01","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.028823Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:8d316da5386039a994f014ba2fffbd284892680ecbc15f65838784c41451b3d8","observation_id":"9836f397-8f1c-4026-b996-27b1613c361a","resolution":{"observed_at":"2026-08-06T21:27:35.028823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.698949Z","title":"Don’t listen to me: understanding and exploring jailbreak prompts of large language models","venue":null,"work_id":"669f1d2e-0122-435d-8fbe-cf691dffc9e5","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.031749Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:4b36b9bee6acc6471239c0d2d13e2508c949c93cad956e6a25c524d67b4e32e5","observation_id":"5857d7c6-e88b-4079-bdda-232f7a5b79d9","resolution":{"observed_at":"2026-08-06T21:27:35.702045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.034422Z","title":"Removing RLHF protections in GPT-4 via fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.034422Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:f69dde3bdc6db9bd493614a314865d87493b12259f245c7854d4dca9b44c3f1b","observation_id":"bf6791de-0c35-48c4-9af0-7d7f436b471c","resolution":{"observed_at":"2026-08-06T21:27:35.034422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.037339Z","title":"Lima: Less is more for alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.037339Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:a7b50807b056b056dbaa845e17420c38dd4e44167cf68c0f00e032579d747b4e","observation_id":"dab3bda0-c3ff-45ee-b08c-c3cb7706f90b","resolution":{"observed_at":"2026-08-06T21:27:35.037339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T21:27:35.040995Z","title":"diverse set of fictional names","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.040995Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:5add91f19f2cd6e0ee458968e91e0f4148be490659bd8bfd13c9c692f5e86f12","observation_id":"e3b2af77-ec94-45f6-9f49-31afebf2d95b","resolution":{"observed_at":"2026-08-06T21:27:35.040995Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.795812Z","title":null,"venue":null,"work_id":"4973625e-81af-4e7c-8c9b-77f1f4c196fb","year":null},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.959696Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:827eadaba7fd1013a7ff17059e037197145ef4edefeb3df09a3867672fce5e30","observation_id":"7b418754-5462-49f6-8997-fc1ee1e73aef","resolution":{"observed_at":"2026-08-06T21:27:35.798529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":5,"verified_fuzzy":22},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 1 inbound Pith citation observation for arXiv:2507.00239."}