{"as_of":"2026-08-22T21:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:025a569e14de14bd74490e14bf4ec94c56ec42040ff21a1288f761f1798771dc","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:51:10.182264Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:29:10.162261Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23556","snapshot_observed_at":"2026-08-06T17:03:16.984373Z","title":"Understanding refusal in language models with sparse autoencoders.arXiv preprint arXiv:2505.23556,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11878","last_updated":"2026-07-06T01:46:44Z","snapshot_observed_at":"2026-08-13T20:49:32.387386Z","submitted_at":"2025-07-16T03:48:03Z","title":"LLMs Encode Harmfulness and Refusal Separately","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:03:16.984373Z"},"links":{"cited_paper":"/paper/2505.23556","citing_paper":"/paper/2507.11878"},"observation_digest":"sha256:7c6a6b3e47bb4c60d86132e47b6449fab1406ad3cb287eb6fae11732a62c26b7","observation_id":"18905129-bc63-4288-a4c1-1fe82f33c3a1","resolution":{"observed_at":"2026-08-06T17:03:16.984373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23556","snapshot_observed_at":"2026-08-15T17:29:10.162261Z","title":"Understanding refusal in language models with sparse autoencoders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.162261Z"},"links":{"cited_paper":"/paper/2505.23556","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:c948dcbef19e99560c75a97cb834aacadb167d1a3bbe685dec73e407b06a3c51","observation_id":"21c0f68c-05f5-45de-8f2d-d8090664d7ac","resolution":{"observed_at":"2026-08-15T17:29:10.162261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23556","snapshot_observed_at":"2026-08-15T16:51:54.950442Z","title":"Un- derstanding refusal in language models with sparse au- toencoders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20333","last_updated":"2025-08-28T00:30:25Z","snapshot_observed_at":"2026-08-18T20:49:21.541238Z","submitted_at":"2025-08-28T00:30:25Z","title":"Poison Once, Refuse Forever: Weaponizing Alignment for Injecting Bias in LLMs","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T16:51:54.950442Z"},"links":{"cited_paper":"/paper/2505.23556","citing_paper":"/paper/2508.20333"},"observation_digest":"sha256:a06cc97d04c9f5af5f8118feac58f505a653627377655de9a2525981f72c5d11","observation_id":"4f81b681-ec55-4df4-8846-35eb76f4d1f6","resolution":{"observed_at":"2026-08-15T16:51:54.950442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":"2505.23556","doi":"10.48550/arxiv.2505.23556","metadata_source":"pith","pith_arxiv_id":"2505.23556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Prakash, N., Neo, C., Lee, R","venue":"cs.CL","work_id":"e9aabf20-7126-472c-9764-caa1b3959071","year":2025},"citing_paper":{"arxiv_id":"2605.07883","last_updated":"2026-05-08T15:33:54Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T15:33:54Z","title":"Beyond \"I cannot fulfill this request\": Alleviating Rigid Rejection in LLMs via Label Enhancement","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T01:53:10.245859Z"},"links":{"cited_paper":"/paper/2505.23556","citing_paper":"/paper/2605.07883"},"observation_digest":"sha256:cf6314d672e979bc44731a098ed30db9e2f3b7bffda49a06b79985d6c71e49ed","observation_id":"50fabb8e-bd0e-4261-a0c6-d006327a1a4b","resolution":{"observed_at":"2026-05-11T04:15:55.709614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":"2505.23556","doi":"10.48550/arxiv.2505.23556","metadata_source":"pith","pith_arxiv_id":"2505.23556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Prakash, N., Neo, C., Lee, R","venue":"cs.CL","work_id":"e9aabf20-7126-472c-9764-caa1b3959071","year":2025},"citing_paper":{"arxiv_id":"2606.15980","last_updated":"2026-06-18T23:56:29Z","snapshot_observed_at":"2026-08-13T20:15:46.535466Z","submitted_at":"2026-06-14T19:07:22Z","title":"Do Activation Monitors Survive Model Updates? Benchmarking, Predicting, and Repairing Activation-Monitor Staleness","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-27T03:24:24.714121Z"},"links":{"cited_paper":"/paper/2505.23556","citing_paper":"/paper/2606.15980"},"observation_digest":"sha256:b96b87c92414a98d1c037ee506905b301d0aa33812354dbf72ee0374c614fe8a","observation_id":"6e7d65de-6cd4-4979-a5a7-d826d06cf823","resolution":{"observed_at":"2026-06-27T03:30:26.978197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":"2505.23556","doi":"10.48550/arxiv.2505.23556","metadata_source":"pith","pith_arxiv_id":"2505.23556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Prakash, N., Neo, C., Lee, R","venue":"cs.CL","work_id":"e9aabf20-7126-472c-9764-caa1b3959071","year":2025},"citing_paper":{"arxiv_id":"2607.02047","last_updated":"2026-07-02T11:14:52Z","snapshot_observed_at":"2026-08-18T14:10:49.713931Z","submitted_at":"2026-07-02T11:14:52Z","title":"OpenSafeIntent: Evaluating Intent-Calibrated Safe Completion Across Dual-Use Prompt Sets","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-03T14:44:57.205766Z"},"links":{"cited_paper":"/paper/2505.23556","citing_paper":"/paper/2607.02047"},"observation_digest":"sha256:9411c41b467ebea6b13e06eb26b3b4bcded0ce250c4b212bdf3402ae5f9b41f8","observation_id":"864ec7c0-b10e-4e34-93db-6fbbb1f58b78","resolution":{"observed_at":"2026-07-03T14:48:32.464906Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":"2505.23556","doi":"10.48550/arxiv.2505.23556","metadata_source":"pith","pith_arxiv_id":"2505.23556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Prakash, N., Neo, C., Lee, R","venue":"cs.CL","work_id":"e9aabf20-7126-472c-9764-caa1b3959071","year":2025},"citing_paper":{"arxiv_id":"2607.05355","last_updated":"2026-07-06T17:33:36Z","snapshot_observed_at":"2026-07-09T23:18:25.416188Z","submitted_at":"2026-07-06T17:33:36Z","title":"Faithfulness to Refusal: A Causal Audit of Neuron Selectors","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-07T15:35:54.665268Z"},"links":{"cited_paper":"/paper/2505.23556","citing_paper":"/paper/2607.05355"},"observation_digest":"sha256:ec6c763061ba2c141b47056e1945a5d183f102987e49c2b35d9afc5eb7ba0853","observation_id":"af26780e-7f3d-4c21-b934-219782f46033","resolution":{"observed_at":"2026-07-07T15:43:53.886128Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23556","snapshot_observed_at":"2026-07-14T14:13:53.489886Z","title":"arXiv preprint arXiv:2505.23556 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10112","last_updated":"2026-07-11T04:13:42Z","snapshot_observed_at":"2026-08-17T04:15:36.330362Z","submitted_at":"2026-07-11T04:13:42Z","title":"Minionese: Comprehensive Benchmark and Mechanistic Study of Multilingual LLM Safety","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-14T14:13:53.489886Z"},"links":{"cited_paper":"/paper/2505.23556","citing_paper":"/paper/2607.10112"},"observation_digest":"sha256:57b2bf6c11820df8a83286e707d3aa85335a3caf6c01b539ffd22b8da2d160e0","observation_id":"adf1c4d8-ea18-4d7f-8102-bb6a5a62a925","resolution":{"observed_at":"2026-07-14T14:13:53.489886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23556","snapshot_observed_at":"2026-07-30T20:47:41.079651Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23496","last_updated":"2026-08-13T10:12:10Z","snapshot_observed_at":"2026-08-19T08:04:18.550983Z","submitted_at":"2026-07-26T06:54:28Z","title":"Do LLMs Know Their Vulnerable Scenarios?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-30T20:47:41.079651Z"},"links":{"cited_paper":"/paper/2505.23556","citing_paper":"/paper/2607.23496"},"observation_digest":"sha256:23c17b7b372188d98302e809c917cddfc2d3443ef6b9a94a84fdf94513a16d6b","observation_id":"df21f8a7-b267-456d-825b-74c3c73cd698","resolution":{"observed_at":"2026-07-30T20:47:41.079651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23556/citation-record","integrity":"/paper/2505.23556/integrity","json":"/paper/2505.23556/citation-record.json","paper":"/paper/2505.23556"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:03.467398Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:03.467398Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:8a03bd4f828868a8e551e9e733fed37c63e408e718542288ba420c11f60e51f3","observation_id":"b87d6d4b-335f-42cc-89fa-210393a7eb9e","resolution":{"observed_at":"2026-08-07T12:51:03.467398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:03.619692Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:03.619692Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:94c577b04cf64ddf8e9b9676abc63c4233cac1dce6501dbbf941ed703c2d38bc","observation_id":"f6e93ff0-36ae-4b15-a944-4cb0f21bc61e","resolution":{"observed_at":"2026-08-07T12:51:03.619692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:03.761845Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:03.761845Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:ff5677c53ff6b41e9d0643331fc8588b7e4068f9e3ef0926c958e2dc42cc79f4","observation_id":"95277383-8242-4f8a-8a42-fe60862e2112","resolution":{"observed_at":"2026-08-07T12:51:03.761845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:11.638420Z","title":null,"venue":null,"work_id":"fac3ad84-3ffd-418f-9fd6-e1f07f42a27e","year":2025},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:03.935149Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:fcf16cc1168142c2decf33e779ae251c4e73b875e6170b00780713ecd1ccb8e4","observation_id":"211e4844-e50f-4bbe-b5b7-1874614661ca","resolution":{"observed_at":"2026-08-07T12:51:11.715851Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11746","last_updated":"2024-02-19T00:18:09Z","snapshot_observed_at":"2026-08-20T19:48:44.430622Z","submitted_at":"2024-02-19T00:18:09Z","title":"Language Models are Homer Simpson! Safety Re-Alignment of Fine-tuned Language Models through Task Arithmetic","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11746","snapshot_observed_at":"2026-08-07T12:51:04.068736Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:04.068736Z"},"links":{"cited_paper":"/paper/2402.11746","citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:43a33511fc88e3eaa4368aa6f5d800de0a73e4a362c9a0d4ab2604c57c3f865e","observation_id":"98250a6e-29fd-4602-af8c-bc8cce841dab","resolution":{"observed_at":"2026-08-07T12:51:04.068736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:04.194499Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:04.194499Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:740f96c2c2ceb11d82fa33db553e5bbe6c9b14a9629f803531b4b2ca7e05588f","observation_id":"60c2fc83-26ef-4266-8811-a18de25e7d80","resolution":{"observed_at":"2026-08-07T12:51:04.194499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:04.321203Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:04.321203Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:a576b513a539d93769c1999abdf60b74ad6ca8ffd4551ca204eb62a0c19af7b7","observation_id":"7893635b-1fa0-4c09-933e-b8557ff57963","resolution":{"observed_at":"2026-08-07T12:51:04.321203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-11T16:28:21.917686Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-07T12:51:04.473685Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:04.473685Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:acbd7a988c59cb31a4a38da74dcea871a0ce76f168d84d5059c4a5f42f3eb7f6","observation_id":"42248491-c859-41ee-acdc-6b0213e6eaa7","resolution":{"observed_at":"2026-08-07T12:51:04.473685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T12:51:04.618404Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:04.618404Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:6c9a22d9feaad8ada9b49480ad586c2caf4c4ebb1b18f81ccba9e9e39e0e3040","observation_id":"52bbbad2-7c50-4c86-a9d3-ffbcf6aa453b","resolution":{"observed_at":"2026-08-07T12:51:04.618404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T12:51:04.777831Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:04.777831Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:d67c0feea6e51d92e0fc3e824d6da370502f74065b58ddde37eee6ada515caa9","observation_id":"db5d23af-9292-46f2-9bad-d318f9e87674","resolution":{"observed_at":"2026-08-07T12:51:04.777831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08600","last_updated":"2023-10-04T13:17:38Z","snapshot_observed_at":"2026-08-21T17:39:12.921162Z","submitted_at":"2023-09-15T17:56:55Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08600","snapshot_observed_at":"2026-08-07T12:51:04.949417Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:04.949417Z"},"links":{"cited_paper":"/paper/2309.08600","citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:40061c09de75b77485ccd85787e73125732b2dc3f8115a64000e7682cb221c94","observation_id":"720b51ec-f4e6-4112-b544-9b759b2dde22","resolution":{"observed_at":"2026-08-07T12:51:04.949417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:11.502037Z","title":null,"venue":null,"work_id":"fea39f9e-9251-443b-801f-19deb5399872","year":2022},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:05.112908Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:7527866c82357a7a8b5826181aef9d75fd4617f57dded3d506e51d2698e74d13","observation_id":"4e69b653-03dd-418e-8b0a-a8a0aa043636","resolution":{"observed_at":"2026-08-07T12:51:11.560309Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:05.247504Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:05.247504Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:1be8d43b9790669e8e5d00b27270b919865caeb24d689f6d7d3eb0553cceacc1","observation_id":"7a98e3a8-2596-4b24-b5d7-948c75dc3e0a","resolution":{"observed_at":"2026-08-07T12:51:05.247504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T12:51:05.461723Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:05.461723Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:4ae75b813a1e9509e4fcf4d83fe44bae4972c3b99513515d0503b3741b7387a2","observation_id":"d838ec9d-519d-4e6e-94bb-e453389c03a9","resolution":{"observed_at":"2026-08-07T12:51:05.461723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04093","last_updated":"2024-06-06T14:10:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T14:10:12Z","title":"Scaling and evaluating sparse autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04093","snapshot_observed_at":"2026-08-07T12:51:05.689549Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:05.689549Z"},"links":{"cited_paper":"/paper/2406.04093","citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:f8bc3d077883fd2b0faadb2745f4214eb84111ca00bae4fb67498d7de3078038","observation_id":"af44740d-c367-4cd4-bd0c-892bcb47005e","resolution":{"observed_at":"2026-08-07T12:51:05.689549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20526","last_updated":"2024-10-27T17:33:49Z","snapshot_observed_at":"2026-08-20T06:06:39.277314Z","submitted_at":"2024-10-27T17:33:49Z","title":"Llama Scope: Extracting Millions of Features from Llama-3.1-8B with Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20526","snapshot_observed_at":"2026-08-07T12:51:06.049313Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:06.049313Z"},"links":{"cited_paper":"/paper/2410.20526","citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:458965569bf54501d4d06ae217d69d903fd8474c7158cffeefe1665be19e8ec3","observation_id":"27ce27a2-0f7e-4a85-a82d-5cf9a0b595d9","resolution":{"observed_at":"2026-08-07T12:51:06.049313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:06.228204Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:06.228204Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:c41c56065e3503e73026d740584cb8023822a9b558b54c3ef7b6f8ab12a489a4","observation_id":"e7ede9f3-942e-4dcc-862d-13d3a3d14a42","resolution":{"observed_at":"2026-08-07T12:51:06.228204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:11.296714Z","title":null,"venue":null,"work_id":"897f6a22-6dc7-4848-871a-971c9c2e8394","year":2024},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:06.398376Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:5737f8999a5787b0b39606385cf3768902d1d894d824568398f8d2ee9ee6030c","observation_id":"7a5d4ce4-2a35-4e7e-baf5-e48bbee81ccb","resolution":{"observed_at":"2026-08-07T12:51:11.386932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:11.063832Z","title":null,"venue":null,"work_id":"795bbe4c-37e9-4e6d-ae50-f4847b7bb619","year":2024},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:06.541363Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:1c52cbbb902b6a5b49e4f7671a56cc17ccfc3272d37096bfcc73c52ccac18b1e","observation_id":"992be6a2-f5d8-4e64-b887-ce83982a36a1","resolution":{"observed_at":"2026-08-07T12:51:11.188031Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:10.833620Z","title":null,"venue":null,"work_id":"ff4ffa40-827f-4af6-98ab-968c41e4e265","year":2025},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:06.689552Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:b56200398a3caf5d47f08c7e2a06a06f5ef0cd536de5ffbcbc012817a3519907","observation_id":"bff34266-a1b9-4506-b254-fdf81c950ee4","resolution":{"observed_at":"2026-08-07T12:51:10.937356Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:06.832925Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:06.832925Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:339318d1f2a0ccf5a7d9b9250449aceacee64902fc0eaacd29611c48596c1f6f","observation_id":"c2500d7e-2418-48ea-b28f-8c75f15e1b48","resolution":{"observed_at":"2026-08-07T12:51:06.832925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05147","last_updated":"2024-08-19T07:51:05Z","snapshot_observed_at":"2026-08-15T15:50:24.074149Z","submitted_at":"2024-08-09T16:06:42Z","title":"Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05147","snapshot_observed_at":"2026-08-07T12:51:06.983803Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:06.983803Z"},"links":{"cited_paper":"/paper/2408.05147","citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:588fbafd93de17f6fc607c01b4e98a558e0aa78d5e9b9038174e9a9a7d0d53a0","observation_id":"1a18718c-642b-4d93-bcfb-27f9fa7b5b9a","resolution":{"observed_at":"2026-08-07T12:51:06.983803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:07.151569Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:07.151569Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:5c840f85097d2517dd466b8d3f3f2105691e630d3629023b22c5549eb373fdff","observation_id":"033b3d0b-835c-44c5-a1c8-01599096460c","resolution":{"observed_at":"2026-08-07T12:51:07.151569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:51:07.314336Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:07.314336Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:10925553fab8f07321346b51c944b5d6ef4b21930818b0f5b5ee6d802f866c61","observation_id":"3e2af9d0-3a49-4239-b8e5-d04a00236886","resolution":{"observed_at":"2026-08-07T12:51:07.314336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:07.476175Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:07.476175Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:c26188ec0e2b1541d0eda1620d66ef9321bbca607c02f9d77ff23c0095ed7aa0","observation_id":"4761377d-cdb4-496a-95a2-b73a41a33e38","resolution":{"observed_at":"2026-08-07T12:51:07.476175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-08-16T09:07:20.265665Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-07T12:51:07.596205Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:07.596205Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:758a2bc6626641ee0afb05f20040855b1e12c1d6365ca61b5b081d68e5fd891d","observation_id":"223a07a0-86ca-477d-a6b4-eba8131902a5","resolution":{"observed_at":"2026-08-07T12:51:07.596205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:07.748855Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:07.748855Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:4b53e4285a8076081d8e15b8736771e312c38cbdd763c9b3f4af436b00b2bb6e","observation_id":"91ce86c1-de40-40d5-99bd-f2d73162279e","resolution":{"observed_at":"2026-08-07T12:51:07.748855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:07.888888Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:07.888888Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:7b846cf767e9c10e927c660943e34f3c610ee665bc6020ef3971701f27312555","observation_id":"cfae3ae1-ab57-40ca-93d5-8687307d2ed6","resolution":{"observed_at":"2026-08-07T12:51:07.888888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06681","last_updated":"2024-07-05T15:30:45Z","snapshot_observed_at":"2026-08-15T08:04:06.283165Z","submitted_at":"2023-12-09T04:40:46Z","title":"Steering Llama 2 via Contrastive Activation Addition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06681","snapshot_observed_at":"2026-08-07T12:51:08.004912Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:08.004912Z"},"links":{"cited_paper":"/paper/2312.06681","citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:e451f9af2466462e8ee7ac2daba6e07c3bb60f8c59d8c6c3cb6bd6f280db9827","observation_id":"8952d920-f0c1-4d1f-ac33-4e7691c130e9","resolution":{"observed_at":"2026-08-07T12:51:08.004912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03658","last_updated":"2024-07-17T22:24:27Z","snapshot_observed_at":"2026-08-16T23:25:38.049210Z","submitted_at":"2023-11-07T01:59:11Z","title":"The Linear Representation Hypothesis and the Geometry of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03658","snapshot_observed_at":"2026-08-07T12:51:08.170319Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:08.170319Z"},"links":{"cited_paper":"/paper/2311.03658","citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:ab3729dd27e642dc69da6743f72ae211d718591bd3ec475a97b4f38ba4809ed7","observation_id":"d96326dd-1e5d-4153-8685-ad9ca6cd69f6","resolution":{"observed_at":"2026-08-07T12:51:08.170319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:10.621829Z","title":null,"venue":null,"work_id":"acad8590-b22a-40f5-ac35-c429d01e7c23","year":2022},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:08.335859Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:f756cda8733210fd7abec0e019ee77ef3fac4f39edd2170b5011f09af70fed63","observation_id":"f0ef8e97-42b3-4272-bef4-f2062076c6e2","resolution":{"observed_at":"2026-08-07T12:51:10.697885Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:08.467896Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:08.467896Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:f56bd288582af92d92f026afca3fa763eb0a8059f48ec9755c7eed56738259f0","observation_id":"eff355b6-863d-42cd-b8c1-7f22534c5888","resolution":{"observed_at":"2026-08-07T12:51:08.467896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:08.580910Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:08.580910Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:53633f75f7c81e64e79c447b8dab55e46c1787b9ab1be590b15682302abf28a9","observation_id":"8c174971-d0af-4c72-ab45-36cb2ab447ed","resolution":{"observed_at":"2026-08-07T12:51:08.580910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:08.750101Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:08.750101Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:886c4096d184c3665588bbc306c75f31ba52ffcfe321dfef06f2e4caf329793c","observation_id":"04d9c88d-664e-4bfe-a57c-52a9129ad98c","resolution":{"observed_at":"2026-08-07T12:51:08.750101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-21T05:15:28.840279Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T12:51:08.933972Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:08.933972Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:fdfa9146470429e1f7d3a875d659523a0ab03dcf1bb310b90bb7505a322bb08b","observation_id":"226d3341-e746-4397-9379-ed5d6c85a2ba","resolution":{"observed_at":"2026-08-07T12:51:08.933972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:51:09.089836Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:09.089836Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:654d54a24eadd777a7a28e417398de11a060216df0839949deaf1ea5b6ec7a6e","observation_id":"59442013-5b2c-4967-8498-697062796c5a","resolution":{"observed_at":"2026-08-07T12:51:09.089836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-07T12:51:09.262929Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:09.262929Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:ef4a5093fc4f167f44ed55141ffb3c489924d861c90657cc699e055abb0dc955","observation_id":"3e4dddc2-448c-4794-a271-5074f8258c15","resolution":{"observed_at":"2026-08-07T12:51:09.262929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:09.416487Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:09.416487Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:c5e7a19fbeeee6aa6d1eec16e79ff342a0591ef6edbc7e439a8d182702e99c35","observation_id":"e72b1cc8-7892-4934-85c7-36669fccc64d","resolution":{"observed_at":"2026-08-07T12:51:09.416487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:09.641665Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:09.641665Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:f78fdf6f247c8ccbfdf34a8668d97cc0469d7ec64d79a56fa8608c027c9f78c4","observation_id":"3d993ff3-e203-472f-8ccb-c257eaccd477","resolution":{"observed_at":"2026-08-07T12:51:09.641665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11998","last_updated":"2024-03-10T19:34:57Z","snapshot_observed_at":"2026-08-20T15:46:44.516034Z","submitted_at":"2023-09-21T12:13:55Z","title":"LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11998","snapshot_observed_at":"2026-08-07T12:51:09.791159Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:09.791159Z"},"links":{"cited_paper":"/paper/2309.11998","citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:b386e3e7b1a3e9f38ec8dce79373735bf5b7b2c85bfd29e2915b3826df1fd7fa","observation_id":"ed9f3ccb-7d07-4760-9f1f-a91681384c04","resolution":{"observed_at":"2026-08-07T12:51:09.791159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-07T12:51:09.944567Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:09.944567Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:c453e291d3d2c70a16746ac4894e458f19f269d2cae07470df60df0b29b52d8a","observation_id":"49d33019-2df4-4d84-90e6-ff7f169775eb","resolution":{"observed_at":"2026-08-07T12:51:09.944567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-07T12:51:10.035803Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:10.035803Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:1615f36403bfbfa782d4b57088bc548cbfc5b9727708e2b184aef54d951bfcbe","observation_id":"92bebfaf-7a33-4af0-ad32-735e66115c58","resolution":{"observed_at":"2026-08-07T12:51:10.035803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:10.093583Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:10.093583Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:c3ce2880c88ab7e44ca2773aafd979740ec2b391a026cb77ad62877c3a0fd615","observation_id":"3a4af4d7-32f3-4d9e-bd1b-88bb15045404","resolution":{"observed_at":"2026-08-07T12:51:10.093583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:51:10.182264Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:51:10.182264Z"},"links":{"citing_paper":"/paper/2505.23556"},"observation_digest":"sha256:5cf4b983c60b9280aad20ad544e02053793cf8a6dca6b3bda02067ad677296e5","observation_id":"eb83ecf0-07e2-45d8-82ce-7769f4c81977","resolution":{"observed_at":"2026-08-07T12:51:10.182264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 9 inbound Pith citation observations for arXiv:2505.23556."}