{"as_of":"2026-08-20T13:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:37d4edaf3dbda01b69b15bb53724664a8965d4e9639ec54b9f6b63c430a72cea","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:17:07.402209Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:01:51.818562Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T09:05:36.555847Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07610","snapshot_observed_at":"2026-08-15T21:01:51.818562Z","title":"Concept-level explainability for auditing & steering llm responses.arXiv preprint arXiv:2505.07610, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11189","last_updated":"2026-06-06T22:28:07Z","snapshot_observed_at":"2026-08-18T19:52:06.614776Z","submitted_at":"2025-05-16T12:48:44Z","title":"Can Global XAI Methods Reveal Injected Behaviours in LLMs? SHAP vs Rule Extraction vs RuleSHAP","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:51.818562Z"},"links":{"cited_paper":"/paper/2505.07610","citing_paper":"/paper/2505.11189"},"observation_digest":"sha256:565523854b44035c222a2704eb238cc020268da12e8e6ee8a3dfbd29886b66eb","observation_id":"fb72a985-5ae2-4caf-bdc6-5473b80e50bf","resolution":{"observed_at":"2026-08-15T21:01:51.818562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07610","snapshot_observed_at":"2026-08-06T20:33:25.666132Z","title":"Concept-level explainability for auditing & steering llm responses","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02595","last_updated":"2025-07-03T13:09:18Z","snapshot_observed_at":"2026-08-19T14:37:36.908748Z","submitted_at":"2025-07-03T13:09:18Z","title":"MPF: Aligning and Debiasing Language Models post Deployment via Multi Perspective Fusion","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:33:25.666132Z"},"links":{"cited_paper":"/paper/2505.07610","citing_paper":"/paper/2507.02595"},"observation_digest":"sha256:5d3b449b40f8a3ba43126323f1a232f6ae25df3908397ea6391f894af12fede2","observation_id":"9769ed81-c868-4115-a94f-e940e0998d1b","resolution":{"observed_at":"2026-08-06T20:33:25.666132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"cited_work":{"arxiv_id":"2505.07610","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07610","snapshot_observed_at":"2026-07-01T09:05:36.555847Z","title":"Concept-level explainability for auditing and steering LLM responses","venue":null,"work_id":"1cf077d3-29d9-43e4-b487-33bc1357dd51","year":null},"citing_paper":{"arxiv_id":"2606.20572","last_updated":"2026-04-28T12:14:30Z","snapshot_observed_at":"2026-08-14T05:21:43.746370Z","submitted_at":"2026-04-28T12:14:30Z","title":"Investigating Linguistic Steering: An Analysis of Adjectival Effects Across Large Language Model Architectures","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-01T09:01:34.038992Z"},"links":{"cited_paper":"/paper/2505.07610","citing_paper":"/paper/2606.20572"},"observation_digest":"sha256:61f6d825a8cd3a02fdd462f2bc22d1c3b32aca6f5d4bd6a8f22ce8def8ddc3cd","observation_id":"8e9168fb-7653-4a6e-847c-0fd7ce1785c6","resolution":{"observed_at":"2026-07-01T09:05:36.558082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.07610/citation-record","integrity":"/paper/2505.07610/integrity","json":"/paper/2505.07610/citation-record.json","paper":"/paper/2505.07610"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.492824Z","title":"Hello gpt-4o","venue":null,"work_id":"36653288-44df-47ce-b6ee-c41ffd60b079","year":2024},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.094844Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:bb721482266b1017d0fbd3ee1d7b78ce5621c41694a1ff6e9515f74d3834d8a6","observation_id":"bac0d01e-ce84-4d53-b949-dfc76ceef72b","resolution":{"observed_at":"2026-08-15T22:17:08.497141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.478854Z","title":"The dark side of generative artificial intelligence: A critical analysis of controversies and risks of chatgpt","venue":null,"work_id":"5785757a-96c9-4c13-8a64-6ce0a81abd45","year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.099884Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:164ab978e89493f6797b630235fab684fbabd054c290bea104d20de3b84a4e14","observation_id":"45fcea3c-3621-4852-b92e-68671c83e7eb","resolution":{"observed_at":"2026-08-15T22:17:08.483311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:07.104508Z","title":"Survey of hallucination in natural language generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.104508Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:03bf1fa879195ad114e448fbff97cea1e232aa87b87ace9ce049a966049a973e","observation_id":"86f892e6-3403-496a-b12a-3a745283dbc5","resolution":{"observed_at":"2026-08-15T22:17:07.104508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:07.108993Z","title":"Jailbroken: How does llm safety training fail? Advances in Neural Information Processing Systems, 36:80079–80110, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.108993Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:cd5db7ef3234d83488759e7fa039b4b12056157bec3e96fe57dc79805fe9d0be","observation_id":"318b843c-b369-4074-b837-e9db22e0b3a1","resolution":{"observed_at":"2026-08-15T22:17:07.108993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06972","last_updated":"2023-12-22T18:01:44Z","snapshot_observed_at":"2026-08-18T14:03:35.014634Z","submitted_at":"2023-05-11T16:55:19Z","title":"Spear Phishing With Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06972","snapshot_observed_at":"2026-08-15T22:17:07.113423Z","title":"Large language models can be used to effectively scale spear phishing campaigns","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.113423Z"},"links":{"cited_paper":"/paper/2305.06972","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:be8e3a07dd543da6fb10a8015468854a03ffd3f84b5a8df6ec2fe55f91086221","observation_id":"8eba732d-fa67-4ab9-a1b8-b3e9acf0c758","resolution":{"observed_at":"2026-08-15T22:17:07.113423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:07.118226Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.118226Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:cc07a089829d58dc8df7ec0125f7fc30a2dc74404034dded7745f09d08238220","observation_id":"b41396e7-6318-438e-9f90-ab13c566e92a","resolution":{"observed_at":"2026-08-15T22:17:07.118226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-15T22:17:07.123143Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.123143Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:13278938754ff136577f257165f4acdc68c3695b20e55c634f513f1b20901264","observation_id":"ddf86fb3-7fa5-4abb-9ecb-0072a0c96075","resolution":{"observed_at":"2026-08-15T22:17:07.123143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:07.127814Z","title":"Pretraining language models with human preferences","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.127814Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:dd2899894fcd881516b3d5eb5aa2b38ed7649bcbe89e22eee0ea52a3fb21e57e","observation_id":"d2b17460-a338-4259-9cac-7056b4ccb6a6","resolution":{"observed_at":"2026-08-15T22:17:07.127814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-08-20T09:36:18.005089Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05206","snapshot_observed_at":"2026-08-15T22:17:07.131947Z","title":"Safety at scale: A comprehensive survey of large model safety","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.131947Z"},"links":{"cited_paper":"/paper/2502.05206","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:c8f512897a1b0097bb6a5038b3a9614e490e365f9063d3311ea4bf0fd05a7581","observation_id":"8dafeab6-0b5a-4734-b201-e5ca3d6c52c7","resolution":{"observed_at":"2026-08-15T22:17:07.131947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13788","last_updated":"2024-04-23T22:59:13Z","snapshot_observed_at":"2026-08-16T14:58:01.353675Z","submitted_at":"2023-09-25T00:45:07Z","title":"Can LLM-Generated Misinformation Be Detected?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13788","snapshot_observed_at":"2026-08-15T22:17:07.136572Z","title":"Can llm-generated misinformation be detected? arXiv preprint arXiv:2309.13788, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.136572Z"},"links":{"cited_paper":"/paper/2309.13788","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:cd7a7ca71c45d334ade32f2f927583e97e5a229dcdbc942da3a0a798bd515b7d","observation_id":"4e11a20c-13d9-497c-a289-773f62e206fa","resolution":{"observed_at":"2026-08-15T22:17:07.136572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.429985Z","title":"Ai model gpt-3 (dis) informs us better than humans","venue":null,"work_id":"142709f9-6f60-4fca-b5ff-93ca511ab4d6","year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.141622Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:ea7af6b513e9cb4a3d8c76b4e7135a544a0d48318140a5455ad3fec09a2288e5","observation_id":"3501c2d3-7799-4708-8c87-99a33c64db35","resolution":{"observed_at":"2026-08-15T22:17:08.434478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.416001Z","title":"The operational risks of ai in large-scale biological attacks","venue":null,"work_id":"34cbe8e7-888b-41a1-ae08-1aa73ec381cb","year":2024},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.145941Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:12a4bef902c3d059a91da238f9a3758fc82ddc3288cea7086acf2103d9fb5603","observation_id":"761c1b7a-e4c5-473d-b0ea-ac4b882f353b","resolution":{"observed_at":"2026-08-15T22:17:08.420698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01605","last_updated":"2024-09-06T18:17:07Z","snapshot_observed_at":"2026-08-19T21:56:58.303635Z","submitted_at":"2024-08-02T23:47:27Z","title":"CYBERSECEVAL 3: Advancing the Evaluation of Cybersecurity Risks and Capabilities in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01605","snapshot_observed_at":"2026-08-15T22:17:07.150065Z","title":"Cyberseceval 3: Advancing the evaluation of cybersecurity risks and capabilities in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.150065Z"},"links":{"cited_paper":"/paper/2408.01605","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:99b95f8e4781bfb2dfb79c3f8cae35953e50a8a75732fe1289ee2499b9b391a1","observation_id":"064faa6d-e629-497f-b57b-b5bd301cce07","resolution":{"observed_at":"2026-08-15T22:17:07.150065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06664","last_updated":"2024-02-16T04:02:51Z","snapshot_observed_at":"2026-08-16T14:20:59.361566Z","submitted_at":"2024-02-06T14:46:08Z","title":"LLM Agents can Autonomously Hack Websites","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06664","snapshot_observed_at":"2026-08-15T22:17:07.154425Z","title":"Llm agents can autonomously hack websites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.154425Z"},"links":{"cited_paper":"/paper/2402.06664","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:2bb7deea436e6c9818fff478626821f377bcc8c503462186a539ddae993c79ce","observation_id":"35081a60-27a7-4c0e-a018-57a1a893c672","resolution":{"observed_at":"2026-08-15T22:17:07.154425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:07.159214Z","title":"Emergent misalignment: Narrow finetuning can produce broadly misaligned llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.159214Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:7f20964f883da89a9abae60def5506c3090fe2aeec842f9a8205c2a2b9c44f01","observation_id":"dd4b3541-5924-427a-9a8c-f7905a998f12","resolution":{"observed_at":"2026-08-15T22:17:07.159214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-15T22:17:07.163342Z","title":"Universal and transferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.163342Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:3de4ec5e1c91f6a875967d3111abad5f32bc496900991167eaa3bba54d775664","observation_id":"96908015-f375-4ffd-8af3-81ab4d62194d","resolution":{"observed_at":"2026-08-15T22:17:07.163342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04984","last_updated":"2025-01-14T20:16:01Z","snapshot_observed_at":"2026-08-15T04:02:05.429942Z","submitted_at":"2024-12-06T12:09:50Z","title":"Frontier Models are Capable of In-context Scheming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04984","snapshot_observed_at":"2026-08-15T22:17:07.168159Z","title":"Frontier models are capable of in-context scheming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.168159Z"},"links":{"cited_paper":"/paper/2412.04984","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:8925e965dfd1307286c5bf9b5b7d876e3d95344f0df263d035336ddb1f7b0580","observation_id":"b18ba5bb-3b5e-4ae5-bb6e-335684b6a272","resolution":{"observed_at":"2026-08-15T22:17:07.168159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08946","last_updated":"2025-05-18T23:56:15Z","snapshot_observed_at":"2026-08-16T14:10:01.581018Z","submitted_at":"2024-03-13T20:25:27Z","title":"Usable XAI: 10 Strategies Towards Exploiting Explainability in the LLM Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08946","snapshot_observed_at":"2026-08-15T22:17:07.172594Z","title":"Usable xai: 10 strategies towards exploiting explainability in the llm era","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.172594Z"},"links":{"cited_paper":"/paper/2403.08946","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:e1f36555486ec7b88721b0e4fee0648cd495460c0b5acc6b701e24a51f6a3971","observation_id":"f4b6a6ec-0b17-4d14-b23a-7911b5a49ecc","resolution":{"observed_at":"2026-08-15T22:17:07.172594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10114","last_updated":"2024-07-22T08:59:07Z","snapshot_observed_at":"2026-08-18T13:42:23.039004Z","submitted_at":"2024-07-14T08:07:50Z","title":"TokenSHAP: Interpreting Large Language Models with Monte Carlo Shapley Value Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10114","snapshot_observed_at":"2026-08-15T22:17:07.178029Z","title":"Tokenshap: Interpreting large language models with monte carlo shapley value estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.178029Z"},"links":{"cited_paper":"/paper/2407.10114","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:58a86ea0d40e797b79efa3f6563e41ab231d0a9fbe1a75a38ff985ecb9d3bf60","observation_id":"fa40994f-4b69-4860-a2c4-87a7da7808d0","resolution":{"observed_at":"2026-08-15T22:17:07.178029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09259","last_updated":"2024-06-03T10:30:00Z","snapshot_observed_at":"2026-08-16T21:10:28.394229Z","submitted_at":"2024-02-14T15:45:56Z","title":"SyntaxShap: Syntax-aware Explainability Method for Text Generation","version":2},"cited_work":{"arxiv_id":"2402.09259","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.09259","snapshot_observed_at":"2026-08-15T22:17:07.849896Z","title":"SyntaxShap: Syntax-aware Explainability Method for Text Generation","venue":"cs.CL","work_id":"727de0a4-a335-4369-9da1-e343c7d2a8c2","year":2024},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.182475Z"},"links":{"cited_paper":"/paper/2402.09259","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:ad9a802b685e16d88a64990d33214f99d14dc0608973d5e9395e918c610deb69","observation_id":"fa737317-87a5-41a2-9b0a-2edc2231b49b","resolution":{"observed_at":"2026-08-15T22:17:07.854631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.401408Z","title":"Investigating the impact of linguistic errors of prompts on llm accuracy","venue":null,"work_id":"f1220284-f0be-4bb4-aba8-307d76cc2b1c","year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.186969Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:67fd9303127817523242af4836e6ddcb95cd2a5001f6f2a3de908e4855aaaa39","observation_id":"f4d51d47-8053-46e0-a1dc-9d533c3f2ac1","resolution":{"observed_at":"2026-08-15T22:17:08.406370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.02015","last_updated":"2020-05-18T02:30:20Z","snapshot_observed_at":"2026-08-20T10:58:07.602176Z","submitted_at":"2020-04-04T20:56:37Z","title":"Generating Hierarchical Explanations on Text Classification via Feature Interaction Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.02015","snapshot_observed_at":"2026-08-15T22:17:07.191242Z","title":"Generating hierarchical explanations on text classification via feature interaction detection","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.191242Z"},"links":{"cited_paper":"/paper/2004.02015","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:ce3371cd8b9f4575dba5af61630199a3aa86563c6528a458e564feb324fe593c","observation_id":"908a955f-fc69-4801-ad0c-99db80f5b14c","resolution":{"observed_at":"2026-08-15T22:17:07.191242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:07.195619Z","title":"Conceptnet 5.5: An open multilingual graph of general knowledge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.195619Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:7ddcb5c3695cdfd187c89bebe955aa1975dc41b3ab3694bd3d01180293ee10a8","observation_id":"5e0e68d1-fc97-44d9-a6f9-3a8cb601876f","resolution":{"observed_at":"2026-08-15T22:17:07.195619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:07.200529Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.200529Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:6c89bf0dc690f15e5630ce7a91eb58a8145ad13d9c4f9ba48575b6b50e7d473e","observation_id":"e10233de-dd21-4122-b1f6-fb870fa5464a","resolution":{"observed_at":"2026-08-15T22:17:07.200529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14348","last_updated":"2024-06-12T00:27:06Z","snapshot_observed_at":"2026-08-18T09:36:32.490699Z","submitted_at":"2023-09-18T02:07:22Z","title":"Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14348","snapshot_observed_at":"2026-08-15T22:17:07.204518Z","title":"Defending against alignment-breaking attacks via robustly aligned llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.204518Z"},"links":{"cited_paper":"/paper/2309.14348","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:f8e1feb48c8450918dbf986b2c553f79baa5bd78502ebc1d04ba80f037b725f3","observation_id":"c6397b1b-1d9b-471a-8ad0-ec57d9acdc38","resolution":{"observed_at":"2026-08-15T22:17:07.204518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:07.208956Z","title":"Definitions, methods, and applications in interpretable machine learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.208956Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:e0a1e96d0456014bfc46970ec44fdaf710d5d69967434784f90f8c19374e919c","observation_id":"8af50549-af41-4b6f-9a53-8f2a4e562276","resolution":{"observed_at":"2026-08-15T22:17:07.208956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.360046Z","title":"Techniques for interpretable machine learning","venue":null,"work_id":"cae5ab4e-f454-460b-bc89-35a53c66b1b8","year":2019},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.213197Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:b8451171c979366f4a4db05573c191462e6ed9c62dadad0f1cddb86c3caad8e8","observation_id":"a628282d-7156-4ad7-b020-88ce0aa63fba","resolution":{"observed_at":"2026-08-15T22:17:08.364846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.345517Z","title":"A survey of the state of explainable AI for natural language processing","venue":null,"work_id":"708382b6-8d51-43c0-bd2c-fd82d8e2e108","year":2020},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.217300Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:155f45833e846324f5fb022e3a68aefb8bfbfd1d91d0e17b428a72e89d521c18","observation_id":"0a6ef210-56d7-4e90-840b-5a2182d8bbaa","resolution":{"observed_at":"2026-08-15T22:17:08.350187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.331198Z","title":"On the explainability of natural language processing deep models","venue":null,"work_id":"a482b643-cf40-4920-acb8-a4538dec2951","year":2022},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.221493Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:a4f4ef3ccc5d5331dae8377c3ab3eea9e6fe40377e44fe676a17a2aa9614bf58","observation_id":"a0cd394b-65d2-415c-ad01-510b20f8c705","resolution":{"observed_at":"2026-08-15T22:17:08.335689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.316246Z","title":"Interpretability in activation space analysis of transformers: A focused survey","venue":null,"work_id":"8afdc486-f35b-491d-97a9-7f7da3ce4b04","year":2022},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.225547Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:d37cd6a5611755e0a5f109270405150c97d5a73ec504af75570c6a618f99db3c","observation_id":"13c4ece8-690a-4a0f-ace5-89c65da0bf65","resolution":{"observed_at":"2026-08-15T22:17:08.321415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.301546Z","title":"Neuron-level Interpretation of Deep NLP Models: A Survey","venue":null,"work_id":"7533b1c1-ce96-4ef1-b30b-49b4529b2339","year":2022},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.229673Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:e5ee338783102035b0ef9ab5605325964398dac207b24c4f19e717923194594a","observation_id":"788db6e4-600c-4c9f-90b9-725ba6436a76","resolution":{"observed_at":"2026-08-15T22:17:08.306137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.287325Z","title":"A value for n-person games","venue":null,"work_id":"f9cc950f-3920-41d5-99b4-dc006fb31256","year":1953},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.233734Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:a00e18d276cf362c41760d8a1213ab046d560f1ded3cf3d6ab79fccd2c7e0a2d","observation_id":"0f800d80-f707-4fa9-9093-9e90f89f4ffb","resolution":{"observed_at":"2026-08-15T22:17:08.292011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.273804Z","title":"why should i trust you?","venue":null,"work_id":"f32f27d9-478c-43c1-839a-eda7f04377d3","year":2016},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.238591Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:2aac17405d26ce0082136b32c2ba8496df0af02ec5b701157bd88e0f156e0fb6","observation_id":"90792b78-b420-45d0-8099-b4a7e118abf5","resolution":{"observed_at":"2026-08-15T22:17:08.278054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.258984Z","title":"BERT meets shapley: Extending SHAP explanations to transformer-based classifiers","venue":null,"work_id":"22d21310-cab0-4481-abdd-d530ce9006a7","year":2021},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.242845Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:978b0ec4131c546d39d15220edd7a2defe5fd843e49c96e88fb6b0c8ec289670","observation_id":"b6712469-0d7d-4b62-8a1c-c31bcfbb1190","resolution":{"observed_at":"2026-08-15T22:17:08.264337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.245091Z","title":"Generating hierarchical explanations on text classification via feature interaction detection","venue":null,"work_id":"028cbcac-2bf5-41b0-b530-e8b6e9c2e29c","year":2020},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.247715Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:069ac6a3ef743dcb5f16c49ad56651cfc71b9bcf10dc0698b21b881153a4cf20","observation_id":"c0e73b65-4983-4c97-b7d1-3db6797eef80","resolution":{"observed_at":"2026-08-15T22:17:08.249633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05566","last_updated":"2024-01-17T20:26:01Z","snapshot_observed_at":"2026-08-15T14:10:05.296241Z","submitted_at":"2024-01-10T22:14:35Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05566","snapshot_observed_at":"2026-08-15T22:17:07.251939Z","title":"Sleeper agents: Training deceptive llms that persist through safety training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.251939Z"},"links":{"cited_paper":"/paper/2401.05566","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:753f40532a629cfcb7935cc41f0513707a0c97b2408d50bc072788b19e2947e2","observation_id":"a1f66367-8446-4169-bada-fe4da118d417","resolution":{"observed_at":"2026-08-15T22:17:07.251939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:07.256221Z","title":"Explainability for large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.256221Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:8c25f2dcbeb40fcfa91548df85e1c08e4db280e3b208417ca912e9dd8190a06c","observation_id":"ee143436-0090-4d70-b195-7e983c05ef79","resolution":{"observed_at":"2026-08-15T22:17:07.256221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.222716Z","title":"Ten levels of ai alignment difficulty","venue":null,"work_id":"1319f98d-2c73-4d05-a7b5-9a75047f6f51","year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.260674Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:ad29c8a76663ab0b07e03448ec420c5de5fdbc6d116f0273f3c57cbf69f6c629","observation_id":"d37153b2-4a86-4c66-a0bc-3534713d77c6","resolution":{"observed_at":"2026-08-15T22:17:08.227087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10149","last_updated":"2024-02-21T13:52:11Z","snapshot_observed_at":"2026-08-16T15:07:16.573910Z","submitted_at":"2023-08-20T03:30:22Z","title":"A Survey on Fairness in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10149","snapshot_observed_at":"2026-08-15T22:17:07.264825Z","title":"A survey on fairness in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.264825Z"},"links":{"cited_paper":"/paper/2308.10149","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:70e16199c371e94bce75a0469b3132cacfb361df131814d1f009d70e16743616","observation_id":"409b987b-19a3-42f5-a77a-1d7e2f3d0b64","resolution":{"observed_at":"2026-08-15T22:17:07.264825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:07.269168Z","title":"Aligned probing: Relating toxic behavior and model internals","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.269168Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:3dd98c7d11f890df40ef631d4802717394c8b5a80abf8d3cc436abd6446d2597","observation_id":"b16f809f-dfdd-4179-a469-a33503eccbb8","resolution":{"observed_at":"2026-08-15T22:17:07.269168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10652","last_updated":"2022-09-21T20:49:26Z","snapshot_observed_at":"2026-08-16T21:36:28.067615Z","submitted_at":"2022-09-21T20:49:26Z","title":"Toy Models of Superposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10652","snapshot_observed_at":"2026-08-15T22:17:07.273064Z","title":"Toy models of superposition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.273064Z"},"links":{"cited_paper":"/paper/2209.10652","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:9821d191fb6d058f9d67c5bb0d296988286a74696c45022c8efc0cb9ef8eabd1","observation_id":"61508227-3c81-450d-a549-ea966a2f268a","resolution":{"observed_at":"2026-08-15T22:17:07.273064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.209243Z","title":"Formalizing convergent instrumental goals","venue":null,"work_id":"61f23181-9ba7-469a-a13d-c5a6a55c35c4","year":2016},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.278372Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:3810fd6cde97931ec59c40a9a800ac49597b0143fa646101e10e3f788cc26841","observation_id":"2db2240e-1800-45a3-aae5-9eca2783b067","resolution":{"observed_at":"2026-08-15T22:17:08.213540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.11415","last_updated":"2022-12-21T23:52:42Z","snapshot_observed_at":"2026-08-17T09:51:51.321213Z","submitted_at":"2022-12-21T23:52:42Z","title":"Circumventing interpretability: How to defeat mind-readers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.11415","snapshot_observed_at":"2026-08-15T22:17:07.282747Z","title":"Circumventing interpretability: How to defeat mind-readers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.282747Z"},"links":{"cited_paper":"/paper/2212.11415","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:4c4bd4b53c90bdd99991a13cb799c6d7d8dfddabe152e846f3efcf5f987a70e6","observation_id":"854b13ba-f2d2-49d3-90a5-3120df4fe382","resolution":{"observed_at":"2026-08-15T22:17:07.282747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03684","last_updated":"2024-06-11T19:02:52Z","snapshot_observed_at":"2026-08-17T15:25:03.596568Z","submitted_at":"2023-10-05T17:01:53Z","title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03684","snapshot_observed_at":"2026-08-15T22:17:07.287109Z","title":"Smoothllm: Defending large language models against jailbreaking attacks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.287109Z"},"links":{"cited_paper":"/paper/2310.03684","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:3a80afbe7e8e96227df1120e6bc23ef95060a32067e226acad17a6509f18e09e","observation_id":"08c856c7-6096-4266-afe9-271843c6fa6b","resolution":{"observed_at":"2026-08-15T22:17:07.287109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.195467Z","title":"Parafuzz: An interpretability-driven technique for detecting poisoned samples in nlp","venue":null,"work_id":"0935a2da-883c-4952-9409-51b41e2054a1","year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.291512Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:6e07a697df33309ab0d153db6dcc961e3eae77e0eabf2e571ba24308e1e56f0d","observation_id":"68ef9ad3-5011-4a51-81b3-be73ea613aee","resolution":{"observed_at":"2026-08-15T22:17:08.200116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05498","last_updated":"2025-02-05T10:29:07Z","snapshot_observed_at":"2026-08-16T16:13:49.286404Z","submitted_at":"2024-06-08T15:45:31Z","title":"SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05498","snapshot_observed_at":"2026-08-15T22:17:07.295771Z","title":"Selfdefend: Llms can defend themselves against jailbreaking in a practical manner","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.295771Z"},"links":{"cited_paper":"/paper/2406.05498","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:7a2521f6ac813549ddafe7d3a6e75d106a5e907bccb0137a8e931698f0d14784","observation_id":"50b6c9e1-5818-47ac-ab9c-55025625e684","resolution":{"observed_at":"2026-08-15T22:17:07.295771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.181789Z","title":"Protecting your llms with information bottleneck","venue":null,"work_id":"5f95d062-9537-4c02-bbf4-45ab5f480b42","year":2024},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.300843Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:248d4f6024c3a8a6318f0a6aedd3c1dd7e5e0c39ea5ce7fe4a21c76c4547d5b9","observation_id":"dea027d8-1962-4ffb-91e0-58686bb29653","resolution":{"observed_at":"2026-08-15T22:17:08.186282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16459","last_updated":"2024-06-06T19:21:44Z","snapshot_observed_at":"2026-08-19T23:34:01.115021Z","submitted_at":"2024-02-26T10:03:33Z","title":"Defending LLMs against Jailbreaking Attacks via Backtranslation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16459","snapshot_observed_at":"2026-08-15T22:17:07.304943Z","title":"Defending llms against jailbreak- ing attacks via backtranslation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.304943Z"},"links":{"cited_paper":"/paper/2402.16459","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:0449d47c5a91b816d5c165979c4becc09477a10aeada9eef84e9c0a9a8232d76","observation_id":"f4d68c51-1582-43be-ae90-20658e656865","resolution":{"observed_at":"2026-08-15T22:17:07.304943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16503","last_updated":"2023-05-25T22:08:57Z","snapshot_observed_at":"2026-08-20T12:11:16.325334Z","submitted_at":"2023-05-25T22:08:57Z","title":"IMBERT: Making BERT Immune to Insertion-based Backdoor Attacks","version":1},"cited_work":{"arxiv_id":"2305.16503","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16503","snapshot_observed_at":"2026-08-15T22:17:07.564664Z","title":"IMBERT: Making BERT Immune to Insertion-based Backdoor Attacks","venue":"cs.CL","work_id":"45918ce1-af49-462d-a6ab-6acba940acfa","year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.309449Z"},"links":{"cited_paper":"/paper/2305.16503","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:ad4d335c8900967393355eed8de96bc227357576b2e209d82dca95c900a11eac","observation_id":"b7369042-7366-4822-93c2-1b76075e8ef7","resolution":{"observed_at":"2026-08-15T22:17:07.573180Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02394","last_updated":"2023-08-07T03:07:59Z","snapshot_observed_at":"2026-08-16T15:35:51.391888Z","submitted_at":"2023-05-03T19:29:26Z","title":"Defending against Insertion-based Textual Backdoor Attacks via Attribution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02394","snapshot_observed_at":"2026-08-15T22:17:07.314042Z","title":"Defending against insertion-based textual backdoor attacks via attribution","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.314042Z"},"links":{"cited_paper":"/paper/2305.02394","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:4a6a33c496eac9a4a4109cd3bcb472c5a421dd58ea31f31dcd25d79c786cbb11","observation_id":"f9ab14bf-c74d-4e11-b9f9-c94e9643bec2","resolution":{"observed_at":"2026-08-15T22:17:07.314042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07308","last_updated":"2024-05-02T14:28:39Z","snapshot_observed_at":"2026-08-20T05:22:16.665208Z","submitted_at":"2023-08-14T17:54:10Z","title":"LLM Self Defense: By Self Examination, LLMs Know They Are Being Tricked","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07308","snapshot_observed_at":"2026-08-15T22:17:07.318596Z","title":"Llm self defense: By self examination, llms know they are being tricked","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.318596Z"},"links":{"cited_paper":"/paper/2308.07308","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:c951564a79ebeed92c21c722e074035ec751633d24e80537a47ab5d7364987fc","observation_id":"b2c2490a-07fd-459f-8340-96c717217984","resolution":{"observed_at":"2026-08-15T22:17:07.318596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06474","last_updated":"2024-03-04T04:03:54Z","snapshot_observed_at":"2026-08-20T04:04:43.980873Z","submitted_at":"2023-10-10T09:44:06Z","title":"Multilingual Jailbreak Challenges in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06474","snapshot_observed_at":"2026-08-15T22:17:07.323068Z","title":"Multilingual jailbreak chal- lenges in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.323068Z"},"links":{"cited_paper":"/paper/2310.06474","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:0ded29dad09d02b5192aa28aa25c464aa4e00823a7d748b97e8765843e63e236","observation_id":"e27ea07c-a248-4f61-b078-a5a85af29c3e","resolution":{"observed_at":"2026-08-15T22:17:07.323068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:07.327313Z","title":"Defending chatgpt against jailbreak attack via self-reminders","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.327313Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:314b64407c5ea938c8cf2eafdb6d757254448c7b3037cd0b76eacb44aaf2c383","observation_id":"78efed91-2622-40ac-8f34-ebea2440af36","resolution":{"observed_at":"2026-08-15T22:17:07.327313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04093","last_updated":"2024-06-06T14:10:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T14:10:12Z","title":"Scaling and evaluating sparse autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04093","snapshot_observed_at":"2026-08-15T22:17:07.331441Z","title":"Scaling and evaluating sparse autoencoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.331441Z"},"links":{"cited_paper":"/paper/2406.04093","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:9980d80bfba9af150cb3d591eab371a7837eb12328c772c2472b7d2b689c7b71","observation_id":"82cf7bc5-488a-405d-b066-6d3dacc68af0","resolution":{"observed_at":"2026-08-15T22:17:07.331441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:07.335878Z","title":"Inference- time intervention: Eliciting truthful answers from a language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.335878Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:0f498263d0939fd0a56a90030dea4074bd8900dd756bb4471272c13519fb1c79","observation_id":"a0420b3f-9101-4fcf-a6f5-742953987e98","resolution":{"observed_at":"2026-08-15T22:17:07.335878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:07.339995Z","title":"Towards monosemanticity: Decomposing language models with dictionary learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.339995Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:a4c7e8dbc3165fef0bef053169b3c76aeb2d5bcf7d7d19e8cbc482b582bb1109","observation_id":"46704d75-9f44-4dba-94d8-1eec70010c58","resolution":{"observed_at":"2026-08-15T22:17:07.339995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08600","last_updated":"2023-10-04T13:17:38Z","snapshot_observed_at":"2026-08-16T13:37:26.527260Z","submitted_at":"2023-09-15T17:56:55Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08600","snapshot_observed_at":"2026-08-15T22:17:07.344144Z","title":"Sparse autoen- coders find highly interpretable features in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.344144Z"},"links":{"cited_paper":"/paper/2309.08600","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:844e10ca00dfd1a0f76327001d27d029f813a56eaf70a11aab535043794fa878","observation_id":"cedf41c0-b192-402b-a851-4a00ae89419d","resolution":{"observed_at":"2026-08-15T22:17:07.344144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.141444Z","title":"spacy: Industrial- strength natural language processing in python","venue":null,"work_id":"d6ac2d5e-36f2-437b-a5cc-bd887506ec66","year":2020},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.348717Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:ce5c860e1c61f2be5aebf1953ca8578726caf096752a4e806e364a8060694116","observation_id":"650c80e1-3e86-4142-b986-ce49f4974040","resolution":{"observed_at":"2026-08-15T22:17:08.146288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:07.352934Z","title":"Minilm: Deep self-attention distillation for task-agnostic compression of pre-trained transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.352934Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:97081286cbf3ee2ea505d155421d1570ef2ae998fd9d8e015b743b795e64d31a","observation_id":"3e971645-5a0c-496d-ab41-69d6d18c3a65","resolution":{"observed_at":"2026-08-15T22:17:07.352934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:07.357912Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.357912Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:3c9223cb703ce68587b84896719fe993bd73ef94d21d1fbe4e608c2bd6997162","observation_id":"967d5286-2ecc-49fa-a25c-ff77cf19efbd","resolution":{"observed_at":"2026-08-15T22:17:07.357912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:07.362031Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.362031Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:eb51ce20ea7563c71f5ebfb682b6c9b864782a803f5003a7daf387a4b157bd39","observation_id":"15ea726d-0cda-4914-adc9-30f5637d5d20","resolution":{"observed_at":"2026-08-15T22:17:07.362031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.098796Z","title":"Gpt-4o mini: advancing cost-efficient intelligence, 2024","venue":null,"work_id":"72bb214b-2e0b-41ff-acc8-16771c26c2c1","year":2024},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.366222Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:cc07c4640d230f805f8dcbc7cfe632a405edd0e4459e33815115d498f81594b1","observation_id":"2592c22d-c44c-4271-a395-5defbe1026f9","resolution":{"observed_at":"2026-08-15T22:17:08.103285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.085095Z","title":"Manning, Andrew Ng, and Christopher Potts","venue":null,"work_id":"d2981020-a9e5-4e5c-bc72-7e8f846ebcb2","year":2013},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.370196Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:484e09bbcb7aa7c04a4cdec87bca6f7a19778c489d676365b603f863cbd05447","observation_id":"5ce51501-ff3e-4b52-8415-992c55a7502f","resolution":{"observed_at":"2026-08-15T22:17:08.089392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.070153Z","title":"Analyzing sentiment polarity reduction in news presentation through contextual perturbation and large language models","venue":null,"work_id":"e8ed52b5-066e-4e97-aa78-ee39749e885f","year":2023},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.375418Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:bbcd54b83590cc46522df9e08235cedcd0276ad6e2284ff9fa67ca12751e04da","observation_id":"e9c8d542-69a1-4c08-bcc2-37d198805965","resolution":{"observed_at":"2026-08-15T22:17:08.075044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15576","last_updated":"2025-02-21T16:36:42Z","snapshot_observed_at":"2026-08-16T12:56:18.063315Z","submitted_at":"2025-02-21T16:36:42Z","title":"Interpreting and Steering LLMs with Mutual Information-based Explanations on Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15576","snapshot_observed_at":"2026-08-15T22:17:07.379461Z","title":"Interpreting and steering llms with mutual information-based explanations on sparse autoencoders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.379461Z"},"links":{"cited_paper":"/paper/2502.15576","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:333d793cfe4abeb4b9565de0c9eec9716884e0dd04bf231c8114c38c8b6c8c03","observation_id":"b9f7cb44-8f69-4289-a243-29596037956f","resolution":{"observed_at":"2026-08-15T22:17:07.379461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05044","last_updated":"2024-06-07T12:05:46Z","snapshot_observed_at":"2026-08-16T14:20:31.299446Z","submitted_at":"2024-02-07T17:33:54Z","title":"SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05044","snapshot_observed_at":"2026-08-15T22:17:07.384006Z","title":"Salad-bench: A hierarchical and comprehensive safety benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.384006Z"},"links":{"cited_paper":"/paper/2402.05044","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:6c58db7bc0865859964c40a2b66e4e3ede8fe8c273c7978bd6e87336eed9b441","observation_id":"e76e2382-4f89-44d7-bde0-4974df77e60f","resolution":{"observed_at":"2026-08-15T22:17:07.384006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.055669Z","title":null,"venue":null,"work_id":"b653a602-1abf-41b9-b8c5-e3343456fffc","year":2024},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.388911Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:c9cdf3d248130ae0af28b2a0c532e66690eea1b048fe8bcb01f49ce88a42d024","observation_id":"02a15849-097a-4bd7-9424-8167c6e7fb6e","resolution":{"observed_at":"2026-08-15T22:17:08.060462Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-08-16T14:04:12.947538Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-08-15T22:17:07.393168Z","title":"Jailbreaking leading safety-aligned llms with simple adaptive attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.393168Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:42f6a2d6bd4a8bfabbfad5377ffc395849da129867b731e6bb77249c206690fa","observation_id":"467cd83a-bdb6-480a-97bd-f5e86ec6082c","resolution":{"observed_at":"2026-08-15T22:17:07.393168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:17:08.041214Z","title":"Seeing stars: Exploiting class relationships for sentiment categorization with respect to rating scales","venue":null,"work_id":"75f86878-914f-4a7c-9916-68cdcd17dc19","year":2005},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.397708Z"},"links":{"citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:b5288be26d529246dd218bf1e2a73195a28b78477576107a04a6394ca8b49806","observation_id":"2c25210f-1a26-44eb-b958-4200a95032de","resolution":{"observed_at":"2026-08-15T22:17:08.046077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T22:17:07.402209Z","title":"You are a woman","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:07.402209Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.07610"},"observation_digest":"sha256:4c99190876f531895f451d1e4a021a2c5ad01a05a47369c8b1652c3987b4a056","observation_id":"81a50a37-21e6-4d3d-bd7d-35e67e9fedbc","resolution":{"observed_at":"2026-08-15T22:17:07.402209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.07610","last_updated":"2025-05-19T14:00:52Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T05:41:31.745284Z","submitted_at":"2025-05-12T14:31:51Z","title":"Concept-Level Explainability for Auditing & Steering LLM Responses"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":2,"verified_fuzzy":23},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 3 inbound Pith citation observations for arXiv:2505.07610."}