{"as_of":"2026-08-08T11:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d032615350d4b579e82f3d0bb9f40fe9802e0723bb7b3d9b844b96a56099b391","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:24:26.477946Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T05:45:42.313410Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05451","snapshot_observed_at":"2026-08-03T05:45:42.313410Z","title":"Lee, S., Cho, A., Kim, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":2000,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:42.313410Z"},"links":{"cited_paper":"/paper/2506.05451","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:9fc6ad5af9819c55879a1d408df479e0d927a2d7b3f367bd19c765dc518d9715","observation_id":"c0ba13cc-7577-4cd3-9ca2-2dfa84908394","resolution":{"observed_at":"2026-08-03T05:45:42.313410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05451/citation-record","integrity":"/paper/2506.05451/integrity","json":"/paper/2506.05451/citation-record.json","paper":"/paper/2506.05451"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-07T10:24:26.305781Z","title":"Sanjeev Arora, Yuanzhi Li, Yingyu Liang, Tengyu Ma, and Andrej Risteski","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.305781Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:e9783c30c01d23b750a2d0ee5b57713bc7cdc7eb5268ba4edccd644c2bc40eba","observation_id":"dbf922d8-bb63-4726-ace1-fb395551418c","resolution":{"observed_at":"2026-08-07T10:24:26.305781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09289","last_updated":"2024-10-05T19:56:20Z","snapshot_observed_at":"2026-07-06T18:30:28.421247Z","submitted_at":"2024-06-13T16:26:47Z","title":"Understanding Jailbreak Success: A Study of Latent Space Dynamics in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09289","snapshot_observed_at":"2026-08-07T10:24:26.309978Z","title":"InThe Thirteenth International Con- ference on Learning Representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.309978Z"},"links":{"cited_paper":"/paper/2406.09289","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:f5c444d7aea0d1371ee0bc19e8a8bdcbf676db3120ea954085cf6ecac1a559fa","observation_id":"062a7351-50e3-44b0-a0e1-ff7da1d591b2","resolution":{"observed_at":"2026-08-07T10:24:26.309978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03827","last_updated":"2024-03-02T21:33:53Z","snapshot_observed_at":"2026-08-03T01:53:33.505931Z","submitted_at":"2022-12-07T18:17:56Z","title":"Discovering Latent Knowledge in Language Models Without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03827","snapshot_observed_at":"2026-08-07T10:24:26.314508Z","title":"InThe Thirty-eighth Annual Conference on Neural Information Processing Systems","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.314508Z"},"links":{"cited_paper":"/paper/2212.03827","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:6dc83eaa0cefc56ef04941c6873f205ed2bf98c762b315af622debd78dd333f7","observation_id":"b58ac760-0795-4097-8005-5aaff2c6130e","resolution":{"observed_at":"2026-08-07T10:24:26.314508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.262723Z","title":"V ojtech Cahlik, Rodrigo Alves, and Pavel Kordik","venue":null,"work_id":"f040072a-cc1b-4ebb-b295-1c883ee30edb","year":null},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.318627Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:8db2d508073af5874d5280d87a07eef0c9d008ffdfa65a497b22d75fc643a8c7","observation_id":"a510d602-2812-4b6e-ad08-998edc02fac3","resolution":{"observed_at":"2026-08-07T10:24:27.266765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.11248","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.071824Z","title":"Nitay Calderon and Roi Reichart","venue":null,"work_id":"d013ce6d-bb20-4b8d-9f49-af00db94134c","year":2025},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.323532Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:48b9f2fb77bc0e33dc0eaee44cf9b149aa528e977125917f29231cb8af3bac06","observation_id":"e97702f2-a65c-42fc-8bb2-dd2a8b388c03","resolution":{"observed_at":"2026-08-07T10:24:27.077942Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-07-06T19:44:51.287226Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-07T10:24:26.327706Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.327706Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:5a86fe174db3af134d3260c76699683e666d6faa126c34916fdb781e67640e2a","observation_id":"d8ea653f-a2ff-40a9-9f0f-2877412ba779","resolution":{"observed_at":"2026-08-07T10:24:26.327706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12180","last_updated":"2024-09-18T17:52:53Z","snapshot_observed_at":"2026-07-06T19:17:46.809272Z","submitted_at":"2024-09-18T17:52:53Z","title":"Finetuning Language Models to Emit Linguistic Expressions of Uncertainty","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12180","snapshot_observed_at":"2026-08-07T10:24:26.332694Z","title":"Jianhui Chen, Xiaozhi Wang, Zijun Yao, Yushi Bai, Lei Hou, and Juanzi Li","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.332694Z"},"links":{"cited_paper":"/paper/2409.12180","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:9c6afa7795778fb01e06e076c73500b0b63020ab4eef0090704d9d3a8cbeef07","observation_id":"c9e87b34-a8e6-4d4d-a985-b455905c92b1","resolution":{"observed_at":"2026-08-07T10:24:26.332694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.14271","last_updated":"2022-08-30T13:44:41Z","snapshot_observed_at":"2026-08-02T22:53:15.092443Z","submitted_at":"2022-08-30T13:44:41Z","title":"Faithful Reasoning Using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.14271","snapshot_observed_at":"2026-08-07T10:24:26.340928Z","title":"In Proceedings of the 29th International Conference on Intelligent User Interfaces, IUI ’24, page 787–802, New York, NY , USA","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.340928Z"},"links":{"cited_paper":"/paper/2208.14271","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:8648a0c9810bd8e45280bf7e6b7186e830d394ec4469aa37268c437e62c5c454","observation_id":"a08dd8f6-c46d-439f-8826-c1fd52b48c8c","resolution":{"observed_at":"2026-08-07T10:24:26.340928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.239998Z","title":"InThe Eleventh International Conference on Learning Rep- resentations","venue":null,"work_id":"7056a044-f78b-4513-b539-f11bfa59a384","year":2023},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.345165Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:8807b17dac332be299c4bf68f1cf8062c087183fc95384e7592a122d97c482ad","observation_id":"f977c197-fd2d-41d8-aa68-130cebbea1dc","resolution":{"observed_at":"2026-08-07T10:24:27.244661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03637","last_updated":"2023-07-07T14:51:30Z","snapshot_observed_at":"2026-08-07T06:56:35.290746Z","submitted_at":"2023-07-07T14:51:30Z","title":"Discovering Variable Binding Circuitry with Desiderata","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03637","snapshot_observed_at":"2026-08-07T10:24:26.349316Z","title":"InProceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 16124–16170, Toronto, Canada","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.349316Z"},"links":{"cited_paper":"/paper/2307.03637","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:8407b7a8fb595f80b75ad7f7bd6b4c113a71ddc888657f7d03fc3c59da6ecb17","observation_id":"07d74fd0-9172-4674-a7fe-6404471bb4ba","resolution":{"observed_at":"2026-08-07T10:24:26.349316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03296","last_updated":"2023-08-07T04:47:42Z","snapshot_observed_at":"2026-07-06T16:03:14.694457Z","submitted_at":"2023-08-07T04:47:42Z","title":"Studying Large Language Model Generalization with Influence Functions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03296","snapshot_observed_at":"2026-08-07T10:24:26.357474Z","title":"Han Guo, Nazneen Rajani, Peter Hase, Mohit Bansal, and Caiming Xiong","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.357474Z"},"links":{"cited_paper":"/paper/2308.03296","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:c06aa66fd7b4ac78e585491dc15612c739178fe70fa02971d285c1aa5a04a420","observation_id":"c72c0a66-3748-4fb3-b5e9-3db3bf864d17","resolution":{"observed_at":"2026-08-07T10:24:26.357474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.216685Z","title":"InProceedings of the 37th Interna- tional Conference on Neural Information Processing Systems, NIPS ’23, Red Hook, NY , USA","venue":null,"work_id":"cccd64ed-f23d-4f50-905f-c3e8e3f8e690","year":null},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.366075Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:a6b6a296af599bcbc10654c742b9842bc70db53c06375022a7dead98f15dabf8","observation_id":"2711a5e4-750b-4a0e-abe1-ae7a0bf9a485","resolution":{"observed_at":"2026-08-07T10:24:27.220441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17806","last_updated":"2024-07-15T12:07:09Z","snapshot_observed_at":"2026-07-06T17:51:24.261505Z","submitted_at":"2024-03-26T15:44:58Z","title":"Have Faith in Faithfulness: Going Beyond Circuit Overlap When Finding Model Mechanisms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17806","snapshot_observed_at":"2026-08-07T10:24:26.370726Z","title":"Shibo Hao, Yi Gu, Haotian Luo, Tianyang Liu, Xiyan Shao, Xinyuan Wang, Shuhua Xie, Haodi Ma, Adithya Samavedhi, Qiyue Gao, Zhen Wang, and Zhiting Hu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.370726Z"},"links":{"cited_paper":"/paper/2403.17806","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:d3164b9896ce8961ee6abd0750e541feadec2e6558e0381362d8e61f91d2dfaa","observation_id":"55a3048b-7a0b-43f1-926f-4d7fd1a3dd6c","resolution":{"observed_at":"2026-08-07T10:24:26.370726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:26.375257Z","title":"Zhengfu He, Xuyang Ge, Qiong Tang, Tianxiang Sun, Qinyuan Cheng, and Xipeng Qiu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.375257Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:c9a1e1c71d82be0a5d6d85faecd1973a4cd5f61b29135cb0698e806fdcb795e0","observation_id":"d010205d-0dd2-4b85-9ba4-9d27f86083e7","resolution":{"observed_at":"2026-08-07T10:24:26.375257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:26.380068Z","title":"Alon Jacovi and Yoav Goldberg","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.380068Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:5a5d210e98397b0719b608eb4fc6e0bae3d805f1f86c388a332d0a378ef44a0e","observation_id":"3488b3e3-dca5-4d5e-8340-3e9f76278872","resolution":{"observed_at":"2026-08-07T10:24:26.380068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16061","last_updated":"2024-03-04T13:37:48Z","snapshot_observed_at":"2026-07-06T17:35:06.195492Z","submitted_at":"2024-02-25T11:15:42Z","title":"How Large Language Models Encode Context Knowledge? A Layer-Wise Probing Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16061","snapshot_observed_at":"2026-08-07T10:24:26.384700Z","title":"InICASSP 2025 - 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 1–5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.384700Z"},"links":{"cited_paper":"/paper/2402.16061","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:81d66f43219ba11672c56690a978ac7984f846e3d2d29c48b1927bb70a735f1e","observation_id":"d86483a8-da5a-482b-b580-4a6b03accbec","resolution":{"observed_at":"2026-08-07T10:24:26.384700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.204763Z","title":"InProceedings of the 37th International Conference on Neural Information Processing Systems, NIPS ’23, Red Hook, NY , USA","venue":null,"work_id":"6292e049-faa0-4719-83af-3626dcee6ff6","year":null},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.392317Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:3629dd54f7a048352fa23a005ac1af3c0cb230a46c7825cce5df13e5d9b3642f","observation_id":"271a24eb-f94f-46b3-b5ae-aaff77699d9a","resolution":{"observed_at":"2026-08-07T10:24:27.209641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.192559Z","title":"InProceedings of the 61st Annual Meeting of the Association for Compu- tational Linguistics (Volume 3: System Demonstra- tions), pages 42–50, Toronto, Canada","venue":null,"work_id":"d3571bbe-740b-47bf-9677-83eb419aeff5","year":null},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.396707Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:005fc345bbd03a10e2a81d7be6c8a590152e62005ec29846408e991a5bdfab81","observation_id":"237d5644-9cb1-4701-bc63-1347536b7e4c","resolution":{"observed_at":"2026-08-07T10:24:27.196551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.180474Z","title":"InThe Twelfth International Conference on Learning Repre- sentations","venue":null,"work_id":"33e8e131-a693-44b2-99fe-b84e512754f1","year":2023},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.400384Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:81df9ba64dd0b13d7ad26d024431e62c9926e01bb87d8c8948c21720c27b7a11","observation_id":"d9c0bf9b-88c6-4aae-b144-8b6267082701","resolution":{"observed_at":"2026-08-07T10:24:27.184327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01875","last_updated":"2022-02-03T22:17:21Z","snapshot_observed_at":"2026-07-06T12:34:17.702891Z","submitted_at":"2022-02-03T22:17:21Z","title":"Rethinking Explainability as a Dialogue: A Practitioner's Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.01875","snapshot_observed_at":"2026-08-07T10:24:26.403709Z","title":"InProceedings of the 61st An- nual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 11482– 11498, Toronto, Canada","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.403709Z"},"links":{"cited_paper":"/paper/2202.01875","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:085b36cb971d8204f52e3b5edf06f56ca0ab89f45fba46cb4bdf3be8712da0b5","observation_id":"6532def3-7402-47d1-89d6-aeee8c336770","resolution":{"observed_at":"2026-08-07T10:24:26.403709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08109","last_updated":"2025-02-12T04:17:02Z","snapshot_observed_at":"2026-08-08T10:23:28.238573Z","submitted_at":"2025-02-12T04:17:02Z","title":"HuDEx: Integrating Hallucination Detection and Explainability for Enhancing the Reliability of LLM responses","version":1},"cited_work":{"arxiv_id":"2502.08109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.08109","snapshot_observed_at":"2026-08-07T10:24:26.761572Z","title":"HuDEx: Integrating Hallucination Detection and Explainability for Enhancing the Reliability of LLM responses","venue":"cs.CL","work_id":"7dbba649-b8fd-4350-867f-3ece896e72b5","year":2025},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.408324Z"},"links":{"cited_paper":"/paper/2502.08109","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:acbfc81c82870d27644570eaf76824d32f02691eb4235e42917b9550f2111455","observation_id":"f0a5476d-6ef2-4063-9cb9-57abc06527db","resolution":{"observed_at":"2026-08-07T10:24:26.766381Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05147","last_updated":"2024-08-19T07:51:05Z","snapshot_observed_at":"2026-08-04T11:44:14.524984Z","submitted_at":"2024-08-09T16:06:42Z","title":"Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05147","snapshot_observed_at":"2026-08-07T10:24:26.412268Z","title":"Https://hdsr.mitpress.mit.edu/pub/aelql9qy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.412268Z"},"links":{"cited_paper":"/paper/2408.05147","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:661e7d3681c404b4639d145354b3fa34ec7e48b988024c0fe76e3c0eac40baff","observation_id":"9d704216-f085-43b4-ad3d-bf434267d1ac","resolution":{"observed_at":"2026-08-07T10:24:26.412268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19660","last_updated":"2024-04-03T14:29:03Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T15:41:32Z","title":"Interpretable-by-Design Text Understanding with Iteratively Generated Concept Bottleneck","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19660","snapshot_observed_at":"2026-08-07T10:24:26.415954Z","title":"Niclas Luick","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.415954Z"},"links":{"cited_paper":"/paper/2310.19660","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:e1039ba3354435322036de3d91e1ca290cf2750c6c44cb5ef9aae707310dd74a","observation_id":"d9ef54eb-60ab-41e0-90dd-9dd62454179e","resolution":{"observed_at":"2026-08-07T10:24:26.415954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08366","last_updated":"2024-05-20T17:46:14Z","snapshot_observed_at":"2026-08-02T17:29:39.715223Z","submitted_at":"2024-05-14T07:07:13Z","title":"Towards Principled Evaluations of Sparse Autoencoders for Interpretability and Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08366","snapshot_observed_at":"2026-08-07T10:24:26.419920Z","title":"Alireza Makhzani and Brendan Frey","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.419920Z"},"links":{"cited_paper":"/paper/2405.08366","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:583c80a55938b95fdfc217f8eef1b3937406902bdbb1e31ad7f3e8fd6aa5e394","observation_id":"b7f2c7cf-d0a3-41ba-bb9f-906cba85e495","resolution":{"observed_at":"2026-08-07T10:24:26.419920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09420","last_updated":"2025-04-13T03:36:06Z","snapshot_observed_at":"2026-08-07T16:06:13.556404Z","submitted_at":"2025-04-13T03:36:06Z","title":"SaRO: Enhancing LLM Safety through Reasoning-based Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09420","snapshot_observed_at":"2026-08-07T10:24:26.427788Z","title":"Maximilian Mozes, Tolga Bolukbasi, Ann Yuan, Frederick Liu, Nithum Thain, and Lucas Dixon","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.427788Z"},"links":{"cited_paper":"/paper/2504.09420","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:7c4dd4e2efffa1956b6f56a6dd2d209b9af1a99ed7298a239da2abce65beb525","observation_id":"de2e084d-6a75-4237-9fca-33dbbf571323","resolution":{"observed_at":"2026-08-07T10:24:26.427788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06598","last_updated":"2023-02-13T18:54:58Z","snapshot_observed_at":"2026-08-05T11:35:37.096667Z","submitted_at":"2023-02-13T18:54:58Z","title":"Gradient-Based Automated Iterative Recovery for Parameter-Efficient Tuning","version":1},"cited_work":{"arxiv_id":"2302.06598","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.06598","snapshot_observed_at":"2026-08-07T10:24:26.692232Z","title":"Gradient-Based Automated Iterative Recovery for Parameter-Efficient Tuning","venue":"cs.CL","work_id":"210accb7-dc02-4975-aadf-dc56bf3b67d5","year":2023},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.431523Z"},"links":{"cited_paper":"/paper/2302.06598","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:5ff2f8e806adcd53ae5fa68dc3de81a1ce192d5bf670acca736f437a63e29282","observation_id":"686d0779-98ad-4775-9f85-46cf60b7591e","resolution":{"observed_at":"2026-08-07T10:24:26.697247Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11296","last_updated":"2025-05-22T23:03:47Z","snapshot_observed_at":"2026-07-06T19:51:46.092732Z","submitted_at":"2024-11-18T05:47:02Z","title":"Steering Language Model Refusal with Sparse Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11296","snapshot_observed_at":"2026-08-07T10:24:26.435845Z","title":"InFindings of the Association for Com- putational Linguistics: NAACL 2025, pages 1604– 1635, Albuquerque, New Mexico","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.435845Z"},"links":{"cited_paper":"/paper/2411.11296","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:2f0d38bf36abddb3419586809597df1991a25e91e4af38745bdd1ae868191071","observation_id":"cbeb1e1e-31e7-498f-af5f-ca4aa00efc3b","resolution":{"observed_at":"2026-08-07T10:24:26.435845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13080","last_updated":"2025-01-22T18:40:57Z","snapshot_observed_at":"2026-08-06T00:49:06.581018Z","submitted_at":"2025-01-22T18:40:57Z","title":"Refining Input Guardrails: Enhancing LLM-as-a-Judge Efficiency Through Chain-of-Thought Fine-Tuning and Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13080","snapshot_observed_at":"2026-08-07T10:24:26.440712Z","title":"Senthooran Rajamanoharan, Arthur Conmy, Lewis Smith, Tom Lieberum, Vikrant Varma, Janos Kramar, Rohin Shah, and Neel Nanda","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.440712Z"},"links":{"cited_paper":"/paper/2501.13080","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:f9b66dfe65012ea13aa9c40e9f2f6e86864c4a924d0909b535e96cc7f365e9c9","observation_id":"08cddfeb-c7d8-4643-b109-c0b071d77632","resolution":{"observed_at":"2026-08-07T10:24:26.440712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18948","last_updated":"2025-08-29T06:03:42Z","snapshot_observed_at":"2026-08-06T09:59:40.841111Z","submitted_at":"2024-11-28T06:29:46Z","title":"RevPRAG: Revealing Poisoning Attacks in Retrieval-Augmented Generation through LLM Activation Analysis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18948","snapshot_observed_at":"2026-08-07T10:24:26.452708Z","title":"InProceedings of the 2022 Conference on Empirical Methods in Nat- ural Language Processing, pages 2078–2093, Abu Dhabi, United Arab Emirates","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.452708Z"},"links":{"cited_paper":"/paper/2411.18948","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:70ec56598ceb8c07a6e2a5e90e8740894f3f8f0596522c32b086fde13500953e","observation_id":"d2f08816-1d81-41f5-87dd-077d24031298","resolution":{"observed_at":"2026-08-07T10:24:26.452708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.155813Z","title":"InICLR 2025 Workshop on Building Trust in Language Models and Applications","venue":null,"work_id":"b900b05b-62c9-4400-9f5c-2ab6fd07e013","year":2025},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.460867Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:0b5711e740a08dc538d3ee3cbe45babeb1e1547af00a1296ca7fb4d0d766f551","observation_id":"25099a16-f626-442c-8027-75aa87f62c6f","resolution":{"observed_at":"2026-08-07T10:24:27.160267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-07T10:24:26.465201Z","title":"InProceedings of the 37th Interna- tional Conference on Neural Information Processing Systems, NIPS ’23, Red Hook, NY , USA","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.465201Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:149fd816cd6716977e0e4b92a56631449bef054f7485f4a8d089fe54ac359bf3","observation_id":"18f8d42c-9149-455b-a29f-653f71b8df80","resolution":{"observed_at":"2026-08-07T10:24:26.465201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.144659Z","title":null,"venue":null,"work_id":"686cc649-57e2-4e49-82e0-04a2fb58de32","year":2024},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.469980Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:45904d0b58068d0efe12d1787d6ebf409c01430469e38bac2c50d8bfefeee988","observation_id":"b7093f4e-d86c-4039-9e92-9ea347a812a3","resolution":{"observed_at":"2026-08-07T10:24:27.148900Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06269","last_updated":"2026-07-03T19:21:25Z","snapshot_observed_at":"2026-08-07T17:20:02.435445Z","submitted_at":"2025-03-08T16:29:45Z","title":"Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06269","snapshot_observed_at":"2026-08-07T10:24:26.474285Z","title":"InFindings of the Associa- tion for Computational Linguistics: EMNLP 2023, pages 2550–2575, Singapore","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.474285Z"},"links":{"cited_paper":"/paper/2503.06269","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:a4d153c61cbe9592775f07a97e5ffb7690196d59864b122a53b1a3127505b8c1","observation_id":"6077e1dc-c411-4eb3-8de1-7e23de6a6069","resolution":{"observed_at":"2026-08-07T10:24:26.474285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20099","last_updated":"2025-06-04T02:59:37Z","snapshot_observed_at":"2026-07-06T18:22:44.129954Z","submitted_at":"2024-05-30T14:40:35Z","title":"Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20099","snapshot_observed_at":"2026-08-07T10:24:26.477946Z","title":"InInternational Conference on Machine Learning, pages 24150–24176","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.477946Z"},"links":{"cited_paper":"/paper/2405.20099","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:f2ad52b3073c4f841a68c54d73df9296b2186e02ba258d53f546f938030d1247","observation_id":"d632adf3-891d-4c43-9da3-7e8ddee5ac65","resolution":{"observed_at":"2026-08-07T10:24:26.477946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.03418","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:26.653471Z","title":"why should i trust you?","venue":null,"work_id":"0bc031db-4246-4a85-a56a-4a87e44882e7","year":2020},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":483,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.444527Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:10b0e6903e2b41d564f3fee4d8df6cfcbc2943d7d258c9eaa411fce797b4617f","observation_id":"fb2c1e6d-62a1-48f1-99ca-61df1f20c819","resolution":{"observed_at":"2026-08-07T10:24:26.660635Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08651","last_updated":"2025-08-11T16:13:08Z","snapshot_observed_at":"2026-07-06T19:01:27.827878Z","submitted_at":"2024-08-16T10:34:50Z","title":"Chain of Thought Still Thinks Fast: APriCoT Helps with Thinking Slow","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08651","snapshot_observed_at":"2026-08-07T10:24:26.423582Z","title":"InProceedings of the 2013 conference of the north american chapter of the as- sociation for computational linguistics: Human lan- guage technologies, pages 746–751","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.423582Z"},"links":{"cited_paper":"/paper/2408.08651","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:729e3b76dcd78afbc55c99a7d2ef17f8f7f9ef72f6bef2da703f2f392a2714b0","observation_id":"99d8ab01-3987-47fe-a284-cd5793d76918","resolution":{"observed_at":"2026-08-07T10:24:26.423582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.06316","last_updated":"2019-05-15T17:48:56Z","snapshot_observed_at":"2026-08-07T09:02:14.264924Z","submitted_at":"2019-05-15T17:48:56Z","title":"What do you learn from context? Probing for sentence structure in contextualized word representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.06316","snapshot_observed_at":"2026-08-07T10:24:26.456815Z","title":"Justin Theodorus, V Swaytha, Shivani Gautam, Adam Ward, Mahir Shah, Cole Blondin, and Kevin Zhu","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.456815Z"},"links":{"cited_paper":"/paper/1905.06316","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:47e9bf00a014451b6b3db56be24f7422f0a389ad0a7876e2629dfce72472e226","observation_id":"55ba416a-3575-4f8b-982a-9f11b3f56127","resolution":{"observed_at":"2026-08-07T10:24:26.456815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.228315Z","title":"In Proceedings of the 58th Annual Meeting of the Asso- ciation for Computational Linguistics, pages 5553– 5563, Online","venue":null,"work_id":"9a54a8ea-7365-4441-b339-3a10a648b546","year":null},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.362341Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:8e1a18b18502f42e971537bfbb5d415546907d08b7caccafdd2d9acdaa46ca07","observation_id":"d9acd6c1-29b8-4742-8f4c-bda55b6e9ef2","resolution":{"observed_at":"2026-08-07T10:24:27.232109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18147","last_updated":"2025-06-06T11:10:03Z","snapshot_observed_at":"2026-08-07T17:50:17.102928Z","submitted_at":"2025-02-25T12:21:45Z","title":"Jacobian Sparse Autoencoders: Sparsify Computations, Not Just Activations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18147","snapshot_observed_at":"2026-08-07T10:24:26.353163Z","title":"Logan Engstrom, Axel Feldmann, and Aleksander M ˛ adry","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.353163Z"},"links":{"cited_paper":"/paper/2502.18147","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:1568436b45534d6d076f11fcac1aa8ab07fc875e718bc68c72ca7b8359f582db","observation_id":"2848e556-47e8-4bc3-8182-b773c9fa1e82","resolution":{"observed_at":"2026-08-07T10:24:26.353163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00745","last_updated":"2024-03-01T18:43:51Z","snapshot_observed_at":"2026-08-08T09:40:22.806772Z","submitted_at":"2024-03-01T18:43:51Z","title":"AtP*: An efficient and scalable method for localizing LLM behaviour to components","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00745","snapshot_observed_at":"2026-08-07T10:24:26.388763Z","title":"InInternational Conference on Learning Representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.388763Z"},"links":{"cited_paper":"/paper/2403.00745","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:45caffc5e364598958621d38305e00c43f9991c0c099785aa305664e82fd3959","observation_id":"1215c80c-f397-4304-89cd-3a2e21d794a6","resolution":{"observed_at":"2026-08-07T10:24:26.388763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.251523Z","title":"InAdvances in Neural Infor- mation Processing Systems, volume 36, pages 16318– 16352","venue":null,"work_id":"1f15ef97-920c-44a1-b2c2-afbb5cbf84d9","year":1980},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.336515Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:27c3914f89a63ca09628788ac5d71bc7a5ee41ca7a8a68f4d2cd12a90ff21210","observation_id":"2f1c746e-ede6-4330-bb77-3f4bf6832ede","resolution":{"observed_at":"2026-08-07T10:24:27.255379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00799","last_updated":"2025-03-06T17:43:10Z","snapshot_observed_at":"2026-08-08T01:50:42.192362Z","submitted_at":"2024-06-02T16:53:21Z","title":"Get my drift? Catching LLM Task Drift with Activation Deltas","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00799","snapshot_observed_at":"2026-08-07T10:24:26.300328Z","title":"Samira Abnar and Willem Zuidema","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.300328Z"},"links":{"cited_paper":"/paper/2406.00799","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:ce7178734aa5930c715d6c6f14a8ba620319fb61514d04ff986684f1142472b2","observation_id":"ebd8f26f-5dc9-4d52-9ac6-bef8b3335c81","resolution":{"observed_at":"2026-08-07T10:24:26.300328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03032","last_updated":"2025-03-04T22:19:52Z","snapshot_observed_at":"2026-08-07T20:49:55.611036Z","submitted_at":"2025-03-04T22:19:52Z","title":"SAFE: A Sparse Autoencoder-Based Framework for Robust Query Enrichment and Hallucination Mitigation in LLMs","version":1},"cited_work":{"arxiv_id":"2503.03032","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.03032","snapshot_observed_at":"2026-08-07T10:24:27.132498Z","title":"SAFE: A Sparse Autoencoder-Based Framework for Robust Query Enrichment and Hallucination Mitigation in LLMs","venue":"cs.CL","work_id":"66c5a900-aba1-4c58-948e-77658a043f14","year":2025},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.294848Z"},"links":{"cited_paper":"/paper/2503.03032","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:994c1b1adc1c404cd0360fe398bd9e61a7ec28e4f96c2f1c3ba5a612a24449bc","observation_id":"560521ff-a5b7-43da-a648-05155e0ef7b0","resolution":{"observed_at":"2026-08-07T10:24:27.136657Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.167517Z","title":"Aaquib Syed, Can Rager, and Arthur Conmy","venue":null,"work_id":"b7c432ca-d332-4819-81c7-a328af4ac010","year":2024},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":3328,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.448608Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:2c7c4915b6aba70b6f77a02b63581870d4dc44f56e6b5de23d7934eb070a4cd8","observation_id":"9e69ad70-b6de-42ab-8d6e-6831fa30682f","resolution":{"observed_at":"2026-08-07T10:24:27.172301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":29,"verified_exact":2,"verified_fuzzy":10},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2506.05451."}