{"as_of":"2026-08-07T17:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:19e318119316f7ceebbdb596200bbc247abf4d31efe700342ea6bd780f171d14","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:01:47.854894Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:09:32.736304Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-14T21:38:00.071469Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"cited_work":{"arxiv_id":"2507.21141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21141","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wollschl¨ager, T., Elstner, J., Geisler, S., Cohen-Addad, V ., G¨unnemann, S., and Gasteiger, J","venue":null,"work_id":"4664fb57-1d86-45f7-8703-349846c87701","year":null},"citing_paper":{"arxiv_id":"2605.12726","last_updated":"2026-07-09T09:24:42Z","snapshot_observed_at":"2026-08-06T13:20:37.791677Z","submitted_at":"2026-05-12T20:30:24Z","title":"Before the Last Token: Diagnosing Final-Token Safety Probe Failures","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T21:37:02.439454Z"},"links":{"cited_paper":"/paper/2507.21141","citing_paper":"/paper/2605.12726"},"observation_digest":"sha256:a41a8a2bb05c223b0c373b3aa53dc2b239f6f1c66436b63a51a0dfd08f8a1ffd","observation_id":"05b043eb-10a1-4ebf-9169-085a654c8545","resolution":{"observed_at":"2026-05-14T21:38:00.073909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21141","snapshot_observed_at":"2026-08-02T07:09:32.736304Z","title":"Alexandra Souly, Qingyuan Lu, Dillon Bowen, Tu Trinh, Elvis Hsieh, Sana Pandey, Pieter Abbeel, Justin Sveg- liato, Scott Emmons, Olivia Watkins, and Sam Toyer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13075","last_updated":"2026-07-12T20:37:19Z","snapshot_observed_at":"2026-08-06T06:44:59.325517Z","submitted_at":"2026-07-12T20:37:19Z","title":"The Entanglement Wall: Activation-Space Probes as Risk Detectors, Not Context Adjudicators","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T07:09:32.736304Z"},"links":{"cited_paper":"/paper/2507.21141","citing_paper":"/paper/2607.13075"},"observation_digest":"sha256:69269e63beb34170f7870efb3d73537337f44dac8e16d82d30f98d0f5a474550","observation_id":"28a2ee74-b0c1-4dc9-a21e-8d16199d1ba7","resolution":{"observed_at":"2026-08-02T07:09:32.736304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.21141/citation-record","integrity":"/paper/2507.21141/integrity","json":"/paper/2507.21141/citation-record.json","paper":"/paper/2507.21141"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-06T15:01:47.765176Z","title":"On the opportunities and risks of foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.765176Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:d406e387dea45b0d51e622da6d49237afe64de2f8c34dfc40c6a72b71e062265","observation_id":"ecb6aa75-1eaf-4e6c-89a3-701ad29a7dff","resolution":{"observed_at":"2026-08-06T15:01:47.765176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10014","last_updated":"2024-10-13T21:24:25Z","snapshot_observed_at":"2026-07-06T19:32:42.378146Z","submitted_at":"2024-10-13T21:24:25Z","title":"Safety-Aware Fine-Tuning of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10014","snapshot_observed_at":"2026-08-06T15:01:47.772974Z","title":"Safety-aware fine-tuning of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.772974Z"},"links":{"cited_paper":"/paper/2410.10014","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:30ed14894ba278caf2761df0f89210781b4bb152c24bce7a9847f0b7807826da","observation_id":"82c5c459-c5e7-4430-96b4-4da7071c1999","resolution":{"observed_at":"2026-08-06T15:01:47.772974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T15:01:47.776571Z","title":"Under review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.776571Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:fd7f9d7b92a2451ae438d3cfc233490514f6316868a9214d814fe9ae72cbe7b2","observation_id":"f360be14-326c-43cc-8947-f019ae1cba39","resolution":{"observed_at":"2026-08-06T15:01:47.776571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T15:01:47.791537Z","title":"Maria Halkidi, Yannis Batistakis, and Michalis Vazirgiannis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.791537Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:ace6eacc3d0cc3c7fb23c847186c6e9aa2157989dcdeae1fb4e6a8572d2b476c","observation_id":"7fb6beaf-c30a-4a6e-a4a4-0d5bf79bceec","resolution":{"observed_at":"2026-08-06T15:01:47.791537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:47.801834Z","title":"Safedpo: A simple approach to direct preference optimization with enhanced safety","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.801834Z"},"links":{"citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:e4c1b605f00a49944a940c503c0b1ff35a5e0dd24ba5dd1f102741d19e4a31fa","observation_id":"a528a80c-c0b7-4f4d-9440-a7b03bb7d901","resolution":{"observed_at":"2026-08-06T15:01:47.801834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-06T15:01:47.805088Z","title":"Xiaogeng Liu, Nan Xu, Muhao Chen, and Chaowei Xiao","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.805088Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:0ff5cc40d2d38a23e5fb91785b2a2bb1a71b10ac58f9d27518e899f44d0b9ee1","observation_id":"6b0343f1-d2dc-41e9-9564-a4d601b82724","resolution":{"observed_at":"2026-08-06T15:01:47.805088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02475","last_updated":"2024-03-04T20:39:24Z","snapshot_observed_at":"2026-07-06T17:39:29.151236Z","submitted_at":"2024-03-04T20:39:24Z","title":"Enhancing LLM Safety via Constrained Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02475","snapshot_observed_at":"2026-08-06T15:01:47.808584Z","title":"Enhancing llm safety via constrained direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.808584Z"},"links":{"cited_paper":"/paper/2403.02475","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:f77f1f0a99c78f649fb72f9960d99d795beee62419f608cff63b726d87a14e06","observation_id":"a1939382-08e1-4005-bcf6-ae0c11ce47c8","resolution":{"observed_at":"2026-08-06T15:01:47.808584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06824","last_updated":"2024-08-19T01:18:41Z","snapshot_observed_at":"2026-07-06T16:30:37.867641Z","submitted_at":"2023-10-10T17:54:39Z","title":"The Geometry of Truth: Emergent Linear Structure in Large Language Model Representations of True/False Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06824","snapshot_observed_at":"2026-08-06T15:01:47.812006Z","title":"The geometry of truth: Emergent linear structure in large language model representations of true/false datasets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.812006Z"},"links":{"cited_paper":"/paper/2310.06824","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:590876e8533575c0dffa5485e94138e79eaebf4fd77ea8ce6d7a6f89ee731c29","observation_id":"ff0ef252-7b16-4373-8618-3decc99bb851","resolution":{"observed_at":"2026-08-06T15:01:47.812006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19647","last_updated":"2025-03-27T05:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T17:56:07Z","title":"Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19647","snapshot_observed_at":"2026-08-06T15:01:47.815767Z","title":"Sparse feature circuits: Discovering and editing interpretable causal graphs in language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.815767Z"},"links":{"cited_paper":"/paper/2403.19647","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:3f2d40c61d83a8f1c17b88f16aa84779062aba7171aca7de56fe05ef438aa535","observation_id":"a681fd9b-fb00-472c-b52d-078489649203","resolution":{"observed_at":"2026-08-06T15:01:47.815767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00941","last_updated":"2023-09-07T20:36:48Z","snapshot_observed_at":"2026-07-06T16:13:34.788427Z","submitted_at":"2023-09-02T13:37:34Z","title":"Emergent Linear Representations in World Models of Self-Supervised Sequence Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00941","snapshot_observed_at":"2026-08-06T15:01:47.819681Z","title":"Emergent linear representations in world models of self-supervised sequence models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.819681Z"},"links":{"cited_paper":"/paper/2309.00941","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:b6e11ff901170e18ebf4ae33f1a469ee6de25274c148e967fb7b0ee18e3cb576","observation_id":"509a0729-c1e0-46ab-a923-9a4e81bc055d","resolution":{"observed_at":"2026-08-06T15:01:47.819681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-07-06T20:36:17.029825Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09674","snapshot_observed_at":"2026-08-06T15:01:47.822986Z","title":"The hidden dimensions of llm alignment: A multi-dimensional safety analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.822986Z"},"links":{"cited_paper":"/paper/2502.09674","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:f58b55e65c0f0ae6eeecd92ffe51107f83934dc402cabdc61dcf8bf87ad67476","observation_id":"70ffcc5d-2c1c-4592-ac8a-bbbb34600921","resolution":{"observed_at":"2026-08-06T15:01:47.822986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:48.204642Z","title":"Interpretable steering of large language models with feature guided activation additions","venue":null,"work_id":"a6f66b46-f717-4c36-ac86-7569f9eb1c44","year":2025},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.826803Z"},"links":{"citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:60f19438f03930d302fd1352a2c445c84b3e509f508e5626bef48812457b3b59","observation_id":"0a8fb2e9-746c-4bd9-808e-5dc127b0f233","resolution":{"observed_at":"2026-08-06T15:01:48.208051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15154","last_updated":"2023-10-23T17:55:31Z","snapshot_observed_at":"2026-07-06T16:37:19.963994Z","submitted_at":"2023-10-23T17:55:31Z","title":"Linear Representations of Sentiment in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15154","snapshot_observed_at":"2026-08-06T15:01:47.830115Z","title":"Linear representa- tions of sentiment in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.830115Z"},"links":{"cited_paper":"/paper/2310.15154","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:c3c3c06b36272ee3d602f020f299300df8e0ed99a7112d3fa88f4ec421b030a8","observation_id":"a850eefb-8758-4c6a-934d-26aa0304363f","resolution":{"observed_at":"2026-08-06T15:01:47.830115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-06T15:01:47.833410Z","title":"Tom Wollschl ¨ager, Jannes Elstner, Simon Geisler, Vincent Cohen-Addad, Stephan G ¨unnemann, and Johannes Gasteiger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.833410Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:856a35272ff2842e4a3ae05648df67567e6657466cd94dd6814b720970e41c7c","observation_id":"4ad54f81-b217-4a3e-b17c-67d477fd1619","resolution":{"observed_at":"2026-08-06T15:01:47.833410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:48.195614Z","title":"pyvene: A library for understanding and improving PyTorch models via interventions","venue":null,"work_id":"29058b96-68e3-41ac-b4fa-fa2574a71160","year":2024},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.836938Z"},"links":{"citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:f32e755108d02774469fcc83b60408b666ddc5cdd316363936ee1b2b5c611d5d","observation_id":"47b0c430-ee7b-49a7-acd6-18f093ce0bce","resolution":{"observed_at":"2026-08-06T15:01:48.198757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:48.185092Z","title":"URL https://aclanthology.org/2024.naacl-demo","venue":null,"work_id":"db6b1f3b-774b-415e-8705-c18d37d96b0e","year":2024},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.840771Z"},"links":{"citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:e95f56078345484d1d730cd0c2f5953450b0d64fdeaa786d3424829054b409c0","observation_id":"3407a27e-cdb7-4591-9266-9b563e4e3180","resolution":{"observed_at":"2026-08-06T15:01:48.189182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T15:01:47.843887Z","title":"Yuanshun Yao, Xiaojun Xu, and Yang Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.843887Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:156295fdc42dd37662a56c26c98a0f6c59cab5782278742b41264fda67fdbb0c","observation_id":"ea24d6d9-d573-408f-b00e-5409aa37c140","resolution":{"observed_at":"2026-08-06T15:01:47.843887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21800","last_updated":"2025-05-27T22:14:54Z","snapshot_observed_at":"2026-08-07T13:20:35.749933Z","submitted_at":"2025-05-27T22:14:54Z","title":"From Directions to Cones: Exploring Multidimensional Representations of Propositional Facts in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21800","snapshot_observed_at":"2026-08-06T15:01:47.847228Z","title":"From directions to cones: Exploring multidimensional representations of propositional facts in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.847228Z"},"links":{"cited_paper":"/paper/2505.21800","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:af2ff8a0959c7f1998e46c70a9c5b60952a1bdd9198c89c027f0d6becb06e9b4","observation_id":"f5c4d94f-9caa-4c5e-8b5b-e722938ad976","resolution":{"observed_at":"2026-08-06T15:01:47.847228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:48.174852Z","title":"Under review","venue":null,"work_id":"d8e7b38b-2826-4aab-81ec-65e910b38544","year":2002},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.850568Z"},"links":{"citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:a784e7ec8b7b8912995bbf2a4b0b2e9877904ffe1e19ba921b07accca63f3110","observation_id":"e59f07d6-563b-4f03-b42d-8bf5f66c7b67","resolution":{"observed_at":"2026-08-06T15:01:48.177822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:48.163046Z","title":null,"venue":null,"work_id":"79cf1f7e-37d1-4c26-a6d1-2b341516a387","year":2024},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.854894Z"},"links":{"citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:6bb9b125b485142e8e8a3ef200c82e356e1132289a65bd0059dee4fe672fd70b","observation_id":"323d869c-b384-4e58-b0b8-df3e41f18161","resolution":{"observed_at":"2026-08-06T15:01:48.167501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:47.769206Z","title":"doi: https:// doi.org/10.1016/S0031-3203(96)00142-2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":1997,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.769206Z"},"links":{"citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:afd184f52015b37cd002dcb33ff12dac00a9db31c2f33ed7df816403e7e1427e","observation_id":"4a5a077b-c308-4fea-820a-662d0f93c565","resolution":{"observed_at":"2026-08-06T15:01:47.769206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08145","last_updated":"2025-01-14T14:23:18Z","snapshot_observed_at":"2026-08-05T16:43:12.384747Z","submitted_at":"2025-01-14T14:23:18Z","title":"Refusal Behavior in Large Language Models: A Nonlinear Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08145","snapshot_observed_at":"2026-08-06T15:01:47.794774Z","title":"Under review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.794774Z"},"links":{"cited_paper":"/paper/2501.08145","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:3dce63cea35b6fbec26ba2017daacf35d20ca06ac5f0a8bc50388c3c199f59a5","observation_id":"580723f0-2f20-47b0-897a-9660e8d9a8e0","resolution":{"observed_at":"2026-08-06T15:01:47.794774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:47.787746Z","title":"emnlp-main.273","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.787746Z"},"links":{"citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:de73ae8b43576d77475a9c899ca34855f42d579fbc0b3d909fe1ef83326d42b0","observation_id":"15050118-aeec-4901-9351-987148f61d04","resolution":{"observed_at":"2026-08-06T15:01:47.787746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10652","last_updated":"2022-09-21T20:49:26Z","snapshot_observed_at":"2026-07-06T13:54:56.779166Z","submitted_at":"2022-09-21T20:49:26Z","title":"Toy Models of Superposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10652","snapshot_observed_at":"2026-08-06T15:01:47.780339Z","title":"Toy models of superposition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.780339Z"},"links":{"cited_paper":"/paper/2209.10652","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:9885f9381acc0e664e4e6535aea64a772b171223c51257a57d1f4d80e00b0e17","observation_id":"2ad56729-0f6b-43cc-88de-f5f7a594dbb2","resolution":{"observed_at":"2026-08-06T15:01:47.780339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:48.214834Z","title":null,"venue":null,"work_id":"cf6fed15-ae99-41e3-b67b-08005828142c","year":2020},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.784263Z"},"links":{"citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:d700e846500f2667c52d13bfedf639b7d8b6196f2f22825319f8ecc8a24df57f","observation_id":"266f749f-500e-42c1-9e67-1ad2a6323e5f","resolution":{"observed_at":"2026-08-06T15:01:48.218134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-06T15:01:47.757141Z","title":"anthropic.com/news/anthropics-responsible-scaling-policy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.757141Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:5bab8c8ebec634efe4562d19bc4e60674bbde7b014e0d055876116af65a46b04","observation_id":"2b54dfec-7589-47ba-96ab-80ad776a304e","resolution":{"observed_at":"2026-08-06T15:01:47.757141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:47.761453Z","title":"On the dangers of stochastic parrots: Can language models be too big? In Proceedings of the 2021 ACM conference on fairness, accountability, and transparency, pp","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.761453Z"},"links":{"citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:05a8ab90a80a1477334e5de96846d8d04b9a05ea4725570e8bfaa63906cbb9ae","observation_id":"9ab45db4-4393-4a33-b972-58749b0b829a","resolution":{"observed_at":"2026-08-06T15:01:47.761453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03867","last_updated":"2024-03-06T17:17:36Z","snapshot_observed_at":"2026-08-04T18:22:42.733859Z","submitted_at":"2024-03-06T17:17:36Z","title":"On the Origins of Linear Representations in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03867","snapshot_observed_at":"2026-08-06T15:01:47.798462Z","title":"On the origins of linear representations in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.798462Z"},"links":{"cited_paper":"/paper/2403.03867","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:311ff80b1da588b809caba8fdc759717ed12e018b4c3d81ce250ddab5f0586b3","observation_id":"89355c50-affb-4354-b6b5-88a10c87a02d","resolution":{"observed_at":"2026-08-06T15:01:47.798462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T14:49:25.827651Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 2 inbound Pith citation observations for arXiv:2507.21141."}