{"as_of":"2026-08-21T03:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:419e93f19a85fa2d11b2adbd9e4fb16032e93013291ef7b4fb7a3c9407f94720","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:52:49.843093Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20333/citation-record","integrity":"/paper/2507.20333/integrity","json":"/paper/2507.20333/citation-record.json","paper":"/paper/2507.20333"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.501028Z","title":"Can language models encode perceptual structure without grounding? a case study in color","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.501028Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:6b76eeedb723bcf4f9c0256a3ddad9a9b39186ed68afb91dceb98c3010e61045","observation_id":"9112da58-035c-4dfb-9821-008c9fb8ab67","resolution":{"observed_at":"2026-08-15T17:52:49.501028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T17:52:49.505584Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.505584Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:8fed3577c37a8f70704093f043a0c17d021213cfa0a96f593d36e72806729094","observation_id":"ec6ca0cc-b41c-4f0d-acac-119a3ccd806a","resolution":{"observed_at":"2026-08-15T17:52:49.505584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.04207","last_updated":"2017-02-09T06:58:50Z","snapshot_observed_at":"2026-08-14T21:44:12.003559Z","submitted_at":"2016-08-15T08:51:38Z","title":"Fine-grained Analysis of Sentence Embeddings Using Auxiliary Prediction Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.04207","snapshot_observed_at":"2026-08-15T17:52:49.510192Z","title":"Fine-grained analysis of sentence embeddings using auxiliary prediction tasks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.510192Z"},"links":{"cited_paper":"/paper/1608.04207","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:1463baa68f573561aee7669adc431a31b9c1f098ae9787621b18da54dbe7147b","observation_id":"964b68a9-c45c-43a8-8a9f-0ddd62ca56a9","resolution":{"observed_at":"2026-08-15T17:52:49.510192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.514424Z","title":"Approximate nearest neighbors and the fast johnson-lindenstrauss transform","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.514424Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:dbada9f6a305c29f307560f03f62f2d6b1cb30d000a39a0871b500f329ec8491","observation_id":"0bcf11af-f74a-4c8d-9f26-daf79db56b7a","resolution":{"observed_at":"2026-08-15T17:52:49.514424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.518610Z","title":"Introducing claude, Mar 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.518610Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:ba9a399e64319dc52c8f8c8025ee6ea0598fed44ec697b3a43df3b6a3621d642","observation_id":"3511c8a4-2128-4976-9f23-93434d408bf9","resolution":{"observed_at":"2026-08-15T17:52:49.518610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.522496Z","title":"Introducing computer use, a new claude 3.5 sonnet, and claude 3.5 haiku, Oct 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.522496Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:6d1982dfcbfa03961019f9c55f0b22885bbe4802881cf7916410cb10395354a4","observation_id":"43cf262a-ad7e-43b7-a111-e8d6490a5f2a","resolution":{"observed_at":"2026-08-15T17:52:49.522496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-08-17T07:39:23.832733Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-15T17:52:49.526916Z","title":"Refusal in language models is mediated by a single direction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.526916Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:4a33529a6bea729b4772b282e80c980be15b691142937502112401c9e9a024bb","observation_id":"14c6691a-d690-48c8-a28e-978f724f7f14","resolution":{"observed_at":"2026-08-15T17:52:49.526916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.531090Z","title":"Adversarial learning guarantees for linear hypotheses and neural networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.531090Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:f109242a84b8be1f0d303db802ab965f08e9eafbf4ac74085097fffc5500124c","observation_id":"49ccb7d3-edad-4391-9ccd-fc6091ec2ed8","resolution":{"observed_at":"2026-08-15T17:52:49.531090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.534696Z","title":"sql-create-context dataset, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.534696Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:73660400630fcb36d05cc8c0aff624c7655ca172fcdec61addf6e2c42ebd255f","observation_id":"53461dd8-235b-40c1-9d88-a9062d49308e","resolution":{"observed_at":"2026-08-15T17:52:49.534696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-20T15:31:01.041088Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-15T17:52:49.539244Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.539244Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:8b49feca632e119ef9855851e77e9de79f7e712aa496092a5350472571e18fef","observation_id":"bcf7615e-7844-4ee1-b430-6b24f04b9651","resolution":{"observed_at":"2026-08-15T17:52:49.539244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.543511Z","title":"LEACE : Perfect linear concept erasure in closed form","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.543511Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:2bbcec6cb2f2987456b3586f886b3895d2f7b5e521d3f46879125bb5786ab04a","observation_id":"886e31db-4e7d-4130-a2c8-08f9db1417cb","resolution":{"observed_at":"2026-08-15T17:52:49.543511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.547365Z","title":"Man is to computer programmer as woman is to homemaker? debiasing word embeddings","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.547365Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:02f82b2b3dfcde89ea8e02cddd0dc4ad29a7304ca96ca1cbd8faa844e7056365","observation_id":"3bdf0a03-9ec0-454f-874b-847f5aef690a","resolution":{"observed_at":"2026-08-15T17:52:49.547365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-11T16:28:21.917686Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-15T17:52:49.550763Z","title":"Jailbreakbench: An open robustness benchmark for jailbreaking large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.550763Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:198a3c1cd57a09a3b2d501d402305440e49e3caa3528e963737198d3899192f5","observation_id":"90b802bb-5de7-445c-a13d-fe0415cf56eb","resolution":{"observed_at":"2026-08-15T17:52:49.550763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:51.042885Z","title":"Fundamental limits of perfect concept erasure","venue":null,"work_id":"48b8cafe-f8b3-41e0-8851-596688b3ef39","year":2025},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.554770Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:364734c838db013d179dd41f8d04c7ae98e49662fc3ab0b94adff3cdf41c07b3","observation_id":"f3063fc8-96d7-4fcf-9891-76e5bd84266c","resolution":{"observed_at":"2026-08-15T17:52:51.047150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T17:52:49.558558Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.558558Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:132d87b650808083339faee35bd60aaffafb8801e033df59af2474ac01629cae","observation_id":"8f6c44b7-d422-4c5e-90aa-7ceb6fec4003","resolution":{"observed_at":"2026-08-15T17:52:49.558558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.562547Z","title":"What you can cram into a single \\ & ! \\# * vector: Probing sentence embeddings for linguistic properties","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.562547Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:5f2b55b48cde418bac7ba144b85a16b5b7bf50a0a136f89cd3525eb745b68cf0","observation_id":"e76c9120-f6f6-47cd-bf64-e10aa17b9f90","resolution":{"observed_at":"2026-08-15T17:52:49.562547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:51.032799Z","title":"Unified language model pre-training for natural language understanding and generation","venue":null,"work_id":"50331eaa-35e0-4b03-b4f6-e5404fe5a370","year":2019},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.566463Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:e86f21b8a6df267b1f3ef346c6dae30bc3b51405e7a6738d66946566222c13b9","observation_id":"aa259576-daed-45ad-bdeb-028fa7abd134","resolution":{"observed_at":"2026-08-15T17:52:51.036210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:51.021004Z","title":"The fast johnson-lindenstrauss transform is even faster","venue":null,"work_id":"55252a5d-f43e-494d-bfc2-ca4305f76f66","year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.570087Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:44396b857be2175cfc0891dee00adbef943e97fb295fa73b726bc417833c5927","observation_id":"2e97fb73-4b40-4e87-9f12-ad9eae4713b7","resolution":{"observed_at":"2026-08-15T17:52:51.024506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00564","last_updated":"2021-02-28T16:57:41Z","snapshot_observed_at":"2026-08-16T18:42:23.830032Z","submitted_at":"2021-02-28T16:57:41Z","title":"An Introduction to Johnson-Lindenstrauss Transforms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00564","snapshot_observed_at":"2026-08-15T17:52:49.573893Z","title":"An introduction to johnson-lindenstrauss transforms","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.573893Z"},"links":{"cited_paper":"/paper/2103.00564","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:1357eabc0fb01b43494dbd1c45b1ec01a7120568ac0f268e1d1dded68c04d063","observation_id":"facfbf49-edb0-41b4-8239-843c8a7f8213","resolution":{"observed_at":"2026-08-15T17:52:49.573893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-08-17T08:35:42.452149Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-15T17:52:49.577732Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.577732Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:12f919e33f6a1524c2cefef761cc776af3bbeee212e0e81c4545e9da1f1f4174","observation_id":"a3ed0316-d765-434e-a036-31305a32a903","resolution":{"observed_at":"2026-08-15T17:52:49.577732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-15T17:52:49.581494Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.581494Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:f092f5c1a89de8df3e58111e6281e244988cdf2a6bd883f37424dd95bba149ff","observation_id":"28606691-d145-4c9d-b2a9-450b357f77a2","resolution":{"observed_at":"2026-08-15T17:52:49.581494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.585078Z","title":"SAMS um corpus: A human-annotated dialogue dataset for abstractive summarization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.585078Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:dd67b79db6eb17bc8973adb3d8ffe454a771f1c03a2e3dddc630244bfc16158d","observation_id":"a6501f38-f02e-4971-b8cf-374a7a0d66f8","resolution":{"observed_at":"2026-08-15T17:52:49.585078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T17:52:49.588972Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.588972Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:cf5fc31a5d40230249bfa6e1a8d109b74b0d44c08c77aef5352b683fd53be015","observation_id":"b40758da-09eb-4c59-ae91-81688dec4831","resolution":{"observed_at":"2026-08-15T17:52:49.588972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02207","last_updated":"2024-03-04T18:25:29Z","snapshot_observed_at":"2026-08-16T14:55:25.223461Z","submitted_at":"2023-10-03T17:06:52Z","title":"Language Models Represent Space and Time","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02207","snapshot_observed_at":"2026-08-15T17:52:49.592913Z","title":"Language models represent space and time","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.592913Z"},"links":{"cited_paper":"/paper/2310.02207","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:e09c618c765e7d00a5ecea2af48fcabe68bbad60de5388ebce80c82bdc07ed03","observation_id":"a44dab2f-c34f-4cf7-8d7a-e3b669b94e2f","resolution":{"observed_at":"2026-08-15T17:52:49.592913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.596618Z","title":"Safety arithmetic: A framework for test-time safety alignment of language models by steering parameters and activations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.596618Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:1dfcf623a26ca39918bdf2b9d24c4f74d93d7a332f97ab82fa954155f7cee99a","observation_id":"ca44fc4c-684c-4f31-aced-878c33985ae2","resolution":{"observed_at":"2026-08-15T17:52:49.596618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.600201Z","title":"Towards reasoning in large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.600201Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:a6b121ab9994d364077c2793748090d8f776c8d34f3ad040114bcbff10dc7dc4","observation_id":"50ea31c8-b52f-4610-a28a-631cbbb9a2b0","resolution":{"observed_at":"2026-08-15T17:52:49.600201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:51.008634Z","title":"Visualisation and'diagnostic classifiers' reveal how recurrent and recursive neural networks process hierarchical structure","venue":null,"work_id":"7720408e-98fc-4a64-8cea-846cb5458cfe","year":2018},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.604181Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:e10511816e5c5f3984ba56b5a6fb37c1f77d6e4fd98b86f5af391ff459dd978e","observation_id":"a9f95b6c-ff0b-4276-afaf-66d5fbed1933","resolution":{"observed_at":"2026-08-15T17:52:51.012770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.607492Z","title":"Approximate nearest neighbors: towards removing the curse of dimensionality","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.607492Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:4abca2d06370247c516df5cdc4ff1e18fab053d74bf0de079e9058584f3efae4","observation_id":"65527a2b-eb29-420d-9d2a-6a8f6456d6c7","resolution":{"observed_at":"2026-08-15T17:52:49.607492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19852","last_updated":"2025-04-04T11:14:49Z","snapshot_observed_at":"2026-08-05T20:02:35.087707Z","submitted_at":"2023-10-30T15:52:15Z","title":"AI Alignment: A Comprehensive Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19852","snapshot_observed_at":"2026-08-15T17:52:49.610886Z","title":"Ai alignment: A comprehensive survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.610886Z"},"links":{"cited_paper":"/paper/2310.19852","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:1801b585645270ff1516ad151e58ccbf37b0669ea46484682a211429a40a4f35","observation_id":"7a5f4181-280f-4827-8292-bd7bdf537786","resolution":{"observed_at":"2026-08-15T17:52:49.610886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03867","last_updated":"2024-03-06T17:17:36Z","snapshot_observed_at":"2026-08-20T06:27:15.559367Z","submitted_at":"2024-03-06T17:17:36Z","title":"On the Origins of Linear Representations in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03867","snapshot_observed_at":"2026-08-15T17:52:49.614746Z","title":"On the origins of linear representations in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.614746Z"},"links":{"cited_paper":"/paper/2403.03867","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:8c2304b0d17b83defb1ac19ec5699537d3e6683555542b0a8c00331f55d9ac72","observation_id":"d8dec612-79a2-430b-98bc-46e678e7372d","resolution":{"observed_at":"2026-08-15T17:52:49.614746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.618817Z","title":"Johnson and Joram Lindenstrauss","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.618817Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:824e9d6f83f5c318c8e792b81a372033645218ce482f8acd910b67b0c7d9bbe2","observation_id":"7679c769-0bef-4825-9250-8050375e2364","resolution":{"observed_at":"2026-08-15T17:52:49.618817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.622315Z","title":"Kane and Jelani Nelson","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.622315Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:7e5373ef87c50d63e0c4a15bc1b7fdc87039fbbc526b71a1c18415296ac2359c","observation_id":"35a27919-65a0-40b8-b954-bf2ee02025f9","resolution":{"observed_at":"2026-08-15T17:52:49.622315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.625870Z","title":"A survey of reinforcement learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.625870Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:4512eae7479d1d9b667976e344351278dfe5b47dc839cbb7c3893ee5b4fcd84a","observation_id":"44394e50-4f44-40e8-8b19-85bacf4d97eb","resolution":{"observed_at":"2026-08-15T17:52:49.625870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-319-71504-9_25","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-17T11:03:46.409680Z","title":"Weighted Entropy and its Use in Computer Science and Beyond, pp.\\ 293--308","venue":"Lecture notes in computer science","work_id":"fe01996b-a742-4106-b085-886b9939f8a2","year":2017},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.629465Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:cca2463e2b4929bf604d1ca8bcd83495188e4e9ff0e6d48eacc9791564104d64","observation_id":"8c21c8ae-8fbb-400f-9326-af2b7a2ddf09","resolution":{"observed_at":"2026-08-15T17:52:49.940292Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:50.996172Z","title":"Weighted entropy: basic inequalities","venue":null,"work_id":"3a3238b1-fee8-4997-8de1-1c9cb1b6515d","year":2017},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.633214Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:e3f36d7a3621e7f4334b5247da4f6587d698cae2edaefeba0ffc162b1cb04d3a","observation_id":"b4fae518-67a7-4026-b796-5d01396cbec1","resolution":{"observed_at":"2026-08-15T17:52:51.000715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14659","last_updated":"2021-03-26T18:01:48Z","snapshot_observed_at":"2026-08-16T18:36:00.757397Z","submitted_at":"2021-03-26T18:01:48Z","title":"Alignment of Language Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.14659","snapshot_observed_at":"2026-08-15T17:52:49.636848Z","title":"Alignment of language agents","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.636848Z"},"links":{"cited_paper":"/paper/2103.14659","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:809bf027bd9688f1140d60e3c693884fbd888f6b05c806cfed1bddcd723be73e","observation_id":"e5f29a71-3c06-45fe-a2b6-ce35a3ade8c9","resolution":{"observed_at":"2026-08-15T17:52:49.636848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-17T18:33:55.039901Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-15T17:52:49.640349Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.640349Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:8fd95e7a310f60590c9aa41f3e680387b996be40b822361ccc2e69a79d927d41","observation_id":"0748a4a9-4ced-4991-9204-70ed04a6d4b0","resolution":{"observed_at":"2026-08-15T17:52:49.640349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.644243Z","title":"Emergent world representations: Exploring a sequence model trained on a synthetic task","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.644243Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:023b91e4026e63ad9c4c97bb48c93b973e54e508d8da8b35e1424c984e2436a5","observation_id":"1ead1a0a-c902-428b-8e08-58adc35638e2","resolution":{"observed_at":"2026-08-15T17:52:49.644243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.647866Z","title":"Safety layers in aligned large language models: The key to LLM security","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.647866Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:5cd89914156dcc66bce4c9598c7be326890558ff48704450ae68765e45278aea","observation_id":"0197f22a-b2b4-4797-acf2-33cfcb5bff6d","resolution":{"observed_at":"2026-08-15T17:52:49.647866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T17:52:49.651544Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.651544Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:0abd2dd5653578441a0abe4f5231e232dfe090521863c7d40e33ce088b35f3d7","observation_id":"3ddaa56d-aef8-4429-b1a1-9ffed6486b0f","resolution":{"observed_at":"2026-08-15T17:52:49.651544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.655116Z","title":"On learning to summarize with large language models as references","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.655116Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:e9dc1c209e37cdc1391d7792d4882e0f38ef7c3df56b85bc9685de8001a6df45","observation_id":"9d033926-6f60-4476-84b2-c50ec47af5c1","resolution":{"observed_at":"2026-08-15T17:52:49.655116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06292","last_updated":"2024-09-01T00:41:18Z","snapshot_observed_at":"2026-08-20T13:44:59.356502Z","submitted_at":"2024-08-12T16:58:11Z","title":"The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06292","snapshot_observed_at":"2026-08-15T17:52:49.658800Z","title":"The ai scientist: Towards fully automated open-ended scientific discovery","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.658800Z"},"links":{"cited_paper":"/paper/2408.06292","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:5ebcb0d2e8290f2c1e44306a2fe5c1cff0779a1b46e07ed1e34258da33a737ec","observation_id":"4cc1a32c-63c9-4d81-afdf-c31439c30bbc","resolution":{"observed_at":"2026-08-15T17:52:49.658800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06824","last_updated":"2024-08-19T01:18:41Z","snapshot_observed_at":"2026-08-17T14:45:35.765424Z","submitted_at":"2023-10-10T17:54:39Z","title":"The Geometry of Truth: Emergent Linear Structure in Large Language Model Representations of True/False Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06824","snapshot_observed_at":"2026-08-15T17:52:49.662834Z","title":"The geometry of truth: Emergent linear structure in large language model representations of true/false datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.662834Z"},"links":{"cited_paper":"/paper/2310.06824","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:653ce1ec1c7d131428e9c9376cdaeb00314db00040b76a58b2538a0f8a382d70","observation_id":"216050a1-32c0-432c-a6c3-0a8c2c7bd7bf","resolution":{"observed_at":"2026-08-15T17:52:49.662834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.666629Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.666629Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:783a0501af5ebfc1ec12884bc897c78bc430c1582c538b43450b9e48f45073e6","observation_id":"daaf478a-ade8-48f0-ab96-607ceb1c0aca","resolution":{"observed_at":"2026-08-15T17:52:49.666629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-08-16T09:07:20.265665Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-15T17:52:49.670083Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.670083Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:81cdea263f52a636560fcdba3011a10f1b091745dcf86e134507e4ff10c2f5f6","observation_id":"8068b4cd-b4a9-46b2-a0ed-6f79f067cc2a","resolution":{"observed_at":"2026-08-15T17:52:49.670083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:50.960335Z","title":"Linguistic regularities in continuous space word representations","venue":null,"work_id":"2003c534-ef3a-42c5-97c7-f8452b57975e","year":2013},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.673698Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:932c254d1637a528906cd1f3270732d9f471b50325ebc959dc6106fefda6543a","observation_id":"dce78205-a5ee-4eae-bb57-0cd08e23648d","resolution":{"observed_at":"2026-08-15T17:52:50.964342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:50.948149Z","title":"Foundations of Machine Learning","venue":null,"work_id":"4d6a486a-6c35-44ab-bd75-38541eee2d86","year":2018},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.677187Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:05745b4cb8bf7191d681ad7801a1f228741a8c0e479c0411c641a4896e831ef8","observation_id":"cd4fc439-97bb-4574-860f-fc0c5460c89b","resolution":{"observed_at":"2026-08-15T17:52:50.952381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00941","last_updated":"2023-09-07T20:36:48Z","snapshot_observed_at":"2026-08-16T15:03:48.794640Z","submitted_at":"2023-09-02T13:37:34Z","title":"Emergent Linear Representations in World Models of Self-Supervised Sequence Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00941","snapshot_observed_at":"2026-08-15T17:52:49.680814Z","title":"Emergent linear representations in world models of self-supervised sequence models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.680814Z"},"links":{"cited_paper":"/paper/2309.00941","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:3d4da809e638595c74b4ebafb4ecb83d287707fd301223fe632dfb19a8bec20b","observation_id":"cac79324-40af-4909-b039-f51b7b15daf1","resolution":{"observed_at":"2026-08-15T17:52:49.680814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.684879Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.684879Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:809161e055ed3bc8c971d74b816646029f788e11e554b87cd777c585137c2a36","observation_id":"443ed322-6612-4f4e-afbe-525f13835149","resolution":{"observed_at":"2026-08-15T17:52:49.684879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-20T15:26:19.198841Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-15T17:52:49.688494Z","title":"The alignment problem from a deep learning perspective","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.688494Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:8b5ec471c1aaeb9e359acaa117ec682e02113fee2321cd67f420f242a41f0edf","observation_id":"842918b6-51a8-41ef-afe8-514cc446455c","resolution":{"observed_at":"2026-08-15T17:52:49.688494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:50.936172Z","title":"Introducing operator, Jan 2025","venue":null,"work_id":"4c2eb5b0-e610-4fc0-aee7-d77d870f3a88","year":2025},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.692610Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:662018102caf9f6de68828102f42a504a79444b19957f3e26240754e7345e2c7","observation_id":"885019ad-6d96-463e-89cd-402251ce58cc","resolution":{"observed_at":"2026-08-15T17:52:50.939805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.696414Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.696414Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:8449a5580ebd4056cb3c2b13221c33fabe7425ce088e2276039697f732f00cc6","observation_id":"d212096f-d32e-4e3b-aa54-0541f4645928","resolution":{"observed_at":"2026-08-15T17:52:49.696414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.700082Z","title":"The linear representation hypothesis and the geometry of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.700082Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:b00090be1bbc4898e0f1e9c67d763d5362e80e6ae7604f2e16d15a7a68129e64","observation_id":"9c971ab1-57b6-4235-81b4-4fe1544cc32c","resolution":{"observed_at":"2026-08-15T17:52:49.700082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01506","last_updated":"2025-02-18T02:23:45Z","snapshot_observed_at":"2026-08-17T00:18:50.876112Z","submitted_at":"2024-06-03T16:34:01Z","title":"The Geometry of Categorical and Hierarchical Concepts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01506","snapshot_observed_at":"2026-08-15T17:52:49.704153Z","title":"The geometry of categorical and hierarchical concepts in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.704153Z"},"links":{"cited_paper":"/paper/2406.01506","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:ad445bd28339609db653cfad819e9d0584206ed6c9486143a375c10f8ec6a0e5","observation_id":"6ae88b55-8a34-4b7c-8465-98fda6f1fce3","resolution":{"observed_at":"2026-08-15T17:52:49.704153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:50.910536Z","title":"The linear representation hypothesis and the geometry of large language models","venue":null,"work_id":"d33abf00-782d-4806-8cfc-24cd225db3d4","year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.708498Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:e7714e255e14c96a6d98ae0b86fb8009b8e2caf226d4727d68b310798f2f697d","observation_id":"29c6de7d-fef3-4547-b175-6b833b37ea9a","resolution":{"observed_at":"2026-08-15T17:52:50.914984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.712579Z","title":"Mapping language models to grounded conceptual spaces","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.712579Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:82fcc0000adb776f07c44a3fbd292b4f8f41db7f70279ee9d7073d592bd0c099","observation_id":"6c26f1c0-f01f-4855-84d8-e477082d5635","resolution":{"observed_at":"2026-08-15T17:52:49.712579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-08-18T11:01:42.927110Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-15T17:52:49.716187Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.716187Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:912e5f67aa7f34a3cbb1a3e272a30480e035c6a953eef34109d16ace07757228","observation_id":"899ee0a4-495e-49d8-9283-69f914704bb6","resolution":{"observed_at":"2026-08-15T17:52:49.716187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.720208Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.720208Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:515893c5115999d4e2a8bdfc2b6902ed83c39d37d74b9ba7db91b05e1256a5e5","observation_id":"d062ffbd-78fc-4a72-9d18-f1cf20833014","resolution":{"observed_at":"2026-08-15T17:52:49.720208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:50.881914Z","title":"Linear adversarial concept erasure","venue":null,"work_id":"89574013-0d69-41e0-af71-c6c9e4915a29","year":2022},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.725352Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:a9f05ef82a41be7684ffa6c54cc77b7524d90e985e0a522bda80bd40902c25d5","observation_id":"a8b8bd3d-b9f5-49c0-8a21-ddd267b1f6d3","resolution":{"observed_at":"2026-08-15T17:52:50.885752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.729704Z","title":"Log-linear guardedness and its implications","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.729704Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:958c2d3668b2af72ab14af4009b6a07962ec0c29ca0f015256c43ee4c002131f","observation_id":"181c4d5f-6dca-4792-9b6f-2dcb2382835a","resolution":{"observed_at":"2026-08-15T17:52:49.729704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.733695Z","title":"Steering llama 2 via contrastive activation addition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.733695Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:49e35f9706293f49b85f38ccfbe17c4baf5ea3bc251e1211becb11ba3383e83d","observation_id":"8cd04245-6af9-40ff-9d82-afe1af05ee7a","resolution":{"observed_at":"2026-08-15T17:52:49.733695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.737822Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.737822Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:75f2a97b226840ec3317576dda03e7200204ac69b383570257bf76c295f5f37c","observation_id":"c031f0c9-3f55-472a-97ef-c6b69e9204f1","resolution":{"observed_at":"2026-08-15T17:52:49.737822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-15T17:52:49.741642Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.741642Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:112425fb28c3f0040aeeb4a8cc547541a9cc3faff7ad100e6b07e3ae4a95ed42","observation_id":"437214f8-db28-49de-a44a-e75e59cf2eb2","resolution":{"observed_at":"2026-08-15T17:52:49.741642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.745686Z","title":"Meta llama guard 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.745686Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:8e90889db3484845202c80635ac472bdf03834f3aa676a98c3d83134b5605958","observation_id":"8b44f8f2-e9ad-4f93-970f-8efc9ddd24d1","resolution":{"observed_at":"2026-08-15T17:52:49.745686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T17:52:49.750096Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.750096Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:7f219a2a7752b8de0dc41dbe7df5a9d605bb4d4d8ba67cdf850de0146b2d3070","observation_id":"39a21e0b-b46f-4096-aeff-d8fe4f7f1e00","resolution":{"observed_at":"2026-08-15T17:52:49.750096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-15T17:52:49.758637Z","title":"Steering language models with activation engineering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.758637Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:7055efcf695b45a20b78d9088aa1f84d70ecaa99fe74b5ad84d1d29008128a5f","observation_id":"ab36a9c0-2601-498d-95d2-8a51ea200198","resolution":{"observed_at":"2026-08-15T17:52:49.758637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:50.853118Z","title":"Langlotz, Jason Hom, Sergios Gatidis, John Pauly, and Akshay S","venue":null,"work_id":"4efce0ea-da0d-4c60-bf81-0150a44631f6","year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.763082Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:bb739eb6710c40ab9b46213a7b4b1fd0e13545d680e407f213383174b0311944","observation_id":"f90c6f60-822d-40cd-ba40-a87d35a42aaa","resolution":{"observed_at":"2026-08-15T17:52:50.857050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.766833Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.766833Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:b2bd82bddd01e4fb2ac82bcfff385a7f450086d0355acad4147bd82b81953fc1","observation_id":"5263f8b6-6ba8-4ac1-9549-7339efa7f815","resolution":{"observed_at":"2026-08-15T17:52:49.766833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-15T17:52:49.770395Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.770395Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:fd7543c2a47dfdd1a5e92daa04f9b4f9f3007d74e9caa96520deb3ae4408744f","observation_id":"f848e9b7-095a-4206-832f-47f745587bfb","resolution":{"observed_at":"2026-08-15T17:52:49.770395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-14T06:11:14.515796Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-15T17:52:49.774293Z","title":"Dai, and Quoc V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.774293Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:fd32fd35f7728d1e0e1a38c245bf747d2ccfbc778c2db1490db4af26cd415e80","observation_id":"01355df8-015e-4314-8ef2-9da85577615d","resolution":{"observed_at":"2026-08-15T17:52:49.774293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.777884Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.777884Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:c0ae028438ae60216ecc548e962dfc2afda7ce93a20a5a103d264128b08c29dc","observation_id":"f8371e6f-127d-427d-a499-dab1aadb578a","resolution":{"observed_at":"2026-08-15T17:52:49.777884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16332","last_updated":"2025-05-27T10:39:39Z","snapshot_observed_at":"2026-08-16T14:23:34.122241Z","submitted_at":"2024-01-29T17:38:14Z","title":"Tradeoffs Between Alignment and Helpfulness in Language Models with Steering Methods","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16332","snapshot_observed_at":"2026-08-15T17:52:49.781561Z","title":"Tradeoffs between alignment and helpfulness in language models with representation engineering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.781561Z"},"links":{"cited_paper":"/paper/2401.16332","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:b3aa863bffae2bca9fb6ad80518be0af41088e0f274fc8dabad23b12214d3eab","observation_id":"4b74949e-6f54-41c6-9c23-75c482876a1f","resolution":{"observed_at":"2026-08-15T17:52:49.781561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T17:52:49.785627Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.785627Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:639fb4fd425bd64bdd8b4795686a17c8be2d7575030edbf7c7b197177a77e588","observation_id":"b8f82108-9de0-473d-a733-856f8d86468b","resolution":{"observed_at":"2026-08-15T17:52:49.785627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.08887","last_updated":"2019-02-02T23:53:18Z","snapshot_observed_at":"2026-08-18T17:54:32.989741Z","submitted_at":"2018-09-24T13:03:13Z","title":"Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.08887","snapshot_observed_at":"2026-08-15T17:52:49.790174Z","title":"Spider: A large-scale human-labeled dataset for complex and cross-domain semantic parsing and text-to-sql task","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.790174Z"},"links":{"cited_paper":"/paper/1809.08887","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:7ab70e74c086eaa74db881640c99f97236df4d475e59557fda665a3f5a15ab12","observation_id":"663f9077-d4f1-44d2-86dc-0b1131bd5e4e","resolution":{"observed_at":"2026-08-15T17:52:49.790174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.795282Z","title":"Hashimoto","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.795282Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:98259017e82033c9245bfe2e6b5ac85ea127b7e586870eed0310662b5365a904","observation_id":"f856561a-4666-4837-9b79-f1e8ff4c956c","resolution":{"observed_at":"2026-08-15T17:52:49.795282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-15T17:52:49.799122Z","title":"Chen, Jinhao Jiang, Ruiyang Ren, Yifan Li, Xinyu Tang, Zikang Liu, Peiyu Liu, Jianyun Nie, and Ji rong Wen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.799122Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:c532e7a9764b59ffe6a55a5e593b1939e1484cc7d5eb4396cc17c459200a9bef","observation_id":"2bf1fb08-e376-4cd0-a9ab-4d355932c4dc","resolution":{"observed_at":"2026-08-15T17:52:49.799122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:50.824919Z","title":"On prompt-driven safeguarding for large language models","venue":null,"work_id":"221a72ef-570b-4652-a916-adb9ff603a5c","year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.803671Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:489cea18f915a6b1441f6235f37b1759634168a61ece7044d12a88e2e3e3b9fe","observation_id":"5225ac8a-ba00-48d5-ae7e-ff18509637c0","resolution":{"observed_at":"2026-08-15T17:52:50.829334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.00103","last_updated":"2017-11-09T23:06:14Z","snapshot_observed_at":"2026-08-16T12:20:26.377960Z","submitted_at":"2017-08-31T23:12:15Z","title":"Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.00103","snapshot_observed_at":"2026-08-15T17:52:49.808075Z","title":"Seq2sql: Generating structured queries from natural language using reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.808075Z"},"links":{"cited_paper":"/paper/1709.00103","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:3f0b0ac362ac2c4753c4cbe2e0e131324bfcef6c774dbb17c0b44b80cdac3f64","observation_id":"6ecc00e4-0e01-42b1-b058-5292770e8697","resolution":{"observed_at":"2026-08-15T17:52:49.808075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.842","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.892521Z","title":null,"venue":null,"work_id":"6eb98d39-6550-4ec7-b61f-d96ba94298ba","year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.812339Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:d231805f74aa4cba32c091c4f2b4718024d6acc96ceed279117bdcf92b8e13df","observation_id":"e87a9abc-b15d-4b70-be24-1c09226d0103","resolution":{"observed_at":"2026-08-15T17:52:49.897604Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.815864Z","title":"How alignment and jailbreak work: Explain LLM safety through intermediate hidden states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.815864Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:d498ce92dc8272d0357a168ab74c09fee4d6f0d6fab084e9c6106ad62fafb874","observation_id":"adcbfc41-5091-4476-9469-0f1cac2f833b","resolution":{"observed_at":"2026-08-15T17:52:49.815864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-15T17:52:49.820475Z","title":"Byun, Zifan Wang, Alex Troy Mallen, Steven Basart, Sanmi Koyejo, Dawn Song, Matt Fredrikson, Zico Kolter, and Dan Hendrycks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.820475Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:8038c5444a67a20f9647626a1e58acfcce07a3b88d60d8632ec9b3d7b570adec","observation_id":"884608be-38d1-474c-b98f-a7c39d4ecfe0","resolution":{"observed_at":"2026-08-15T17:52:49.820475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-15T17:52:49.824695Z","title":"Universal and transferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.824695Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:739ca68436df2415978702c54f678649a3621a8c32388db434b777563b131b86","observation_id":"b640e861-2ad6-4165-82c7-471742abc465","resolution":{"observed_at":"2026-08-15T17:52:49.824695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.829177Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.829177Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:e30e5f284d873600c96ddde4a82b93aecef06e66a1ae9ed197378b0fd3a77355","observation_id":"fa407600-1c3f-4b55-af7c-2cbbd6322fa0","resolution":{"observed_at":"2026-08-15T17:52:49.829177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.834076Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.834076Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:264c95dfecc21faf0f4319ddbbb6309e952fe7a1600b3490eea81438fa824610","observation_id":"f74a1336-1f6d-40d3-be72-3686ccdb55cd","resolution":{"observed_at":"2026-08-15T17:52:49.834076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.838599Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.838599Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:3fa895d9099ffaf537d521326f106125e9da78fde5e3bb1d748bc1876c49c9e8","observation_id":"e0fbb592-adc9-44b8-80a1-4d78c0b00269","resolution":{"observed_at":"2026-08-15T17:52:49.838599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.843093Z","title":",# (7),01444 '9=82<.342C 2! !22222222222222222222222222222222222222222222222222","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:49.843093Z"},"links":{"citing_paper":"/paper/2507.20333"},"observation_digest":"sha256:98c7c4add1931a021a5af2d317fef56a392c17018a04f4c790316873f09e4941","observation_id":"cf986049-94ea-40da-8bd3-60f0c6e2d52b","resolution":{"observed_at":"2026-08-15T17:52:49.843093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.20333","last_updated":"2025-07-27T15:51:23Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T21:49:37.937488Z","submitted_at":"2025-07-27T15:51:23Z","title":"The Blessing and Curse of Dimensionality in Safety Alignment"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":72,"verified_exact":2,"verified_fuzzy":12},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 0 inbound Pith citation observations for arXiv:2507.20333."}