{"as_of":"2026-08-08T00:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:841e31c7b40fed77da95a5c956c20cee80e9a35d5c3d874417ad317132f2638c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:35:39.020367Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":5,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":"2401.18018","doi":"10.48550/arxiv.2401.18018","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, F","venue":"arXiv (Cornell University)","work_id":"8fd0f811-ec0b-498a-817a-1bbbdc6fee68","year":2024},"citing_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"reference_index":206,"source":"arxiv_source","source_observed_at":"2026-05-13T10:47:55.934081Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2406.11717"},"observation_digest":"sha256:70c0c8c9c7c82146eedd4bb8d28c7218d81873a505c10b6535045bdc7f452e57","observation_id":"0de766c3-c60f-451e-94c9-6ae8a1726782","resolution":{"observed_at":"2026-05-13T10:47:56.174132Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":"2401.18018","doi":"10.48550/arxiv.2401.18018","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, F","venue":"arXiv (Cornell University)","work_id":"8fd0f811-ec0b-498a-817a-1bbbdc6fee68","year":2024},"citing_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-04T23:34:13.332065Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-05-15T02:20:44.368219Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2407.04295"},"observation_digest":"sha256:e94c09d94367ff56053e982837829386c005051086568f29e76c225e5327238e","observation_id":"377af2ab-81c0-42a1-a840-06d03b8365ca","resolution":{"observed_at":"2026-05-15T02:20:44.509404Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-07T12:35:39.020367Z","title":"Kiho Park, Yo Joong Choe, and Victor Veitch","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00085","last_updated":"2025-05-30T04:54:18Z","snapshot_observed_at":"2026-08-07T12:27:05.156381Z","submitted_at":"2025-05-30T04:54:18Z","title":"COSMIC: Generalized Refusal Direction Identification in LLM Activations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:39.020367Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2506.00085"},"observation_digest":"sha256:0fdb262e09ed300c6423e284c601777113f9c6115b2325d3fac45358e407cf20","observation_id":"77e6bcea-72a4-4f40-aedc-3c1047fb9f50","resolution":{"observed_at":"2026-08-07T12:35:39.020367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":"2401.18018","doi":"10.48550/arxiv.2401.18018","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, F","venue":"arXiv (Cornell University)","work_id":"8fd0f811-ec0b-498a-817a-1bbbdc6fee68","year":2024},"citing_paper":{"arxiv_id":"2506.01770","last_updated":"2026-04-18T05:40:12Z","snapshot_observed_at":"2026-08-04T01:20:56.393646Z","submitted_at":"2025-06-02T15:17:38Z","title":"ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T11:34:09.428653Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2506.01770"},"observation_digest":"sha256:9d2a2294f0312f051aa371b503b2c72885e5d2f1f13bd273438c5e33ea580da9","observation_id":"da8b92c4-2591-4935-b4ff-28cb1244cdb6","resolution":{"observed_at":"2026-05-19T11:37:16.008776Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-06T19:57:44.717885Z","title":"Prompt-driven llm safeguarding via directed representation optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.717885Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:396c320b18c6a8b5729729a53b3ce273301fecde2d230c0bc5dcafbd4c35a983","observation_id":"36cde0a9-52cb-47df-8885-9a0c480d83cd","resolution":{"observed_at":"2026-08-06T19:57:44.717885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-06T18:32:44.096157Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07974","last_updated":"2025-08-25T16:49:10Z","snapshot_observed_at":"2026-08-06T18:25:32.971973Z","submitted_at":"2025-07-10T17:51:05Z","title":"Defending Against Prompt Injection With a Few DefensiveTokens","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:44.096157Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2507.07974"},"observation_digest":"sha256:0360daae7b98d47a9fc63829abe3857a563fac9babfcd6ac1da92f748de166f8","observation_id":"c46fd5ac-48fa-416e-9127-e34bc783e919","resolution":{"observed_at":"2026-08-06T18:32:44.096157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-06T04:47:25.678524Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03054","last_updated":"2025-08-05T03:58:15Z","snapshot_observed_at":"2026-08-06T15:30:46.727768Z","submitted_at":"2025-08-05T03:58:15Z","title":"Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning","version":1},"reference_index":197,"source":"arxiv_source","source_observed_at":"2026-08-06T04:47:25.678524Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2508.03054"},"observation_digest":"sha256:e415b449379a7d5bbed8246fdcfc8000703397f4895937953b3f906ed629b247","observation_id":"408b7a6e-c13e-4e9d-85a8-fd40974b14f4","resolution":{"observed_at":"2026-08-06T04:47:25.678524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T14:57:12.969212Z","title":"Prompt-driven LLM safeguarding via directed representation optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.969212Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:19b4e19ab66487e030409cded6064012f5cf1833bb57ac445c0c7c8ac94405be","observation_id":"c96e3b12-54fb-4287-967a-e210244f832d","resolution":{"observed_at":"2026-08-05T14:57:12.969212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-04T11:17:49.954144Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05969","last_updated":"2026-07-19T06:24:18Z","snapshot_observed_at":"2026-08-07T17:16:23.901959Z","submitted_at":"2025-10-07T14:24:32Z","title":"Probing the Difficulty Perception Mechanism of Large Language Models","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T11:17:49.954144Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2510.05969"},"observation_digest":"sha256:28a37ddf6cd068f6604fb13bfb43925d53d0a4a0e781f0b84232632153c8e477","observation_id":"af93b3cf-a963-466e-813d-761b4e2907a2","resolution":{"observed_at":"2026-08-04T11:17:49.954144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-04T09:40:47.454032Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14207","last_updated":"2026-06-29T03:28:16Z","snapshot_observed_at":"2026-08-07T22:39:10.403032Z","submitted_at":"2025-10-16T01:27:44Z","title":"Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T09:40:47.454032Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2510.14207"},"observation_digest":"sha256:87f357c18e21b76d1094e38dea4ec2b29d5670b88a086c06e802b2c18cccd372","observation_id":"9629203d-6a04-42d9-ba97-2cbeaf89f271","resolution":{"observed_at":"2026-08-04T09:40:47.454032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-04T09:25:58.615053Z","title":"Prompt- driven LLM safeguarding via directed representation optimization.CoRR, abs/2401.18018, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.15476","last_updated":"2026-07-04T04:20:15Z","snapshot_observed_at":"2026-08-06T02:45:04.316908Z","submitted_at":"2025-10-17T09:38:54Z","title":"SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses","version":3},"reference_index":245,"source":"pdf_text","source_observed_at":"2026-08-04T09:25:58.615053Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2510.15476"},"observation_digest":"sha256:8e4d2caa8bf9f6cc79d7dbac777206081297d7681c34432690b3a40e49e1a714","observation_id":"b4569ed4-f15f-4ffc-8149-6e402c9d083f","resolution":{"observed_at":"2026-08-04T09:25:58.615053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":"2401.18018","doi":"10.48550/arxiv.2401.18018","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, F","venue":"arXiv (Cornell University)","work_id":"8fd0f811-ec0b-498a-817a-1bbbdc6fee68","year":2024},"citing_paper":{"arxiv_id":"2602.02280","last_updated":"2026-05-12T03:47:11Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:20:51Z","title":"RACC: Representation-Aware Coverage Criteria for LLM Safety Testing","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-16T08:12:55.296932Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2602.02280"},"observation_digest":"sha256:2b14852acb89902288195e4fe5f214f03bf1b1f985f2b11716245369a6b55960","observation_id":"afa072e4-9ff1-4b24-850d-2432afd9bbf9","resolution":{"observed_at":"2026-05-16T08:17:36.688250Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":"2401.18018","doi":"10.48550/arxiv.2401.18018","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, F","venue":"arXiv (Cornell University)","work_id":"8fd0f811-ec0b-498a-817a-1bbbdc6fee68","year":2024},"citing_paper":{"arxiv_id":"2602.05946","last_updated":"2026-05-11T01:44:43Z","snapshot_observed_at":"2026-08-02T10:13:32.692710Z","submitted_at":"2026-02-05T18:01:52Z","title":"f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T06:48:35.723474Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2602.05946"},"observation_digest":"sha256:c156a3dc1389daccf313dda647cf995df4aca5e9af483773c8e8bed377f2394e","observation_id":"9d5160d1-3eed-4b90-a28b-f1a98939264c","resolution":{"observed_at":"2026-05-16T06:50:42.968338Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":"2401.18018","doi":"10.48550/arxiv.2401.18018","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, F","venue":"arXiv (Cornell University)","work_id":"8fd0f811-ec0b-498a-817a-1bbbdc6fee68","year":2024},"citing_paper":{"arxiv_id":"2604.08846","last_updated":"2026-04-10T01:01:56Z","snapshot_observed_at":"2026-08-02T14:54:38.934183Z","submitted_at":"2026-04-10T01:01:56Z","title":"Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs","version":1},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-05-10T18:04:05.157103Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2604.08846"},"observation_digest":"sha256:f06ed31efc57766581d7538b32265385950af31305cfd2481319807df36ee1b9","observation_id":"a8bc067e-a858-481a-a400-4b0f18743e42","resolution":{"observed_at":"2026-05-11T05:35:57.513789Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":"2401.18018","doi":"10.48550/arxiv.2401.18018","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, F","venue":"arXiv (Cornell University)","work_id":"8fd0f811-ec0b-498a-817a-1bbbdc6fee68","year":2024},"citing_paper":{"arxiv_id":"2605.08513","last_updated":"2026-05-08T21:45:28Z","snapshot_observed_at":"2026-08-03T10:26:10.527615Z","submitted_at":"2026-05-08T21:45:28Z","title":"A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-12T01:41:44.898358Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2605.08513"},"observation_digest":"sha256:6d20c4503beed30f7885adb79598d408133bc8221fe5ab07ea96027821c3365f","observation_id":"c8a09e59-74ee-4937-83ad-b7ada4e165b4","resolution":{"observed_at":"2026-05-12T01:46:14.370017Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":"2401.18018","doi":"10.48550/arxiv.2401.18018","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, F","venue":"arXiv (Cornell University)","work_id":"8fd0f811-ec0b-498a-817a-1bbbdc6fee68","year":2024},"citing_paper":{"arxiv_id":"2605.17284","last_updated":"2026-05-17T06:45:53Z","snapshot_observed_at":"2026-08-02T07:22:05.535449Z","submitted_at":"2026-05-17T06:45:53Z","title":"CLAP: Contrastive Latent-space Prompt Optimization for End-to-end Autonomous Driving","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T14:58:03.757712Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2605.17284"},"observation_digest":"sha256:9dd1fed7cb7672f4be629071b3cffb98310d58c771d838a729d975ccd23418ef","observation_id":"155d4921-eef9-4a92-9c50-46cb5fab9cf2","resolution":{"observed_at":"2026-05-20T14:58:24.670438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":"2401.18018","doi":"10.48550/arxiv.2401.18018","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, F","venue":"arXiv (Cornell University)","work_id":"8fd0f811-ec0b-498a-817a-1bbbdc6fee68","year":2024},"citing_paper":{"arxiv_id":"2605.18104","last_updated":"2026-05-18T09:16:55Z","snapshot_observed_at":"2026-08-02T08:21:56.104408Z","submitted_at":"2026-05-18T09:16:55Z","title":"Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-20T10:57:40.997128Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2605.18104"},"observation_digest":"sha256:ca93a8426700c2d4d0f286b29649e94ac06a1e2d143c1cd6278a4c13dd3da78b","observation_id":"a30150e8-b607-4b84-bdb7-75acaad5a53b","resolution":{"observed_at":"2026-05-20T10:58:13.540944Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":"2401.18018","doi":"10.48550/arxiv.2401.18018","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, F","venue":"arXiv (Cornell University)","work_id":"8fd0f811-ec0b-498a-817a-1bbbdc6fee68","year":2024},"citing_paper":{"arxiv_id":"2606.15980","last_updated":"2026-06-18T23:56:29Z","snapshot_observed_at":"2026-07-06T23:52:37.922109Z","submitted_at":"2026-06-14T19:07:22Z","title":"Do Activation Monitors Survive Model Updates? Benchmarking, Predicting, and Repairing Activation-Monitor Staleness","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-27T03:24:24.714121Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2606.15980"},"observation_digest":"sha256:631dbf7f2c45ac223dfcb8ab11ba08fc03b61e5f46649d94a612524bea3b8d66","observation_id":"16e62ae5-3a5f-4a29-94b2-79b8b61791a7","resolution":{"observed_at":"2026-06-27T03:30:26.970938Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-01T13:10:37.718031Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22716","last_updated":"2026-07-21T15:52:30Z","snapshot_observed_at":"2026-08-06T12:10:57.542923Z","submitted_at":"2026-07-21T15:52:30Z","title":"Visual Token Compression Enhances Robustness of MLLMs","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-01T13:10:37.718031Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2607.22716"},"observation_digest":"sha256:b32217ee4025cb4e8753343775c5ab7bce94f1162796c2b640b912e8284bfc8e","observation_id":"e2fbc2da-a71e-4a66-933c-d61fc06f346f","resolution":{"observed_at":"2026-08-01T13:10:37.718031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-03T16:32:06.278220Z","title":"Prompt-driven llm safeguarding via directed representation optimization.arXiv preprint arXiv:2401.18018, 3,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-07T09:55:43.436622Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:06.278220Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:12f646e5e4d778cdceff678bc54abb81258e26d9fe0dc98271cba5a727da594d","observation_id":"7b1d80d9-b084-414a-9a8f-51ecc7ee23d1","resolution":{"observed_at":"2026-08-03T16:32:06.278220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.18018/citation-record","integrity":"/paper/2401.18018/integrity","json":"/paper/2401.18018/citation-record.json","paper":"/paper/2401.18018"},"outbound":[],"paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2401.18018."}