{"as_of":"2026-08-08T19:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a18f8be806fecfa5968d26c8a4eb18f5a40bb45a1ab293ac581be3836761a775","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T05:45:45.089748Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T11:26:55.810822Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"cited_work":{"arxiv_id":"2602.02600","doi":"10.48550/arxiv.2602.02600","metadata_source":"arxiv_reference","pith_arxiv_id":"2602.02600","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2026 , journal =","venue":"Open MIND","work_id":"1bf172df-7f75-496d-932c-3b58d7703324","year":2026},"citing_paper":{"arxiv_id":"2605.12522","last_updated":"2026-04-04T17:30:35Z","snapshot_observed_at":"2026-08-02T09:51:20.420159Z","submitted_at":"2026-04-04T17:30:35Z","title":"Differences in Text Generated by Diffusion and Autoregressive Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T20:59:06.804446Z"},"links":{"cited_paper":"/paper/2602.02600","citing_paper":"/paper/2605.12522"},"observation_digest":"sha256:2f1d2a31a4c184b75630e9a0b3bcda1af3b75ba32a01cbf2d6ceddeb1c098f0f","observation_id":"7bf662f9-f996-4d98-88ef-0c3e7c16450f","resolution":{"observed_at":"2026-06-08T02:04:45.785996Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-20T21:55:05.733745+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T21:55:05.733745+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"cited_work":{"arxiv_id":"2602.02600","doi":"10.48550/arxiv.2602.02600","metadata_source":"arxiv_reference","pith_arxiv_id":"2602.02600","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2026 , journal =","venue":"Open MIND","work_id":"1bf172df-7f75-496d-932c-3b58d7703324","year":2026},"citing_paper":{"arxiv_id":"2605.18719","last_updated":"2026-05-18T17:50:04Z","snapshot_observed_at":"2026-08-03T04:40:08.919496Z","submitted_at":"2026-05-18T17:50:04Z","title":"SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training","version":1},"reference_index":133,"source":"arxiv_source","source_observed_at":"2026-05-20T11:26:55.810822Z"},"links":{"cited_paper":"/paper/2602.02600","citing_paper":"/paper/2605.18719"},"observation_digest":"sha256:c200545a2436082e93f83d134ae7f5f94101a1d9d7aeaa082be8f436e90b2e44","observation_id":"e245d122-1e7f-4868-8adf-2c7c0c89f951","resolution":{"observed_at":"2026-06-08T02:04:45.785996Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-20T21:55:05.733745+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T21:55:05.733745+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.02600/citation-record","integrity":"/paper/2602.02600/integrity","json":"/paper/2602.02600/citation-record.json","paper":"/paper/2602.02600"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T05:45:41.616691Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:41.616691Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:eac761bec84b350b0186a4aa214993dac0c4255453c09df44b25b735b5b2da16","observation_id":"0af9e6f5-b904-439c-927d-71c7ec52a5a9","resolution":{"observed_at":"2026-08-03T05:45:41.616691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-08-08T01:18:53.200448Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-08-03T05:45:41.783523Z","title":"Jail- breaking leading safety-aligned llms with simple adaptive attacks.arXiv preprint arXiv:2404.02151,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:41.783523Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:211a7f055b96c9e045c1eea8fdfd97cc51088db046e58686bcbcf66b53c14150","observation_id":"f79f4f1f-4dd5-43bb-b67b-d8c4f1cf3c08","resolution":{"observed_at":"2026-08-03T05:45:41.783523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.00512","last_updated":"2019-09-02T01:51:46Z","snapshot_observed_at":"2026-07-06T08:18:18.838990Z","submitted_at":"2019-09-02T01:51:46Z","title":"How Contextual are Contextualized Word Representations? Comparing the Geometry of BERT, ELMo, and GPT-2 Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.00512","snapshot_observed_at":"2026-08-03T05:45:41.989458Z","title":"How contextual are contextualized word representations? comparing the geometry of bert, elmo, and gpt-2 embeddings.arXiv preprint arXiv:1909.00512,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:41.989458Z"},"links":{"cited_paper":"/paper/1909.00512","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:b75215b04abe1831cc1a68cfc08c67008cc0a83991849aeee6a7cf6116cf2e77","observation_id":"cef9de61-027f-4f8d-8796-dad0bd30655f","resolution":{"observed_at":"2026-08-03T05:45:41.989458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-03T05:45:42.088173Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conversations.arXiv preprint arXiv:2312.06674,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:42.088173Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:0f94adf2d6239935eb6e3ab0d8047faee0aa1f3bce8172f74a24e0892e31fedf","observation_id":"8bde1605-6053-4eaf-a72f-0bfe42687318","resolution":{"observed_at":"2026-08-03T05:45:42.088173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:45:42.151015Z","title":"A2d: Any-order, any-step safety align- ment for diffusion language models.arXiv preprint arXiv:2509.23286,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:42.151015Z"},"links":{"citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:452d91da6822f8a4ac0f4e437b4a33dfe9196485e5a6db8b28f1ffef4e4eb9b8","observation_id":"645a920c-ee84-45a8-8165-a35bf813f178","resolution":{"observed_at":"2026-08-03T05:45:42.151015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:45:42.207501Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:42.207501Z"},"links":{"citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:768fa0a1fc6e68e61b5fd2ef5464b608c0f20b22d8bfd7cc94e227f7adbb5131","observation_id":"d91a8e40-f89f-4d19-b118-a621952607ab","resolution":{"observed_at":"2026-08-03T05:45:42.207501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:45:44.663357Z","title":"Refusal Suppression.Refusal Suppression is implemented following the prompt-based method introduced in (Wei et al., 2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:44.663357Z"},"links":{"citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:bd416a2005c13ad1a10f949a8b640ba34b8906e48401bda8561d051a8c43766a","observation_id":"4aa0717e-6e43-4b42-b623-f08cf4a9df94","resolution":{"observed_at":"2026-08-03T05:45:44.663357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09755","last_updated":"2026-06-02T09:20:34Z","snapshot_observed_at":"2026-08-07T20:33:01.836421Z","submitted_at":"2025-02-13T20:25:40Z","title":"Jailbreak Attack Initializations as Extractors of Compliance Directions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09755","snapshot_observed_at":"2026-08-03T05:45:42.429452Z","title":"Jailbreak attack initializations as extractors of compliance directions.arXiv preprint arXiv:2502.09755,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:42.429452Z"},"links":{"cited_paper":"/paper/2502.09755","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:2729fe3c6e68bf6bd37031536a8beeb6240fb5b0bc8100399825b8b2ffa02a0d","observation_id":"c45463bd-11a8-4de5-9d58-d0d0eef889d6","resolution":{"observed_at":"2026-08-03T05:45:42.429452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02832","last_updated":"2026-05-15T07:55:39Z","snapshot_observed_at":"2026-07-06T19:27:16.301809Z","submitted_at":"2024-10-02T08:41:23Z","title":"FlipAttack: Jailbreak LLMs via Flipping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02832","snapshot_observed_at":"2026-08-03T05:45:42.577745Z","title":"Flipattack: Jailbreak llms via flipping.arXiv preprint arXiv:2410.02832,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:42.577745Z"},"links":{"cited_paper":"/paper/2410.02832","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:d945d323d13409ffbe6f9ec8eebc33c8d5864c014e42fcb7caaec77aa1525500","observation_id":"2ef57400-6880-4f34-bb57-99551e0497a3","resolution":{"observed_at":"2026-08-03T05:45:42.577745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-03T05:45:42.702775Z","title":"Harm- bench: A standardized evaluation framework for auto- mated red teaming and robust refusal.arXiv preprint arXiv:2402.04249,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:42.702775Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:e2e16f8950eae133bc8182903662ca921c9ddc8ab64a73a20bd51d40b86f29a5","observation_id":"0f9c8323-108f-4d09-802f-9e189777ab62","resolution":{"observed_at":"2026-08-03T05:45:42.702775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-03T05:45:42.780302Z","title":"Large language diffusion models.arXiv preprint arXiv:2502.09992,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:42.780302Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:be30f57063d23313f0d09c1f1b7ff376d7f0ad203bee178d73e23bdb181ccb29","observation_id":"79833021-1f3f-4cad-8c93-f07497e42aa3","resolution":{"observed_at":"2026-08-03T05:45:42.780302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07308","last_updated":"2024-05-02T14:28:39Z","snapshot_observed_at":"2026-08-01T14:42:09.926151Z","submitted_at":"2023-08-14T17:54:10Z","title":"LLM Self Defense: By Self Examination, LLMs Know They Are Being Tricked","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07308","snapshot_observed_at":"2026-08-03T05:45:42.882537Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:42.882537Z"},"links":{"cited_paper":"/paper/2308.07308","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:1b81b8bef717ddfcc03e861fa34bd68db0fda2cdf33bbb2a84890a30a207adc2","observation_id":"8270372a-f80b-497a-b771-f6f76a872fa9","resolution":{"observed_at":"2026-08-03T05:45:42.882537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17686","last_updated":"2024-12-23T16:11:27Z","snapshot_observed_at":"2026-07-06T20:12:13.548098Z","submitted_at":"2024-12-23T16:11:27Z","title":"Large Language Model Safety: A Holistic Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17686","snapshot_observed_at":"2026-08-03T05:45:43.008497Z","title":"Large lan- guage model safety: A holistic survey.arXiv preprint arXiv:2412.17686,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:43.008497Z"},"links":{"cited_paper":"/paper/2412.17686","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:e76dcec08c9667f0e5fad156c2b7916bec3d9d99212d339a7262f3269b35a128","observation_id":"f5353b55-d912-427a-a9e8-f0f2abcc47dd","resolution":{"observed_at":"2026-08-03T05:45:43.008497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-03T05:45:43.091156Z","title":"S., Love, J., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:43.091156Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:0446c595eb593d4a4a647d53f2325a0e4cddcc9c977902b747eab6d8d0ee4f55","observation_id":"fd1bd27b-07a2-4db1-bf4e-b921ce2f7fe8","resolution":{"observed_at":"2026-08-03T05:45:43.091156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.05950","last_updated":"2019-08-09T15:51:47Z","snapshot_observed_at":"2026-07-06T07:53:03.268985Z","submitted_at":"2019-05-15T05:47:23Z","title":"BERT Rediscovers the Classical NLP Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.05950","snapshot_observed_at":"2026-08-03T05:45:43.168094Z","title":"Bert rediscovers the classical nlp pipeline.arXiv preprint arXiv:1905.05950,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:43.168094Z"},"links":{"cited_paper":"/paper/1905.05950","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:5cd63b0b7d4d2ce3035e72d08ceb0d4cd100dd4fa470d5b29f86aac03917b4b9","observation_id":"38181c6c-e721-4a81-8377-6ddca49e4aac","resolution":{"observed_at":"2026-08-03T05:45:43.168094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:45:43.286735Z","title":"The devil behind the mask: An emergent safety vulnerability of diffusion llms.arXiv preprint arXiv:2507.11097,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:43.286735Z"},"links":{"citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:723eff8bcc1765de4ccc13b406084577c3e81ecb6892dba297e3219bba9aa984","observation_id":"659cb4a2-6c44-4335-999b-26af90ba3d57","resolution":{"observed_at":"2026-08-03T05:45:43.286735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:45:43.334338Z","title":"The geometry of refusal in large language models: Concept cones and representa- tional independence.arXiv preprint arXiv:2502.17420,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:43.334338Z"},"links":{"citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:87fd5a9f129303833434ebeafbce2dc44bd3af75112cfb5ed2da4bb593660b02","observation_id":"4623871c-c93f-49f9-a08b-3449b3bd9c6b","resolution":{"observed_at":"2026-08-03T05:45:43.334338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12567","last_updated":"2025-05-18T22:55:16Z","snapshot_observed_at":"2026-08-07T15:43:35.656611Z","submitted_at":"2025-05-18T22:55:16Z","title":"A Survey of Attacks on Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12567","snapshot_observed_at":"2026-08-03T05:45:43.424556Z","title":"and Parhi, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:43.424556Z"},"links":{"cited_paper":"/paper/2505.12567","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:753c9441a3e8509eaf8cd77579e57c0b51afe69bea8e58915cbcd540e3cd67c4","observation_id":"b3b4624a-5506-431b-8382-3254edd8199a","resolution":{"observed_at":"2026-08-03T05:45:43.424556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-07-31T01:49:29.562668Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-03T05:45:43.533522Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:43.533522Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:97b9bc4f6324d93fe353016a8242a6de8b4cc5177160e9430a535954c5e7099f","observation_id":"4ec446d6-0ff9-4998-95de-1f29e5e44e6d","resolution":{"observed_at":"2026-08-03T05:45:43.533522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15487","last_updated":"2025-08-21T12:09:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-21T12:09:58Z","title":"Dream 7B: Diffusion Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15487","snapshot_observed_at":"2026-08-03T05:45:43.602807Z","title":"Dream 7b: Diffusion large language models.arXiv preprint arXiv:2508.15487,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:43.602807Z"},"links":{"cited_paper":"/paper/2508.15487","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:3c4c20fd990675a91c7e92659c7128486981962c3c409622e085d45113a343d0","observation_id":"bd6f25c0-3a76-4335-aa7f-b6ce870c33cf","resolution":{"observed_at":"2026-08-03T05:45:43.602807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:45:43.714527Z","title":"Discrete diffusion in large lan- guage and multimodal models: A survey.arXiv preprint arXiv:2506.13759,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:43.714527Z"},"links":{"citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:2ce45b8909e91ff90fc6216a35a91c2de5b095ca4ebfa68526619d17f76ca1ad","observation_id":"777b2d59-949d-4018-9c6a-eaf9c7c97545","resolution":{"observed_at":"2026-08-03T05:45:43.714527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19227","last_updated":"2025-07-25T12:53:03Z","snapshot_observed_at":"2026-08-08T12:10:35.474612Z","submitted_at":"2025-07-25T12:53:03Z","title":"Jailbreaking Large Language Diffusion Models: Revealing Hidden Safety Flaws in Diffusion-Based Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19227","snapshot_observed_at":"2026-08-03T05:45:43.832756Z","title":"Jailbreaking large language diffusion mod- els: Revealing hidden safety flaws in diffusion-based text generation.arXiv preprint arXiv:2507.19227,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:43.832756Z"},"links":{"cited_paper":"/paper/2507.19227","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:8193eb7f1af838655d1282a247a06d752a353b3f938e02dc768aa2ad9b65958b","observation_id":"89253ad6-01f5-4fbe-89ac-e287371ac473","resolution":{"observed_at":"2026-08-03T05:45:43.832756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-03T05:45:43.930775Z","title":"X., Zhou, K., Li, J., Tang, T., Wang, X., Hou, Y ., Min, Y ., Zhang, B., Zhang, J., Dong, Z., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:43.930775Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:14684f3442f834a6049b43f042d556c599491e46d6092450930591bd55b78964","observation_id":"6e3c96fc-248a-4283-9bd5-e37970a29c02","resolution":{"observed_at":"2026-08-03T05:45:43.930775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19223","last_updated":"2025-10-12T15:42:47Z","snapshot_observed_at":"2026-07-06T21:30:09.658226Z","submitted_at":"2025-05-25T16:36:20Z","title":"LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19223","snapshot_observed_at":"2026-08-03T05:45:44.043197Z","title":"Don’t say no: Jailbreaking llm by suppressing re- fusal","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:44.043197Z"},"links":{"cited_paper":"/paper/2505.19223","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:35a6caf947e7acf9053512ac4c3153d2af7ec51cf516396cc3afe1c518c87fbd","observation_id":"e107358e-4f46-4aef-a539-16469f26a025","resolution":{"observed_at":"2026-08-03T05:45:44.043197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-03T05:45:44.104063Z","title":"Z., and Fredrikson, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:44.104063Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:8d32955ee176c61737640bee94d899cdc914acd6dd355eba368b8d430e233177","observation_id":"080d095d-ce43-4f94-abba-3ec258137151","resolution":{"observed_at":"2026-08-03T05:45:44.104063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:45:44.215298Z","title":"In setups with active defenses, any prompt or response blocked by a defense is also counted toward the Refusal Rate","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:44.215298Z"},"links":{"citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:61ed3610b732afa0a2ea59cd624fa7a9be4edb37fd9b6c1e4d54d1abc9e00228","observation_id":"b124f1db-3f47-4ee5-a44f-0a6bd0bffd4c","resolution":{"observed_at":"2026-08-03T05:45:44.215298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:45:44.364746Z","title":"True\" if it is answering or","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:44.364746Z"},"links":{"citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:045ceaf75d31bcbc55107776430e16e3771838b7cfffc036a4a5222acda8a7ca","observation_id":"99a4289c-9bf2-436d-97f3-dc8b23408f56","resolution":{"observed_at":"2026-08-03T05:45:44.364746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:45:44.522702Z","title":"Text: {response} Answer: Figure 8.Judge prompt used to evaluate whether a model response contains harmful information","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:44.522702Z"},"links":{"citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:489077765ed16153e6e38e5db0e1ef8766445804251dbd04607636711fbcd403","observation_id":"bd0d541b-b0c9-4ff6-b18d-c10906c6dd90","resolution":{"observed_at":"2026-08-03T05:45:44.522702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:45:44.789698Z","title":"We use a subset of 100 PAIR-generated jailbreak prompts provided in the repository","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:44.789698Z"},"links":{"citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:0dcc5e80768c4dab58dd9c0ee5f18b0a7da68c852a33f496dd124281954dbc3f","observation_id":"33bdee98-4d52-4f47-912f-00cb694bc98c","resolution":{"observed_at":"2026-08-03T05:45:44.789698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:45:44.896303Z","title":"We use a subset of 100 Random Search jailbreak prompts for evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:44.896303Z"},"links":{"citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:27e332b854e9a3c21b514ccb88338cd2d37e96a7594beb56237b200e8902d3cd","observation_id":"c26b6b94-e78e-47a5-8aef-4fad5fec848d","resolution":{"observed_at":"2026-08-03T05:45:44.896303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:45:45.026784Z","title":"For each response, we compute the average per-token negative log-likelihood under GPT-2 and reject outputs whose perplexity exceeds a fixed threshold","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:45.026784Z"},"links":{"citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:236e076857228e1adc256f927b93f236af757f5aa3c93b9f1670a234ab3204f0","observation_id":"04a391ec-90cb-412f-9616-00c55a0a6440","resolution":{"observed_at":"2026-08-03T05:45:45.026784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:45:45.089748Z","title":"<|begin_of_text|> [INST] Task: Check if the following content is safe or unsafe","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:45.089748Z"},"links":{"citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:973d4ca405ac9d67a22c7f2995322464ad42b9dec84344adf6e45c12ebc2e636","observation_id":"d57c5549-f954-430d-9660-83838cb14afc","resolution":{"observed_at":"2026-08-03T05:45:45.089748Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-07T10:19:08.286287Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05451","snapshot_observed_at":"2026-08-03T05:45:42.313410Z","title":"Lee, S., Cho, A., Kim, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":2000,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:42.313410Z"},"links":{"cited_paper":"/paper/2506.05451","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:9fc6ad5af9819c55879a1d408df479e0d927a2d7b3f367bd19c765dc518d9715","observation_id":"c0ba13cc-7577-4cd3-9ca2-2dfa84908394","resolution":{"observed_at":"2026-08-03T05:45:42.313410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-03T05:45:42.950747Z","title":"and Gurevych, I","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:42.950747Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:4e562a2bc6cdd0688dfb5326afb4abe9afb1f2a009cbb482710f29b6aa9c51fb","observation_id":"d40a9abd-ada4-4e57-acef-072fcfbb3a7a","resolution":{"observed_at":"2026-08-03T05:45:42.950747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:45:42.491993Z","title":"Diffuguard: How in- trinsic safety is lost and found in diffusion large language models.arXiv preprint arXiv:2509.24296,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:42.491993Z"},"links":{"citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:225cca73f715a58f0690484ed49304f93ed2640dc7cc6370523cf25896d28fbd","observation_id":"caaa3fb1-b72d-4031-b394-2af6d2856717","resolution":{"observed_at":"2026-08-03T05:45:42.491993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14132","last_updated":"2023-11-07T03:30:15Z","snapshot_observed_at":"2026-07-06T16:10:54.723336Z","submitted_at":"2023-08-27T15:20:06Z","title":"Detecting Language Model Attacks with Perplexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14132","snapshot_observed_at":"2026-08-03T05:45:41.660950Z","title":"and Kamfonas, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:41.660950Z"},"links":{"cited_paper":"/paper/2308.14132","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:124b3b33035556fa0e2d19e2a5a1077c7092434a1a5963f7ccc84593058241b2","observation_id":"fe89cb34-533d-47c8-9e36-339b16167c22","resolution":{"observed_at":"2026-08-03T05:45:41.660950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-03T05:45:41.842845Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:41.842845Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:138a694e8996a9a3cab883bb54b5206147d59174db9fc7785b15eed94b441f30","observation_id":"76555a29-24b3-4b02-9b3a-4a097edaea0c","resolution":{"observed_at":"2026-08-03T05:45:41.842845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:45:41.899498Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:41.899498Z"},"links":{"citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:26b5623bb67aa7065bbd398d2c52a47e7f8d7d028c1eb54585c927bf2a90c084","observation_id":"1e4310c0-1c9b-4c52-9dbf-ef67e2c47430","resolution":{"observed_at":"2026-08-03T05:45:41.899498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T05:45:40.908563Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 2 inbound Pith citation observations for arXiv:2602.02600."}