{"as_of":"2026-08-14T20:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4db358fd5f6acbbeb1c1909c8475c40debf7de18d8b559e679c89eea833fb43f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:13:57.190980Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T20:58:25.807935Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-13T16:27:38.909701Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":"2402.09283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attacks, defenses and evaluations for llm conversation safety: A survey","venue":null,"work_id":"5156efe7-fff9-4498-ab27-c7506f4cbdc6","year":2024},"citing_paper":{"arxiv_id":"2404.13501","last_updated":"2024-04-21T01:49:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-21T01:49:46Z","title":"A Survey on the Memory Mechanism of Large Language Model based Agents","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-15T07:21:39.440092Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2404.13501"},"observation_digest":"sha256:867abaad1c3bfffcc06c62e61ab1dc121e44aa53f4f362941f1bc3ac317bc7ff","observation_id":"58198bde-1ee4-4db5-8467-a76cbf49d036","resolution":{"observed_at":"2026-05-15T07:21:39.904669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-13T16:27:38.909701Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":"2402.09283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attacks, defenses and evaluations for llm conversation safety: A survey","venue":null,"work_id":"5156efe7-fff9-4498-ab27-c7506f4cbdc6","year":2024},"citing_paper":{"arxiv_id":"2409.18169","last_updated":"2026-04-23T18:48:49Z","snapshot_observed_at":"2026-08-14T15:55:00.676298Z","submitted_at":"2024-09-26T17:55:22Z","title":"Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey","version":6},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-23T20:58:16.237327Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2409.18169"},"observation_digest":"sha256:36302bdd1f74b21f7072f7f967840384ad860d921810bd6f33ce9e9c53bce0a8","observation_id":"4ff44bce-84ff-434f-934f-191c6a17673d","resolution":{"observed_at":"2026-05-23T20:58:25.814451Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-13T16:27:38.909701Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-08-12T20:13:57.190980Z","title":"Attacks, defenses and evaluations for llm conversation safety: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-12T20:06:41.245137Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.190980Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:b2165b274fb0aa5f590c8f0acf2b9646d58fff57edf9f6b66c00b465dfd93722","observation_id":"2b4d91b7-1791-4e0c-8b0f-a307743f6348","resolution":{"observed_at":"2026-08-12T20:13:57.190980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-13T16:27:38.909701Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-08-11T20:13:07.138295Z","title":"Attacks, defenses and evaluations for llm conversation safety: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14186","last_updated":"2024-12-22T08:52:15Z","snapshot_observed_at":"2026-08-13T06:20:56.614613Z","submitted_at":"2024-12-08T14:14:16Z","title":"Towards AI-$45^{\\circ}$ Law: A Roadmap to Trustworthy AGI","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T20:13:07.138295Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2412.14186"},"observation_digest":"sha256:cd2b13304139033e3acfc66114c9b1053ee2b06ba524f26806ae203dcf0d2775","observation_id":"96721cf1-8b99-466c-9273-56eeb7809bef","resolution":{"observed_at":"2026-08-11T20:13:07.138295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-13T16:27:38.909701Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-08-10T23:40:38.782601Z","title":"Attacks, defenses and evaluations for llm conversation safety: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00055","last_updated":"2024-12-28T07:48:57Z","snapshot_observed_at":"2026-08-14T04:31:42.253785Z","submitted_at":"2024-12-28T07:48:57Z","title":"LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:40:38.782601Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2501.00055"},"observation_digest":"sha256:d6ca81eda9c9e1746a38da07ad1ecf6196614cc3985154dc473eb2dbafa70f3b","observation_id":"11287278-d19c-42aa-bd9b-95cd6ddf99d9","resolution":{"observed_at":"2026-08-10T23:40:38.782601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-13T16:27:38.909701Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-08-10T20:35:52.755719Z","title":"Attacks, defenses and evaluations for llm conversation safety: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07959","last_updated":"2025-02-01T09:30:34Z","snapshot_observed_at":"2026-08-13T01:25:02.967809Z","submitted_at":"2025-01-14T09:23:30Z","title":"Self-Instruct Few-Shot Jailbreaking: Decompose the Attack into Pattern and Behavior Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:52.755719Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2501.07959"},"observation_digest":"sha256:624ce108e088638064a67f20f2780b4674982ec4579d61bf4845ae20ee3e3f91","observation_id":"7a878be1-1938-426c-8f49-4cc7ed5d7ebb","resolution":{"observed_at":"2026-08-10T20:35:52.755719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-13T16:27:38.909701Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-08-09T16:18:40.719150Z","title":"Attacks, defenses and evaluations for llm conversation safety: A survey, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-13T01:59:36.614054Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.719150Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:47db1fbbdc48a1b72d985937b6bf546af01fceb75249959148d31a458457333b","observation_id":"92d87873-ae93-4ffb-9f2c-8da28b49f108","resolution":{"observed_at":"2026-08-09T16:18:40.719150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-13T16:27:38.909701Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-08-08T12:17:55.180732Z","title":"Attacks, defenses and evaluations for llm conversation safety: A survey.arXiv preprint arXiv:2402.09283, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07577","last_updated":"2025-06-09T17:49:46Z","snapshot_observed_at":"2026-08-08T12:13:06.365821Z","submitted_at":"2025-02-11T14:23:13Z","title":"Automated Capability Discovery via Foundation Model Self-Exploration","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T12:17:55.180732Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2502.07577"},"observation_digest":"sha256:ab16ead39e1fd7c09a44a5954fcbde9ff114b6d3da21358cb65b3462dd80d986","observation_id":"6326dc9e-6c85-48be-9f1c-f5a4f72e2522","resolution":{"observed_at":"2026-08-08T12:17:55.180732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-13T16:27:38.909701Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-08-07T11:27:47.195714Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02442","last_updated":"2025-06-04T05:56:40Z","snapshot_observed_at":"2026-08-14T01:20:47.175723Z","submitted_at":"2025-06-03T05:00:12Z","title":"Should LLM Safety Be More Than Refusing Harmful Instructions?","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:27:47.195714Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2506.02442"},"observation_digest":"sha256:31ca1b0e8476286fff856971eacdbcc91c4e1e027ff7704995a539bbb5c0e560","observation_id":"5ca62124-816a-4f1f-9737-e4b7ec72e693","resolution":{"observed_at":"2026-08-07T11:27:47.195714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-13T16:27:38.909701Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-08-07T10:17:26.628023Z","title":"Attacks, defenses and evaluations for llm conversation safety: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-13T12:53:10.459412Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.628023Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:3397a92b58ecc63e3afe8eff9f3d865eef6c6e35a74fd71cf7b804569daab9bc","observation_id":"3c486612-93d0-40dc-85e4-27353eafd775","resolution":{"observed_at":"2026-08-07T10:17:26.628023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-13T16:27:38.909701Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-08-06T14:37:19.061499Z","title":"Attacks,defensesand evaluationsforllmconversationsafety: Asurvey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18576","last_updated":"2025-08-07T08:02:42Z","snapshot_observed_at":"2026-08-08T02:00:15.105327Z","submitted_at":"2025-07-24T16:49:19Z","title":"SafeWork-R1: Coevolving Safety and Intelligence under the AI-45$^{\\circ}$ Law","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:37:19.061499Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2507.18576"},"observation_digest":"sha256:8444b92fffbb8224dc7f600f14c9b1c584127dd4ba5e7fc15aac979c60b6cba9","observation_id":"1786d7bb-51c9-4630-aa93-52ef0bd1c9b1","resolution":{"observed_at":"2026-08-06T14:37:19.061499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-13T16:27:38.909701Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-08-05T20:31:45.301706Z","title":"Attacks, defenses and evaluations for llm conversation safety: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10404","last_updated":"2025-08-14T07:12:44Z","snapshot_observed_at":"2026-08-14T12:49:41.668100Z","submitted_at":"2025-08-14T07:12:44Z","title":"Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation","version":1},"reference_index":136,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.301706Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2508.10404"},"observation_digest":"sha256:cbeaa36bedc792760ced60a001b37c419e1197d3056b8f9760c7504d3f2f9e2e","observation_id":"30cfdb8e-44c4-4999-8133-323b19a8d475","resolution":{"observed_at":"2026-08-05T20:31:45.301706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-13T16:27:38.909701Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-08-05T14:22:34.913851Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21417","last_updated":"2025-08-29T08:38:58Z","snapshot_observed_at":"2026-08-08T11:01:31.511538Z","submitted_at":"2025-08-29T08:38:58Z","title":"An Empirical Study of Vulnerable Package Dependencies in LLM Repositories","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.913851Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2508.21417"},"observation_digest":"sha256:c0c4bae1370b9a5b355929e25d7ab97ba54eba90753e98dc72169ba1a297f50b","observation_id":"ddf34a5f-a9c9-4178-a38c-74dfd1bdc6f8","resolution":{"observed_at":"2026-08-05T14:22:34.913851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-13T16:27:38.909701Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-08-04T23:09:41.432374Z","title":"Attacks, defenses and evaluations for llm conversation safety: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.432374Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:aa438331feb20a69faaf84d62360a5ae2bfd22e4b9e4e4659bfcdf1edf6451d7","observation_id":"403519d2-2a8b-4bc2-8ae3-e9693caa9657","resolution":{"observed_at":"2026-08-04T23:09:41.432374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-13T16:27:38.909701Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-08-04T19:55:56.468210Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08997","last_updated":"2025-09-10T20:47:56Z","snapshot_observed_at":"2026-08-08T06:23:27.336190Z","submitted_at":"2025-09-10T20:47:56Z","title":"YouthSafe: A Youth-Centric Safety Benchmark and Safeguard Model for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:56.468210Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2509.08997"},"observation_digest":"sha256:8d8c8bf63a22d8e1061705b4e251cb5b50e893ce8c12a64909248d7b02f1e90d","observation_id":"f00d6933-57f9-4176-918c-24f41037209a","resolution":{"observed_at":"2026-08-04T19:55:56.468210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-13T16:27:38.909701Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":"2402.09283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attacks, defenses and evaluations for llm conversation safety: A survey","venue":null,"work_id":"5156efe7-fff9-4498-ab27-c7506f4cbdc6","year":2024},"citing_paper":{"arxiv_id":"2604.02359","last_updated":"2026-03-20T04:31:03Z","snapshot_observed_at":"2026-08-13T20:39:38.275039Z","submitted_at":"2026-03-20T04:31:03Z","title":"Using LLM-as-a-Judge/Jury to Advance Scalable, Clinically-Validated Safety Evaluations of Model Responses to Users Demonstrating Psychosis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T09:06:33.531027Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2604.02359"},"observation_digest":"sha256:8557a79af33b35aa33ba6042598b724ef1dca394b5d9f7cdbe9577c6e6ad96ac","observation_id":"089a587c-4ee2-47b9-9733-67c3c23f0217","resolution":{"observed_at":"2026-05-15T09:09:53.363837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-13T16:27:38.909701Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":"2402.09283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attacks, defenses and evaluations for llm conversation safety: A survey","venue":null,"work_id":"5156efe7-fff9-4498-ab27-c7506f4cbdc6","year":2024},"citing_paper":{"arxiv_id":"2605.20654","last_updated":"2026-06-03T08:00:52Z","snapshot_observed_at":"2026-08-02T18:56:31.274465Z","submitted_at":"2026-05-20T03:16:15Z","title":"REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-21T06:16:01.040236Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2605.20654"},"observation_digest":"sha256:9cdb6cf409e12044e5cf7abf74263580ff868b860879e7367c187bad1f704e16","observation_id":"c0c202ab-1e91-4d16-9f97-028daa4a0a44","resolution":{"observed_at":"2026-05-21T06:19:41.943495Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-13T16:27:38.909701Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":"2402.09283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attacks, defenses and evaluations for llm conversation safety: A survey","venue":null,"work_id":"5156efe7-fff9-4498-ab27-c7506f4cbdc6","year":2024},"citing_paper":{"arxiv_id":"2605.20759","last_updated":"2026-05-20T05:59:54Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:59:54Z","title":"Rethinking Fraud Safety Evaluation: Multi-Round Attacks Reveal Safety-Utility Tradeoffs in Graph-Context LLM Defenders","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T04:33:04.629491Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2605.20759"},"observation_digest":"sha256:f7a77c0521bfac98171293d103da41f3a966d3053806a795213258e245b6ce44","observation_id":"f44e2550-66fe-4be8-bce1-a6ddf263678f","resolution":{"observed_at":"2026-05-21T04:33:57.779596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2402.09283/citation-record","integrity":"/paper/2402.09283/integrity","json":"/paper/2402.09283/citation-record.json","paper":"/paper/2402.09283"},"outbound":[],"paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T16:27:38.909701Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2402.09283."}