{"as_of":"2026-08-07T15:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:62215b2b3bf9a5d6106f8d919e085185325afb0f72fcf1e49bddc43333ec20fd","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":81,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:43:01.890905Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-03T09:39:14.242702Z","title":"the safest bet,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13300","last_updated":"2026-06-25T15:25:41Z","snapshot_observed_at":"2026-08-06T23:35:40.692537Z","submitted_at":"2026-01-19T18:56:08Z","title":"OI-Bench: An Option Injection Benchmark for Evaluating LLM Susceptibility to Directive Interference","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T09:39:14.242702Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2601.13300"},"observation_digest":"sha256:19e8292d4e17b3be690c7140656f96783c6873c4f85fceeacc7de39742df22a5","observation_id":"a2ee35e7-4f83-48c8-ba17-2020e2e83b0e","resolution":{"observed_at":"2026-08-03T09:39:14.242702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-03T05:10:16.641500Z","title":"Qwen3guard technical report.arXiv preprint arXiv:2510.14276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03224","last_updated":"2026-06-06T09:48:09Z","snapshot_observed_at":"2026-08-06T23:53:57.800987Z","submitted_at":"2026-02-03T07:52:26Z","title":"TAME: A Trustworthy Test-Time Evolution of Agent Memory with Systematic Benchmarking","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T05:10:16.641500Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2602.03224"},"observation_digest":"sha256:d32c6ae4d6231cf861aa52345802caeb621bd00b0da01beea9cfd2ebc3564b75","observation_id":"3cf92171-df0c-43c1-af28-a441cfe0d64b","resolution":{"observed_at":"2026-08-03T05:10:16.641500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2602.07954","last_updated":"2026-04-20T08:43:04Z","snapshot_observed_at":"2026-08-02T08:21:58.639356Z","submitted_at":"2026-02-08T12:57:04Z","title":"Bielik Guard: Efficient Polish Language Safety Classifiers for LLM Content Moderation","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T06:07:23.060966Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2602.07954"},"observation_digest":"sha256:851ee1a3ec51df7f200c1396f00b83fd7d6a5c73e68dbb8c4f69d7c13eafa29d","observation_id":"1192903c-7a2f-4236-8f6f-d311c236161e","resolution":{"observed_at":"2026-05-16T06:07:25.534823Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-03T01:22:20.614946Z","title":"B” in “Bigger","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.10179","last_updated":"2026-06-26T07:21:53Z","snapshot_observed_at":"2026-08-07T01:08:46.321729Z","submitted_at":"2026-02-10T18:59:55Z","title":"When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T01:22:20.614946Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2602.10179"},"observation_digest":"sha256:a8e2ba9bb41f8003c124ef6a3c939b85afa041e88d5d39cd2fcca076f815ecbd","observation_id":"ac3f4e19-64f3-49b7-ba25-df2614565de2","resolution":{"observed_at":"2026-08-03T01:22:20.614946Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-02T23:32:42.145394Z","title":"for educational purposes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.13562","last_updated":"2026-06-29T01:49:38Z","snapshot_observed_at":"2026-08-05T00:49:41.773901Z","submitted_at":"2026-02-14T02:37:36Z","title":"Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T23:32:42.145394Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2602.13562"},"observation_digest":"sha256:09dfcaa71464a8e78c10e33511a298f11aceeb5aa251d902d8ee9d23a33b12c8","observation_id":"ef62d42f-acf5-4d33-a413-8fccf9ef0315","resolution":{"observed_at":"2026-08-02T23:32:42.145394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2602.17283","last_updated":"2026-05-10T08:12:01Z","snapshot_observed_at":"2026-07-31T23:38:16.481714Z","submitted_at":"2026-02-19T11:41:34Z","title":"Towards Cross-lingual Values Judgment: A Consensus-Pluralism Perspective","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T21:17:21.852857Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2602.17283"},"observation_digest":"sha256:81067ace1fa94893291e26831007cb611668b197d953de1fe2460caab43a0fb5","observation_id":"953ff1f0-7746-4841-ad91-8df6107ca5f0","resolution":{"observed_at":"2026-05-15T21:20:18.557992Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2602.23636","last_updated":"2026-04-15T12:34:59Z","snapshot_observed_at":"2026-08-03T13:25:48.086807Z","submitted_at":"2026-02-27T03:14:19Z","title":"FlexGuard: Continuous Risk Scoring for Strictness-Adaptive LLM Content Moderation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:40.332443Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2602.23636"},"observation_digest":"sha256:ca887c5faf82a37aad98fa7b347122152e9493d58f21985f558fd586388c01e0","observation_id":"d61d6741-9d06-49bb-8e60-f052ea538963","resolution":{"observed_at":"2026-05-15T19:00:15.677990Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-02T17:39:43.471239Z","title":"Qwen3guard technical report.arXiv preprint arXiv:2510.14276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.23171","last_updated":"2026-07-29T15:06:33Z","snapshot_observed_at":"2026-08-06T12:57:45.987647Z","submitted_at":"2026-03-24T13:13:23Z","title":"Adaptively Robust LLM Monitoring via Activation Watermarking","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T17:39:43.471239Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2603.23171"},"observation_digest":"sha256:1d04254be52cc146659c9e21ee4a4418d8e85c06d0abd4caf968a309b181ff92","observation_id":"089d5599-51c5-4e85-863e-53799a233b26","resolution":{"observed_at":"2026-08-02T17:39:43.471239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2604.01444","last_updated":"2026-04-03T15:46:12Z","snapshot_observed_at":"2026-07-06T22:51:35.522923Z","submitted_at":"2026-04-01T22:38:38Z","title":"Cooking Up Risks: Benchmarking and Reducing Food Safety Risks in Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T22:02:12.555644Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2604.01444"},"observation_digest":"sha256:be5b05b363e38bf79181d25fc6af3b13eceb7ea10096a6b6ee35a0ac52aba7b3","observation_id":"77548c0f-f68b-4302-b493-eeeabb6d6ba5","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2604.02022","last_updated":"2026-05-13T10:22:49Z","snapshot_observed_at":"2026-08-03T03:33:11.193819Z","submitted_at":"2026-04-02T13:26:20Z","title":"ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-13T21:17:15.523370Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2604.02022"},"observation_digest":"sha256:8c5311fd396c0e2b1049ee92a831a4197bf325288a034609fe9ac6cd5eaa83eb","observation_id":"ee9d3177-6c38-429a-a682-9f1fc0279b8e","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2604.02022","last_updated":"2026-05-13T10:22:49Z","snapshot_observed_at":"2026-08-03T03:33:11.193819Z","submitted_at":"2026-04-02T13:26:20Z","title":"ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-14T22:02:00.638549Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2604.02022"},"observation_digest":"sha256:2e1923060d4bdda878633f61a354175a5b747153f34a3ec1c8c7ff50bb221feb","observation_id":"0100edde-10da-426a-9a50-ffa15b8d4a14","resolution":{"observed_at":"2026-05-14T22:03:02.661178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2604.02947","last_updated":"2026-04-03T10:29:31Z","snapshot_observed_at":"2026-07-29T16:09:43.498926Z","submitted_at":"2026-04-03T10:29:31Z","title":"AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T19:42:53.778980Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2604.02947"},"observation_digest":"sha256:462a2b538641e5eaf832aa570fda7c3bf65e89370f8e352e545041e15ee2a41d","observation_id":"6aae269a-4fcd-4655-b67d-1b764e5a7858","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-07-13T11:43:31.089245Z","title":"org/abs/2510.14276","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.03962","last_updated":"2026-04-05T04:48:15Z","snapshot_observed_at":"2026-07-13T11:43:29.708599Z","submitted_at":"2026-04-05T04:48:15Z","title":"Predict, Don't React: Value-Based Safety Forecasting for LLM Streaming","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T11:43:31.089245Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2604.03962"},"observation_digest":"sha256:e5aee322e904a3cb3fa4465c3228acb0a83d6ba6642537778e53ab0e14fa0307","observation_id":"acb2e677-16d9-4437-bf87-1d765d248428","resolution":{"observed_at":"2026-07-13T11:43:31.089245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2604.07727","last_updated":"2026-04-09T02:22:44Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T02:22:44Z","title":"TrajGuard: Streaming Hidden-state Trajectory Detection for Decoding-time Jailbreak Defense","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-10T18:26:19.922383Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2604.07727"},"observation_digest":"sha256:701aa2a68bc49052f6147e5767ee131d1e326dc926fe7b8fa2f82356dd2d10c0","observation_id":"895d1e27-5556-4a2e-baa9-e6716d4636dc","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2604.08846","last_updated":"2026-04-10T01:01:56Z","snapshot_observed_at":"2026-08-02T14:54:38.934183Z","submitted_at":"2026-04-10T01:01:56Z","title":"Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs","version":1},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-05-10T18:04:05.157103Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2604.08846"},"observation_digest":"sha256:0e98e4e755316059c301299650db8794fc3336ced411ac40c076314ef0f15d22","observation_id":"c1b0cf5e-4bce-459e-90a4-579e2c7709b9","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2604.08881","last_updated":"2026-07-30T10:00:35Z","snapshot_observed_at":"2026-08-02T23:16:51.942005Z","submitted_at":"2026-04-10T02:42:52Z","title":"Targeted Interpretable Safety Neuron Enhancement for Multilingual Vision-Language Large Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T18:12:34.909229Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2604.08881"},"observation_digest":"sha256:7f6248acfefa33e6caca8b897d9de33d0df8b5667d4351a5a29f8f5dad80b684","observation_id":"96198d4b-94d5-4a0a-9e6d-936350d542ae","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-02T16:34:08.890416Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.08881","last_updated":"2026-07-30T10:00:35Z","snapshot_observed_at":"2026-08-02T23:16:51.942005Z","submitted_at":"2026-04-10T02:42:52Z","title":"Targeted Interpretable Safety Neuron Enhancement for Multilingual Vision-Language Large Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T16:34:08.890416Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2604.08881"},"observation_digest":"sha256:74a1237acc92c1a2423ca79f99ea34fc3eb116830c1d6907a8b2ccdff0b1da08","observation_id":"5c2330a1-1240-412a-a106-d5c8f896d5c8","resolution":{"observed_at":"2026-08-02T16:34:08.890416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2604.09750","last_updated":"2026-04-10T11:44:57Z","snapshot_observed_at":"2026-08-03T01:32:17.065525Z","submitted_at":"2026-04-10T11:44:57Z","title":"Conflicts Make Large Reasoning Models Vulnerable to Attacks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T17:24:25.255602Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2604.09750"},"observation_digest":"sha256:5853f8ab212ebbdc5c930399eb47bf1534c0e5bd5bffdc3a27f3a4ebcfb48e4e","observation_id":"59c4354f-ad08-4875-90f2-886c83a31690","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2604.12284","last_updated":"2026-04-14T04:50:35Z","snapshot_observed_at":"2026-07-06T23:00:32.607699Z","submitted_at":"2026-04-14T04:50:35Z","title":"WebAgentGuard: A Reasoning-Driven Guard Model for Detecting Prompt Injection Attacks in Web Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:12:51.787807Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2604.12284"},"observation_digest":"sha256:62a640dfa9549272f2555a3d86282cf9740097ff369e3293ccdac9ba958396f6","observation_id":"7a8df8ac-0519-4525-b995-b6cff0ada22a","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2604.12616","last_updated":"2026-04-14T11:44:59Z","snapshot_observed_at":"2026-07-06T23:00:46.620106Z","submitted_at":"2026-04-14T11:44:59Z","title":"Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T15:06:43.140580Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2604.12616"},"observation_digest":"sha256:45d951f64c78952aad58c851c1e19c558e5a4672d4a162491063e95d6cba9b8d","observation_id":"9907746f-35e6-4bc4-9247-2c87138b28bf","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2604.16542","last_updated":"2026-04-17T01:55:37Z","snapshot_observed_at":"2026-08-01T22:59:54.227625Z","submitted_at":"2026-04-17T01:55:37Z","title":"TWGuard: A Case Study of LLM Safety Guardrails for Localized Linguistic Contexts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T09:07:57.713675Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2604.16542"},"observation_digest":"sha256:4ab75666b0ca740a0286aae880005515d982bf4b9cadc62086dcbfb43f16b2bc","observation_id":"b97785af-a3bc-40ae-8253-aaa8cc275766","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2604.18519","last_updated":"2026-04-20T17:17:07Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:17:07Z","title":"LLM Safety From Within: Detecting Harmful Content with Internal Representations","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-10T04:33:54.058475Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2604.18519"},"observation_digest":"sha256:5c3b9f44c3a2c6ae837cba7578e6ccc1863ac19d265af4d969ba6b07fb379bcd","observation_id":"7f1df501-f39a-4bbc-937e-38143a422378","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2604.25716","last_updated":"2026-04-28T14:43:40Z","snapshot_observed_at":"2026-07-31T17:39:47.294991Z","submitted_at":"2026-04-28T14:43:40Z","title":"Cross-Lingual Jailbreak Detection via Semantic Codebooks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-07T16:22:33.567085Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2604.25716"},"observation_digest":"sha256:dc6373deccd4f4d539a31ae7839799eb2ed9016768408ad8f48e89a38311ef73","observation_id":"cbb5fa31-2f11-4671-951b-e95dfa0cdeb3","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:5db959804250c0880858846ffd3a6691274a812f32d5f98ee57c5ea26eb57f98","observation_id":"6ee575a7-71b0-483c-b980-ac83ad56f12c","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:2349906f7ddaaa86e06baa55adda39a64ef5b350cee61389bc3cd1bb71c1c770","observation_id":"741ebe01-1101-4823-9dcf-8eb789514f8f","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.02946","last_updated":"2026-05-01T11:54:55Z","snapshot_observed_at":"2026-07-31T02:35:59.178763Z","submitted_at":"2026-05-01T11:54:55Z","title":"RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-09T19:22:00.217729Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.02946"},"observation_digest":"sha256:3d62f2809eda6b527675fa6a0b2ee18ebf7adc68cdb3bd46fb81422306ccad69","observation_id":"c20d8a6a-bf83-46fb-a9ad-df26c85d8ea5","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.05630","last_updated":"2026-05-12T16:52:21Z","snapshot_observed_at":"2026-08-02T19:44:06.033074Z","submitted_at":"2026-05-07T03:35:31Z","title":"One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T11:17:19.079380Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.05630"},"observation_digest":"sha256:235804c5e2092ea3ba96c437216aea1e24a1da76fab3087b963e03cc56d0e2f6","observation_id":"a3e94ded-a735-4a6e-bb79-334960950d46","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.05630","last_updated":"2026-05-12T16:52:21Z","snapshot_observed_at":"2026-08-02T19:44:06.033074Z","submitted_at":"2026-05-07T03:35:31Z","title":"One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T07:53:06.928500Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.05630"},"observation_digest":"sha256:1eaeecb2ecd0bf6048f164b4d6a2ab4a7f296b5266e61ef4ad28c27475ae84e8","observation_id":"dfe079d6-5def-4232-8c0e-88f2c01d0992","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.06230","last_updated":"2026-05-08T02:31:22Z","snapshot_observed_at":"2026-08-04T18:06:27.816136Z","submitted_at":"2026-05-07T13:21:15Z","title":"Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-08T10:12:58.421050Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.06230"},"observation_digest":"sha256:0c81e566d7514d826eb46c2f9078942ee07c238cf37cfb2fe3f8e68705009aba","observation_id":"8bf3d127-5e3c-477e-85fe-4539c4873800","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.06230","last_updated":"2026-05-08T02:31:22Z","snapshot_observed_at":"2026-08-04T18:06:27.816136Z","submitted_at":"2026-05-07T13:21:15Z","title":"Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-11T00:56:48.838028Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.06230"},"observation_digest":"sha256:5d83965a3882a9b14b3fee6dde5a21a6fd70d2dca203ce108641cfe78480fb79","observation_id":"e2cba8ce-94e2-4df4-b2b4-7ed0663236e0","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.07982","last_updated":"2026-05-08T16:44:07Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T16:44:07Z","title":"GLiGuard: Schema-Conditioned Classification for LLM Safeguard","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-11T03:19:11.495230Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.07982"},"observation_digest":"sha256:9c728ab55d9b881991c57de6ba4b612c3e351c0b9561ad432ee9968b45351faf","observation_id":"a69cbbfd-bae0-439e-81a0-ceffc8106d1d","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.08878","last_updated":"2026-05-09T10:57:36Z","snapshot_observed_at":"2026-08-02T21:23:38.225682Z","submitted_at":"2026-05-09T10:57:36Z","title":"Why Do Aligned LLMs Remain Jailbreakable: Refusal-Escape Directions, Operator-Level Sources, and Safety-Utility Trade-off","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-12T01:36:41.651502Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.08878"},"observation_digest":"sha256:9e8afe6290a1e1694f4fd64c7f129ceabcaf2eddd5fc53027f4c3ba93f89846f","observation_id":"a91efb1d-f110-4ee8-98c6-6bce8c59cbdc","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.08936","last_updated":"2026-05-09T13:14:31Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:14:31Z","title":"Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T02:07:04.364417Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.08936"},"observation_digest":"sha256:cbdbfe21bfddb2cf606c6af979273742ba13a80c6492b779a417d5c57a41c059","observation_id":"21944711-f9ad-4068-b05e-38b942855f32","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.11002","last_updated":"2026-05-10T00:17:14Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T00:17:14Z","title":"MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T01:24:24.242731Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.11002"},"observation_digest":"sha256:c37833157e8ffeb9b2d641640e9adab5cd0897b69ae1aaa27c0b3ea596bb7eb2","observation_id":"f25c482f-3f03-461c-b915-41c5c9b2e414","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.11882","last_updated":"2026-05-12T09:56:28Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:56:28Z","title":"On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T06:29:32.776647Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.11882"},"observation_digest":"sha256:3a995ec20b5ddbf0eb2b6ed6bb4bb239783281362ec624cffda4678b3a5a6d2e","observation_id":"38c12b81-ec92-4a54-9533-a081addca1aa","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.16346","last_updated":"2026-05-08T03:26:55Z","snapshot_observed_at":"2026-08-02T22:55:59.683039Z","submitted_at":"2026-05-08T03:26:55Z","title":"PropGuard: Safeguarding LLM-MAS via Propagation-Aware Exploration and Remediation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T22:33:12.568495Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.16346"},"observation_digest":"sha256:16879017b4e19cb580e48b0ac8eb89a9e7f3359faa02de6528d960658d9e6fcc","observation_id":"6f7cd408-60e2-4749-a641-bda07f119b0b","resolution":{"observed_at":"2026-05-20T22:33:48.181891Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.17329","last_updated":"2026-05-17T08:35:38Z","snapshot_observed_at":"2026-08-02T18:06:42.223470Z","submitted_at":"2026-05-17T08:35:38Z","title":"LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T23:42:58.135553Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.17329"},"observation_digest":"sha256:d3657790f63a49f500bff77070bf4d66feec3e4570e1e7283e88a6a2f5b75656","observation_id":"dc84d407-2b46-47fe-9f78-5f426fb8978c","resolution":{"observed_at":"2026-05-19T23:43:17.768883Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.22321","last_updated":"2026-07-24T06:09:29Z","snapshot_observed_at":"2026-08-02T13:28:32.433657Z","submitted_at":"2026-05-21T11:07:51Z","title":"ASEval: Automated Trajectory-Level Security Testing for Autonomous Agents","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-22T05:49:21.532568Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.22321"},"observation_digest":"sha256:e876ddc8988f06bcd81a9d2dc1620e31be47297bad0c739bff13dea7fe2ee9cb","observation_id":"58d4bf75-186e-4dc1-b5a8-bbb1bd9ba4a0","resolution":{"observed_at":"2026-05-22T05:51:08.490229Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-02T13:28:38.489351Z","title":"Qwen3Guard technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.22321","last_updated":"2026-07-24T06:09:29Z","snapshot_observed_at":"2026-08-02T13:28:32.433657Z","submitted_at":"2026-05-21T11:07:51Z","title":"ASEval: Automated Trajectory-Level Security Testing for Autonomous Agents","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T13:28:38.489351Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.22321"},"observation_digest":"sha256:0d5dc2fa7b749cc65f43331b77e0ccb32e0ac4ba1aca370506898c95bb93c524","observation_id":"22cbf2ee-a3bb-487a-9f31-5a3dc50a0cab","resolution":{"observed_at":"2026-08-02T13:28:38.489351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.22373","last_updated":"2026-05-22T14:13:36Z","snapshot_observed_at":"2026-07-06T23:32:44.699825Z","submitted_at":"2026-05-21T12:05:22Z","title":"Boundary-targeted Membership Inference Attacks on Safety Classifiers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T08:06:45.896332Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.22373"},"observation_digest":"sha256:d52c9c527753b812e666ca150dc97fe7e188d7170c5d154ee2030b249401fa30","observation_id":"addcadd6-44c4-40d7-88bf-852a058f9a43","resolution":{"observed_at":"2026-05-22T08:11:17.564431Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.22373","last_updated":"2026-05-22T14:13:36Z","snapshot_observed_at":"2026-07-06T23:32:44.699825Z","submitted_at":"2026-05-21T12:05:22Z","title":"Boundary-targeted Membership Inference Attacks on Safety Classifiers","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-25T05:42:55.999769Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.22373"},"observation_digest":"sha256:4ac45e2fc082fe889366994fb999ec64c2997ba4dd2eee8850474260c710aadf","observation_id":"806d8ec1-9d40-4c23-a64f-9197ae35b049","resolution":{"observed_at":"2026-05-25T05:45:24.364866Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.23974","last_updated":"2026-05-13T14:18:29Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-13T14:18:29Z","title":"AERIC: Anticipatory Hidden-State Monitoring for Implicit Harmful Dialogue","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T21:28:25.577739Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.23974"},"observation_digest":"sha256:c98f525b523a29900afcab6ecfd8e70210b45f5a96b5cb30324c19422305aca2","observation_id":"dfa74ac4-01f4-4a8b-aea0-3baaffb1bc6a","resolution":{"observed_at":"2026-06-30T21:35:04.717507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.27489","last_updated":"2026-05-26T16:03:10Z","snapshot_observed_at":"2026-08-07T05:44:17.846668Z","submitted_at":"2026-05-26T16:03:10Z","title":"HARP: Measuring Harm Amplification in Multi-Agent LLM Systems","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T17:20:09.363041Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.27489"},"observation_digest":"sha256:d193f6317327dca823844fe8574aa1e5d7bb90a6a0c7941c381d23087d4c3873","observation_id":"102c8e1e-8392-4f15-8e9b-34698f4f9b99","resolution":{"observed_at":"2026-06-29T17:23:44.848183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.28017","last_updated":"2026-05-28T01:52:56Z","snapshot_observed_at":"2026-08-02T23:35:15.748538Z","submitted_at":"2026-05-27T06:16:11Z","title":"Can It Reach the Generator? Investigating the Survival of Prompt-Injection Attacks in Realistic RAG Settings","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-29T11:55:34.911818Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.28017"},"observation_digest":"sha256:0102bac8de6197fe9ddc218fd2278b4f4b05ab8f27eec2aa0efd50f39e947c66","observation_id":"f9c544c2-2970-4610-8795-75b28cedc916","resolution":{"observed_at":"2026-06-29T12:03:24.289784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.28553","last_updated":"2026-05-27T14:44:36Z","snapshot_observed_at":"2026-07-06T23:38:09.179597Z","submitted_at":"2026-05-27T14:44:36Z","title":"Refusal Before Decoding: Detecting and Exploiting Refusal Signals in Intermediate LLM Activations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T12:11:06.703658Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.28553"},"observation_digest":"sha256:a1982ca7d0a2982cfc1cbc5b806b9b44551b5da8f74804f45f75e3d64ab16c86","observation_id":"ff6d13ed-0b0c-4314-91bd-5fe17d65b2c0","resolution":{"observed_at":"2026-06-29T12:13:26.524287Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.29303","last_updated":"2026-05-28T03:36:05Z","snapshot_observed_at":"2026-08-02T10:09:28.694342Z","submitted_at":"2026-05-28T03:36:05Z","title":"Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-29T08:01:39.412431Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.29303"},"observation_digest":"sha256:bfded4c945df5fa63489e0469d4bf0a34607b1199d9a46e8eb837b7aa9b89c51","observation_id":"05e3e30e-2f45-44d1-b966-62c353dbe840","resolution":{"observed_at":"2026-06-29T08:03:13.519898Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.30693","last_updated":"2026-05-29T00:36:48Z","snapshot_observed_at":"2026-08-02T21:44:58.322249Z","submitted_at":"2026-05-29T00:36:48Z","title":"Triaging Threats to Specialized Guardrails","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-28T22:27:44.703466Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.30693"},"observation_digest":"sha256:e7d67b46a53517cc3654b7f15330f6be216db7ff32588d6376138f147b788d7c","observation_id":"a0d915d8-b543-402c-8299-c6941d727df3","resolution":{"observed_at":"2026-06-28T22:32:44.290259Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.31140","last_updated":"2026-05-29T10:49:44Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:49:44Z","title":"EvoDefense: Co-Evolving Black-Box Defense with Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T21:58:13.411712Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.31140"},"observation_digest":"sha256:8033c8d4bc8195c2735d7445218fd08523a284cbe932442bce67d1e98577289d","observation_id":"32818b3e-6f64-4ab0-8415-7e41f8c08743","resolution":{"observed_at":"2026-07-01T19:56:10.437273Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:08f242e72599241ae8a2ccf4da100b75fd65f74470a23fded0b40800b78b353b","observation_id":"34a6731d-7ffc-462b-8994-6888630cd5de","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2606.01166","last_updated":"2026-05-31T11:16:18Z","snapshot_observed_at":"2026-07-06T23:41:48.357871Z","submitted_at":"2026-05-31T11:16:18Z","title":"BraveGuard: From Open-World Threats to Safer Computer-Use Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T17:04:46.912915Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2606.01166"},"observation_digest":"sha256:55adc9ee851b09c5f5ae6f373db6798fb016443b9e8079bc703adb0068ab4ceb","observation_id":"999dbe27-ee5c-4ed0-bbd7-4c2ac2b91cca","resolution":{"observed_at":"2026-07-01T21:26:14.200911Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2606.02041","last_updated":"2026-06-01T10:30:08Z","snapshot_observed_at":"2026-08-06T02:57:08.156185Z","submitted_at":"2026-06-01T10:30:08Z","title":"SentGuard: Sentence-Level Streaming Guardrails for Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T14:51:17.667213Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2606.02041"},"observation_digest":"sha256:6a1d9714fced6aca99e00d2e1dca32dfe60d79e2c98d9d300db206ee3d852c7e","observation_id":"a3361792-4000-4263-9bbe-dc4bf030ba50","resolution":{"observed_at":"2026-07-01T22:56:20.738256Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2606.02423","last_updated":"2026-06-01T16:01:37Z","snapshot_observed_at":"2026-07-06T23:42:49.173711Z","submitted_at":"2026-06-01T16:01:37Z","title":"Investigating and Alleviating Harm Amplification in LLM Interactions","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T14:31:52.027889Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2606.02423"},"observation_digest":"sha256:1403a7afb71ca5be00c5230ca11cb5b6a730d209cdca850d572d92ef8e9c29e5","observation_id":"87f650aa-4c74-4889-9be3-07c16aecf429","resolution":{"observed_at":"2026-07-01T23:16:24.051535Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2606.02640","last_updated":"2026-05-31T06:40:02Z","snapshot_observed_at":"2026-07-06T23:43:02.654629Z","submitted_at":"2026-05-31T06:40:02Z","title":"D-Judge: Disrupting Multi-Turn Jailbreaks using Semantics-Preserving Output Rewriting","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T17:14:15.815256Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2606.02640"},"observation_digest":"sha256:2689b718bc8cf2f177ea291ef4b990f7ac3260e53ac22e8366b361a9bcf7abea","observation_id":"7ca2c2a7-a9f7-47be-a0a5-efce46f2b391","resolution":{"observed_at":"2026-07-01T21:16:14.792525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2606.03601","last_updated":"2026-06-02T13:07:12Z","snapshot_observed_at":"2026-08-02T23:51:44.360084Z","submitted_at":"2026-06-02T13:07:12Z","title":"DDOR: Delta Debugging for Explainable Overrefusal Testing and Repair","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T08:54:19.113501Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2606.03601"},"observation_digest":"sha256:ce4561be295a5ed77484619538482556d45c0257f8f063b3035f14057ec753e2","observation_id":"ea4e50c6-120e-4086-bb78-194ac08be0c5","resolution":{"observed_at":"2026-06-28T10:32:00.153885Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2606.04051","last_updated":"2026-06-02T09:02:14Z","snapshot_observed_at":"2026-07-06T23:44:14.261541Z","submitted_at":"2026-06-02T09:02:14Z","title":"RUBAS: Rubric-Based Reinforcement Learning for Agent Safety","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:47.814115Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2606.04051"},"observation_digest":"sha256:f7f8a047f3b1fcf5a17e3cdae4a1b01084063fbfa8eca7a73146f72fc87749ff","observation_id":"10a7bd08-76f6-408d-888f-9fac76c66858","resolution":{"observed_at":"2026-07-02T02:16:26.540113Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2606.09038","last_updated":"2026-06-08T05:10:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-08T05:10:05Z","title":"Personalization Meets Safety:Mechanisms,Risks,and Mitigations in Personalized LLMs","version":1},"reference_index":254,"source":"pdf_text","source_observed_at":"2026-06-27T16:49:14.243931Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2606.09038"},"observation_digest":"sha256:24f3416518b081e98e1b2b08a8b4a2e4a5ad3d6ced2379be420e5ed1b8a215a8","observation_id":"2e26bcb3-a5f4-4548-aa0a-58d142f7486f","resolution":{"observed_at":"2026-07-03T01:07:30.265011Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2606.09890","last_updated":"2026-06-03T13:26:41Z","snapshot_observed_at":"2026-08-05T22:09:44.085308Z","submitted_at":"2026-06-03T13:26:41Z","title":"PreAct-Bench: Benchmarking Predictive Monitoring in LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T06:49:29.653094Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2606.09890"},"observation_digest":"sha256:963025ee59a2ac0a3bbd2f90da860fbff045eccdfd032f7ba8e85b70c9390e1e","observation_id":"5677da66-5809-4ddd-96d1-8d009b22d61b","resolution":{"observed_at":"2026-07-02T07:36:45.291932Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2606.15531","last_updated":"2026-06-16T14:29:31Z","snapshot_observed_at":"2026-08-01T19:11:56.873454Z","submitted_at":"2026-06-14T01:18:53Z","title":"Greedy Coordinate Diffusion: Effective and Semantically Coherent Adversarial Attacks via Diffusion Guidance","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-27T04:35:35.594085Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2606.15531"},"observation_digest":"sha256:a5b5dde12a7a7b50e346e13136dd4a1ed11085c1a0f7af1fc9dd714a84d01916","observation_id":"48d2f00c-23e7-478f-84d4-d479a9a27744","resolution":{"observed_at":"2026-07-03T17:08:43.472292Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2606.19755","last_updated":"2026-06-18T03:35:32Z","snapshot_observed_at":"2026-07-06T23:55:01.487552Z","submitted_at":"2026-06-18T03:35:32Z","title":"SafeSpec: Fast and Safe LLM via Dynamic Reflective Sampling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T17:23:06.382761Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2606.19755"},"observation_digest":"sha256:fe64f7280ea525f2cce282cdef46ba618c84cc3432b580346a4acf8a1bc5601c","observation_id":"7866f3d9-92a2-4f16-af08-7305969aeec6","resolution":{"observed_at":"2026-07-04T03:59:33.713380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2606.25380","last_updated":"2026-06-24T04:24:30Z","snapshot_observed_at":"2026-08-03T19:47:13.872409Z","submitted_at":"2026-06-24T04:24:30Z","title":"A Survey of Toxicity Detection and Mitigation Strategies for Multilingual Language Models","version":1},"reference_index":132,"source":"arxiv_source","source_observed_at":"2026-06-25T21:16:36.392606Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2606.25380"},"observation_digest":"sha256:7318b24184f463f7492c826b141e28f68317ce283ef125ca4e4b60be98c3b3c8","observation_id":"919a3143-2067-4700-906d-12b4341afadc","resolution":{"observed_at":"2026-07-04T19:30:07.687112Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-08-07T08:27:53.838717Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:60998edee9fe8f78c82f70d9d38e1337fbbfbc2639b1d038c5fc081e063d1fe0","observation_id":"9b5ea55a-911f-4b47-aa53-578cc0a2dbb6","resolution":{"observed_at":"2026-07-04T19:40:06.686892Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2606.26968","last_updated":"2026-06-25T12:40:39Z","snapshot_observed_at":"2026-07-31T01:20:28.481331Z","submitted_at":"2026-06-25T12:40:39Z","title":"RedVox: Safety and Fairness Gaps in Speech Models Across Languages","version":1},"reference_index":178,"source":"arxiv_source","source_observed_at":"2026-06-26T04:37:00.399470Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2606.26968"},"observation_digest":"sha256:aaeaeed8fba4d05086f2ec0ec017fe981187ffa52e5016a460edaa6f8a20d64c","observation_id":"a9ec080c-6f31-4bee-85eb-fcd68ae0362a","resolution":{"observed_at":"2026-07-04T13:59:52.792091Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2606.27632","last_updated":"2026-06-26T01:12:02Z","snapshot_observed_at":"2026-08-01T14:50:11.591955Z","submitted_at":"2026-06-26T01:12:02Z","title":"Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T00:46:03.210076Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2606.27632"},"observation_digest":"sha256:491445bda6418edb74610dc010a74a05724130eff37abc1cda74e47e49a57fb0","observation_id":"840de7ff-2bce-4795-9354-4a3ba6a3be6b","resolution":{"observed_at":"2026-06-29T00:52:55.753869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2606.28153","last_updated":"2026-06-29T15:00:34Z","snapshot_observed_at":"2026-07-07T00:02:18.989389Z","submitted_at":"2026-06-26T14:51:16Z","title":"Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-29T03:35:34.594617Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2606.28153"},"observation_digest":"sha256:2d75f88d67c8e0f049ff8a7bebd86121775063c7b1d77a2c87891eb3792f6130","observation_id":"451b577f-e355-4210-91c9-1b1ae3569c9d","resolution":{"observed_at":"2026-07-01T17:35:51.339657Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-08-07T12:54:24.298798Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:9140f7c62797c02af33ca56d679beba81588d20ba122fd49b08f37cdeabbe0a9","observation_id":"18f8e2e8-a9b5-4ac6-943e-d2f0b157d95a","resolution":{"observed_at":"2026-06-30T06:34:18.837556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2607.01793","last_updated":"2026-07-02T07:08:26Z","snapshot_observed_at":"2026-08-05T13:54:16.783317Z","submitted_at":"2026-07-02T07:08:26Z","title":"Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-03T13:45:02.167211Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2607.01793"},"observation_digest":"sha256:f9acf29c87cf1f1b4bdbeaf829cd9e6714e10e341451dc161b5b0ba598500f45","observation_id":"5f22d630-37e7-4659-af2c-cde6ae8b2ec9","resolution":{"observed_at":"2026-07-03T13:48:20.362672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2607.02079","last_updated":"2026-07-02T12:21:16Z","snapshot_observed_at":"2026-08-06T21:17:29.886069Z","submitted_at":"2026-07-02T12:21:16Z","title":"HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-03T14:38:55.045628Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2607.02079"},"observation_digest":"sha256:80b585d257ad2770aedd99f2cc92cf2a2994e3e7dec1ff48f7cb16aa793db8ff","observation_id":"eca486b9-8716-48c0-a4c2-d5b3aa0e9e42","resolution":{"observed_at":"2026-07-03T14:48:32.676927Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-07-12T05:07:18.364787Z","title":"arXiv preprint arXiv:2510.14276 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03069","last_updated":"2026-07-03T08:03:35Z","snapshot_observed_at":"2026-08-06T08:24:53.219694Z","submitted_at":"2026-07-03T08:03:35Z","title":"SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-12T05:07:18.364787Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2607.03069"},"observation_digest":"sha256:92b7937224b566bd42e41d6501c86dd82d6cb377a18c9fc10ec2360ff0b52327","observation_id":"a08cd464-6fe2-4b80-a965-4cee34df93bc","resolution":{"observed_at":"2026-07-12T05:07:18.364787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2607.06326","last_updated":"2026-07-07T14:25:05Z","snapshot_observed_at":"2026-07-10T23:18:24.158692Z","submitted_at":"2026-07-07T14:25:05Z","title":"DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrail","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-08T10:00:02.677030Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2607.06326"},"observation_digest":"sha256:6c5d1dd81a8ac40dc5c900deec29b073120065a749d9bf3fa15db30adb204982","observation_id":"33f58612-2cd1-4783-bbab-edb5e84dd497","resolution":{"observed_at":"2026-07-08T10:04:51.438848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-07-14T07:16:57.009797Z","title":"Qwen3guard technical report.arXiv preprint arXiv:2510.14276, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11070","last_updated":"2026-07-13T04:19:37Z","snapshot_observed_at":"2026-08-07T05:32:49.065984Z","submitted_at":"2026-07-13T04:19:37Z","title":"MJ: Multi-turn LLM Jailbreaking via Decomposed Credit Assignment","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-14T07:16:57.009797Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2607.11070"},"observation_digest":"sha256:969e799aba2639ea83cc1a63300051c7bb66ec3a7c39a493a08ad6a39414da63","observation_id":"9b7e8732-b495-48ad-bfd8-cb0bf3f02011","resolution":{"observed_at":"2026-07-14T07:16:57.009797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-02T10:00:11.484540Z","title":"Qwen3guard technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16242","last_updated":"2026-06-26T03:29:59Z","snapshot_observed_at":"2026-08-06T19:59:54.568684Z","submitted_at":"2026-06-26T03:29:59Z","title":"TRACE: Trajectory-Based Safety Patch Learning for LLM Post-Training Realignment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T10:00:11.484540Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2607.16242"},"observation_digest":"sha256:b23a78e940d8e5ab1784316411c13f307df1f51a92437ed4e44bd328ada9f415","observation_id":"a4eeda0a-0ae7-430e-ac72-7db9b183733a","resolution":{"observed_at":"2026-08-02T10:00:11.484540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-01T17:07:55.050266Z","title":"arXiv preprint arXiv:2510.14276 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17779","last_updated":"2026-07-20T10:09:30Z","snapshot_observed_at":"2026-08-06T08:52:24.582710Z","submitted_at":"2026-07-20T10:09:30Z","title":"Dynamic Defense Profiling Enables Cognitive Jailbreak of Text-to-Image Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T17:07:55.050266Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2607.17779"},"observation_digest":"sha256:ec6e14a8fd2da8f224ffbd49b01cbffe699f84697d985942f4e3e7be4969bf16","observation_id":"74607a4b-5e4b-4619-96f8-bb475d4356f1","resolution":{"observed_at":"2026-08-01T17:07:55.050266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-01T16:21:27.339175Z","title":"Qwen3Guard Technical Report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18056","last_updated":"2026-08-06T06:39:11Z","snapshot_observed_at":"2026-08-07T15:16:14.514612Z","submitted_at":"2026-07-20T15:26:23Z","title":"An Early Warning of Emerging Biosecurity Risks in Frontier LLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T16:21:27.339175Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2607.18056"},"observation_digest":"sha256:81e2c0116fa0a5f32848efc437d08710918b0adb68b3a01742ff440b27d4f53d","observation_id":"7aeaac08-ab9b-4bbb-be7c-2051410b33bf","resolution":{"observed_at":"2026-08-01T16:21:27.339175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-02T12:28:42.789128Z","title":"Qwen3Guard: A multilingual safety guardrail model for LLM deployments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19361","last_updated":"2026-06-03T02:55:17Z","snapshot_observed_at":"2026-08-07T03:55:00.362898Z","submitted_at":"2026-06-03T02:55:17Z","title":"Stateful Guardrails for Multi-Turn LLM Systems: A Conversational Risk Accumulation Framework","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T12:28:42.789128Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2607.19361"},"observation_digest":"sha256:a7bbc6375c3a5b7a36486554dc272687416aec613bae1057ee1f1fe69aa049c0","observation_id":"394f09dc-e471-49c1-82ba-a426fa996511","resolution":{"observed_at":"2026-08-02T12:28:42.789128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-01T11:40:29.208494Z","title":"Qwen3guard technical report.arXiv preprint arXiv:2510.14276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19829","last_updated":"2026-07-22T07:08:59Z","snapshot_observed_at":"2026-08-06T19:43:18.323440Z","submitted_at":"2026-07-22T07:08:59Z","title":"DARWIN: Evolving Jailbreak Adversary and Guardrail for LLM Safety Evaluation and Protection","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-01T11:40:29.208494Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2607.19829"},"observation_digest":"sha256:10ed13a345462c0a70819b11caa53b1376afb09cc0474976bdb48713971d0209","observation_id":"6d40fd64-6589-481e-9e53-08b0119ad890","resolution":{"observed_at":"2026-08-01T11:40:29.208494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-01T11:24:49.027826Z","title":"arXiv preprint arXiv:2510.14276 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19913","last_updated":"2026-07-22T08:43:43Z","snapshot_observed_at":"2026-08-05T09:52:46.724864Z","submitted_at":"2026-07-22T08:43:43Z","title":"JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T11:24:49.027826Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2607.19913"},"observation_digest":"sha256:f51f8082255a17e32431002e01b8f4c30700dff1758eb3348a6c668865348e92","observation_id":"a8dbd1ec-f3d7-4490-9551-643f179de68d","resolution":{"observed_at":"2026-08-01T11:24:49.027826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-07-30T20:11:00.888291Z","title":"arXiv preprint arXiv:2510.14276 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26820","last_updated":"2026-07-29T12:14:23Z","snapshot_observed_at":"2026-08-07T10:24:58.276069Z","submitted_at":"2026-07-29T12:14:23Z","title":"Forecasting Trajectory-Level Safety Risks in Black-Box Multi-Turn Interactions","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-07-30T20:11:00.888291Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2607.26820"},"observation_digest":"sha256:07d271d62580d8c4a9d591a2317a230e2739ec2c85188cc3d914bfffa8606170","observation_id":"ed0c3849-3f89-460d-9de2-e723ffc92b01","resolution":{"observed_at":"2026-07-30T20:11:00.888291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-07-31T23:07:38.966539Z","title":"arXiv preprint arXiv:2510.14276 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27917","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-07T15:15:58.184585Z","submitted_at":"2026-07-30T09:30:03Z","title":"One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-31T23:07:38.966539Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2607.27917"},"observation_digest":"sha256:2ce8101e76b17702e0b2ad7f846d0336fdb2e9e496b784a36f027aafb34abfa2","observation_id":"e2e490ba-21df-4a62-a7d0-872b3bd31cd8","resolution":{"observed_at":"2026-07-31T23:07:38.966539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-03T16:20:26.886091Z","title":"arXiv preprint arXiv:2510.14276 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28969","last_updated":"2026-07-31T02:45:56Z","snapshot_observed_at":"2026-08-06T15:47:23.649596Z","submitted_at":"2026-07-31T02:45:56Z","title":"SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T16:20:26.886091Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2607.28969"},"observation_digest":"sha256:fba0c58eb109c776d95df658fa83bf838e7c3c5c60dbf075c91f629b5fbdf1c5","observation_id":"78c107ad-85f8-49d4-85c9-18d18ad73bde","resolution":{"observed_at":"2026-08-03T16:20:26.886091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-06T00:43:01.890905Z","title":"arXiv preprint arXiv:2510.14276 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00973","last_updated":"2026-08-02T03:53:30Z","snapshot_observed_at":"2026-08-06T23:25:15.560334Z","submitted_at":"2026-08-02T03:53:30Z","title":"Mind the Gap: Zero-Query Jailbreaks via Filter-Generator Discrepancy in Text-to-Image Systems","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T00:43:01.890905Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2608.00973"},"observation_digest":"sha256:545dcefb0dd8b3bc3f2285782a9b2c31980b87726da4ad082133371e99e62837","observation_id":"9ce19e8a-ced2-4fe2-a713-61ce7b8e48ca","resolution":{"observed_at":"2026-08-06T00:43:01.890905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T23:46:20.553544Z","title":"Qwen3guard technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-07T15:24:54.633375Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.553544Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:ed11cf69c0ce521fc58a93b38585ceec4ba9773af2a15f8eb7860aeb34e8044e","observation_id":"bc178fed-7253-42ef-866b-51cd6a4120b8","resolution":{"observed_at":"2026-08-05T23:46:20.553544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.14276/citation-record","integrity":"/paper/2510.14276/integrity","json":"/paper/2510.14276/citation-record.json","paper":"/paper/2510.14276"},"outbound":[],"paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 81 inbound Pith citation observations for arXiv:2510.14276."}