{"as_of":"2026-08-23T12:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0d86c6de2d9c47c5c7e518d39914291430c45791dc52f4d3802e8ff31fcba983","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:23:31.950259Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.21151/citation-record","integrity":"/paper/2607.21151/integrity","json":"/paper/2607.21151/citation-record.json","paper":"/paper/2607.21151"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:24.265213Z","title":"Qwen3-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:24.265213Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:aa1fe16a478964bcb896943cefcaaaf2a9d3d8cb749f7c3076b50fea407cd82b","observation_id":"523e1f8d-aaa2-4679-8667-bb6b4fc3243e","resolution":{"observed_at":"2026-08-01T08:23:24.265213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-17T12:32:16.575866Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-01T08:23:24.414167Z","title":"Internvl3. 5: Advancing open-source multimodal models in versatility, reasoning, and efficiency,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:24.414167Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:fc5fe1cea6a684a630436f65edef2223f9cdbe57c09c18be358d7ab1682a9684","observation_id":"0cec7b8c-3c74-45d4-8161-880fdb5788a6","resolution":{"observed_at":"2026-08-01T08:23:24.414167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-01T08:23:24.495566Z","title":"Internvideo2. 5: Empowering video mllms with long and rich context modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:24.495566Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:b303ffea0ed024f16047e5a0d9a1d30ba11e32f9d17d602e276745b9b3aca51e","observation_id":"ff3267ed-70a9-484c-bfc9-b1e7b5a9304d","resolution":{"observed_at":"2026-08-01T08:23:24.495566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:24.732526Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:24.732526Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:961adb6c9822cf7c0279f51d69ddddfac32bd9012d6325db5cb8a7e3f1c74603","observation_id":"f1501e31-11e0-4751-b687-4403fe63d4a1","resolution":{"observed_at":"2026-08-01T08:23:24.732526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-01T08:23:24.901910Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:24.901910Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:2277691b4a7343f80119508df8ff5aebc6aaeb7c2d45a7200f130af58abca292","observation_id":"0e45cb66-a857-409a-996d-155224d02cf1","resolution":{"observed_at":"2026-08-01T08:23:24.901910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00357","last_updated":"2024-06-20T15:06:10Z","snapshot_observed_at":"2026-08-16T14:22:38.182009Z","submitted_at":"2024-02-01T05:57:10Z","title":"Safety of Multimodal Large Language Models on Images and Texts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00357","snapshot_observed_at":"2026-08-01T08:23:25.032757Z","title":"Safety of multimodal large language models on images and texts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:25.032757Z"},"links":{"cited_paper":"/paper/2402.00357","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:b371da1e669cce6535d3130e6a67a9a5dcd63482f92c912b7dbad37a15749087","observation_id":"d54a7677-0c02-45c0-a740-7977675c926f","resolution":{"observed_at":"2026-08-01T08:23:25.032757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09259","last_updated":"2024-12-09T14:22:14Z","snapshot_observed_at":"2026-08-15T23:29:53.216494Z","submitted_at":"2024-11-14T07:51:51Z","title":"Jailbreak Attacks and Defenses against Multimodal Generative Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09259","snapshot_observed_at":"2026-08-01T08:23:25.193531Z","title":"Jailbreak attacks and defenses against multimodal generative models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:25.193531Z"},"links":{"cited_paper":"/paper/2411.09259","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:b82770299e3b0909ea4a3acea0e9ec6d929a2e1e724fd7fe57e52e86da1f8825","observation_id":"a4b7d2bc-1709-4d4c-a6fd-1c95fbc5f6b3","resolution":{"observed_at":"2026-08-01T08:23:25.193531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:25.333115Z","title":"Vlsbench: Unveiling visual leakage in multimodal safety,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:25.333115Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:7c2e8cb28f2aa4e337f4e33da35f89b7c34a65ea1c3b964633596d0aa3da2f7b","observation_id":"4f1ed196-4b14-46ee-ab10-788259ce4909","resolution":{"observed_at":"2026-08-01T08:23:25.333115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:25.472715Z","title":"Video-safetybench: A benchmark for safety evaluation of video lvlms,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:25.472715Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:61b15d4f831a9d7dad0f2b6136ce30fb53934a1e6c1a9843ec1b767ac8a0a8c7","observation_id":"4f03dbc6-603b-4ded-b8bf-e21a660b6bc2","resolution":{"observed_at":"2026-08-01T08:23:25.472715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:25.646133Z","title":"Sea: Low-resource safety alignment for multimodal large language models via synthetic embeddings,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:25.646133Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:1fa11cda4a95cdd4f818d0385beb5df76c5b956ffd20fec514161814a62d706d","observation_id":"0a720c0d-0f09-49df-ac44-d317cfab5980","resolution":{"observed_at":"2026-08-01T08:23:25.646133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:25.779852Z","title":"Figstep: Jail- breaking large vision-language models via typographic visual prompts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:25.779852Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:345f69132f2453f1c370e6b64fa96ea48433c92d7650aedbf5c314737120834d","observation_id":"e8ace07f-185f-4fa4-83a5-e562128e3cc6","resolution":{"observed_at":"2026-08-01T08:23:25.779852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20773","last_updated":"2024-06-12T07:13:48Z","snapshot_observed_at":"2026-08-17T15:14:45.354691Z","submitted_at":"2024-05-25T17:17:18Z","title":"Visual-RolePlay: Universal Jailbreak Attack on MultiModal Large Language Models via Role-playing Image Character","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20773","snapshot_observed_at":"2026-08-01T08:23:25.911168Z","title":"Visual-roleplay: Universal jailbreak attack on multimodal large language models via role-playing image character,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:25.911168Z"},"links":{"cited_paper":"/paper/2405.20773","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:4e9af348cf360a0b78a42099529a512bd9a684e391649d6a3ae8d9dd081fe636","observation_id":"8d8a2ab6-d404-41d3-971f-ace533de2ab2","resolution":{"observed_at":"2026-08-01T08:23:25.911168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:26.010574Z","title":"Ideator: Jailbreaking and benchmarking large vision-language models using them- selves,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:26.010574Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:5b4dd1e8d78d4721f6a92a4144feaa1a8eb902d6cfe885417fd56babdaf5505a","observation_id":"40ece37e-0c78-405a-99c1-3cbaea5b3982","resolution":{"observed_at":"2026-08-01T08:23:26.010574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03027","last_updated":"2024-11-24T06:22:37Z","snapshot_observed_at":"2026-08-16T14:03:50.278504Z","submitted_at":"2024-04-03T19:23:18Z","title":"JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03027","snapshot_observed_at":"2026-08-01T08:23:26.121407Z","title":"Jailbreakv: A benchmark for assessing the robustness of multimodal large language models against jailbreak attacks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:26.121407Z"},"links":{"cited_paper":"/paper/2404.03027","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:bf23001249fd6ec5b81fa627a9d7d6c95e753bfbd092214e736f175c9743b9d3","observation_id":"1291fbc4-d084-4448-9111-d280c0f35c09","resolution":{"observed_at":"2026-08-01T08:23:26.121407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08464","last_updated":"2024-10-22T02:01:16Z","snapshot_observed_at":"2026-08-16T13:26:08.051157Z","submitted_at":"2024-08-16T00:18:23Z","title":"$\\textit{MMJ-Bench}$: A Comprehensive Study on Jailbreak Attacks and Defenses for Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08464","snapshot_observed_at":"2026-08-01T08:23:26.274455Z","title":"Mmj-bench: A comprehensive study on jail- break attacks and defenses for multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:26.274455Z"},"links":{"cited_paper":"/paper/2408.08464","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:65737add10926e73ce0999729271cbd1125b55e53b3083abc53b51e07f4522f5","observation_id":"04e745c3-3952-4397-a67f-fd6de91ff9a3","resolution":{"observed_at":"2026-08-01T08:23:26.274455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:26.442624Z","title":"Omni-SafetyBench: A benchmark for safety evaluation of audio-visual large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:26.442624Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:8e710dae00620da3efd6e3b67fd6def9d92233c181eab22ee7394b8a05b7e671","observation_id":"8589873e-2a79-4293-8974-7c5712661bb7","resolution":{"observed_at":"2026-08-01T08:23:26.442624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:26.575880Z","title":"Videostir: Understanding long videos via spatio-temporally structured and intent-aware rag,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:26.575880Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:eb162d1d9898fe36291d430d7a6e5ccbfdbbabd0596aeae10ddc730aa7797648","observation_id":"0799568d-d601-4bdb-b40f-01e8d412a9d1","resolution":{"observed_at":"2026-08-01T08:23:26.575880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00181","last_updated":"2026-04-14T16:44:13Z","snapshot_observed_at":"2026-08-15T21:28:05.921564Z","submitted_at":"2026-01-30T04:45:43Z","title":"CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.00181","snapshot_observed_at":"2026-08-01T08:23:26.724359Z","title":"Camreasoner: Reinforcing camera movement understanding via structured spatial reasoning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:26.724359Z"},"links":{"cited_paper":"/paper/2602.00181","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:3a43f38513e0a117060b3aab91551a350e6f979020cb82c425397e92de199bbb","observation_id":"24f3724e-cae4-4827-bc03-a84c4437508a","resolution":{"observed_at":"2026-08-01T08:23:26.724359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:26.846948Z","title":"Mm-safetybench: A benchmark for safety evaluation of multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:26.846948Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:448cad30402bcd313e9a8ba5355cb78051b4f6964185d6dc20130879dd6c352b","observation_id":"36976e9f-b72e-4da3-87b6-8ad0f773f60d","resolution":{"observed_at":"2026-08-01T08:23:26.846948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:27.008533Z","title":"Xstest: A test suite for identifying exaggerated safety behaviours in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:27.008533Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:28308b984d5503147a06b725bdc6d86a816cdb3fdf0871fcf05d97f4f8824c48","observation_id":"a5e9b5bb-6654-4fe7-9342-345395041551","resolution":{"observed_at":"2026-08-01T08:23:27.008533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02684","last_updated":"2024-10-03T17:10:41Z","snapshot_observed_at":"2026-08-16T13:12:53.009123Z","submitted_at":"2024-10-03T17:10:41Z","title":"HiddenGuard: Fine-Grained Safe Generation with Specialized Representation Router","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02684","snapshot_observed_at":"2026-08-01T08:23:27.163780Z","title":"Hiddenguard: Fine-grained safe generation with specialized representation router,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:27.163780Z"},"links":{"cited_paper":"/paper/2410.02684","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:d3cf8d26a94e796e8452ada338817a09fafd17b8a683b71cf28f04b372d0ec35","observation_id":"c24710b5-bd32-4c48-a740-b1448f5570fc","resolution":{"observed_at":"2026-08-01T08:23:27.163780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03857","last_updated":"2024-10-08T08:34:38Z","snapshot_observed_at":"2026-08-20T11:30:23.388292Z","submitted_at":"2024-10-04T18:42:57Z","title":"You Know What I'm Saying: Jailbreak Attack via Implicit Reference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03857","snapshot_observed_at":"2026-08-01T08:23:27.312864Z","title":"You know what i’m saying: Jailbreak attack via implicit reference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:27.312864Z"},"links":{"cited_paper":"/paper/2410.03857","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:8869973170404cca5e2384e018beda1050c58c1c198ac59dfee8c3cf1b60afd5","observation_id":"bbdb4910-4e60-4fde-ac4e-5eb904998a4c","resolution":{"observed_at":"2026-08-01T08:23:27.312864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:27.461462Z","title":"Spa-vl: A comprehensive safety preference alignment dataset for vision language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:27.461462Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:c86d2b82e164498e819b78ff44da43fde497e7a96f824a158402447e0e15a56e","observation_id":"ea9bd991-09de-47c9-9bb2-4d0721a37be1","resolution":{"observed_at":"2026-08-01T08:23:27.461462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:27.575849Z","title":"Msr-align: Policy-grounded multimodal alignment for safety-aware reasoning in vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:27.575849Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:4411ce8fcf695de982d54eb6d820832ae10775e7afa3e58dc8f63c82461a03d5","observation_id":"4b465fa7-55d3-4f53-aa60-62705d4cfda4","resolution":{"observed_at":"2026-08-01T08:23:27.575849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02207","last_updated":"2024-06-17T22:26:32Z","snapshot_observed_at":"2026-08-20T19:28:32.512392Z","submitted_at":"2024-02-03T16:43:42Z","title":"Safety Fine-Tuning at (Almost) No Cost: A Baseline for Vision Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02207","snapshot_observed_at":"2026-08-01T08:23:27.722142Z","title":"Safety fine-tuning at (almost) no cost: A baseline for vision large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:27.722142Z"},"links":{"cited_paper":"/paper/2402.02207","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:d7f0277858057a88eca4b777ce1518d918b8e6df36f096d39fac0fdb90e679d8","observation_id":"7e02f988-e635-400b-a83d-0e25b20f020b","resolution":{"observed_at":"2026-08-01T08:23:27.722142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:27.870185Z","title":"Adashield: Safeguarding multimodal large language models from structure-based attack via adaptive shield prompting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:27.870185Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:167d80737767c096d4a268716083d144b541c3a4a9f96c80a2df96bdb7748e08","observation_id":"310881d8-b230-4136-9ee3-2b7a756e426e","resolution":{"observed_at":"2026-08-01T08:23:27.870185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:28.009260Z","title":"Bluesuffix: Reinforced blue teaming for vision-language models against jailbreak attacks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:28.009260Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:75cbf497fc510b7b76835c5cecae64f77fee5e720b668090bcab082133c3c69f","observation_id":"3b66fdb5-54da-4621-91ef-69c857226bd6","resolution":{"observed_at":"2026-08-01T08:23:28.009260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:28.133850Z","title":"E2AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:28.133850Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:61858195063b03c83e09e5e19560a863ed751f3f5a112bfbb78690717aa1d40a","observation_id":"01f990d7-6f45-4a36-bd9c-700efb04c40f","resolution":{"observed_at":"2026-08-01T08:23:28.133850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:28.293786Z","title":"Eta: Evaluating then aligning safety of vision language models at inference time,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:28.293786Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:16f300433aeea70417c4d464e1b00f9b25777b1ce8121c340a49c6b2658f123f","observation_id":"07f65600-5646-4f35-ae3c-5cc7e167741d","resolution":{"observed_at":"2026-08-01T08:23:28.293786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:28.455095Z","title":"Safedecoding: Defending against jailbreak attacks via safety-aware decoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:28.455095Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:78e7edd261c04e1368ab59c419c0438bfd7b058c182db3e406b3cdff5a434254","observation_id":"226d2725-39a9-453a-a544-0f92bc29216e","resolution":{"observed_at":"2026-08-01T08:23:28.455095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:28.556600Z","title":"Defending multimodal backdoored models by repulsive visual prompt tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:28.556600Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:59e5b02d75349481f4607e2173be17c4fba479dd0976a2bcddec43a30fe43c6e","observation_id":"74c85e18-a11e-4e1a-a77f-4188d01526cf","resolution":{"observed_at":"2026-08-01T08:23:28.556600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:28.634357Z","title":"Gated differentiable working memory for long-context language modeling,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:28.634357Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:692626b1a4efa6952c244dce51b6ade1cc42972dc50ff0887af21914da512abf","observation_id":"0041fd77-69c9-4866-858f-31066c132e23","resolution":{"observed_at":"2026-08-01T08:23:28.634357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:28.719510Z","title":"Test-time attention purification for backdoored large vision language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:28.719510Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:f67ccc32803802203287e435523c45cd3b175f60da92616171e7d31240a11c66","observation_id":"aac1f20a-73f5-42a2-bf28-0c476ef2a120","resolution":{"observed_at":"2026-08-01T08:23:28.719510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:28.799554Z","title":"Mrfd: Multi-region fusion decoding with self-consistency for mitigating hallucinations in lvlms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:28.799554Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:227dbdb526316575b877b3050ad428db644b84512babecbebb261f0f8c257448","observation_id":"81a69b56-690e-451c-95b5-8dec922b5162","resolution":{"observed_at":"2026-08-01T08:23:28.799554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24566","last_updated":"2026-07-16T09:55:58Z","snapshot_observed_at":"2026-08-20T14:30:18.663894Z","submitted_at":"2025-09-29T10:19:22Z","title":"TokenSwap: Backdoor Attack on the Compositional Understanding of Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.24566","snapshot_observed_at":"2026-08-01T08:23:28.879633Z","title":"Tokenswap: Backdoor attack on the compositional understanding of large vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:28.879633Z"},"links":{"cited_paper":"/paper/2509.24566","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:f7e49f292e07f28b195dd635a97b0133f9f4d4afb8928162a0077f082e269f1d","observation_id":"118b9f87-2a9e-433f-abf5-bfa77a4b287c","resolution":{"observed_at":"2026-08-01T08:23:28.879633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:28.977259Z","title":"Dimo-gui: Advancing test-time scaling in gui grounding via modality-aware visual reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:28.977259Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:e83c68cb5b49aba2ce408fcfa21c4c82f68614ef5e7cc9b35fb8d1a4e2272af8","observation_id":"b26c8ed6-704d-491b-972e-e90a15e84d13","resolution":{"observed_at":"2026-08-01T08:23:28.977259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:29.061898Z","title":"Improving generaliz- ability and undetectability for targeted adversarial attacks on multimodal pre-trained models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:29.061898Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:f9c0dfc814296f4755af0564836684e2786e857e0ee510d21098364c25ed689e","observation_id":"65a08c8c-3f88-4687-80e8-befe5ba759d4","resolution":{"observed_at":"2026-08-01T08:23:29.061898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-01T08:23:29.149242Z","title":"Representation engineering: A top-down approach to ai transparency,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:29.149242Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:46be4da2c3038d30eac92abfcf20e537c243a5d684c01fd5ae5690191bda3a6a","observation_id":"bf77cec6-6d0c-4de2-84f0-5d857f8d57aa","resolution":{"observed_at":"2026-08-01T08:23:29.149242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:29.228401Z","title":"Refusal in language models is mediated by a single direction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:29.228401Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:db11f6e8a7476d31a86a7b034eaf35aba3dda0fc571865ff7cfa027c7d19cb00","observation_id":"802859be-1d11-4bcd-8a5e-615a765b77f2","resolution":{"observed_at":"2026-08-01T08:23:29.228401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:29.306894Z","title":"Guardreasoner-vl: Safeguarding vlms via reinforced reasoning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:29.306894Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:39930646e506c1aceb7f091ca22decfd5790f45c7935557348ba6b210d0c95d3","observation_id":"7182405a-2387-43d1-9069-b4d8d7b7f80c","resolution":{"observed_at":"2026-08-01T08:23:29.306894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02029","last_updated":"2025-01-03T07:01:15Z","snapshot_observed_at":"2026-08-18T01:32:14.098188Z","submitted_at":"2025-01-03T07:01:15Z","title":"Spot Risks Before Speaking! Unraveling Safety Attention Heads in Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02029","snapshot_observed_at":"2026-08-01T08:23:29.396060Z","title":"Spot risks before speaking! unraveling safety attention heads in large vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:29.396060Z"},"links":{"cited_paper":"/paper/2501.02029","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:228817a20dce59d15619e443ec4ac9ff53fa365c9aa43f2ba2cce51d11fbcb33","observation_id":"fba53fc4-82a2-42ab-8546-6cd5b542d37f","resolution":{"observed_at":"2026-08-01T08:23:29.396060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:29.481321Z","title":"Jail- breaklens: Visual analysis of jailbreak attacks against large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:29.481321Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:a65d3c40999a3241378f3815ffc69566aa2ebcfa95d0bf920a791942dd297da8","observation_id":"2241f3d5-bfa8-4ef7-a6fa-57d22577eecf","resolution":{"observed_at":"2026-08-01T08:23:29.481321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:29.581759Z","title":"\"not aligned","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:29.581759Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:c4c050b603f60c635429a04040fd2fe0611e1da5693e559b00da06ad2e9a691e","observation_id":"7391216b-c470-4022-8132-13e4d62df029","resolution":{"observed_at":"2026-08-01T08:23:29.581759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06461","last_updated":"2026-08-17T09:40:04Z","snapshot_observed_at":"2026-08-20T23:15:31.073494Z","submitted_at":"2025-09-08T09:20:04Z","title":"Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06461","snapshot_observed_at":"2026-08-01T08:23:29.666893Z","title":"Fo- cusing by contrastive attention: Enhancing vlms’ visual reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:29.666893Z"},"links":{"cited_paper":"/paper/2509.06461","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:213d3d78b9c48e4fc029296be8b40c9b5efef76db8ab3a33f22f65910cfbca50","observation_id":"4b4b0dab-6a3f-4a77-a3dd-70cbd4b3efb0","resolution":{"observed_at":"2026-08-01T08:23:29.666893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22888","last_updated":"2024-10-30T10:33:10Z","snapshot_observed_at":"2026-08-19T16:29:37.594285Z","submitted_at":"2024-10-30T10:33:10Z","title":"Effective and Efficient Adversarial Detection for Vision-Language Models via A Single Vector","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22888","snapshot_observed_at":"2026-08-01T08:23:29.745621Z","title":"Effective and efficient adversarial detection for vision-language models via a single vector,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:29.745621Z"},"links":{"cited_paper":"/paper/2410.22888","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:0eea4b6a1ff4e475f4c63671fca768c7ca18e4f82fdc195fb8cd2995841a03cf","observation_id":"efbcb1ad-39ac-4840-b030-692cdfce5d57","resolution":{"observed_at":"2026-08-01T08:23:29.745621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10486","last_updated":"2025-02-14T08:44:43Z","snapshot_observed_at":"2026-08-09T21:15:29.298237Z","submitted_at":"2025-02-14T08:44:43Z","title":"VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10486","snapshot_observed_at":"2026-08-01T08:23:29.831115Z","title":"VLM-Guard: Safeguarding vision-language models via fulfilling safety alignment gap,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:29.831115Z"},"links":{"cited_paper":"/paper/2502.10486","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:7cc449058517d3469808aa79885f4d2e24fd33dbe0b63b027b9dbbafd7a4b5e0","observation_id":"c89cbb58-65f9-46d4-a841-f7f94bb71fb4","resolution":{"observed_at":"2026-08-01T08:23:29.831115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:29.961493Z","title":"Safety Subspaces are Not Linearly Distinct: A Fine-Tuning Case Study,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:29.961493Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:3e1a7c6040282937df8abd45026d26e33a758c82966cca39fb0d62442e3bf522","observation_id":"9dd1bd8a-8244-4790-afa5-b31096496715","resolution":{"observed_at":"2026-08-01T08:23:29.961493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14744","last_updated":"2025-06-23T06:11:32Z","snapshot_observed_at":"2026-08-18T22:17:27.498288Z","submitted_at":"2025-02-20T17:14:34Z","title":"HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14744","snapshot_observed_at":"2026-08-01T08:23:30.045950Z","title":"Hiddendetect: Detecting jailbreak attacks against large vision-language models via monitoring hidden states,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:30.045950Z"},"links":{"cited_paper":"/paper/2502.14744","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:f769d39dea951447cbae7cf639ae92dc63b1c2fe91f26f19e7f6b5dd15f208b4","observation_id":"5b3c30c2-be6d-4e5c-80de-9472927ce71b","resolution":{"observed_at":"2026-08-01T08:23:30.045950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:30.102859Z","title":"Brainvis: Exploring the bridge between brain and visual signals via image reconstruction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:30.102859Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:365268f3ae20925488cfdb04f52f02aaeac67d683667307af0352221fc63a298","observation_id":"2cb625d7-3ab6-4ba9-9b7f-6bca1a30cb20","resolution":{"observed_at":"2026-08-01T08:23:30.102859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:30.217304Z","title":"Tuning vision-language models with candidate labels by prompt alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:30.217304Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:60987ad1e9bcdb71b68e3a2787a55467285afd5b51be18ee0b7133d1f6dd6003","observation_id":"ff7c5261-a453-457f-8426-f2b941488006","resolution":{"observed_at":"2026-08-01T08:23:30.217304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:30.354643Z","title":"Refineshot: Rethinking cinematography understanding with foundational skill evaluation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:30.354643Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:34f24b29fd4c1bb5040ca290e70de59febd8a7149cae321a99dcafafcd1545c2","observation_id":"aa737389-de1b-479e-8a3e-c0a65151bfb0","resolution":{"observed_at":"2026-08-01T08:23:30.354643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:30.430349Z","title":"What should a streaming video model remember?","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:30.430349Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:2a8b7fa5c2c213f15774e81d4bb3c67f010f002fffe0b807c3c08db35eb505e4","observation_id":"2707110f-43c0-40e8-9446-3278e2f9779a","resolution":{"observed_at":"2026-08-01T08:23:30.430349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:30.536722Z","title":"VLSU: Mapping the Limits of Joint Multimodal Understanding for AI Safety,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:30.536722Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:6a95149e9ec8137be36eb0300046ab8c19e9b00ecf2878ac48014bda6f34264b","observation_id":"fc9c40da-8dca-4354-8b8a-9e8f9e7a5591","resolution":{"observed_at":"2026-08-01T08:23:30.536722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:30.608162Z","title":"Vistawise: Building cost-effective agent with cross-modal knowledge graph for minecraft,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:30.608162Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:afbdf5390ba82049040237988e129493d56c01d44de7249f8ce521209e94bd0c","observation_id":"58db01ab-fba1-4b02-b875-2df991562a9e","resolution":{"observed_at":"2026-08-01T08:23:30.608162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:30.700547Z","title":"Safe inputs but unsafe output: Benchmarking cross-modality safety alignment of large vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:30.700547Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:6c28f2b1cd918d9983fdffb4da28db4bb900c535aec06474496bd26aea4703e2","observation_id":"42dea20b-383b-4903-befe-c2cf52b315fb","resolution":{"observed_at":"2026-08-01T08:23:30.700547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:30.785369Z","title":"Contextnav: Towards agentic multimodal in-context learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:30.785369Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:085a10f224196e655bc52a9de3f5ba4f7a2b40b164db97279008d5dc2c9dcfed","observation_id":"ec738abf-5682-4d9e-9949-bc5c97e30644","resolution":{"observed_at":"2026-08-01T08:23:30.785369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19602","last_updated":"2025-03-25T12:37:22Z","snapshot_observed_at":"2026-08-18T00:51:04.126241Z","submitted_at":"2025-03-25T12:37:22Z","title":"Innate Reasoning is Not Enough: In-Context Learning Enhances Reasoning Large Language Models with Less Overthinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19602","snapshot_observed_at":"2026-08-01T08:23:30.869177Z","title":"Innate reasoning is not enough: In-context learning enhances reasoning large language models with less overthinking,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:30.869177Z"},"links":{"cited_paper":"/paper/2503.19602","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:6c25170cdaa89e40b13f81d3b17dbb00f9072dad991dc499a236c8bfe2748d1c","observation_id":"a624a08a-09d9-4b82-ba71-dfb74e901cb5","resolution":{"observed_at":"2026-08-01T08:23:30.869177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10057","last_updated":"2025-01-17T09:22:35Z","snapshot_observed_at":"2026-08-21T02:31:48.030559Z","submitted_at":"2025-01-17T09:22:35Z","title":"MSTS: A Multimodal Safety Test Suite for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10057","snapshot_observed_at":"2026-08-01T08:23:30.999477Z","title":"MSTS: A Multimodal Safety Test Suite for Vision-Language Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:30.999477Z"},"links":{"cited_paper":"/paper/2501.10057","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:0761da1cee4c96df0fe29f1a577f22666c8d732578bed459fa56d99a279ddd01","observation_id":"acff3c2e-36fe-41ef-85c3-3f6dad372087","resolution":{"observed_at":"2026-08-01T08:23:30.999477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:31.127006Z","title":"Enhanced partially relevant video retrieval through inter-and intra-sample analysis with coherence prediction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:31.127006Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:0f233355b1dbaef51a3a056b402a1b70b89538fc5701dce5dbd8fa8cc4b72e3c","observation_id":"329af082-73f1-40cf-927d-45246d7dec74","resolution":{"observed_at":"2026-08-01T08:23:31.127006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:31.257851Z","title":"Slang: New concept comprehension of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:31.257851Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:5598be000e41b181dddb9497de552d8f4de98903f06097035b8550fd3b862689","observation_id":"7ed234ea-30bd-4a88-aea4-96f441780839","resolution":{"observed_at":"2026-08-01T08:23:31.257851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03343","last_updated":"2026-07-31T11:04:28Z","snapshot_observed_at":"2026-08-14T23:39:10.341307Z","submitted_at":"2025-08-05T11:44:26Z","title":"WaMo: Wavelet-Enhanced Multi-Frequency Trajectory Analysis for Fine-Grained Text-Motion Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03343","snapshot_observed_at":"2026-08-01T08:23:31.376601Z","title":"Wamo: Wavelet-enhanced multi- frequency trajectory analysis for fine-grained text-motion retrieval,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:31.376601Z"},"links":{"cited_paper":"/paper/2508.03343","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:c89e3057cf514b4522b00dcf3f10b1ae7dbd25bf8427d319a764dc859bf8501c","observation_id":"8df1f85f-83e8-4bd7-a22c-e78884379a39","resolution":{"observed_at":"2026-08-01T08:23:31.376601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:31.512899Z","title":"Sdr-gain: A high real-time occluded pedestrian pose completion method for autonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:31.512899Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:25fab724eb3ccb68e327b03886af4a1a63031ecf8c763fd12599f9099055607e","observation_id":"530f78e2-97ce-4999-950d-9dd642de875f","resolution":{"observed_at":"2026-08-01T08:23:31.512899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27393","last_updated":"2026-04-30T04:05:43Z","snapshot_observed_at":"2026-08-11T08:01:37.262348Z","submitted_at":"2026-04-30T04:05:43Z","title":"MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27393","snapshot_observed_at":"2026-08-01T08:23:31.649091Z","title":"Minicpm-o 4.5: Towards real-time full-duplex omni-modal interaction,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:31.649091Z"},"links":{"cited_paper":"/paper/2604.27393","citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:7ccfe907d9f65746c1b63b5adc9380afda86cf3bfefafb05d54909d7d209a3be","observation_id":"81008fc1-aaf3-4e1e-88bf-16763bfc89cd","resolution":{"observed_at":"2026-08-01T08:23:31.649091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:31.730788Z","title":"Enhanced cross-modal 3d retrieval via tri-modal reconstruction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:31.730788Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:b06c04d9a9de43c264f85c38632fce8aae99a8e24e9eeaf0fe39825689bd3516","observation_id":"1f5e13f5-9c9b-4a31-8035-7a685dd5f467","resolution":{"observed_at":"2026-08-01T08:23:31.730788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:23:31.950259Z","title":"Minicpm-v 4.5: Cooking efficient mllms via architecture, data, and training recipe,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T08:23:31.950259Z"},"links":{"citing_paper":"/paper/2607.21151"},"observation_digest":"sha256:5ced4c86dc5b194af320087beb681a7adf9a27a67cbefc853b92035408101e86","observation_id":"86184b48-d41f-42d1-8a98-0e156bc87929","resolution":{"observed_at":"2026-08-01T08:23:31.950259Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21151","last_updated":"2026-07-26T23:23:12Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T00:29:09.440481Z","submitted_at":"2026-07-23T10:35:38Z","title":"V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2607.21151."}