{"as_of":"2026-08-13T12:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f971ec0622eb38dc4c94c4e062e215bad4f589bc1b5d520a0e066a84b8ef6ea7","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:01:41.590694Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.10933/citation-record","integrity":"/paper/2608.10933/integrity","json":"/paper/2608.10933/citation-record.json","paper":"/paper/2608.10933"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.855742Z","title":"luma dream machine, 2024","venue":null,"work_id":"b059e7d6-95dd-4560-a07b-f3e318c93787","year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.251423Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:4502c64a5773495c018f2f3f6d8bd39db80bc83aba608b8d5a96f7a844763c36","observation_id":"3621170c-3fdd-46e2-80f0-fc40c4eed616","resolution":{"observed_at":"2026-08-12T14:01:42.862468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.835051Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval, 2021","venue":null,"work_id":"972c7e1e-3510-46df-80f3-b485628048ad","year":2021},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.258136Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:986e00b623b51b85c29ef4f934057f795f661d7eef1d84d95ef89d815cc2f3f4","observation_id":"ec10b06b-8c33-4795-9427-3d480ba6238c","resolution":{"observed_at":"2026-08-12T14:01:42.841263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T14:01:41.263970Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.263970Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:01e39347a8c41aa113250eb68d13ed40ba72f2792a173f45d887706223686212","observation_id":"3b67e2fa-adaa-4280-968c-b8d964b66e78","resolution":{"observed_at":"2026-08-12T14:01:41.263970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09838","last_updated":"2021-04-05T11:19:28Z","snapshot_observed_at":"2026-08-12T22:54:15.655627Z","submitted_at":"2020-12-17T18:56:33Z","title":"Transformer Interpretability Beyond Attention Visualization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09838","snapshot_observed_at":"2026-08-12T14:01:41.272247Z","title":"Transformer inter- pretability beyond attention visualization.arXiv preprint, arXiv:2012.09838, 2020","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.272247Z"},"links":{"cited_paper":"/paper/2012.09838","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:cf25f3ddf4e3b7acdd1ebfce215c66f68418c309af89025bb26c329261b2af80","observation_id":"f00a8dc0-52d0-42c0-b2e2-9dc01d3ef0d5","resolution":{"observed_at":"2026-08-12T14:01:41.272247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.814589Z","title":"Transformer inter- pretability beyond attention visualization","venue":null,"work_id":"5d093bea-9ad5-4431-9130-b1ea00f4c599","year":2021},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.278872Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:f394f05d4b9e1a8daaeb83ff4b483b85953049e655da3d7dae8b368b6dd920bb","observation_id":"3207e168-661f-4923-8765-b9c2cd0cbc9d","resolution":{"observed_at":"2026-08-12T14:01:42.820844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.786609Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffu- sion models","venue":null,"work_id":"24c6aa71-906d-413b-83ac-0123373d7bbf","year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.286281Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:5de83244a45912268413063c28e45c06d8e2c2921378bd32e4bb31dde33d399e","observation_id":"dd18a8dc-8fa7-41f5-b1ef-592bd7b2418c","resolution":{"observed_at":"2026-08-12T14:01:42.793770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06878","last_updated":"2024-12-09T18:59:04Z","snapshot_observed_at":"2026-08-13T10:32:27.316360Z","submitted_at":"2024-12-09T18:59:04Z","title":"SafeWatch: An Efficient Safety-Policy Following Video Guardrail Model with Transparent Explanations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06878","snapshot_observed_at":"2026-08-12T14:01:41.294275Z","title":"Safewatch: An efficient safety-policy following video guardrail model with transparent explanations.arXiv preprint arXiv:2412.06878, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.294275Z"},"links":{"cited_paper":"/paper/2412.06878","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:f4c720dac3e9e50e8a0d198293dcd7bb46090459826ae4c6c83b001e284f8c96","observation_id":"1b194c8a-90e4-44d1-8fbb-0dd988a485f4","resolution":{"observed_at":"2026-08-12T14:01:41.294275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00523","last_updated":"2025-06-24T18:55:29Z","snapshot_observed_at":"2026-08-12T23:10:17.184579Z","submitted_at":"2024-08-01T12:54:46Z","title":"Fuzz-Testing Meets LLM-Based Agents: An Automated and Efficient Framework for Jailbreaking Text-To-Image Generation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00523","snapshot_observed_at":"2026-08-12T14:01:41.299903Z","title":"Jailbreaking text-to-image models with llm- based agents.arXiv preprint arXiv:2408.00523, 1, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.299903Z"},"links":{"cited_paper":"/paper/2408.00523","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:7621edebfb5a1172ed590c915b254c723b1e52d51a8c50067fcf8f2105b8e35a","observation_id":"6d9cfe28-841e-4496-95dc-fa4bf40d3c83","resolution":{"observed_at":"2026-08-12T14:01:41.299903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.770813Z","title":"Not what you’ve signed up for: Compromising real-world llm-integrated ap- plications with indirect prompt injection","venue":null,"work_id":"b04c18f8-c540-4444-a2e5-b06e5b4b4452","year":2023},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.307066Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:775a605c4c76a56522364352ccd900d194d96e2208b7c6536cee27348b439e75","observation_id":"3fd487d9-3984-4e6c-ac3f-90d1a8f2657f","resolution":{"observed_at":"2026-08-12T14:01:42.776223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08567","last_updated":"2024-06-03T14:15:03Z","snapshot_observed_at":"2026-08-13T04:19:43.326759Z","submitted_at":"2024-02-13T16:06:17Z","title":"Agent Smith: A Single Image Can Jailbreak One Million Multimodal LLM Agents Exponentially Fast","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08567","snapshot_observed_at":"2026-08-12T14:01:41.313665Z","title":"Agent smith: A single image can jailbreak one million multimodal llm agents exponentially fast.arXiv preprint arXiv:2402.08567, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.313665Z"},"links":{"cited_paper":"/paper/2402.08567","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:027c29c25874aad93047e557a5c8ae1d43d921c65302eabdc3bc3d23c1e79048","observation_id":"c215ba6d-439a-4854-91f7-b8745555ad68","resolution":{"observed_at":"2026-08-12T14:01:41.313665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08970","last_updated":"2024-10-29T05:23:53Z","snapshot_observed_at":"2026-08-12T22:25:16.584744Z","submitted_at":"2024-10-11T16:40:03Z","title":"NoVo: Norm Voting off Hallucinations with Attention Heads in Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.08970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.08970","snapshot_observed_at":"2026-08-12T14:01:42.370995Z","title":"NoVo: Norm Voting off Hallucinations with Attention Heads in Large Language Models","venue":"cs.CL","work_id":"19ed3715-b1e3-4911-abf3-d370c2e9f61c","year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.323593Z"},"links":{"cited_paper":"/paper/2410.08970","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:2fb08cccbe62909a9e589f5d26d022740e2c7cc9327325c2f587320367060d1e","observation_id":"66a3a2b8-8ce7-42e6-a674-8a2e9f4cc013","resolution":{"observed_at":"2026-08-12T14:01:42.378552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00614","snapshot_observed_at":"2026-08-12T14:01:41.329399Z","title":"Baseline defenses for adversarial attacks against aligned language models.arXiv preprint arXiv:2309.00614,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.329399Z"},"links":{"cited_paper":"/paper/2309.00614","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:15a874b8fb2020f4ce94492aa38168d27c7058b9b4222645423b2497c3539038","observation_id":"4c4bc3a6-4452-4519-b453-f790865937f6","resolution":{"observed_at":"2026-08-12T14:01:41.329399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11815","last_updated":"2025-01-22T03:17:01Z","snapshot_observed_at":"2026-08-12T11:05:47.645400Z","submitted_at":"2025-01-21T01:45:56Z","title":"CogMorph: Cognitive Morphing Attacks for Text-to-Image Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11815","snapshot_observed_at":"2026-08-12T14:01:41.335157Z","title":"Cogmorph: Cognitive morphing attacks for text-to-image models.arXiv preprint arXiv:2501.11815, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.335157Z"},"links":{"cited_paper":"/paper/2501.11815","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:07e74127fbfcd47f381bc91864c77195daca15b505cb9d10769b342fd0558fac","observation_id":"8972b9cb-ce23-4fc2-97e7-a8a31332e2be","resolution":{"observed_at":"2026-08-12T14:01:41.335157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-12T14:01:41.341437Z","title":"Videopoet: A large language model for zero-shot video gen- eration.arXiv preprint arXiv:2312.14125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.341437Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:98b0997991e22ef0ad9ced74561e0c565372b792f91988ab8979f58683eddef5","observation_id":"13b9dec2-e8b1-4543-a0d5-68eeb5a64972","resolution":{"observed_at":"2026-08-12T14:01:41.341437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-12T14:01:41.348391Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.348391Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:82f6fd7b3c0dde9e90be9647ca79e6657d06d8cd1a7fc6b776fdbd4110feb00b","observation_id":"43710e97-8d7a-4c1e-a991-9ea39212dba6","resolution":{"observed_at":"2026-08-12T14:01:41.348391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:41.354134Z","title":"Bridg- ing text and video generation: A survey.arXiv preprint arXiv:2510.04999, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.354134Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:f972db8c3436aedd5dc9667fac122d25c97c33cb52a0799227ebac664fe53b87","observation_id":"2d353691-0f5f-4120-91bc-cef5f852c683","resolution":{"observed_at":"2026-08-12T14:01:41.354134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14872","last_updated":"2024-02-27T13:49:22Z","snapshot_observed_at":"2026-08-13T04:13:38.316013Z","submitted_at":"2024-02-21T15:13:50Z","title":"Semantic Mirror Jailbreak: Genetic Algorithm Based Jailbreak Prompts Against Open-source LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14872","snapshot_observed_at":"2026-08-12T14:01:41.360266Z","title":"Semantic mirror jailbreak: Genetic algorithm based jailbreak prompts against open-source llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.360266Z"},"links":{"cited_paper":"/paper/2402.14872","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:9c4ade520b46daf4f1c4042926788e2b74cfe3dbad79305bde59b9288a71ce12","observation_id":"bd25bb91-9d8f-4890-b3c5-17aa88224f50","resolution":{"observed_at":"2026-08-12T14:01:41.360266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15182","last_updated":"2025-08-21T02:39:14Z","snapshot_observed_at":"2026-08-08T01:21:32.994965Z","submitted_at":"2025-08-21T02:39:14Z","title":"SafeLLM: Unlearning Harmful Outputs from Large Language Models against Jailbreak Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15182","snapshot_observed_at":"2026-08-12T14:01:41.366538Z","title":"Safellm: Unlearning harmful outputs from large language models against jailbreak attacks.arXiv preprint arXiv:2508.15182, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.366538Z"},"links":{"cited_paper":"/paper/2508.15182","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:39d3aab80b59dd1ba630b99e1fdd9d2b32527981c9e33c18b306bee91eab63e0","observation_id":"f784ee13-bc4b-41fc-a28e-37dd8c9be12e","resolution":{"observed_at":"2026-08-12T14:01:41.366538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.747344Z","title":"Exploring inconsistent knowledge distil- lation for object detection with data augmentation","venue":null,"work_id":"afff501a-81b5-47df-b3de-a29f99002e56","year":2023},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.371822Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:02c7dd4f9afa5f6a958dac6b97ebee5618b3df12d9694b39876c1545b4f583da","observation_id":"d734b093-3c1e-468d-b241-58ca493f5254","resolution":{"observed_at":"2026-08-12T14:01:42.753162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.729277Z","title":"A large-scale multiple- objective method for black-box attack against object detec- tion","venue":null,"work_id":"8abaccae-b07f-4c71-8c4c-7c1fcf68b491","year":2022},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.376752Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:c419d8db5732f3aaade19c9cad3230755ebd651438ad59ac7ad0715da56eb2ef","observation_id":"acb65aa9-fd16-4785-9da7-5838883f6ecd","resolution":{"observed_at":"2026-08-12T14:01:42.734396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.710778Z","title":"Imitated detectors: Stealing knowl- edge of black-box object detectors","venue":null,"work_id":"0e539eea-82e7-4d13-9fb3-52a9e07403e2","year":2022},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.385652Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:a7736abbedf9ff27e8757e71d42395e9d93b9b51940aac2344064a3e74071c2e","observation_id":"aa3512d5-d9fd-465e-a773-0bed35cd8693","resolution":{"observed_at":"2026-08-12T14:01:42.716384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.688525Z","title":"Badclip: Dual- embedding guided backdoor attack on multimodal con- trastive learning","venue":null,"work_id":"37842211-e5cb-4e9c-904a-c286b17aa395","year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.392269Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:9711891be5863f354e59942c93e34071c586fa73172698af70bcac5cbf1aee09","observation_id":"5997afa1-715b-4658-93ed-45fe0e387139","resolution":{"observed_at":"2026-08-12T14:01:42.694850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.667728Z","title":"Re- visiting backdoor attacks against large vision-language mod- els from domain shift","venue":null,"work_id":"558fbcfd-5960-45a5-a75f-61b5b43f0ee5","year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.403136Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:dfe15047845e3bcd7ab1d93984a722890ead389cde3b9f8d90bd3518f8cd06a3","observation_id":"03be24ac-c4ba-4923-95eb-0e8b77dbb5cb","resolution":{"observed_at":"2026-08-12T14:01:42.675758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15512","last_updated":"2025-04-26T16:17:55Z","snapshot_observed_at":"2026-08-07T16:00:24.594893Z","submitted_at":"2025-04-22T01:18:42Z","title":"T2VShield: Model-Agnostic Jailbreak Defense for Text-to-Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15512","snapshot_observed_at":"2026-08-12T14:01:41.409683Z","title":"T2vshield: Model-agnostic jailbreak defense for text- to-video models.arXiv preprint arXiv:2504.15512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.409683Z"},"links":{"cited_paper":"/paper/2504.15512","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:a08bd41a178d928b18d2e3b0c35a0854feeaad846ab55577c560a11f60786a10","observation_id":"75b6184d-628f-4045-8014-aa06a4e4f31a","resolution":{"observed_at":"2026-08-12T14:01:41.409683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06679","last_updated":"2025-06-17T07:44:28Z","snapshot_observed_at":"2026-08-08T06:57:13.896585Z","submitted_at":"2025-05-10T16:04:52Z","title":"T2V-OptJail: Discrete Prompt Optimization for Text-to-Video Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06679","snapshot_observed_at":"2026-08-12T14:01:41.416164Z","title":"T2v-optjail: Discrete prompt optimization for text-to-video jailbreak attacks.arXiv preprint arXiv:2505.06679, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.416164Z"},"links":{"cited_paper":"/paper/2505.06679","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:e48684a413091713031dc9695ee18aa5f44b4537680ea88ea8e33fed21a698a9","observation_id":"49c1450e-a640-44d9-a75a-f765678b4c7b","resolution":{"observed_at":"2026-08-12T14:01:41.416164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-12T14:01:41.421711Z","title":"Sora: A review on background, technology, 9 limitations, and opportunities of large vision models.arXiv preprint arXiv:2402.17177, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.421711Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:cb3a6bb2d6488facadb959ae68c0fc64c346561b020fd7da011d636719fe8551","observation_id":"b37bf1e9-2c04-4f9a-bdb1-6d6a0da3e612","resolution":{"observed_at":"2026-08-12T14:01:41.421711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.644985Z","title":"T2vsafetybench: Evaluating the safety of text-to-video generative models.Advances in Neural In- formation Processing Systems, 37:63858–63872, 2024","venue":null,"work_id":"d212c4c0-5db7-4b7a-a204-e8cfe0d0e4eb","year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.427081Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:1aa5d5477e9a1ccfa77c65be6ed8052ed6661a87e834f8503a7d9c52ae9a2b94","observation_id":"3430bbff-3f71-4fc1-9474-13c77bfbd341","resolution":{"observed_at":"2026-08-12T14:01:42.651236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-12T14:01:41.432312Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to- video generation.arXiv preprint arXiv:2407.02371, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.432312Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:e783e2575d0ac595a59184ded0af0828b5d38b1714710b30caa312440110fc12","observation_id":"9cbb6cf0-a596-4ec5-808f-38138c7904fb","resolution":{"observed_at":"2026-08-12T14:01:41.432312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.628739Z","title":"T2veval: Benchmark dataset and objective evaluation method for t2v-generated videos.Displays, page 103178,","venue":null,"work_id":"b74dd5de-0b83-4bee-bb95-d5e89f2f731c","year":null},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.439770Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:0c793bf8c244c6155f3a850a3d5d9e5f4a20958c927774271fa77fa250f9dd18","observation_id":"c6ebe9aa-8a0d-474c-b5f6-506e679252c8","resolution":{"observed_at":"2026-08-12T14:01:42.634346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-12T14:01:41.446099Z","title":"Make-a-video: Text-to-video generation without text-video data.arXiv preprint arXiv:2209.14792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.446099Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:af5678cad9c092ff2a2f5a1d8fae615445a1894859a79cab7ea3b4fc3c53c0be","observation_id":"9085880b-0bed-4c4d-871b-ad881d48e851","resolution":{"observed_at":"2026-08-12T14:01:41.446099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.614403Z","title":"Kling-omni technical report, 2025","venue":null,"work_id":"c61b5513-22da-4144-98ad-f14184fced3f","year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.451995Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:f8dbca4cc29aeb7a00497e75daf9744d8439d5a36461608a0debc49ab5f155c8","observation_id":"91185768-7cf0-4da1-a1a5-4580ab734650","resolution":{"observed_at":"2026-08-12T14:01:42.618604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.596951Z","title":"Videotetris: Towards compositional text-to-video generation.Advances in Neural Information Processing Sys- tems, 37:29489–29513, 2024","venue":null,"work_id":"26a5f127-f211-4110-b26a-e2a65675a250","year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.457213Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:e1979485eba5f2733e525eec3e944b51d6410e0caf69d8bfd3a16742c46d367f","observation_id":"787ac11e-2afb-4b10-959c-eebed3a757ad","resolution":{"observed_at":"2026-08-12T14:01:42.602757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14348","last_updated":"2025-07-27T10:12:52Z","snapshot_observed_at":"2026-08-07T21:52:02.659469Z","submitted_at":"2025-04-19T16:28:03Z","title":"Manipulating Multimodal Agents via Cross-Modal Prompt Injection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14348","snapshot_observed_at":"2026-08-12T14:01:41.462806Z","title":"Manipulating multimodal agents via cross-modal prompt injection.arXiv preprint arXiv:2504.14348, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.462806Z"},"links":{"cited_paper":"/paper/2504.14348","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:0eea7e52d4632923c11d0ed79b4f7f2dd4ecfb56d63aca94588057d7ad70245c","observation_id":"aa6d094c-6ecd-415f-a8a3-05a3584c3702","resolution":{"observed_at":"2026-08-12T14:01:41.462806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.578146Z","title":"Jail- broken: How does llm safety training fail?Advances in neu- ral information processing systems, 36:80079–80110, 2023","venue":null,"work_id":"9691e8d1-cbdb-4410-9c71-0163e8042d5c","year":2023},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.470170Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:f6638bccbb71f44c6b4cc855c151d8badd01a3de4d88242eed7399143a637fcf","observation_id":"7f40b8f3-844b-41c1-9968-e5b0f8480707","resolution":{"observed_at":"2026-08-12T14:01:42.583597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.555338Z","title":"Defensive prompt patch: A robust and generalizable defense of large language models against jailbreak attacks","venue":null,"work_id":"ad91f73f-dfde-4766-84ee-8afb03a04a1a","year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.484064Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:362d8ebfd2ab7e691219f64bc7d5b68a4018283c9b13a0bc9f6df3535c1c733c","observation_id":"fc4eeec0-dd76-452b-abce-c1d7f2013989","resolution":{"observed_at":"2026-08-12T14:01:42.560545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.535984Z","title":"Video- eraser: Concept erasure in text-to-video diffusion models","venue":null,"work_id":"95a2cd59-4b02-44e3-80b4-75738e8293ba","year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.490263Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:b25ac8166e085958bbffb88215bea4182c1b43049ab38ad7b90705e8a2a48878","observation_id":"532d45e4-ee0e-4995-a0ca-a53616ba061a","resolution":{"observed_at":"2026-08-12T14:01:42.541646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-12T14:01:41.500641Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.500641Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:e7a01602260bdad45ae8579f551ca6018fca9ef7aebc1296695bb51c689619fa","observation_id":"6b4a4a8d-21e5-42fe-a6fa-0d08d8f668dd","resolution":{"observed_at":"2026-08-12T14:01:41.500641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-12T17:45:10.384900Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04295","snapshot_observed_at":"2026-08-12T14:01:41.509428Z","title":"Jailbreak attacks and defenses against large language models: A survey.arXiv preprint arXiv:2407.04295, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.509428Z"},"links":{"cited_paper":"/paper/2407.04295","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:4e900ccb8007d3944fc345fd9c19987dd859f316b55cb10b2cd838c7e97a38c0","observation_id":"81a610f3-d5d9-4ea5-a11e-e2d4588ba948","resolution":{"observed_at":"2026-08-12T14:01:41.509428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04031","last_updated":"2024-07-01T14:25:23Z","snapshot_observed_at":"2026-08-12T23:48:48.833189Z","submitted_at":"2024-06-06T13:00:42Z","title":"Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04031","snapshot_observed_at":"2026-08-12T14:01:41.516193Z","title":"Jailbreak vision language models via bi-modal adversarial prompt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.516193Z"},"links":{"cited_paper":"/paper/2406.04031","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:ebf4ac3f4784f7b0a478cdc62996f9968f91f5d982d378319cce369fa874c163","observation_id":"62a1afb1-8ef7-4f5d-9bd2-81bbc9236c81","resolution":{"observed_at":"2026-08-12T14:01:41.516193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12430","last_updated":"2025-07-11T02:01:54Z","snapshot_observed_at":"2026-08-09T20:22:46.693664Z","submitted_at":"2025-06-14T10:03:17Z","title":"Pushing the Limits of Safety: A Technical Report on the ATLAS Challenge 2025","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12430","snapshot_observed_at":"2026-08-12T14:01:41.521564Z","title":"Pushing the limits of safety: A tech- nical report on the atlas challenge 2025.arXiv preprint arXiv:2506.12430, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.521564Z"},"links":{"cited_paper":"/paper/2506.12430","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:a16866422732ae9e9f97168d79e2f302902c8dcb6b6e93985e1e55b034c058de","observation_id":"f9a84e0f-5891-4928-8125-6b618b3d553f","resolution":{"observed_at":"2026-08-12T14:01:41.521564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11054","last_updated":"2025-03-11T03:06:17Z","snapshot_observed_at":"2026-08-11T01:06:25.294944Z","submitted_at":"2025-02-16T09:27:44Z","title":"Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11054","snapshot_observed_at":"2026-08-12T14:01:41.527677Z","title":"Reasoning- augmented conversation for multi-turn jailbreak attacks on large language models.arXiv preprint arXiv:2502.11054,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.527677Z"},"links":{"cited_paper":"/paper/2502.11054","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:b270a112f6f7d1fa17fea70c89ee1ff0f50a1c2e4287998f8428989a267689b4","observation_id":"dd8eaec9-7540-4b66-b0ff-cf4653a68eb6","resolution":{"observed_at":"2026-08-12T14:01:41.527677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12761","last_updated":"2025-03-14T04:47:39Z","snapshot_observed_at":"2026-08-12T22:21:40.084656Z","submitted_at":"2024-10-16T17:32:23Z","title":"SAFREE: Training-Free and Adaptive Guard for Safe Text-to-Image And Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12761","snapshot_observed_at":"2026-08-12T14:01:41.533067Z","title":"Safree: Training-free and adaptive guard for safe text-to-image and video generation.arXiv preprint arXiv:2410.12761, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.533067Z"},"links":{"cited_paper":"/paper/2410.12761","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:cc7d26fdaf7a0df38e753a66759bdeaa3b6124d3cec4112fd43350723bb39e7a","observation_id":"d33333d5-1b61-4c26-b77e-7a84afc3ae10","resolution":{"observed_at":"2026-08-12T14:01:41.533067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.516733Z","title":"Safree: Training-free and adaptive guard for safe text-to-image and video generation","venue":null,"work_id":"9b06c47a-931f-4ccc-923e-91c0d39ffa96","year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.539171Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:a3508946aaa6c7efbd0d1b175d6a016148e218813361cbf6c1b3138837d77e64","observation_id":"2ab41e49-4e0a-42f6-bcc1-bdcd5fa9660a","resolution":{"observed_at":"2026-08-12T14:01:42.522597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-12T14:01:41.549719Z","title":"Language model beats diffusion–tokenizer is key to visual generation.arXiv preprint arXiv:2310.05737, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.549719Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:a604be3249f633bcd2e6ee6c866ca9448f8c2027e03bcb5cb12367ac7974c456","observation_id":"c100e2ec-4c37-49f1-bdfa-be661290bb15","resolution":{"observed_at":"2026-08-12T14:01:41.549719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20242","last_updated":"2026-06-09T05:19:18Z","snapshot_observed_at":"2026-08-13T04:16:56.340592Z","submitted_at":"2024-07-16T13:13:16Z","title":"BadRobot: Jailbreaking Embodied LLM Agents in the Physical World","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20242","snapshot_observed_at":"2026-08-12T14:01:41.556081Z","title":"Badrobot: Jailbreaking llm-based embodied ai in the physical world.arXiv preprint arXiv:2407.20242, 3:1, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.556081Z"},"links":{"cited_paper":"/paper/2407.20242","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:372c4049f99510dbbad7feeedaa784c6f6c827b5ed806c73d69bb937808215b8","observation_id":"19624e28-881f-42bb-964d-0cfc1773be5d","resolution":{"observed_at":"2026-08-12T14:01:41.556081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.495446Z","title":"Jbshield: Defending large lan- guage models from jailbreak attacks through activated con- cept analysis and manipulation","venue":null,"work_id":"b0a5c2e5-58e8-47aa-b465-e5a493fc0b30","year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.562372Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:5e8edf0dbc6a3e2b8878507c0c6c435beeb7cd761627e626dedc6832c760b9a1","observation_id":"4e47367e-6738-42a7-9a3e-be9d00ec226c","resolution":{"observed_at":"2026-08-12T14:01:42.503946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08924","last_updated":"2024-08-22T17:21:34Z","snapshot_observed_at":"2026-08-12T23:03:06.239063Z","submitted_at":"2024-08-15T14:51:32Z","title":"Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08924","snapshot_observed_at":"2026-08-12T14:01:41.567414Z","title":"Prefix guidance: A steering wheel for large language models to defend against jailbreak attacks.arXiv preprint arXiv:2408.08924, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.567414Z"},"links":{"cited_paper":"/paper/2408.08924","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:097b3106d6f0d735f5e3661a4161e717223b892f74eda13061066f56a713f6fd","observation_id":"9f387c79-6dd8-4fdd-9df1-3c138f0b56fd","resolution":{"observed_at":"2026-08-12T14:01:41.567414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-12T14:01:41.585415Z","title":"Open-sora: Democratizing efficient video production for all.arXiv preprint arXiv:2412.20404, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.585415Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:32ce0e84ab8e369ef614b32232d2ce78332a79c6a60aa0fe02f035ff00055c12","observation_id":"1fa8f2b4-2334-4a8e-bc4d-9c924c6f477b","resolution":{"observed_at":"2026-08-12T14:01:41.585415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-12T14:01:41.590694Z","title":"Universal and transferable ad- versarial attacks on aligned language models.arXiv preprint arXiv:2307.15043, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.590694Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:5ae0307955b89ef817cd018234265e0d5462db50424279b4fc56ade25afa825d","observation_id":"827e0253-8a58-4128-9d07-a5c44328da0a","resolution":{"observed_at":"2026-08-12T14:01:41.590694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T10:22:40.805981Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2608.10933."}