{"as_of":"2026-08-07T23:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97aa073de26a4efaf46110cd4773f93caf9f7c286bd2c3ae5d16f4a6aea80526","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:12:03.631575Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.00817/citation-record","integrity":"/paper/2507.00817/integrity","json":"/paper/2507.00817/citation-record.json","paper":"/paper/2507.00817"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T21:12:03.460828Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.460828Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:d2263eb4bb7719d671b7e050e9b87973836dd859e26fcb2a5b1feda480f32f9c","observation_id":"ab9a3c74-bce9-475f-beff-8717619f3c63","resolution":{"observed_at":"2026-08-06T21:12:03.460828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T21:12:03.466590Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.466590Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:f9180a1ddb39636e7bf6fda06822f5fd686b4242d6e8797eb9621b955eacd3c2","observation_id":"e405321d-415a-415e-a4c0-01d13ab22267","resolution":{"observed_at":"2026-08-06T21:12:03.466590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T21:12:03.471197Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.471197Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:50c2bdcfc69399e20d74ec004980ebc60c5ea18809fdad4e7f17b023e22b59d9","observation_id":"d3e09ca4-f9bf-44ba-b2b3-5280009a6fc9","resolution":{"observed_at":"2026-08-06T21:12:03.471197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.296505Z","title":"Rethinking model ensemble in transfer-based adversarial attacks","venue":null,"work_id":"3b187de3-5406-4a5c-a426-a8c587b8b6fb","year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.475888Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:b0c9e3c9833e02091a7c10acd86681b44b784314d7fde6f7eb5e6adb42e16959","observation_id":"fd4f7cb2-84d9-42f7-9d58-9953771d356d","resolution":{"observed_at":"2026-08-06T21:12:04.301035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.282221Z","title":"Gcma: Generative cross-modal transferable adversarial attacks from images to videos","venue":null,"work_id":"8bd1eab1-de4a-4895-9817-4c4dc6eb5210","year":2023},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.481152Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:984e617ff7251467b1d2e856a6ed43f97a861bfc8c824081d24e2a9ed2bf5ddd","observation_id":"7be22a30-c6aa-42a1-8f01-36546015233d","resolution":{"observed_at":"2026-08-06T21:12:04.286592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T21:12:03.486303Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.486303Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:605be41bd270513f0a7541a6fd228a7c645d854faee6ef5e45be35e938b7d6f9","observation_id":"3d11eb4b-aecf-4563-88a8-77e0ac458ce8","resolution":{"observed_at":"2026-08-06T21:12:03.486303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.267851Z","title":"Parseval networks: Improving robustness to adversarial examples","venue":null,"work_id":"549121ce-bda1-4b20-9177-bcd421785da6","year":2017},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.491971Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:bd27dc8ffda232b36589a704c74071c21515e7f69a7ef4ecb6608ad72db7531c","observation_id":"f7554876-00cb-4579-a646-9fbd67b13ab0","resolution":{"observed_at":"2026-08-06T21:12:04.272326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:03.496616Z","title":"One perturbation is enough: On generating universal adversarial perturbations against vision- language pre-training models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.496616Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:c99aa74a9262c8624b6db9d32f212d794f2bc542add2b46b20c69f1b3068fafe","observation_id":"128bc05e-11e6-426c-8930-b4fd367ac9cc","resolution":{"observed_at":"2026-08-06T21:12:03.496616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:03.500911Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.500911Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:e33948cf864d05948e12c80d76da633a7181ad860acdab05387b535ad46ed7e6","observation_id":"8b69b999-4419-4bb0-b762-2b015be3263a","resolution":{"observed_at":"2026-08-06T21:12:03.500911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-06T21:12:03.505036Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.505036Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:7adf42909192ca376556bc5956e6ebe0d6dc1b4a1735e160f1bcb512d42ff7d6","observation_id":"3081277c-1838-442e-8114-028a50bc5332","resolution":{"observed_at":"2026-08-06T21:12:03.505036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.241890Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"836e81a4-bd18-4575-9887-52c0088b29d7","year":2025},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.509895Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:bfe25b9eaa99d8919a1c28d6b59085c505bade0599b7ee5c542177591e1b388c","observation_id":"f83f7fd2-5384-4c96-bf26-f92b75ca8ffc","resolution":{"observed_at":"2026-08-06T21:12:04.246709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.225757Z","title":"Retome-va: Recursive token merging for video diffusion-based unrestricted adversarial attack","venue":null,"work_id":"306d2ea7-3fcb-46d3-aa23-3bb6ae59cc20","year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.515186Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:6f13fa6da1740fdf0ee88ea06086f062deb1125810694efa13a5cfad616d55f9","observation_id":"40c594a2-e467-4b93-967c-63785b6c8830","resolution":{"observed_at":"2026-08-06T21:12:04.230595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-06T21:12:03.519327Z","title":"Explaining and harnessing adversar- ial examples","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.519327Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:946f7b68f3e5974a92fa1a72429b970e0a5a54d0539fbf9d5d1c60d2d46feecd","observation_id":"82d0fffc-fb17-46c4-b2ae-dc9427800d6d","resolution":{"observed_at":"2026-08-06T21:12:03.519327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.210014Z","title":"X-transfer attacks: Towards super transferable adversarial attacks on clip","venue":null,"work_id":"10c7170b-1725-40da-b889-e07f7be90ee3","year":2025},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.523977Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:795bdb512f1a7f14252fdef415a67baa156a28c1a3748728bb95b03ca9547e3a","observation_id":"48a29949-3fa6-4845-b58a-894c68812495","resolution":{"observed_at":"2026-08-06T21:12:04.215116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T21:12:03.528213Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.528213Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:fbd56243e2b33de8599c7d4b4e8e16fa35b353f641fb3fb93e0b32c6e9c20d92","observation_id":"4c32859d-f05e-4ad6-94f8-674b6719cd98","resolution":{"observed_at":"2026-08-06T21:12:03.528213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T21:12:03.532425Z","title":"Aria: An open multimodal native mixture-of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.532425Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:383d1d54aa23b8259e1a293fef921a3a63d32f1c2867ddc6fb184ae41f8f31cb","observation_id":"eead32a8-c627-48ac-b545-2cbbaea125dc","resolution":{"observed_at":"2026-08-06T21:12:03.532425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:03.536504Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.536504Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:d92c6ff5b2e8c807d5e2fe4dfa244cde5ebd6e72db89d03e49e0ce18fbc00aed","observation_id":"ebd10513-2b87-41c1-99b6-38a145df829f","resolution":{"observed_at":"2026-08-06T21:12:03.536504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:03.540655Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.540655Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:e0ce646f7188e87875d444d83f5f23cf75e97395edc30f7a3080a6d5c5ab64f2","observation_id":"51a9d344-5cb7-440f-ac7d-d88c4ffc0315","resolution":{"observed_at":"2026-08-06T21:12:03.540655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.174046Z","title":"Set-level guidance attack: Boosting adversarial transferability of vision-language pre-training models","venue":null,"work_id":"e2d4062f-8386-4f36-a29d-0b9fd9c272d6","year":2023},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.544625Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:d800d935f0c074c3ebf3bbb2ff7f2cfa54c245ef9046393ea8ea6ca31d49d3e9","observation_id":"a3ea58a3-74c1-4ee8-83a9-81ddaf24e3de","resolution":{"observed_at":"2026-08-06T21:12:04.179120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06083","last_updated":"2019-09-04T18:53:10Z","snapshot_observed_at":"2026-08-07T14:27:46.872660Z","submitted_at":"2017-06-19T17:53:11Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06083","snapshot_observed_at":"2026-08-06T21:12:03.549503Z","title":"Towards deep learning models resistant to adversarial attacks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.549503Z"},"links":{"cited_paper":"/paper/1706.06083","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:36c0b2b23a9358f20925b2d8d26e917ed2febb30a4495616e0c3aa748112147f","observation_id":"b6a1ca85-0bdb-487b-98a7-73c187545f8e","resolution":{"observed_at":"2026-08-06T21:12:03.549503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.159247Z","title":"Univer- sal adversarial perturbations","venue":null,"work_id":"4b9fd1e9-95a6-4e14-8db9-6c3655970d7a","year":2017},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.554064Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:d161891e0a2c06c6aea873c995205b9cb31a95e217690b608d00685b1ced290d","observation_id":"93f61dd9-ccb2-44ed-815b-7fdc3892785b","resolution":{"observed_at":"2026-08-06T21:12:04.163647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:03.558815Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.558815Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:9fdc4d5bcb162abcc77c70bb66ca14131379d66c58c92c9261f2ff2c7a0b070f","observation_id":"ab3872f9-c4e8-4123-859f-9d5a7f70b926","resolution":{"observed_at":"2026-08-06T21:12:03.558815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:03.563178Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.563178Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:abd6291eba51235a468e30271a260dfc3aeb3488e2dcad4835995b13df9e7fb5","observation_id":"7c9e3e32-446e-4b8d-a0f7-e5a836791a7f","resolution":{"observed_at":"2026-08-06T21:12:03.563178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:03.567331Z","title":"Imagenet large scale visual recognition challenge","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.567331Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:65b4be29c0b0319d320f285fc85ff4b81612705fd12b8d1a96888e8986d4ab10","observation_id":"47612cf9-a8db-4d85-a995-80f50e49d618","resolution":{"observed_at":"2026-08-06T21:12:03.567331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-06T21:12:03.571419Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.571419Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:2e2775794b0446baf76e580bd296fda4ba654c93c1b2b9b293c037d21310fac0","observation_id":"7a0c61b1-3f95-425e-b8ce-27c69effc377","resolution":{"observed_at":"2026-08-06T21:12:03.571419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T21:12:03.575394Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.575394Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:d64d5637f2e3c0ef003fcfd8f5d51c908294f9a4152d518a32e7291aad016785","observation_id":"cc980697-0bdf-4e78-936d-0e3f2ad73a81","resolution":{"observed_at":"2026-08-06T21:12:03.575394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.112859Z","title":"Heuristic black-box adversarial attacks on video recognition models","venue":null,"work_id":"b7b72c00-153b-46cd-aa5b-8626bdd8978c","year":2020},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.579468Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:02330fa3def2c383ea8760a670502881330be8dd2b7cc60ebdf98a43f1f04cb7","observation_id":"77b55267-56ec-4a69-a202-3b0d4b9db60d","resolution":{"observed_at":"2026-08-06T21:12:04.117058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.096063Z","title":"Boosting the transferability of video adversarial examples via temporal translation","venue":null,"work_id":"57920b5b-fe1b-43ba-bcbd-2e6a50ee641c","year":2022},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.583937Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:cc447c9ebe7cd6ddbc3cc5d0b22f6d48ec2d67f2c920c3f0c418134416fbb816","observation_id":"90334929-223c-417a-ab9e-70774e542d45","resolution":{"observed_at":"2026-08-06T21:12:04.101434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.080050Z","title":"Cross-modal transferable adversarial attacks from images to videos","venue":null,"work_id":"6ef04030-6378-40be-8f30-11b1d83f86d0","year":2022},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.587903Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:ec7c51ad19c2d194c173ca4d4074d71a111161cf18dd919953889a565fa6948a","observation_id":"c90db321-d442-49cc-a7b6-74635529a31c","resolution":{"observed_at":"2026-08-06T21:12:04.084862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.064957Z","title":"Adaptive temporal grouping for black-box adversarial attacks on videos","venue":null,"work_id":"a187f09e-2a00-4c55-ae46-3986ef58434d","year":2022},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.592180Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:57a78a216cb2c9d83ab995c17fc374edf06383fec590f8a47f6a497b56e2ec53","observation_id":"11506826-ea51-45e5-baa0-929ff5c98432","resolution":{"observed_at":"2026-08-06T21:12:04.069512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.049240Z","title":"Adaptive cross-modal transferable adversarial attacks from images to videos","venue":null,"work_id":"38456efb-48f6-48e5-8414-e2ca477c1384","year":2023},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.596832Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:02bf6ad9d788492b34a39d54a9a6e33c6ea1ab1c901a0e90a7de8cc58a497786","observation_id":"63950faf-6718-4384-b2d9-e190306a711b","resolution":{"observed_at":"2026-08-06T21:12:04.054373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T21:12:03.601085Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.601085Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:08a1d3382c03feb09d91ac261922bcc06d11aa2a0adfa65837d049b500032ce2","observation_id":"ef1ee7dd-1f2b-495d-9dc3-6daabfc7e3d5","resolution":{"observed_at":"2026-08-06T21:12:03.601085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.032954Z","title":"Vlattack: Multimodal adversarial attacks on vision-language tasks via pre-trained models","venue":null,"work_id":"866a5b35-5fb8-4baa-a022-caf9cad56ea0","year":2023},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.605433Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:27d632dc4e06390d4b98953656cedaf626d852660db4521f7a7977925d1beb17","observation_id":"d2c84931-efae-493e-b958-0a6fe724b5f0","resolution":{"observed_at":"2026-08-06T21:12:04.038244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-06T21:12:03.609942Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.609942Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:83259661ea928d98e2373778392b1e5174a9a37eb3f6f5a6c8dd468e672d3058","observation_id":"cafb8a2f-740b-498a-8a6a-66360466bc4d","resolution":{"observed_at":"2026-08-06T21:12:03.609942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.016837Z","title":"Towards adversarial attack on vision-language pre- training models","venue":null,"work_id":"3d9fec20-8c75-4284-905f-042ecbf1ecc3","year":2022},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.614224Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:9307120a3e444cd961a329db88e4d1be099d4a326f0a72f9d387265aa39b340a","observation_id":"a12e187f-292a-4365-a725-f186be113542","resolution":{"observed_at":"2026-08-06T21:12:04.021487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:03.618948Z","title":"Anyattack: Towards large-scale self-supervised adversarial attacks on vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.618948Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:ad17679efc2b9be0e8a4b3383e17f417cfdf265bc9ffdd296042e4f629cf235f","observation_id":"3917b869-8038-4e06-92c5-d231c4ea92f5","resolution":{"observed_at":"2026-08-06T21:12:03.618948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T21:12:03.623119Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.623119Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:67fffb080dd468277d0ef2d02a1bc0f20f9bbdcea0be1474712b11766598bd11","observation_id":"b3f8ab5d-e1e0-4dc3-a967-4662dd2d825b","resolution":{"observed_at":"2026-08-06T21:12:03.623119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:03.980753Z","title":"On evaluating adversarial robustness of large vision-language models","venue":null,"work_id":"adfbdbe0-7fa0-4235-b297-7d2261805544","year":2023},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.627271Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:9159c61c87d0dda51a06bde64d8232da8f014f72f65b4e2ef48353563f026e78","observation_id":"0dcb5446-bb7b-470d-9d49-d67f429a301d","resolution":{"observed_at":"2026-08-06T21:12:03.985237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:03.962555Z","title":"Advclip: Downstream-agnostic adversarial examples in multimodal contrastive learning","venue":null,"work_id":"5b20f619-2cb3-4a70-bcfb-b1a90b67b3b6","year":2023},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.631575Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:faf08c782e4db298da021710ecce7caf79501820a54f71fada5d1e0031765aa4","observation_id":"79e3a4b7-3877-468d-9264-e3da8c4e4bf2","resolution":{"observed_at":"2026-08-06T21:12:03.968998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2507.00817."}