{"as_of":"2026-08-09T10:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4916ecd3ae97eaf5d6487681a17ea464e27f43e2ffed073b9a0cbe326c874b35","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T02:13:30.231270Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.25522/citation-record","integrity":"/paper/2607.25522/integrity","json":"/paper/2607.25522/citation-record.json","paper":"/paper/2607.25522"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1706.06083","last_updated":"2019-09-04T18:53:10Z","snapshot_observed_at":"2026-08-07T14:27:46.872660Z","submitted_at":"2017-06-19T17:53:11Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06083","snapshot_observed_at":"2026-08-01T02:13:29.359126Z","title":"To- wards deep learning models resistant to adversarial attacks.arXiv preprint arXiv:1706.06083,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25522","last_updated":"2026-07-29T07:30:08Z","snapshot_observed_at":"2026-08-07T09:55:38.965350Z","submitted_at":"2026-07-28T10:05:11Z","title":"I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:29.359126Z"},"links":{"cited_paper":"/paper/1706.06083","citing_paper":"/paper/2607.25522"},"observation_digest":"sha256:c78472c9eb4e283eb7b1b7950bb91b6e530a77b0c89eba86129fc484de38e6b5","observation_id":"b858a6e9-b9bd-4656-ae14-1a9ec512d219","resolution":{"observed_at":"2026-08-01T02:13:29.359126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-01T02:13:29.820660Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25522","last_updated":"2026-07-29T07:30:08Z","snapshot_observed_at":"2026-08-07T09:55:38.965350Z","submitted_at":"2026-07-28T10:05:11Z","title":"I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:29.820660Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.25522"},"observation_digest":"sha256:38572c9fffec9bd7cc179003dc72040fcacda977aae287dd8873a34d76681b4a","observation_id":"81c4dfa5-c9f3-4ea9-b8d0-cc597a9775ec","resolution":{"observed_at":"2026-08-01T02:13:29.820660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17090","snapshot_observed_at":"2026-08-01T02:13:29.918103Z","title":"Q-align: Teach- ing lmms for visual scoring via discrete text-defined levels.arXiv preprint arXiv:2312.17090,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25522","last_updated":"2026-07-29T07:30:08Z","snapshot_observed_at":"2026-08-07T09:55:38.965350Z","submitted_at":"2026-07-28T10:05:11Z","title":"I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:29.918103Z"},"links":{"cited_paper":"/paper/2312.17090","citing_paper":"/paper/2607.25522"},"observation_digest":"sha256:5633f2d521862838ccefeeb8dfd9349a7269dca6ce6a6f7fbb62ef0c6f39a00e","observation_id":"b6dc54cf-ace0-4b21-aa70-171e202aae57","resolution":{"observed_at":"2026-08-01T02:13:29.918103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-01T02:13:30.015968Z","title":"Videogpt: Video generation using vq-vae and transformers.arXiv preprint arXiv:2104.10157,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25522","last_updated":"2026-07-29T07:30:08Z","snapshot_observed_at":"2026-08-07T09:55:38.965350Z","submitted_at":"2026-07-28T10:05:11Z","title":"I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:30.015968Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2607.25522"},"observation_digest":"sha256:9d1eaf43c696bc8b689233ab5382149c5564fad9f82994c6d3920d455e204fcc","observation_id":"7197715f-2a52-46bd-a2fb-9ba0a20af3d8","resolution":{"observed_at":"2026-08-01T02:13:30.015968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-01T02:13:30.128863Z","title":"Open-sora: Democratiz- ing efficient video production for all.arXiv preprint arXiv:2412.20404,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25522","last_updated":"2026-07-29T07:30:08Z","snapshot_observed_at":"2026-08-07T09:55:38.965350Z","submitted_at":"2026-07-28T10:05:11Z","title":"I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:30.128863Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2607.25522"},"observation_digest":"sha256:ffa3f631e0ea839cfba41ea8e34dd23a3e649802282e1a41ed405d4adc515447","observation_id":"69603e0f-1328-43ce-b422-2868916449f0","resolution":{"observed_at":"2026-08-01T02:13:30.128863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:30.231270Z","title":"Here, we further provide the quantitative results on each dataset separately for a more detailed comparison","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25522","last_updated":"2026-07-29T07:30:08Z","snapshot_observed_at":"2026-08-07T09:55:38.965350Z","submitted_at":"2026-07-28T10:05:11Z","title":"I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:30.231270Z"},"links":{"citing_paper":"/paper/2607.25522"},"observation_digest":"sha256:481603390942ba021b1b2a447a73c2a19ddbc1a4dbcea566e9a33fecf66f6517","observation_id":"f735d82a-135e-40cf-b573-9cda589f6372","resolution":{"observed_at":"2026-08-01T02:13:30.231270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-01T02:13:29.204402Z","title":"Latte: Latent diffusion transformer for video genera- tion.arXiv preprint arXiv:2401.03048,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25522","last_updated":"2026-07-29T07:30:08Z","snapshot_observed_at":"2026-08-07T09:55:38.965350Z","submitted_at":"2026-07-28T10:05:11Z","title":"I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:29.204402Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2607.25522"},"observation_digest":"sha256:301465870fabee8a8544d186904eb00b4ed7f12c46c03a4aafd222e0973900bb","observation_id":"ab6034de-5a4c-4ae9-8e23-65e797b7c084","resolution":{"observed_at":"2026-08-01T02:13:29.204402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01236","last_updated":"2017-02-11T00:15:46Z","snapshot_observed_at":"2026-07-06T05:17:20.642708Z","submitted_at":"2016-11-04T01:11:02Z","title":"Adversarial Machine Learning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01236","snapshot_observed_at":"2026-08-01T02:13:29.029322Z","title":"Ad- versarial machine learning at scale.arXiv preprint arXiv:1611.01236,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25522","last_updated":"2026-07-29T07:30:08Z","snapshot_observed_at":"2026-08-07T09:55:38.965350Z","submitted_at":"2026-07-28T10:05:11Z","title":"I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:29.029322Z"},"links":{"cited_paper":"/paper/1611.01236","citing_paper":"/paper/2607.25522"},"observation_digest":"sha256:7a63b86ad95833d3744c13b0d02d9a5e72f36036d1be3106540b516a2288b7d8","observation_id":"d961e942-61da-413d-9744-790366284d06","resolution":{"observed_at":"2026-08-01T02:13:29.029322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06588","last_updated":"2023-02-13T18:38:42Z","snapshot_observed_at":"2026-07-06T14:51:22.788392Z","submitted_at":"2023-02-13T18:38:42Z","title":"Raising the Cost of Malicious AI-Powered Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.06588","snapshot_observed_at":"2026-08-01T02:13:29.497557Z","title":"Raising the cost of malicious ai-powered image editing.arXiv preprint arXiv:2302.06588,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25522","last_updated":"2026-07-29T07:30:08Z","snapshot_observed_at":"2026-08-07T09:55:38.965350Z","submitted_at":"2026-07-28T10:05:11Z","title":"I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:29.497557Z"},"links":{"cited_paper":"/paper/2302.06588","citing_paper":"/paper/2607.25522"},"observation_digest":"sha256:8c89019b621632b5ae64d51be09179e330a5f9f6057333d39e3f2489d51dc3de","observation_id":"dfe4aeee-a307-40b9-987e-2286e9c56f9b","resolution":{"observed_at":"2026-08-01T02:13:29.497557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-01T02:13:28.831727Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers.arXiv preprint arXiv:2205.15868,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25522","last_updated":"2026-07-29T07:30:08Z","snapshot_observed_at":"2026-08-07T09:55:38.965350Z","submitted_at":"2026-07-28T10:05:11Z","title":"I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:28.831727Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2607.25522"},"observation_digest":"sha256:0b1fa8c7b8160233aedbf1446c064e33fa2c71f786460fd5382406a6e822525e","observation_id":"f145e9c2-1dbf-406c-9de5-42c755b165e3","resolution":{"observed_at":"2026-08-01T02:13:28.831727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-01T02:13:29.632575Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild.arXiv preprint arXiv:1212.0402,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25522","last_updated":"2026-07-29T07:30:08Z","snapshot_observed_at":"2026-08-07T09:55:38.965350Z","submitted_at":"2026-07-28T10:05:11Z","title":"I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:29.632575Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2607.25522"},"observation_digest":"sha256:0e5a3f91e91cd3768fe09b067bb71c242d1a998ef019aeec0268f5f67bd7d53f","observation_id":"c6f02ae3-f422-4e3f-8ee8-489d1e694d2f","resolution":{"observed_at":"2026-08-01T02:13:29.632575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-01T02:13:28.652966Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.25522","last_updated":"2026-07-29T07:30:08Z","snapshot_observed_at":"2026-08-07T09:55:38.965350Z","submitted_at":"2026-07-28T10:05:11Z","title":"I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:28.652966Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2607.25522"},"observation_digest":"sha256:9f3ef2d0c7d4cef91a4e108bf1a3fab8ed7ce1725b421cfdc3383a831ee6421c","observation_id":"81b7a5cb-1195-4b9b-811c-79832d78b517","resolution":{"observed_at":"2026-08-01T02:13:28.652966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-01T02:13:28.720596Z","title":"Animatediff: Animate your person- alized text-to-image diffusion models without specific tuning.arXiv preprint arXiv:2307.04725,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25522","last_updated":"2026-07-29T07:30:08Z","snapshot_observed_at":"2026-08-07T09:55:38.965350Z","submitted_at":"2026-07-28T10:05:11Z","title":"I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:28.720596Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2607.25522"},"observation_digest":"sha256:4cda4cd7561c4542dc8d65493d5ac81699ec046a9a8810f3cf8fbe7aa3cb5e23","observation_id":"e81fb3b3-b884-4420-b1d3-0e8ea09f605a","resolution":{"observed_at":"2026-08-01T02:13:28.720596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.25522","last_updated":"2026-07-29T07:30:08Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T09:55:38.965350Z","submitted_at":"2026-07-28T10:05:11Z","title":"I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2607.25522."}