{"as_of":"2026-08-24T00:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5c9cb3edfa65ab96218b2acdfab4d2a572b3fddc69b19b234a204125629a23b9","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:31:51.684749Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T09:16:37.881212Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13224","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2507.13224 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-17T05:29:21.824057Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2507.13224","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:f0eda6ea730bb54f374c9e7a7abb0eb5b7b83472dbfd889add94a668f4aae5a3","observation_id":"f115174a-66fb-44cc-82a9-b9ed101f4226","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.13224/citation-record","integrity":"/paper/2507.13224/integrity","json":"/paper/2507.13224/citation-record.json","paper":"/paper/2507.13224"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-20T04:48:52.471048Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-06T16:31:51.589383Z","title":"Lumiere: A space- time diffusion model for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.589383Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:f2502a0cbc13504d1bf9df52c22003204397502eef55dfe5237dfd0eff9359e5","observation_id":"24b0f054-f3df-4f61-b5c6-07a036d480b1","resolution":{"observed_at":"2026-08-06T16:31:51.589383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.992757Z","title":"V-jepa: Latent video prediction for visual represen- tation learning","venue":null,"work_id":"1cf66906-ffc1-4697-852d-7c2ebefef4a6","year":2023},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.592961Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:0f4087b4192a75d46b568079f09f4014888f0634b96cc5986635e32d4844ea08","observation_id":"273cb00c-dcf7-437b-b4a6-d9c76de368f0","resolution":{"observed_at":"2026-08-06T16:31:51.995479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.985325Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":"8157cce4-08e2-4026-929c-3e3ed11d9d28","year":2023},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.595445Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:6a7f280e0b980223ef86d33125c2c412ccd088bb9c8f8d59bfbd9ac5c82d00e5","observation_id":"d9dafa71-108f-4354-8a3f-94e753c95121","resolution":{"observed_at":"2026-08-06T16:31:51.988049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.598055Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.598055Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:b0b245e1aea9ad5b6a61d66ebce993ef91738d90bdd7a425538ac606103ac4e4","observation_id":"6def0bfe-f915-4aa7-9502-c67a7ea7f556","resolution":{"observed_at":"2026-08-06T16:31:51.598055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19707","last_updated":"2024-08-22T09:48:49Z","snapshot_observed_at":"2026-08-19T09:59:35.788967Z","submitted_at":"2024-05-30T05:36:12Z","title":"DeMamba: AI-Generated Video Detection on Million-Scale GenVideo Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19707","snapshot_observed_at":"2026-08-06T16:31:51.600484Z","title":"Demamba: Ai- generated video detection on million-scale genvideo bench- mark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.600484Z"},"links":{"cited_paper":"/paper/2405.19707","citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:7045c0921d29bfdf2352feb63a1201720cc37027e03e350b7302124c881d071e","observation_id":"937dc668-ddc5-4e35-8d94-fb164d98076b","resolution":{"observed_at":"2026-08-06T16:31:51.600484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.973270Z","title":"Audio-visual person-of-interest deep- fake detection","venue":null,"work_id":"903ab5bb-38f6-44d2-8084-3586f139c0a4","year":null},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.603150Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:5f5eee68bdb3c5a6d7a53195f16e6d0f0529134b6b0d0bcb38a98a4ef857bb9a","observation_id":"ba9a9f47-554a-4562-9e3a-88924613ddd1","resolution":{"observed_at":"2026-08-06T16:31:51.975791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.966153Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":"7770938d-ba3f-4d91-ab02-ea92082af1dd","year":null},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.605830Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:b3a715c505aefb3369923f6a994a22e2091596031e93df19378dac2437e91efa","observation_id":"379dc573-3292-47fb-8754-63bf6019dc85","resolution":{"observed_at":"2026-08-06T16:31:51.968695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06662","last_updated":"2023-12-11T18:59:57Z","snapshot_observed_at":"2026-08-21T01:21:02.724804Z","submitted_at":"2023-12-11T18:59:57Z","title":"Photorealistic Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06662","snapshot_observed_at":"2026-08-06T16:31:51.608613Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.608613Z"},"links":{"cited_paper":"/paper/2312.06662","citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:cb7962ec1301453d378116859d357d4632557223ec7d6313d973fee52f08c744","observation_id":"cfb24bf3-a349-4e53-8ef7-8937b27eefbc","resolution":{"observed_at":"2026-08-06T16:31:51.608613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.958721Z","title":"G ¨uera and E","venue":null,"work_id":"5b19f59c-5a89-4af9-a9d0-ff184254eaee","year":2018},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.611196Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:f70e174c75678d87cb4b91b613fda6f1a87c3c43eac10396af46bb69caf8d0a4","observation_id":"2081cc76-6cbd-4c38-90ad-9e8b5984f3fe","resolution":{"observed_at":"2026-08-06T16:31:51.961408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06940","last_updated":"2023-07-13T17:57:13Z","snapshot_observed_at":"2026-08-19T07:44:31.456566Z","submitted_at":"2023-07-13T17:57:13Z","title":"Animate-A-Story: Storytelling with Retrieval-Augmented Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06940","snapshot_observed_at":"2026-08-06T16:31:51.613656Z","title":"Word Cloud showing different scenes captured in the videos from our dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.613656Z"},"links":{"cited_paper":"/paper/2307.06940","citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:c1af7672201be97503f98be342007336dbf209d5cbc9885dead964834a61256f","observation_id":"ededeec1-6bba-4cff-8ec1-50a300f0cfc2","resolution":{"observed_at":"2026-08-06T16:31:51.613656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.616362Z","title":"Animate anyone: Consistent and controllable image- to-video synthesis for character animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.616362Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:0690ba42a8c1f14e126e15fa6df53f013b0a2c50ba6eba69f42e951e5ba95a04","observation_id":"5f53ad64-bf9f-40a5-8660-a6581b821fa6","resolution":{"observed_at":"2026-08-06T16:31:51.616362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.945561Z","title":"Text2video-zero: Text- to-image diffusion models are zero-shot video generators","venue":null,"work_id":"8fe13ad0-970f-4257-8a9a-b78632b3ae07","year":2023},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.618768Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:cd20578c6e821b2f7eaeaf5c8d96f50b3b44d82cbebfc93346b8d0a25246d6ea","observation_id":"fe72b6bf-73ed-409c-85d6-3da0a382755d","resolution":{"observed_at":"2026-08-06T16:31:51.948754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T16:31:51.621185Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.621185Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:7f9fc6fb41ecb1bca18f4bcc3a3497919d61d7103268e37350407e4bc59e4069","observation_id":"dcfc8b18-7485-413d-a8ab-6c33ddf1950a","resolution":{"observed_at":"2026-08-06T16:31:51.621185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.937793Z","title":"Videopoet: A large language model for zero-shot video gen- eration","venue":null,"work_id":"fe0cda15-7c34-475b-a7c7-0c370352921e","year":2024},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.623988Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:7dc34a1637e9864e9d3a2f95b40bc97d94f9c503975ab5980fa4d25fa0f694d1","observation_id":"312f032a-f17a-463c-be14-68596e50419a","resolution":{"observed_at":"2026-08-06T16:31:51.940469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-21T21:36:12.450915Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-06T16:31:51.626147Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.626147Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:9960bb257a02987d06273e015650545e8147c3f51cdcf93418544fbc942610a9","observation_id":"b32420b9-fc6b-42c3-b32b-48e303904eb6","resolution":{"observed_at":"2026-08-06T16:31:51.626147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.930220Z","title":"Mao and J","venue":null,"work_id":"dc8afad7-6adb-4159-88c0-fd4ce7418d0f","year":2021},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.628671Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:01d8d61f243ea83d56eea0c11d8d3ebf21d21263146947e458dff7a17b48ea8b","observation_id":"90d86c20-1104-44e7-ab98-664870316be4","resolution":{"observed_at":"2026-08-06T16:31:51.932462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.922605Z","title":"Expanding language-image pretrained models for gen- eral video recognition","venue":null,"work_id":"e43006ac-dcfc-463f-b802-95a201cedb1b","year":2022},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.630861Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:ddaf700e9e5d4a3ecc9d4c95205e73d3669955f47e2c2b30439787f67518a016","observation_id":"6892b951-4bdb-48b4-87af-7494b440bb47","resolution":{"observed_at":"2026-08-06T16:31:51.925082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.915087Z","title":"Towards uni- versal fake image detectors that generalize across genera- tive models","venue":null,"work_id":"53f4bee5-2ff3-430f-8141-5eb8efba9022","year":2023},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.633018Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:476989ba5ee699183cd80730843c6786639ea4ec4b10f6d43af558c11233287d","observation_id":"c51de8e8-5202-4d1d-b3f3-782f66381dc2","resolution":{"observed_at":"2026-08-06T16:31:51.917790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.907866Z","title":"Chatgpt (gpt-3.5), 2024","venue":null,"work_id":"e83334b2-961e-43ee-b49b-7152c38915a1","year":2024},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.635540Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:f3bcb43323c8b3a195bf6b4b6290ef21a1d1a2dd6ad42d8ced383cb594e0befd","observation_id":"e1801895-595a-49dc-8588-9e4b3922eaf8","resolution":{"observed_at":"2026-08-06T16:31:51.910464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.637789Z","title":"Pytorch: An im- perative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.637789Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:c4dca77887862d3e039faa6a3419aecba2dc7f6748cad657edc10be6b4953540","observation_id":"d4a21571-a0b8-4cd4-add6-19ff78f4c51a","resolution":{"observed_at":"2026-08-06T16:31:51.637789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.895896Z","title":null,"venue":null,"work_id":"cbf058bd-d990-406c-806b-594cbec1f539","year":2024},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.639817Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:edaa50d98f82553e3564df25382dc608bd58638a6114f1746ad5aaa4caa0122b","observation_id":"0f7db1c8-5bb9-411b-a1df-a9514a3bd3ea","resolution":{"observed_at":"2026-08-06T16:31:51.898441Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.641889Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.641889Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:ff507c76779d80e8fe423e74f4c6f39811d4a6b789ce10b033bd6e4faa95a2ec","observation_id":"8d8b7feb-3811-43b7-825a-46dd6fee20e3","resolution":{"observed_at":"2026-08-06T16:31:51.641889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.883408Z","title":"Dream machine","venue":null,"work_id":"08774c02-e497-43d6-83f7-795a5c351f39","year":2024},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.644033Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:6a3a6e2a753f634f64f8e042ffde24d1cc9f8397e4bb649392eed587aa662043","observation_id":"6b16a43a-f624-4f0f-a234-932be7ba3212","resolution":{"observed_at":"2026-08-06T16:31:51.885641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.875346Z","title":null,"venue":null,"work_id":"4fccc776-5518-41c7-9a24-33691c024cdf","year":2024},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.646137Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:a4283a6f58b7c2584da286dac6eb927e160ed7dc0ce9c40fb8ebe225ce9c63f3","observation_id":"c7ff9ff4-97e6-4e83-bfef-dbaabb7d2d8d","resolution":{"observed_at":"2026-08-06T16:31:51.878202Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.867456Z","title":null,"venue":null,"work_id":"77d91261-cf78-4ad1-8b34-480d8cc7971c","year":2022},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.648444Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:6dc70a8e8246215b8625b51c093409abaca498a228ae8712cf8f2c2e86ace491","observation_id":"0fdb7cf3-62da-44ac-ac2c-5edc6e974741","resolution":{"observed_at":"2026-08-06T16:31:51.869777Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.859642Z","title":"Visualizing data using t-sne","venue":null,"work_id":"aa65895b-3100-4007-a8de-13050d92d7cd","year":2008},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.650500Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:b6619df4f4cd9e88137856575085376a06ce33b77acc05aeb92ea52454f80ce1","observation_id":"95c9139c-d1b3-4861-92c5-283f77a6903e","resolution":{"observed_at":"2026-08-06T16:31:51.862216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.851859Z","title":"Phenaki: Variable length video generation from open domain textual descriptions","venue":null,"work_id":"8f4ba3a0-187e-48eb-8e18-8dd39d1d4922","year":2022},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.652563Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:42cf6ecec91b59d0de211942182e3abc38f919963605d7fedd3d2f73ee439c94","observation_id":"9c348a41-1a43-4c9e-bbe2-b63ffd1cde2b","resolution":{"observed_at":"2026-08-06T16:31:51.854858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-14T13:59:50.878772Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-06T16:31:51.654872Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.654872Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:22eb39e683086614f8b5d99b7674a63f775aafb26e5c76b36527831f9cc66ce9","observation_id":"af79b22c-b0d5-4617-a0fd-8f19c3ce7d9a","resolution":{"observed_at":"2026-08-06T16:31:51.654872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.844172Z","title":"Cnn-generated images are surprisingly easy to spot","venue":null,"work_id":"43804165-4f23-4313-ae14-c0766eb44211","year":2020},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.657290Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:e47b57683255a69181df3257518a487df2189e2ae07f8833619bf1c0ef7a2842","observation_id":"b6c24671-2f8d-47b9-943e-f0232247aa25","resolution":{"observed_at":"2026-08-06T16:31:51.846863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.836700Z","title":"Dire for diffusion-generated image detection","venue":null,"work_id":"e8d8dc2e-1333-4687-a66b-d0b5d40e44d5","year":2023},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.659622Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:8760a012c23bc27028a9bac2da17120ccbc127dc511f7404f6ab57e8d3f469bd","observation_id":"d4032ad9-2466-4684-b9ce-94a8450c6734","resolution":{"observed_at":"2026-08-06T16:31:51.839243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.661901Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.661901Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:347c2b1fda4dee608a5b6e070d2559bdc554e4007333ee1a881c9874c2de2770","observation_id":"f49514de-70b8-477e-9bea-15a0f59225c6","resolution":{"observed_at":"2026-08-06T16:31:51.661901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.03327","last_updated":"2018-09-06T04:19:45Z","snapshot_observed_at":"2026-08-20T04:50:05.503590Z","submitted_at":"2018-09-06T04:19:45Z","title":"YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.03327","snapshot_observed_at":"2026-08-06T16:31:51.664073Z","title":"Youtube-vos: A large-scale video object segmentation benchmark","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.664073Z"},"links":{"cited_paper":"/paper/1809.03327","citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:6a5009706f85a62438b08ce696bb25c97a580198f69d2de0691cb6f782db9f24","observation_id":"14cba349-c68c-40f7-aad4-6bb0a15e041c","resolution":{"observed_at":"2026-08-06T16:31:51.664073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.824502Z","title":"Ucf: Uncovering common features for generalizable deep- fake detection","venue":null,"work_id":"c8f2f022-dfb2-496f-8eb4-5d26c074857c","year":null},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.666400Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:dd0413137f80b779b644602d6493ee5eb79f8ca0d11504abad973089b76e3295","observation_id":"400ba0c6-a93f-459a-9053-8bc43418fe3c","resolution":{"observed_at":"2026-08-06T16:31:51.826864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.816781Z","title":"Cross-modal con- textualized diffusion models for text-guided visual genera- tion and editing","venue":null,"work_id":"62e06881-fd00-4864-82ce-0e53eac55c74","year":null},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.668707Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:7a63ef71b41a7e464f8268dd980fa70ff8713f972f3721926f08b50c39d2c577","observation_id":"380b1d44-df7a-4de3-8ef1-59c73f91ec23","resolution":{"observed_at":"2026-08-06T16:31:51.819435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.808991Z","title":null,"venue":null,"work_id":"5044b0d1-de76-4760-97fa-8f53a9b82423","year":null},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.671243Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:72c6dc663562470d22365416a4593732767bb92dfa00d0a3bfe11396ee4fe318","observation_id":"94ad0b14-e3d6-4e13-b5f8-2d62dbdd50f0","resolution":{"observed_at":"2026-08-06T16:31:51.811302Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.793615Z","title":"Nuwa-xl: Diffusion over dif- fusion for extremely long video generation","venue":null,"work_id":"ba701b94-2e6c-4dfa-97b5-6d5d55375944","year":2023},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.675756Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:619836219906f79a586d3b3207272251a7f0acd25e0be8ef6aa8b09513a0beca","observation_id":"c4a96180-af04-46ff-80d4-fc1eeabff66e","resolution":{"observed_at":"2026-08-06T16:31:51.796141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.786167Z","title":"Zeroscope, 2023","venue":null,"work_id":"1ecb16b6-2cd5-433c-95eb-ca7c8bcf7093","year":2023},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.677951Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:5e2f5a8c9e8695457f43c3708c35ec234afab0621f82147ca6317c1fcb0bdd34","observation_id":"aa43922b-65a6-4dab-aa37-8d43d1abf4b3","resolution":{"observed_at":"2026-08-06T16:31:51.788577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.778936Z","title":null,"venue":null,"work_id":"c0d1cd6f-29c4-41c7-9660-462785ac2027","year":2023},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.680026Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:fa97c8df9c9a670b636090920b9f6b95ff5ba9de6e6d9d95469cdfae2c6f2e87","observation_id":"571252e5-e8c8-45df-8948-c704b6959feb","resolution":{"observed_at":"2026-08-06T16:31:51.781276Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.770979Z","title":"Multi-attentional deep- fake detection","venue":null,"work_id":"adeffdad-423c-4c74-ac75-b515a9ff7cee","year":2021},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.682136Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:87800374499fdbad63d9b21cbd8a251bb560143ef0e6771d00d1e48b42296db9","observation_id":"166745f0-87a6-404e-a7d6-5440eb44ae9d","resolution":{"observed_at":"2026-08-06T16:31:51.773994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.760838Z","title":"Open-sora: Democratizing efficient video production for all, 2024","venue":null,"work_id":"c2261f42-9b8a-44a0-b3e7-58e369250613","year":2024},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.684749Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:ea79e5ec7b30e2ad7145abb601772f994babdd060ffcc75ceadaafc27bf85b74","observation_id":"0db8b4c8-2d16-4a6f-9c9e-cd726a7f437d","resolution":{"observed_at":"2026-08-06T16:31:51.765291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:31:51.801283Z","title":"01, 2024","venue":null,"work_id":"67d52939-a324-4f94-9c1e-5f65afdb1a8b","year":2024},"citing_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T16:31:51.673628Z"},"links":{"citing_paper":"/paper/2507.13224"},"observation_digest":"sha256:2189625d43ddc8e8270f4a45a2fee0bbe407b235e37445876384e7d59094347b","observation_id":"8a3ea686-cb03-49bc-b2b3-9431b124ec80","resolution":{"observed_at":"2026-08-06T16:31:51.804015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T21:58:46.449707Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2507.13224."}