{"as_of":"2026-08-05T15:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:24727465fead0df339ff3098c27a61e20122ec4988f31e5056ee727b85af08ce","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T18:42:02.940250Z","state":"measured"},{"denominator":196,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":196,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":126,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:54:23.761559Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-04T10:54:23.761559Z","title":"Vbench-2.0: Advancing video generation benchmark suite for intrinsic faithfulness.arXiv preprint arXiv:2503.21755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08073","last_updated":"2026-06-10T11:00:38Z","snapshot_observed_at":"2026-08-04T10:54:17.464105Z","submitted_at":"2025-10-09T11:00:35Z","title":"Physics-Driven Spatiotemporal Modeling for AI-Generated Video Detection","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T10:54:23.761559Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2510.08073"},"observation_digest":"sha256:e88c5e13a99e3f0afb92017cc117a50e67916bb0a632ca25d36ad8fa6166346a","observation_id":"48d2e080-75c0-4e5b-958c-96f9626c6c8c","resolution":{"observed_at":"2026-08-04T10:54:23.761559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-04T08:32:46.348667Z","title":"VBench-2.0: Advancing Video Gen- eration Benchmark Suite for Intrinsic Faithfulness.arXiv preprint arXiv:2503.21755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.20182","last_updated":"2026-06-05T22:19:39Z","snapshot_observed_at":"2026-08-04T08:32:30.329897Z","submitted_at":"2025-10-23T04:06:58Z","title":"PEDRA: Evaluating the Realism of Pedestrian Dynamics in Video Generation","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.348667Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2510.20182"},"observation_digest":"sha256:4278b26a3a9f8de74c6f4f7294f36968a6a35890e75c3a33baedeab730895338","observation_id":"d1bb3569-13ef-44bc-8d71-64c311d94929","resolution":{"observed_at":"2026-08-04T08:32:46.348667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2511.00503","last_updated":"2026-04-07T13:15:23Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-11-01T11:16:25Z","title":"Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models","version":2},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-05-18T01:59:23.928725Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2511.00503"},"observation_digest":"sha256:f6ae96a06a792551fd64e846d5bf7307e3c277db863d426580c5ea8726ed8448","observation_id":"9c840c7c-9009-4f58-ad61-19a053859894","resolution":{"observed_at":"2026-05-18T02:00:39.460436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-04T06:47:11.222875Z","title":"Vbench-2.0: Advancing video generation benchmark suite for intrinsic faithfulness.arXiv preprint arXiv:2503.21755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-05T15:18:14.507856Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:11.222875Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:88fe07f67dd03fcdf514bfa56256f42816f2fc7280c36c1f8bba98e82acc3d95","observation_id":"6a715269-7317-4d48-bd85-48f9045caa8f","resolution":{"observed_at":"2026-08-04T06:47:11.222875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-03T19:11:53.511931Z","title":"Vbench-2.0: Advancing video generation benchmark suite for intrinsic faithfulness.arXiv preprint arXiv:2503.21755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-03T19:11:45.881397Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:53.511931Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:0c67be233ae0127790160bbfba14503b03fe7be94c264af77f5ab0301e955883","observation_id":"00b4eaac-2f57-44cb-a055-d6fb0a4a26cb","resolution":{"observed_at":"2026-08-03T19:11:53.511931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2512.01843","last_updated":"2026-05-18T11:10:13Z","snapshot_observed_at":"2026-07-06T22:37:26.652349Z","submitted_at":"2025-12-01T16:28:13Z","title":"PhyDetEx: Detecting and Explaining the Physical Plausibility of T2V Models","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-21T17:57:57.263574Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2512.01843"},"observation_digest":"sha256:d59516e5619530db4f3781943f45d9784f078f7926949d570650bcf0c31eb864","observation_id":"c209ae9e-d936-4cf3-93c8-9c84627ae244","resolution":{"observed_at":"2026-05-21T18:00:27.270911Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-03T18:09:53.091830Z","title":"VBench-2.0: Advancing video genera- tion benchmark suite for intrinsic faithfulness.arXiv preprint arXiv:2503.21755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06628","last_updated":"2026-07-05T11:17:31Z","snapshot_observed_at":"2026-08-03T18:09:44.634080Z","submitted_at":"2025-12-07T02:28:06Z","title":"MIND-V: Hierarchical World Model for Long-Horizon Robotic Manipulation with RL-based Physical Alignment","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T18:09:53.091830Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2512.06628"},"observation_digest":"sha256:018fc0021be785844149637890e5ad6b381b7fe93a093ac45d4f708f2ef29b0d","observation_id":"d8d81511-a1ce-42fd-94cd-f5c679fe3751","resolution":{"observed_at":"2026-08-03T18:09:53.091830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2512.09299","last_updated":"2026-04-06T13:16:33Z","snapshot_observed_at":"2026-07-06T22:38:35.387503Z","submitted_at":"2025-12-10T03:57:29Z","title":"VABench: A Comprehensive Benchmark for Audio-Video Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-17T00:03:45.576961Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2512.09299"},"observation_digest":"sha256:1fbf7cfca0e2b247c396afdc15196a2d1c9b3c32aedbc32872a5633b85f1f853","observation_id":"df4841dc-dc21-463a-a21f-44ac8b575ebd","resolution":{"observed_at":"2026-05-17T00:08:43.888647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-03T17:02:43.826638Z","title":"VBench-2.0: Advancing video generation benchmark suite for intrinsic faithfulness.arXiv preprint arXiv:2503.21755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10958","last_updated":"2026-06-01T17:54:44Z","snapshot_observed_at":"2026-08-03T18:19:00.778254Z","submitted_at":"2025-12-11T18:59:58Z","title":"WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World","version":2},"reference_index":143,"source":"pdf_text","source_observed_at":"2026-08-03T17:02:43.826638Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2512.10958"},"observation_digest":"sha256:22e9db3435218ff1464b1f868b07b0f90978af5a883c2862d41d4a1e45c7cd7d","observation_id":"fef3fb4c-309c-4151-8b6a-ab6615a855d1","resolution":{"observed_at":"2026-08-03T17:02:43.826638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-03T13:35:50.055528Z","title":"VBench-2.0: Advancing video generation benchmark suite for intrinsic faithfulness.arXiv preprint arXiv:2503.21755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23851","last_updated":"2026-06-20T17:45:12Z","snapshot_observed_at":"2026-08-03T13:35:49.257640Z","submitted_at":"2025-12-29T20:29:21Z","title":"TinyHistory: Lightweight Video History Embeddings via Two-Stage Context Learning","version":6},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-03T13:35:50.055528Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2512.23851"},"observation_digest":"sha256:4eedb239cf1c4b735e0e588806cbd0b83115d982eedefb037d82bbd3a8e60bcb","observation_id":"e739784d-cd95-4afd-bfc7-7d2021d20d51","resolution":{"observed_at":"2026-08-03T13:35:50.055528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2601.10632","last_updated":"2026-04-10T16:10:59Z","snapshot_observed_at":"2026-07-06T22:41:48.115083Z","submitted_at":"2026-01-15T17:52:29Z","title":"CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos","version":2},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-05-16T13:43:26.460480Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2601.10632"},"observation_digest":"sha256:dd74ac56670280c2eedf597f5f8a54eac871a720fe4544ec4c219f29d9be49be","observation_id":"e92d8b5a-297f-4a86-83d0-e80cb53d7e77","resolution":{"observed_at":"2026-05-16T13:47:57.401677Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2602.07775","last_updated":"2026-05-03T01:49:14Z","snapshot_observed_at":"2026-07-30T09:22:37.641917Z","submitted_at":"2026-02-08T02:16:02Z","title":"Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion","version":6},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-05-16T07:02:38.876518Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2602.07775"},"observation_digest":"sha256:d20d162f2dbae95c047b60cff8ddf24ed8a2e2b2f31efd0c8a5193c359a82ebc","observation_id":"291f92dc-54b8-4450-9a32-6c44f1bc1797","resolution":{"observed_at":"2026-05-16T07:07:29.949973Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2602.13669","last_updated":"2026-04-22T07:41:44Z","snapshot_observed_at":"2026-07-06T22:45:53.926021Z","submitted_at":"2026-02-14T08:32:38Z","title":"EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T22:20:16.320171Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2602.13669"},"observation_digest":"sha256:680497d40767c6252d94357c6089991ed5b8445d9c696c71d25eb141f2f1d148","observation_id":"f521e21b-80fc-4bec-99cc-e2b38ad47eda","resolution":{"observed_at":"2026-05-15T22:20:22.274966Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2603.04727","last_updated":"2026-05-18T17:56:22Z","snapshot_observed_at":"2026-07-06T22:47:55.281598Z","submitted_at":"2026-03-05T02:00:53Z","title":"Are Multimodal LLMs Ready for Surveillance? A Reality Check on Zero-Shot Anomaly Detection in the Wild","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T12:23:02.046757Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2603.04727"},"observation_digest":"sha256:44b7999779d8c66c1cfdbfa2b05f8e858c53c8d6c15e74cfff0c95258ee6010d","observation_id":"7c89d9fb-7672-4ac1-9d8b-545a91e91710","resolution":{"observed_at":"2026-05-21T12:24:10.643726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-07-15T13:51:30.008232Z","title":"arXiv preprint arXiv:2503.21755 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06445","last_updated":"2026-07-08T07:22:50Z","snapshot_observed_at":"2026-07-15T13:51:28.065188Z","submitted_at":"2026-03-06T16:37:15Z","title":"What if? Emulative Simulation with World Models for Situated Reasoning","version":3},"reference_index":125,"source":"pdf_text","source_observed_at":"2026-07-15T13:51:30.008232Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2603.06445"},"observation_digest":"sha256:13a0b4da6978cbbcdc6ba12db7dc707ac4c3c6dc3216ac1c934c1e0255e60ba8","observation_id":"87711a17-bc1d-406e-8bf7-43bd3b0a8a0e","resolution":{"observed_at":"2026-07-15T13:51:30.008232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-07-14T22:56:23.337858Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13402","last_updated":"2026-06-29T23:43:05Z","snapshot_observed_at":"2026-08-03T00:48:30.265316Z","submitted_at":"2026-03-12T00:16:56Z","title":"Event-Driven Video Generation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T22:56:23.337858Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2603.13402"},"observation_digest":"sha256:a6f90e8dd1cf7fc56b88bb45d463b62319b71898161ccd2c3ecb5e7ae6c60abe","observation_id":"cf20a088-0f91-4618-990f-ca1a9eef1480","resolution":{"observed_at":"2026-07-14T22:56:23.337858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-07-14T21:09:36.040879Z","title":"arXiv preprint arXiv:2503.21755 (2025) 10","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14526","last_updated":"2026-06-28T22:57:12Z","snapshot_observed_at":"2026-08-02T01:05:20.949344Z","submitted_at":"2026-03-15T18:07:29Z","title":"LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-14T21:09:36.040879Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2603.14526"},"observation_digest":"sha256:6696bd4c45040c0f0526056e71f7284d50495d90704aa660d6aa15d6cf2799ed","observation_id":"77ffc277-090a-4635-97fb-05ac0de0481d","resolution":{"observed_at":"2026-07-14T21:09:36.040879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-07-13T23:27:11.006580Z","title":"arXiv preprint arXiv:2503.21755 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T15:09:42.003563Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-13T23:27:11.006580Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:96fa8cab06492a332c9c281e8d3368c09daef8e4757868b3a10a4d46897c75e3","observation_id":"ed668bc2-4087-4903-919d-98214c2caa99","resolution":{"observed_at":"2026-07-13T23:27:11.006580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-03T02:34:01.381315Z","title":"arXiv preprint arXiv:2503.21755 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T15:09:42.003563Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:01.381315Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:15938a88a06442d4ac9828744309e51258aa467d5406c4ac21b6bf2f2657d04c","observation_id":"0871f3ab-e617-4dea-8835-4fdf9977c74b","resolution":{"observed_at":"2026-08-03T02:34:01.381315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2603.18636","last_updated":"2026-05-08T04:13:25Z","snapshot_observed_at":"2026-07-06T22:49:42.664225Z","submitted_at":"2026-03-19T09:00:08Z","title":"Attention Sparsity is Input-Stable: Training-Free Sparse Attention for Video Generation via Offline Sparsity Profiling and Online QK Co-Clustering","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T08:55:52.757489Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2603.18636"},"observation_digest":"sha256:f4b275f6eb08ece0d89b76db8a8cfa7c722f17cd480b92df0b22711fb215ca19","observation_id":"719b23bb-341b-4d62-a191-f0ba63c89016","resolution":{"observed_at":"2026-05-15T08:59:53.186042Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2604.06339","last_updated":"2026-04-07T18:17:05Z","snapshot_observed_at":"2026-07-06T22:54:53.308309Z","submitted_at":"2026-04-07T18:17:05Z","title":"Evolution of Video Generative Foundations","version":1},"reference_index":167,"source":"pdf_text","source_observed_at":"2026-05-10T18:41:38.616611Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2604.06339"},"observation_digest":"sha256:607e645754a8cae8c856dacbbc13380cbf9626a7f4c00f3af09f2456ddc7d7f5","observation_id":"f6141929-8344-4cf3-bb2f-bbf2f6333b8a","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2604.06939","last_updated":"2026-04-13T17:35:53Z","snapshot_observed_at":"2026-07-06T22:55:20.208897Z","submitted_at":"2026-04-08T11:03:22Z","title":"Grounded Forcing: Bridging Time-Independent Semantics and Proximal Dynamics in Autoregressive Video Synthesis","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T18:32:01.665435Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2604.06939"},"observation_digest":"sha256:a156e7a111aeff898c7681450e0f13dddc6e20300f9b2a569d67d4e785e9d12b","observation_id":"51c9e71b-2bd5-420c-87da-8a95373434c8","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2604.07958","last_updated":"2026-04-23T12:58:42Z","snapshot_observed_at":"2026-07-06T22:57:09.435331Z","submitted_at":"2026-04-09T08:22:09Z","title":"ImVideoEdit: Image-learning Video Editing via 2D Spatial Difference Attention Blocks","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T17:49:33.822264Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2604.07958"},"observation_digest":"sha256:c4a5658c74a91162a5835c888d07c475d043242d5bf9ff1de86fb99fd59e0975","observation_id":"07c10dc0-b2ce-4af9-a18d-efdbe2818d71","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2604.08503","last_updated":"2026-05-18T19:22:00Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:48:46Z","title":"Phantom: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamics","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T18:15:37.338442Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2604.08503"},"observation_digest":"sha256:4b636921843fabac0667df8553cc1e64ff2b0e585f014fb66dc15504dfa5da75","observation_id":"45f169c0-6fbc-4050-ba06-3d967b51bb53","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2604.08503","last_updated":"2026-05-18T19:22:00Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:48:46Z","title":"Phantom: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamics","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-21T09:17:53.731701Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2604.08503"},"observation_digest":"sha256:ba27b72c76bb5b0181abc8c1fe95b5d6e145d3028eac8857280f57e15b44875a","observation_id":"5c8ae224-0e31-44d3-8c07-69f7d1fb8bfa","resolution":{"observed_at":"2026-05-21T09:19:56.631167Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2604.09415","last_updated":"2026-04-10T15:27:27Z","snapshot_observed_at":"2026-07-06T22:58:17.167367Z","submitted_at":"2026-04-10T15:27:27Z","title":"PhysInOne: Visual Physics Learning and Reasoning in One Suite","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-10T16:39:48.066744Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2604.09415"},"observation_digest":"sha256:bcdea9b3e210edcdc5a7d1652a3ac4e12d18a35a422b45d48bc97352b3b3766d","observation_id":"35875d69-0581-4bc9-b2e4-4589cc23fa50","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2604.10127","last_updated":"2026-04-11T09:44:39Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T09:44:39Z","title":"VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T15:44:02.709823Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2604.10127"},"observation_digest":"sha256:c411f1e1b3786640b3157ee1e7dce085267e8a1f6d62475a55b6ebf4274e41e2","observation_id":"c44fc420-4c93-4dcc-9607-6c66d6cea954","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2604.15299","last_updated":"2026-04-16T17:57:08Z","snapshot_observed_at":"2026-07-06T23:02:53.677687Z","submitted_at":"2026-04-16T17:57:08Z","title":"AnimationBench: Are Video Models Good at Character-Centric Animation?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T11:47:27.131584Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2604.15299"},"observation_digest":"sha256:7e713592c5b8cb8c3032a95b94648b6b7ef8f58a2662e58bb84ddf2f47efc3e0","observation_id":"0cc9bd07-3732-41a5-a679-84c3b5c05826","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2604.17428","last_updated":"2026-04-19T13:17:34Z","snapshot_observed_at":"2026-08-02T22:52:58.429125Z","submitted_at":"2026-04-19T13:17:34Z","title":"Long-CODE: Isolating Pure Long-Context as an Orthogonal Dimension in Video Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T05:55:51.789570Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2604.17428"},"observation_digest":"sha256:09105ac452c899412fe483f87ca6186104268876c1fa1907a4dba1b41e8b2ee5","observation_id":"95534f3d-8e80-45d9-87cf-2f02e42d7709","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2604.19092","last_updated":"2026-05-14T07:32:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T05:09:56Z","title":"RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T03:02:26.084185Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2604.19092"},"observation_digest":"sha256:122e2b29060275b55e017b6d8428fd0accc756879677a35c0666f4d6cf9c0f55","observation_id":"93dd91ef-3576-4bfa-baf2-7a34cf65be63","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2604.19092","last_updated":"2026-05-14T07:32:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T05:09:56Z","title":"RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-15T06:15:32.881140Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2604.19092"},"observation_digest":"sha256:4d6df5179b75dc45f0b08b1ae7ef6293e4547ae176640053a2a48d63c60400a7","observation_id":"76fecfd6-f0b7-40e0-8667-20abb4805852","resolution":{"observed_at":"2026-05-15T06:19:50.182670Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2604.21931","last_updated":"2026-04-23T17:59:57Z","snapshot_observed_at":"2026-07-06T23:08:23.939574Z","submitted_at":"2026-04-23T17:59:57Z","title":"Seeing Fast and Slow: Learning the Flow of Time in Videos","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-09T21:55:17.377887Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2604.21931"},"observation_digest":"sha256:15e7ec198e14bb4727d214bf8f1458e9b099b73c60e2d574a4bbb1ccadde8ceb","observation_id":"c8a34807-950b-4a13-ae38-70acb8307eed","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2604.23632","last_updated":"2026-04-26T09:46:58Z","snapshot_observed_at":"2026-07-06T23:09:48.137856Z","submitted_at":"2026-04-26T09:46:58Z","title":"Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-08T06:56:19.795651Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2604.23632"},"observation_digest":"sha256:7ad850c822e538767d1176ccca35886fed6e79f9b2e99d32833aaeefd943ba2e","observation_id":"9905d9fe-7616-4981-8e01-82be8b333db6","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2604.25361","last_updated":"2026-04-28T08:27:35Z","snapshot_observed_at":"2026-07-06T23:11:16.247497Z","submitted_at":"2026-04-28T08:27:35Z","title":"HuM-Eval: A Coarse-to-Fine Framework for Human-Centric Video Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-07T16:53:42.069330Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2604.25361"},"observation_digest":"sha256:90f5d10cf75a7c44c3427132eaac1d6dc2542deb2b29fd441ccc283c3d42a61b","observation_id":"05d7f6f9-2afb-4618-b5ef-45ec5da75177","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.02641","last_updated":"2026-05-04T14:26:33Z","snapshot_observed_at":"2026-07-06T23:15:41.793878Z","submitted_at":"2026-05-04T14:26:33Z","title":"Mamoda2.5: Enhancing Unified Multimodal Model with DiT-MoE","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-08T18:26:58.696936Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.02641"},"observation_digest":"sha256:877a534c5dd5c83dc0ac0f2908ea86bf73f5279694b6ca62d938ac59ec8e7bef","observation_id":"2d882fe4-0c96-445e-9794-b98a06955be2","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.03475","last_updated":"2026-05-06T04:45:21Z","snapshot_observed_at":"2026-08-04T23:39:56.172321Z","submitted_at":"2026-05-05T08:03:34Z","title":"WorldJen: An End-to-End Multi-Dimensional Benchmark for Generative Video Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T04:13:26.433133Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.03475"},"observation_digest":"sha256:16238686ad910b1fc87d07eefab416b0246b22c1b6da8b021a76b32209f455f1","observation_id":"f9dd60d1-2874-4631-b7c6-2a210c7980fc","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.03475","last_updated":"2026-05-06T04:45:21Z","snapshot_observed_at":"2026-08-04T23:39:56.172321Z","submitted_at":"2026-05-05T08:03:34Z","title":"WorldJen: An End-to-End Multi-Dimensional Benchmark for Generative Video Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T19:08:07.487384Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.03475"},"observation_digest":"sha256:8ff76d29c5ded0908c372ad75aab494bee91996ca85acc3a8ee126f6aceca22e","observation_id":"c94f50d6-ba34-4fcc-ae69-cb75797ae008","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.05187","last_updated":"2026-05-06T17:52:39Z","snapshot_observed_at":"2026-08-05T11:06:48.787619Z","submitted_at":"2026-05-06T17:52:39Z","title":"LoViF 2026 The First Challenge on Holistic Quality Assessment for 4D World Model (PhyScore)","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T16:20:40.024442Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.05187"},"observation_digest":"sha256:33989f28f39ff5da8079b9c5276f296666a671ea6a90075c0f491d9d8970676c","observation_id":"e726c2a2-2b93-4152-b367-6d2966d3c0bf","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.07503","last_updated":"2026-05-08T09:37:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T09:37:46Z","title":"Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-11T01:58:25.291448Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.07503"},"observation_digest":"sha256:ed3399f3d071851d52e3c7f03ed140119e513770aa7ca515abdd7487f7a6e7db","observation_id":"89a46d18-ad7e-4eec-9f40-2485b79f3f43","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.07800","last_updated":"2026-06-09T17:19:58Z","snapshot_observed_at":"2026-08-02T01:30:37.148519Z","submitted_at":"2026-05-08T14:36:32Z","title":"SARA: Semantically Adaptive Relational Alignment for Video Diffusion Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T02:21:52.861714Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.07800"},"observation_digest":"sha256:0779f482519e15518a65a26b1afdefa0dc7349e009bdf1829ac4ca7f4471f14f","observation_id":"4be55b5e-4e0b-4820-9815-f4f825f0de85","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.07800","last_updated":"2026-06-09T17:19:58Z","snapshot_observed_at":"2026-08-02T01:30:37.148519Z","submitted_at":"2026-05-08T14:36:32Z","title":"SARA: Semantically Adaptive Relational Alignment for Video Diffusion Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T23:13:31.195562Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.07800"},"observation_digest":"sha256:dccd59bf5845570f978bc69edb78686a2062cf2c762228657f778487a5cceafe","observation_id":"72c4ceeb-1209-4b66-9595-832b79380c7b","resolution":{"observed_at":"2026-06-30T23:15:07.972570Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.10434","last_updated":"2026-05-11T12:06:57Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:06:57Z","title":"WorldReasonBench: Human-Aligned Stress Testing of Video Generators as Future World-State Predictors","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:01.254916Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.10434"},"observation_digest":"sha256:3304cd76d533416e9d3eaf9c64e2eb9c3f17fd4ed681d400307b700d6e921c94","observation_id":"68692374-cc1f-4b67-bb2d-865ebdda8e73","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.10806","last_updated":"2026-05-11T16:30:51Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:30:51Z","title":"PhyGround: Benchmarking Physical Reasoning in Generative World Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T05:17:30.010064Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.10806"},"observation_digest":"sha256:77afef838d9e129dfd9cad43cefd3459b637044f9a59f92d8a7bc7ed73f75d35","observation_id":"876ce071-c6a5-494f-b23c-0f48aed884a6","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":214,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:eaced405371c24f1154f399a6bd9782e91c3b15b4f804c233cedb09d50122588","observation_id":"fd1cf23c-94e7-4639-a279-ccc890647146","resolution":{"observed_at":"2026-05-14T18:42:03.548540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.14269","last_updated":"2026-05-14T02:12:13Z","snapshot_observed_at":"2026-08-02T12:45:57.975749Z","submitted_at":"2026-05-14T02:12:13Z","title":"PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T02:49:21.291716Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.14269"},"observation_digest":"sha256:6c2b7075268e40388bc4a82380ebdb836c529bde5765cbc571a6819836704d66","observation_id":"d8452ca0-bc95-4925-9e73-3c92d414f3de","resolution":{"observed_at":"2026-05-15T02:49:41.457390Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.14278","last_updated":"2026-05-14T02:24:46Z","snapshot_observed_at":"2026-07-06T23:25:44.508166Z","submitted_at":"2026-05-14T02:24:46Z","title":"KVPO: ODE-Native GRPO for Autoregressive Video Alignment via KV Semantic Exploration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T02:38:14.180433Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.14278"},"observation_digest":"sha256:49ed794fdfabc43bfcea9d25d88ed29deec0f8b874a3b43e85814b0304e2856b","observation_id":"08d7cb65-e235-4e37-9e86-d1d2457a4bf4","resolution":{"observed_at":"2026-05-15T02:38:34.447281Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.14382","last_updated":"2026-06-29T03:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T05:06:57Z","title":"Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:14.874049Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.14382"},"observation_digest":"sha256:fbcfdd534ef79aa0efd378b37e93f78fd682b6f448eb19b39effdb1b03845f1c","observation_id":"fa154dfa-102c-42cc-9229-b9c7fcbc646c","resolution":{"observed_at":"2026-05-15T01:53:28.794513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.14382","last_updated":"2026-06-29T03:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T05:06:57Z","title":"Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T21:54:33.902256Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.14382"},"observation_digest":"sha256:e27fb02aff4c2fda11da614852fc2eed14964f72747dea69f3436ce6a0f82d63","observation_id":"efac5b77-bdd3-4386-bfeb-51c9f34cd9f2","resolution":{"observed_at":"2026-05-20T21:59:06.467855Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.14382","last_updated":"2026-06-29T03:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T05:06:57Z","title":"Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T09:12:35.777810Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.14382"},"observation_digest":"sha256:4d4bb0af131e70b220fa70a526b1dacbcb015333393c3c57e85e80f5e0154a2d","observation_id":"384a8bc9-d1b1-4831-adee-e6794238fda3","resolution":{"observed_at":"2026-05-21T09:14:05.651779Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.14382","last_updated":"2026-06-29T03:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T05:06:57Z","title":"Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T21:44:21.427570Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.14382"},"observation_digest":"sha256:5222097508a918abb2fa0a61d1a62e05287d50f210f4340f6de415826890d16f","observation_id":"7d9a6d56-cfe5-4c7a-9d10-fc809f2cdf6e","resolution":{"observed_at":"2026-06-30T21:45:05.549385Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.14815","last_updated":"2026-05-14T13:27:33Z","snapshot_observed_at":"2026-08-02T19:23:49.520789Z","submitted_at":"2026-05-14T13:27:33Z","title":"Probing into Camera Control of Video Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-30T21:11:19.441408Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.14815"},"observation_digest":"sha256:49dfcf401a752bfed6000c887d4bc9ca202fd52427beb5c2855fd41ea5835918","observation_id":"d603e154-5c34-4289-aa7f-ee6f68c3e232","resolution":{"observed_at":"2026-06-30T21:15:04.297273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.15116","last_updated":"2026-05-14T17:29:35Z","snapshot_observed_at":"2026-07-06T23:26:28.006734Z","submitted_at":"2026-05-14T17:29:35Z","title":"DriveCtrl: Conditioned Sim-to-Real Driving Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T21:06:06.548538Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.15116"},"observation_digest":"sha256:6db098ea46b52d0e7d404af32e7213cd1686271a5bce8f899a87e5a5aee5584d","observation_id":"051107ee-7eda-4a79-9b1f-50fba12854d4","resolution":{"observed_at":"2026-06-30T21:15:04.749003Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.15199","last_updated":"2026-05-14T17:59:55Z","snapshot_observed_at":"2026-08-02T15:10:45.692933Z","submitted_at":"2026-05-14T17:59:55Z","title":"EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T03:16:03.450742Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.15199"},"observation_digest":"sha256:7cf1f0e836fde97b1a0393b8fe92ed90268076c4dfb550aca67c8a0c625cb4d3","observation_id":"b665fa80-5335-4075-97a5-d02a58887526","resolution":{"observed_at":"2026-05-15T03:19:43.927820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.16003","last_updated":"2026-05-15T14:33:09Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T14:33:09Z","title":"Echo-Forcing: A Scene Memory Framework for Interactive Long Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T20:02:45.505404Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.16003"},"observation_digest":"sha256:86f6b3feb59b09da60f049227a1df0b7bdd471c5c0be14b4279a76aebf8d8a9a","observation_id":"36276399-b29d-4e4d-9d0e-bf1848bbbf2d","resolution":{"observed_at":"2026-05-20T20:03:43.454867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.18303","last_updated":"2026-05-18T12:20:54Z","snapshot_observed_at":"2026-08-02T12:26:28.647804Z","submitted_at":"2026-05-18T12:20:54Z","title":"PH-Dreamer: A Physics-Driven World Model via Port-Hamiltonian Generative Dynamics","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-20T12:27:13.931203Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.18303"},"observation_digest":"sha256:7b8bab36b2e2b347081ccdd3fe35d92290435707a468ab3b053cc5b81027f6ba","observation_id":"13a6eff0-4f16-407b-bc65-e6c49a4ddadd","resolution":{"observed_at":"2026-05-20T12:28:16.664868Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.18365","last_updated":"2026-05-18T13:17:08Z","snapshot_observed_at":"2026-08-02T07:31:08.555715Z","submitted_at":"2026-05-18T13:17:08Z","title":"GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-20T11:06:09.367559Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.18365"},"observation_digest":"sha256:a38ed7092919f65bf572b36e388bd3b3755fa9029ab9506f8463f76716ff44d2","observation_id":"ab5342ea-7643-4e4a-b5e0-9ef3c1297888","resolution":{"observed_at":"2026-05-20T11:08:13.576182Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.18396","last_updated":"2026-05-19T06:23:43Z","snapshot_observed_at":"2026-07-06T23:29:14.916114Z","submitted_at":"2026-05-18T13:42:24Z","title":"NEWTON: Agentic Planning for Physically Grounded Video Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T10:56:22.343333Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.18396"},"observation_digest":"sha256:d3f20137bc4ed4936ab64670a9ac50993a574a9c7880b331c9f6b45042719de0","observation_id":"88cdd745-86b4-4b61-9881-79dc6de571ff","resolution":{"observed_at":"2026-05-20T10:58:13.768504Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.19728","last_updated":"2026-05-19T12:02:17Z","snapshot_observed_at":"2026-08-03T06:16:41.678547Z","submitted_at":"2026-05-19T12:02:17Z","title":"Aero-World: Action-Conditioned Aerial Video Generation from Inertial Controls","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T05:42:59.996351Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.19728"},"observation_digest":"sha256:3d4663415becc054a6258d1d1cd4405676a5afd3260f709f4d42e306250a6ca6","observation_id":"f7a7b085-5b71-4cb8-8363-bf3956deddd1","resolution":{"observed_at":"2026-05-20T05:43:05.314784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.19957","last_updated":"2026-05-19T15:10:27Z","snapshot_observed_at":"2026-07-06T23:30:35.042915Z","submitted_at":"2026-05-19T15:10:27Z","title":"World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-20T06:36:47.265734Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.19957"},"observation_digest":"sha256:ef08266ca9c4dd5c519f35e0644b55344e4c8f5712fec0b7b9df0da361acf6bc","observation_id":"69412894-ea02-48f8-8557-4a4b19f957fa","resolution":{"observed_at":"2026-05-20T06:38:05.568899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.20731","last_updated":"2026-06-02T04:39:14Z","snapshot_observed_at":"2026-08-02T14:00:02.575787Z","submitted_at":"2026-05-20T05:27:05Z","title":"TASTE: A Designer-Annotated Multi-Dimensional Preference Dataset for AI-Generated Graphic Design","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T05:09:05.834499Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.20731"},"observation_digest":"sha256:3a1f490502e3f507a141be0743c1b745105c2470553ad8ee18150805e6d141d3","observation_id":"5bcded02-8d64-4f31-af7f-52e916209f62","resolution":{"observed_at":"2026-05-21T05:09:38.435915Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.20731","last_updated":"2026-06-02T04:39:14Z","snapshot_observed_at":"2026-08-02T14:00:02.575787Z","submitted_at":"2026-05-20T05:27:05Z","title":"TASTE: A Designer-Annotated Multi-Dimensional Preference Dataset for AI-Generated Graphic Design","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T17:47:47.801278Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.20731"},"observation_digest":"sha256:3f5060a957d1f7fd4b73b4b7d7ae955aa6c170f57e84f7b1cc2a7c4d1eecf70d","observation_id":"e818ee83-4b7a-4287-93dd-a08713b638cd","resolution":{"observed_at":"2026-07-01T15:05:48.014950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.23271","last_updated":"2026-05-22T06:22:21Z","snapshot_observed_at":"2026-07-06T23:33:29.550551Z","submitted_at":"2026-05-22T06:22:21Z","title":"EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-25T04:34:58.052261Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.23271"},"observation_digest":"sha256:0a492628679fe59874f71c1ad25b677cf7c88ecec8272ccbf2da9bebba415b97","observation_id":"2823c6e8-d942-4878-b9bf-803d8a700c40","resolution":{"observed_at":"2026-05-25T04:35:20.647662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.23699","last_updated":"2026-05-22T14:51:22Z","snapshot_observed_at":"2026-07-06T23:33:53.870540Z","submitted_at":"2026-05-22T14:51:22Z","title":"CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-25T04:39:22.400458Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.23699"},"observation_digest":"sha256:5968bbcb1bd29df4f23aa3b2264557c657092b8e799bf7fcfb02e974e44fba16","observation_id":"c4e37179-df03-4788-a0b1-271e57acf0e6","resolution":{"observed_at":"2026-05-25T04:40:23.301198Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.24509","last_updated":"2026-05-23T10:43:40Z","snapshot_observed_at":"2026-07-31T00:14:37.077106Z","submitted_at":"2026-05-23T10:43:40Z","title":"{\\Phi}-Noise: Training-Free Temporal Video Conditioning via Phase-Based Noise Manipulation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-30T13:43:50.161133Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.24509"},"observation_digest":"sha256:440c5c805fae5a597231eb52bdaf5a2ffe3318535fe3b3f9e8209363d9fac3ae","observation_id":"5de8f7d2-f5c4-429c-b8a7-1d2733c17daa","resolution":{"observed_at":"2026-06-30T13:44:40.548924Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":177,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:afdfb77f0491ec913139009ab746b8a0856c276801c7b77288eef72571eec761","observation_id":"748b889e-3b59-410e-a5db-9cbc03597e8f","resolution":{"observed_at":"2026-06-29T23:04:01.996944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:90ae76ecfb90d1c0989e555105f247143b44afe905dfbb8e97d0def504e6212d","observation_id":"1a8e8902-5c98-47f7-9334-02f415bedda7","resolution":{"observed_at":"2026-06-29T22:24:00.833339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.25874","last_updated":"2026-05-25T14:01:31Z","snapshot_observed_at":"2026-07-06T23:35:46.157653Z","submitted_at":"2026-05-25T14:01:31Z","title":"WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T22:57:08.381846Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.25874"},"observation_digest":"sha256:245b9d0bbd0b6e54fa3712258db1560b6eced8fd2af948ef65ec83bd657fa73d","observation_id":"324a26da-c816-4261-8dc1-db12d2c7046e","resolution":{"observed_at":"2026-06-29T23:34:04.893918Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.26918","last_updated":"2026-05-26T12:16:41Z","snapshot_observed_at":"2026-08-01T21:44:13.728036Z","submitted_at":"2026-05-26T12:16:41Z","title":"Are Video Models Zero-Shot Learners and Reasoners in Education? EduVideoBench, A Knowledge-Skills-Attitude Benchmark for Educational Video Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-29T18:17:52.284353Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.26918"},"observation_digest":"sha256:a6659a9217ed87662d9945dad97ad74193bfc98a2a2ac8f0fa6ce090fdf80779","observation_id":"db762ebe-603c-4586-a067-5bce8530f9ea","resolution":{"observed_at":"2026-06-29T18:23:50.878167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.27589","last_updated":"2026-05-26T19:02:26Z","snapshot_observed_at":"2026-08-05T09:42:53.562841Z","submitted_at":"2026-05-26T19:02:26Z","title":"What-If World: A Causal Benchmark for General World Models in Embodied Scenarios","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:22.987086Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.27589"},"observation_digest":"sha256:6beeba340d6484340d81726e1a355d019786e45375794a10b2ec6a5fe688a4d5","observation_id":"aaddc02a-7f16-4cdc-bf6f-94455700735c","resolution":{"observed_at":"2026-06-29T18:23:50.420197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.29360","last_updated":"2026-05-28T04:58:15Z","snapshot_observed_at":"2026-08-02T15:53:42.308053Z","submitted_at":"2026-05-28T04:58:15Z","title":"MiraBench: Evaluating Action-Conditioned Reliability in Robotic World Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T07:46:28.469913Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.29360"},"observation_digest":"sha256:562b39a9cfb98a585f9ef537ddc440055c58222dfb36249aa4e94bcc7ebe5ef0","observation_id":"27571782-f3bb-4227-a2f9-c9d79dad29dc","resolution":{"observed_at":"2026-06-29T07:53:13.865967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.30090","last_updated":"2026-05-28T15:35:34Z","snapshot_observed_at":"2026-08-02T05:10:06.145713Z","submitted_at":"2026-05-28T15:35:34Z","title":"DirectorBench: Diagnosing Long-Form Video Generation with Personalized Multi-Agent Evaluation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:47.144439Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.30090"},"observation_digest":"sha256:b1aec571715e05de36e228552179e1ed08aa5c5ddebc8d51f13f72c9c2a0f2d0","observation_id":"77964db8-ffa5-477a-a3c7-3e178f32fe9f","resolution":{"observed_at":"2026-06-29T08:03:13.607331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:f0a64f07e48c14b39c29555dcb9ba1f4bdbebf64b2f41499cdbe0693ee396aea","observation_id":"0e3e906a-261c-4b4b-95e9-2c0414226947","resolution":{"observed_at":"2026-06-29T08:33:15.616945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:7a8fab937d83dc73e664d774c77e4ee9171da3db1343592a97d8aa9bc6fa2a1d","observation_id":"e4d837c3-d93d-4010-bbf0-90d83ba5839e","resolution":{"observed_at":"2026-06-28T23:12:46.585772Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:2e6c90ea628b2e33f32c415ea53f1eab4d96eb13d865f5e6857318ae193511e0","observation_id":"f39305a2-4a6b-41ef-ad91-b22585cceff1","resolution":{"observed_at":"2026-06-28T19:22:35.113216Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.04527","last_updated":"2026-06-03T07:09:01Z","snapshot_observed_at":"2026-08-02T11:45:54.510691Z","submitted_at":"2026-06-03T07:09:01Z","title":"Echo-Infinity: Learning Evolving Memory for Real-Time Infinite Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T03:27:02.232039Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.04527"},"observation_digest":"sha256:3b92ba7b2b2d180840d6909e62864e4d56136df5902d9c21838e65949003c2c3","observation_id":"de71d412-7938-449a-8926-ed49498bfff1","resolution":{"observed_at":"2026-07-02T11:36:54.897618Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:13baf6b314ed6c4a0074ea53f5f7ff91ab962dbd09c43367d3266e64a625a4e1","observation_id":"c0694b18-4a2d-4c96-bc2f-2fdf5d4a00b1","resolution":{"observed_at":"2026-07-02T07:16:44.749104Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.05665","last_updated":"2026-06-04T03:48:42Z","snapshot_observed_at":"2026-07-06T23:45:37.713710Z","submitted_at":"2026-06-04T03:48:42Z","title":"V2V-Bench: A Comprehensive Benchmark for Video-to-Video Generation Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T02:20:05.748127Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.05665"},"observation_digest":"sha256:5e7f0e0c11b73304b24fbd45c20c7ee8292b8fe7d1f22ead36dec80768ce557a","observation_id":"de8b3afa-52d2-418c-839a-67364ca93d67","resolution":{"observed_at":"2026-07-02T12:16:56.695068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.08231","last_updated":"2026-06-06T15:39:29Z","snapshot_observed_at":"2026-07-06T23:47:43.942733Z","submitted_at":"2026-06-06T15:39:29Z","title":"Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning","version":1},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-06-27T19:36:57.231932Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.08231"},"observation_digest":"sha256:a8b50d1476c6a166358cb509c0cc96f406f37346dfaf0e416026a440c72091c2","observation_id":"07563dcc-115d-4010-a987-114aa518c494","resolution":{"observed_at":"2026-07-02T21:37:25.416891Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.09639","last_updated":"2026-06-11T05:58:22Z","snapshot_observed_at":"2026-08-02T02:07:05.154330Z","submitted_at":"2026-06-08T15:35:51Z","title":"CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-27T17:30:25.371658Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.09639"},"observation_digest":"sha256:bc577d98c5784fa959dc93ab2be4e964432f3732b23858df3f3782d14d42d8ad","observation_id":"8a7b593b-41e2-498b-ace9-211bd0ac6387","resolution":{"observed_at":"2026-07-03T00:07:28.022371Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.10620","last_updated":"2026-06-09T09:17:55Z","snapshot_observed_at":"2026-08-02T16:01:56.626147Z","submitted_at":"2026-06-09T09:17:55Z","title":"Can Image Models Imagine Time? ImageTime: A Novel Benchmark for Probing Visual World Modeling Through Spatiotemporal Consistency","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T13:34:25.079037Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.10620"},"observation_digest":"sha256:cd2a34b9410dc7c66fcffa8a9b4d880554735426a71b18ffedca4afe45eb8dda","observation_id":"1a9097e2-3ca7-439c-ae3c-0bf96d0eeb1b","resolution":{"observed_at":"2026-07-03T04:57:38.089097Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.11129","last_updated":"2026-06-23T05:28:32Z","snapshot_observed_at":"2026-07-06T23:50:16.299969Z","submitted_at":"2026-06-09T17:24:36Z","title":"WorldOlympiad: Can Your World Model Survive a Triathlon?","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T13:05:26.397711Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.11129"},"observation_digest":"sha256:f7bce8b36cb625ee8513437bb8d4f68ef8fa81f5276f2f53e70eb42ac1823e42","observation_id":"0ec81154-947f-4089-a48e-25184b4ea122","resolution":{"observed_at":"2026-07-03T05:47:41.329969Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.17536","last_updated":"2026-06-16T05:25:55Z","snapshot_observed_at":"2026-07-31T01:15:07.358009Z","submitted_at":"2026-06-16T05:25:55Z","title":"OmniDrive: An LLM-Choreographed Multi-Agent World Model with Unified Latent Co-Compression for Multi-View Driving Video Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-27T01:46:14.430539Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.17536"},"observation_digest":"sha256:76fce709cea042f216c72f3b47d2d20e70620b55f8ffa87865005eb407a1b761","observation_id":"4dbcfeab-de94-447e-bb06-d890d11d46bd","resolution":{"observed_at":"2026-07-03T19:28:52.698300Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.18591","last_updated":"2026-06-17T01:39:30Z","snapshot_observed_at":"2026-08-04T14:24:42.474763Z","submitted_at":"2026-06-17T01:39:30Z","title":"Bridging Creative Intent and Visual Quality: Creator-Driven Recurrent Video Generation with Agentic Feedback Loops","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T22:02:18.035999Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.18591"},"observation_digest":"sha256:abaa6a4620c1bd8dfb59c09eac9cc474c6efb3e0af3f51f04cf0a9579a97f010","observation_id":"16a955d3-dc51-445b-8f9d-e347351367a4","resolution":{"observed_at":"2026-07-03T23:39:03.326182Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.18943","last_updated":"2026-06-17T11:23:52Z","snapshot_observed_at":"2026-08-01T03:49:23.750491Z","submitted_at":"2026-06-17T11:23:52Z","title":"Physics-IQ Verified","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-26T21:13:36.568700Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.18943"},"observation_digest":"sha256:ef3abdd0a10dc7855e8869490725f76889eeb7f598443bf21a0729424490966d","observation_id":"39818612-6086-477c-8d37-1dc8e6664cb4","resolution":{"observed_at":"2026-07-04T00:29:15.588672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.20545","last_updated":"2026-06-18T17:55:15Z","snapshot_observed_at":"2026-07-06T23:55:38.979306Z","submitted_at":"2026-06-18T17:55:15Z","title":"Current World Models Lack a Persistent State Core","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T17:33:41.461245Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.20545"},"observation_digest":"sha256:b538c8fcf942d96d73fd6271ac18391fb3ca12626edab6309d8a13826a45b41a","observation_id":"f5d4044c-b1f6-4307-83b2-219ba02675f4","resolution":{"observed_at":"2026-07-04T03:49:31.001578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.21982","last_updated":"2026-06-20T10:33:14Z","snapshot_observed_at":"2026-08-04T14:46:13.489000Z","submitted_at":"2026-06-20T10:33:14Z","title":"CoDMD: Copula-aware Distribution Matching Distillation for Fast Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T12:52:05.465272Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.21982"},"observation_digest":"sha256:70a1f82d94fe3d6796fab256905b5321d2da780287ea83a29609b00f3bb11618","observation_id":"e06c768e-ab04-4609-94d1-bd17330571ad","resolution":{"observed_at":"2026-07-04T07:49:38.702544Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.24829","last_updated":"2026-06-23T17:12:21Z","snapshot_observed_at":"2026-08-03T12:13:18.174737Z","submitted_at":"2026-06-23T17:12:21Z","title":"GeoT2V-Bench: Benchmarking 3D Consistency in Text-to-Video Models via 3D Reconstruction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T00:28:33.734545Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.24829"},"observation_digest":"sha256:5fd87140d02e18602c521f95d64a6205a71113472e5c5b32a141bc34d30ada00","observation_id":"5576326d-9deb-4b3e-a20f-e93d59b39fec","resolution":{"observed_at":"2026-07-04T16:39:57.132385Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.25344","last_updated":"2026-06-24T03:18:10Z","snapshot_observed_at":"2026-08-04T18:36:25.340564Z","submitted_at":"2026-06-24T03:18:10Z","title":"Follow Your Track: Precise Skeleton Animation Controlled by 3D Trajectories","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-25T21:12:03.751682Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.25344"},"observation_digest":"sha256:c2bf53859e5b526cb34e864e933274372c262651ed298d14fa1b335a0b48c3bf","observation_id":"70fab6d5-95c5-4b68-ae6f-5cee8af5347c","resolution":{"observed_at":"2026-07-04T19:40:06.059882Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.26668","last_updated":"2026-06-25T07:01:05Z","snapshot_observed_at":"2026-07-07T00:01:01.437499Z","submitted_at":"2026-06-25T07:01:05Z","title":"Disco-LoRA: Disentangled Composition of Content, Style, and Motion for Multi-concept Video Customization","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-26T05:51:29.839498Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.26668"},"observation_digest":"sha256:d6504312086857f0abe2e8ecc9aab04ed0c4d15178dd26c98460b75db78273d6","observation_id":"7ccc178c-bfdf-4d96-abcc-9ecd4f0e267a","resolution":{"observed_at":"2026-07-04T12:49:52.821413Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.26694","last_updated":"2026-06-28T04:16:09Z","snapshot_observed_at":"2026-07-07T00:01:01.437499Z","submitted_at":"2026-06-25T07:27:09Z","title":"PhysEditWorld: A Large-Scale Dataset Toward Physics-Editable World Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-26T05:46:21.198781Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.26694"},"observation_digest":"sha256:3954da62a8dcf5f484c78bd4290d9b93e5cfc7197f0221e51f082f4a2d868253","observation_id":"d97b9917-9216-4d53-9db2-d7863335fa32","resolution":{"observed_at":"2026-07-04T12:49:53.206917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.26694","last_updated":"2026-06-28T04:16:09Z","snapshot_observed_at":"2026-07-07T00:01:01.437499Z","submitted_at":"2026-06-25T07:27:09Z","title":"PhysEditWorld: A Large-Scale Dataset Toward Physics-Editable World Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T10:19:06.268547Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.26694"},"observation_digest":"sha256:f164e3866930529a42547eb155c446ff7ccc613b3de60f07e338b984d25eccee","observation_id":"6f303530-57df-4530-929a-545d03c29bd5","resolution":{"observed_at":"2026-06-30T12:04:39.241670Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.28385","last_updated":"2026-06-22T06:45:09Z","snapshot_observed_at":"2026-07-07T00:02:29.000757Z","submitted_at":"2026-06-22T06:45:09Z","title":"RoboGaze: Evaluating Robot World Models via Structured Vision-Language Analysis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T10:49:58.019238Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.28385"},"observation_digest":"sha256:a252283018f45ea6b8fde599aaf3b43e6668c7f1253864427586fcfeb16ddaaf","observation_id":"4aa509f5-a983-43a7-8e5e-aa12df6ef359","resolution":{"observed_at":"2026-06-30T10:54:36.522496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.28757","last_updated":"2026-07-07T07:21:54Z","snapshot_observed_at":"2026-07-12T11:18:57.822920Z","submitted_at":"2026-06-27T06:13:35Z","title":"A Physics-Grounded Benchmark for Multi-Agent Dynamics in World Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-30T09:51:45.272494Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.28757"},"observation_digest":"sha256:bb82b1728c9459c095b55fcc0a4ae81b6abe7be7ba579bfc004c3aedae01645b","observation_id":"7789858c-2357-44cf-9630-358abf4ccad8","resolution":{"observed_at":"2026-06-30T09:54:34.907927Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-07-12T11:18:58.558989Z","title":"arXiv preprint arXiv:2503.21755 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.28757","last_updated":"2026-07-07T07:21:54Z","snapshot_observed_at":"2026-07-12T11:18:57.822920Z","submitted_at":"2026-06-27T06:13:35Z","title":"A Physics-Grounded Benchmark for Multi-Agent Dynamics in World Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-12T11:18:58.558989Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.28757"},"observation_digest":"sha256:e593b9f1a8b1a754c07cb11ced1bbc226c5e38a7593457322c60be040de6045f","observation_id":"abef0d2f-f577-4f6d-929d-8a5491541a98","resolution":{"observed_at":"2026-07-12T11:18:58.558989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.30557","last_updated":"2026-06-29T16:51:56Z","snapshot_observed_at":"2026-08-02T04:52:55.899592Z","submitted_at":"2026-06-29T16:51:56Z","title":"EcoVideo: Entropy-Orchestrated Video Generation Paradigm in Cloud-Edge Dynamics","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T06:15:31.587641Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.30557"},"observation_digest":"sha256:edf40042ca011d0e650d590431cfea68e05f3eb0573f9c23faa98b238ae39a19","observation_id":"079321c7-7923-40f4-b92e-32ad7e4cde6c","resolution":{"observed_at":"2026-06-30T07:14:22.114346Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.31672","last_updated":"2026-07-06T17:27:19Z","snapshot_observed_at":"2026-07-12T10:02:27.801010Z","submitted_at":"2026-06-30T13:51:44Z","title":"WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-01T06:01:05.571698Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.31672"},"observation_digest":"sha256:b57d074977a8ba5f9d524fee14385bc080f16bca7ed75f7a87b119af1fadad51","observation_id":"3297169d-3b07-4949-b7b4-90f970952944","resolution":{"observed_at":"2026-07-01T09:55:41.260286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.31672","last_updated":"2026-07-06T17:27:19Z","snapshot_observed_at":"2026-07-12T10:02:27.801010Z","submitted_at":"2026-06-30T13:51:44Z","title":"WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-03T21:58:29.499220Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.31672"},"observation_digest":"sha256:a7aeeabd7d5c6217a5a1f03b1d31b8e174e677db8f77f1df8d93d6d0cf82a0e4","observation_id":"a9ec7e36-f7e0-440f-b9f0-f417525e6533","resolution":{"observed_at":"2026-07-03T21:58:58.308702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-07-12T10:02:29.248139Z","title":"VBench-2.0: Advancing video generation benchmark suite for intrinsic faithfulness.arXiv preprint arXiv:2503.21755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.31672","last_updated":"2026-07-06T17:27:19Z","snapshot_observed_at":"2026-07-12T10:02:27.801010Z","submitted_at":"2026-06-30T13:51:44Z","title":"WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T10:02:29.248139Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.31672"},"observation_digest":"sha256:e56c87dd934877756ec02acc5ef705ed97eac5501146aa80de1da997295c38fe","observation_id":"4ac97cbb-237a-4999-b55e-0ced07080a90","resolution":{"observed_at":"2026-07-12T10:02:29.248139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2607.00310","last_updated":"2026-07-01T01:23:34Z","snapshot_observed_at":"2026-07-07T00:05:59.073754Z","submitted_at":"2026-07-01T01:23:34Z","title":"RetailSMV: Exocentric vs. Egocentric Adaptation of Foundation Video World Models in Retail","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-02T15:33:09.686278Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2607.00310"},"observation_digest":"sha256:8bad39932ce135fda0a98fa6b07946d3dfc3aa99c1939fb73ff34aa7e0cef820","observation_id":"66210f22-da9b-480f-8ca8-0d1e4998e44b","resolution":{"observed_at":"2026-07-02T15:37:05.917415Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2607.00712","last_updated":"2026-07-01T09:59:28Z","snapshot_observed_at":"2026-07-07T00:06:20.346610Z","submitted_at":"2026-07-01T09:59:28Z","title":"Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-02T14:12:29.528065Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2607.00712"},"observation_digest":"sha256:aca288e0cbef31c4368f33d45be3c4ba0202de0ccb140679a9cf14c6bdffd59c","observation_id":"ab1d21b1-ff9d-4138-8a97-836dedc3f9c9","resolution":{"observed_at":"2026-07-02T14:17:02.608226Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2503.21755/citation-record","integrity":"/paper/2503.21755/integrity","json":"/paper/2503.21755/citation-record.json","paper":"/paper/2503.21755"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.14749","last_updated":"2023-08-28T17:56:22Z","snapshot_observed_at":"2026-07-06T16:11:23.382222Z","submitted_at":"2023-08-28T17:56:22Z","title":"MagicEdit: High-Fidelity and Temporally Coherent Video Editing","version":1},"cited_work":{"arxiv_id":"2308.14749","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.14749","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MagicEdit: High-Fidelity and Temporally Coherent Video Editing","venue":null,"work_id":"809e7a2a-81ca-495f-a5e0-ca72ba719aa7","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2308.14749","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:704c235c8865682814500948709e965a0b794aa3b2dc8ecc54fab468281f3bdc","observation_id":"ba914254-4d15-4d69-bcf3-ff00c43de820","resolution":{"observed_at":"2026-05-14T18:42:03.305992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09592","last_updated":"2023-08-18T14:39:16Z","snapshot_observed_at":"2026-08-05T02:35:27.583273Z","submitted_at":"2023-08-18T14:39:16Z","title":"StableVideo: Text-driven Consistency-aware Diffusion Video Editing","version":1},"cited_work":{"arxiv_id":"2308.09592","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09592","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stable video diffusion: A novel ap- proach to image-to-video generation","venue":null,"work_id":"ce4d5b88-8e62-4f9b-81c2-2521f978ec41","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2308.09592","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:27395a085982565aba4110aacfeb855f2bee05571027f7e1ddc2dd3a1fbc98de","observation_id":"0aae27db-8c0b-4314-8129-07b998544b1a","resolution":{"observed_at":"2026-05-14T18:42:03.120227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-03T08:18:12.263722Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":"2307.10373","doi":"10.1109/iccv51701.2025.005","metadata_source":"pith","pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","venue":"cs.CV","work_id":"2e967b53-6386-4564-b468-ffd540817064","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:2f41bd6ea7021cbff9ef53f082b12cd2285b85fb544b06c618c3f1b5c36d7447","observation_id":"9bf14d16-edfa-4e48-baca-279c2dc30c34","resolution":{"observed_at":"2026-05-17T20:17:47.115702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07663","last_updated":"2023-07-15T00:02:41Z","snapshot_observed_at":"2026-07-06T15:54:17.094199Z","submitted_at":"2023-07-15T00:02:41Z","title":"INVE: Interactive Neural Video Editing","version":1},"cited_work":{"arxiv_id":"2307.07663","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.07663","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Inve: Interactive neural video editing","venue":null,"work_id":"2f964c30-a7ac-4097-97f8-79f34d438b04","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2307.07663","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:a3c032d02d3f9e25605c04872f90b0f7d57a953c5bc4855099a9482cbec54a8c","observation_id":"61d61183-d2ab-43bf-abf8-6e901ed0d23a","resolution":{"observed_at":"2026-05-14T18:42:03.263828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08707","last_updated":"2024-04-02T11:08:12Z","snapshot_observed_at":"2026-07-06T15:42:41.200399Z","submitted_at":"2023-06-14T19:15:49Z","title":"VidEdit: Zero-Shot and Spatially Aware Text-Driven Video Editing","version":4},"cited_work":{"arxiv_id":"2306.08707","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.08707","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videdit: Zero-shot and spatially aware text-driven video editing","venue":null,"work_id":"cd6d4d95-bc1d-4d8e-8c88-5b387f84ffb8","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2306.08707","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:e4c6d4c88788ab6aad82df3fb63a3478ddcd982f84da2bfbae02a44095f6519f","observation_id":"8af9ce0c-0fa1-452a-a43f-ec97a91e515c","resolution":{"observed_at":"2026-05-14T18:42:03.035650Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04761","last_updated":"2023-03-08T17:53:49Z","snapshot_observed_at":"2026-07-06T15:00:17.108271Z","submitted_at":"2023-03-08T17:53:49Z","title":"Video-P2P: Video Editing with Cross-attention Control","version":1},"cited_work":{"arxiv_id":"2303.04761","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.04761","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-p2p: Video editing with cross- attention control","venue":null,"work_id":"992fb0d5-f233-4443-97a9-806ea0165cc0","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2303.04761","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:a9129a46f1a7846232097ec8b6135da33b2ca1fd1ea0e9fa80b78239c545f62a","observation_id":"2bd06f04-49e6-4f92-ad6f-eca2bbb6fb48","resolution":{"observed_at":"2026-05-14T18:42:03.074904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17431","last_updated":"2023-05-27T10:03:36Z","snapshot_observed_at":"2026-08-02T13:47:42.816123Z","submitted_at":"2023-05-27T10:03:36Z","title":"Towards Consistent Video Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2305.17431","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.17431","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards consistent video editing with text-to-image diffusion models","venue":null,"work_id":"3d486cfa-1d6e-444a-af88-6120f73da843","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2305.17431","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:03cfc740e846726a84718ab878f0816a8f760ad11d9652863bfadf4fe1a93184","observation_id":"ab550ae9-dc24-4609-87ac-398428111115","resolution":{"observed_at":"2026-05-14T18:42:03.101089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17098","last_updated":"2023-11-28T02:37:16Z","snapshot_observed_at":"2026-08-05T02:51:41.926242Z","submitted_at":"2023-05-26T17:13:55Z","title":"ControlVideo: Conditional Control for One-shot Text-driven Video Editing and Beyond","version":2},"cited_work":{"arxiv_id":"2305.17098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.17098","snapshot_observed_at":"2026-07-04T00:39:16.878968Z","title":"Controlvideo: Adding conditional control for one shot text-to-video editing","venue":null,"work_id":"6a851ba4-8cce-4174-957d-fcbc64eae39b","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2305.17098","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:2441ce0b3d18e7b2fc4a912de17c2737edc116a722b10b13098cd4f9455c0f8f","observation_id":"99fe037b-73ba-46aa-bdaa-403fa1eb9ea2","resolution":{"observed_at":"2026-05-14T18:42:03.106987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17599","last_updated":"2024-01-04T01:30:50Z","snapshot_observed_at":"2026-07-06T15:10:15.773528Z","submitted_at":"2023-03-30T17:59:25Z","title":"Zero-Shot Video Editing Using Off-The-Shelf Image Diffusion Models","version":3},"cited_work":{"arxiv_id":"2303.17599","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.17599","snapshot_observed_at":"2026-07-02T22:27:26.579395Z","title":"Zero-shot video editing using off-the-shelf image diffusion models.arXiv preprint arXiv:2303.17599, 2023a","venue":null,"work_id":"4c97830a-8fb9-434f-aa32-6170ab0ca315","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2303.17599","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:f408e3fce43202e19bc36b31bc5e3fc889575bf2b0539baae09663bfc122899c","observation_id":"212609fc-a2bc-44b4-ad08-ba8489fb9c1c","resolution":{"observed_at":"2026-05-14T18:42:03.113128Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pix2video: Video editing using image diffusion","venue":null,"work_id":"d2fc06e4-cae9-48cf-9485-6ab5c867da44","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:cf119fc0eafe497fb9267982e3033195d9c87ac8d9c58ad9b2fcbea3660341a2","observation_id":"b085ec1d-a1b1-43cc-802f-efce63c829e3","resolution":{"observed_at":"2026-05-14T18:42:03.351996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09535","last_updated":"2023-10-11T17:46:21Z","snapshot_observed_at":"2026-07-06T15:04:23.117620Z","submitted_at":"2023-03-16T17:51:13Z","title":"FateZero: Fusing Attentions for Zero-shot Text-based Video Editing","version":3},"cited_work":{"arxiv_id":"2303.09535","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.09535","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FateZero: Fusing Attentions for Zero- shot Text-based Video Editing","venue":null,"work_id":"622a06c5-1bc5-4cd2-a4d5-26204e97b70b","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2303.09535","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:1166ebdafb4fac1268fc54dcff191489ae300560d26eb5f627b0d5627dbfcf5e","observation_id":"d813f99a-6758-46c2-ac02-cc2dd0f7cb0d","resolution":{"observed_at":"2026-05-14T18:42:03.167787Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13173","last_updated":"2023-01-30T18:41:58Z","snapshot_observed_at":"2026-07-06T14:46:15.598295Z","submitted_at":"2023-01-30T18:41:58Z","title":"Shape-aware Text-driven Layered Video Editing","version":1},"cited_work":{"arxiv_id":"2301.13173","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.13173","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2301.13173 , year =","venue":null,"work_id":"60eb0bda-841d-401e-983f-891425c74aac","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2301.13173","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:e612bda999b59a24f48086747ed2709c8a885cceb6745e801a65efc5d3c48d74","observation_id":"1408eb54-f942-4301-8c58-00397d631360","resolution":{"observed_at":"2026-05-14T18:42:03.185592Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08850","last_updated":"2024-02-19T02:42:27Z","snapshot_observed_at":"2026-07-06T15:27:25.253387Z","submitted_at":"2023-05-15T17:59:03Z","title":"Make-A-Protagonist: Generic Video Editing with An Ensemble of Experts","version":2},"cited_work":{"arxiv_id":"2305.08850","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.08850","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2305.08850 (2023)","venue":null,"work_id":"43a2aadd-a754-492a-984c-2a6018e7cab9","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2305.08850","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:b4a56638bd144af961e7a09f4ef2eb637085b87fd6482dbbae1b1605f5d00d49","observation_id":"2fd84b6c-4f86-4e94-a3b7-33b696640cd4","resolution":{"observed_at":"2026-05-14T18:42:03.194287Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videograin: Modulating space- time attention for multi-grained video editing","venue":null,"work_id":"141318cf-586d-49ce-af63-22907bb149ec","year":2025},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:3f1c3370442310dfd9df408490245edd4e821341030b62682c5deff35eb436ad","observation_id":"4c4f5aa0-4469-43ce-af46-85814478e3aa","resolution":{"observed_at":"2026-05-14T18:42:03.356861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04488","last_updated":"2023-06-20T16:26:38Z","snapshot_observed_at":"2026-08-05T13:25:19.870503Z","submitted_at":"2022-12-08T18:57:02Z","title":"Multi-Concept Customization of Text-to-Image Diffusion","version":2},"cited_work":{"arxiv_id":"2212.04488","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.04488","snapshot_observed_at":"2026-07-09T18:36:27.273245Z","title":"Multi-concept customization of text-to-image diffusion","venue":"cs.CV","work_id":"655cc7bc-e4c0-44ca-86dd-6a0f15818e82","year":2022},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2212.04488","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:a25797f74cb8c2d25ba2754c484b381c03d13a29fe60c028aae679a98e5fddbb","observation_id":"af84aaa9-a05c-479a-a5fe-f3c8e93fa322","resolution":{"observed_at":"2026-05-14T18:42:03.210335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06025","last_updated":"2023-10-30T21:44:52Z","snapshot_observed_at":"2026-08-05T12:57:59.143272Z","submitted_at":"2023-04-12T17:59:17Z","title":"DreamPose: Fashion Image-to-Video Synthesis via Stable Diffusion","version":4},"cited_work":{"arxiv_id":"2304.06025","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.06025","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreampose: Fashion image-to-video synthesis via stable diffusion","venue":null,"work_id":"d72a4b56-71a4-4eb0-9b82-068a8d9c3608","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2304.06025","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:a1eaf8fcfd6f1acdfc205a6ef3cb0310db47d3e9cda697a7a17fb149a0b9217c","observation_id":"33d2f420-8534-4bd1-95e2-d9d537fdae1c","resolution":{"observed_at":"2026-05-14T18:42:03.244661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06940","last_updated":"2023-07-13T17:57:13Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:57:13Z","title":"Animate-A-Story: Storytelling with Retrieval-Augmented Video Generation","version":1},"cited_work":{"arxiv_id":"2307.06940","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.06940","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Animate-a-story: Storytelling with retrieval-augmented video generation","venue":null,"work_id":"dbf72166-2a04-4e6d-bf72-b3e72b0a5de7","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2307.06940","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:33f1ef21c612c78f9ed8a1151ff0fdfb22b16bfe2a48b95a77d70cf387bd727d","observation_id":"67b1625f-6bbf-4966-a5db-e6638d3b1ead","resolution":{"observed_at":"2026-05-14T18:42:03.257455Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":"4759c94a-c742-4aee-a8a0-b31f7678bd28","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:78c74ba541d753b86372ffc3f70f41590997c889354f098d81f8d821722e7516","observation_id":"673183fc-06e6-420a-90a9-397abf4acf99","resolution":{"observed_at":"2026-05-14T18:42:03.361780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12190","last_updated":"2023-11-27T13:36:04Z","snapshot_observed_at":"2026-07-06T16:35:15.777674Z","submitted_at":"2023-10-18T14:42:16Z","title":"DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors","version":2},"cited_work":{"arxiv_id":"2310.12190","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.12190","snapshot_observed_at":"2026-07-04T14:59:55.949933Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"cd60d897-1a74-482c-84b4-93dfa38c1c33","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2310.12190","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:565571f2e959a0fec8a8dc860fd8492a57bcf0e56a3f0c45022061a734716c05","observation_id":"3ff369ee-bffb-4214-b2d0-05b85f3042a8","resolution":{"observed_at":"2026-05-14T18:42:03.281084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":"2501.03575","doi":"10.48550/arxiv.2501.03575","metadata_source":"pith","pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cosmos World Foundation Model Platform for Physical AI","venue":"cs.CV","work_id":"a2dba24c-318d-476a-8b21-4289c265810c","year":2025},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:a123688fbb731b0a0d0902791455b166697bf381b828e753d17c892e146e8f63","observation_id":"b2a5a481-821d-47ca-b442-25c02053e973","resolution":{"observed_at":"2026-05-14T18:42:03.311760Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":"2309.15103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-06-29T18:43:51.114876Z","title":"Lavie: High-quality video gener- ation with cascaded latent diffusion models","venue":null,"work_id":"e26464f0-6aed-49c2-b00f-e3639b1da5b1","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:49b4094b2307797c38f77e66be7fcdd6e24527d1dc07b750540fb2e38f7bdaee","observation_id":"da2ed417-d0c8-4e28-a494-b6b97da79a99","resolution":{"observed_at":"2026-05-14T18:42:03.319741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-07-06T16:05:35.645037Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":"2308.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-07-11T01:57:50.025885Z","title":"ModelScope Text-to-Video Technical Report","venue":"cs.CV","work_id":"1b1baf78-58ec-44d0-b700-84dff57b2f1f","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:9eea586c9b9398f459e41fd655f8173102e39e02aca71131327f85a80b8771a0","observation_id":"36fd5551-48b9-4d7f-a4ad-066365df1f3d","resolution":{"observed_at":"2026-05-14T18:42:03.330403Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-07-06T16:40:28.142296Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":"2310.19512","doi":"10.48550/arxiv.2310.19512","metadata_source":"pith","pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","venue":"cs.CV","work_id":"4d4486c5-6317-4d8d-bb5b-3b100d732a83","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:8850205e873b072206d188be93f34aa78fa645adf42c365505c0c295ae556b08","observation_id":"5fc17b73-e264-4628-a563-8c92539999b5","resolution":{"observed_at":"2026-05-14T21:40:44.284627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":"2205.15868","doi":"10.48550/arxiv.2205.15868","metadata_source":"pith","pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","venue":"cs.CV","work_id":"2dbd6bcd-fc98-4fbf-b586-f6d94fe1abd2","year":2022},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:71c385f1fe14b9554845123efe529a07e678465f9e13b572d3cf59e39fbff3ea","observation_id":"fa345237-6193-4a18-8fac-8eff8ecf5c23","resolution":{"observed_at":"2026-05-14T18:42:03.029148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"ed2bbc37-2b17-43ba-8b3a-4af9100434bc","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:0730fdae849528400d519f8947c3497db97c90a4b8b1bb457352b71c79987a90","observation_id":"3dd40a92-8d94-43ce-8535-af053855d6fc","resolution":{"observed_at":"2026-05-14T18:42:03.366650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13503","last_updated":"2024-11-20T17:54:41Z","snapshot_observed_at":"2026-07-06T19:53:17.024873Z","submitted_at":"2024-11-20T17:54:41Z","title":"VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models","version":1},"cited_work":{"arxiv_id":"2411.13503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.13503","snapshot_observed_at":"2026-07-04T00:29:15.561418Z","title":"Vbench++: Comprehensive and versatile bench- mark suite for video generative models","venue":null,"work_id":"edd66998-17b7-45c3-b89b-4ddbbc9f3a96","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2411.13503","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:0b61bd91b5848441fe2c3dfd20e0b108993b50e4285d35ed5d8195514f74a8d9","observation_id":"7700a839-f3fd-4584-aebc-0edf89d9011e","resolution":{"observed_at":"2026-05-14T18:42:03.062549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models","venue":null,"work_id":"0a5abd5e-b042-40d8-b112-9a10b63d8329","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:e8c942cc2e6ff93920174b5021224c504a960b777fe5ed78edfcf87802a00ab5","observation_id":"c43040c1-b322-4984-907b-e424e4912422","resolution":{"observed_at":"2026-05-14T18:42:03.371390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"[Online]","venue":null,"work_id":"ba3941e0-44b1-4ad1-a2e3-f1557d089f75","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:97816bf6a0dd1205e841a2cffb25405794503868a54243d51560f2d219a4a623","observation_id":"1f354b25-c8cb-4a5f-852c-aa238d63624f","resolution":{"observed_at":"2026-05-14T18:42:03.375721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Team, “Kling,” Accessed December 9, 2024 [Online] https://klingai","venue":null,"work_id":"f4743904-d89b-403d-96e7-cf114efe1bfb","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:0e85e6ad8f3004b0277e5b4a4e6b4631bd1e7b1c9a421499cbb6384f781bf611","observation_id":"9958637a-01d0-4454-8a0d-5e5de704abbf","resolution":{"observed_at":"2026-05-14T18:42:03.380044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"com/research/introducing-gen-3-alpha","venue":null,"work_id":"de60a81a-9684-4fd0-a950-9f6e5fb68fce","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:b6ad30b10500da780edf9d235ad7a7bc769a09851273ed7b8284e180360b6211","observation_id":"273c13ec-928d-4bb1-8e26-c6b7785661cf","resolution":{"observed_at":"2026-05-14T18:42:03.384201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":"8be5b54d-f52a-4a4e-81f3-1600c120ec81","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:c9a81793b9ab0ca2f7594ecff3ae7999aee371e178bd1d3628887b57f696906b","observation_id":"fa4130e4-d2a2-4b68-8c5d-e3c698504879","resolution":{"observed_at":"2026-05-14T18:42:03.388926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Team, “Veo2,” Accessed December 18, 2024 [Online] https: //deepmind.google/technologies/veo/veo-2/","venue":null,"work_id":"a089ba33-19cb-4c1f-aa16-ad8f3b2988d9","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:c62b087be81967b5a54f7fd777683d4cb26067ed81ff872f379910607cf12a9f","observation_id":"d1a5381e-9c04-487d-8b89-2f8dab47d150","resolution":{"observed_at":"2026-05-14T18:42:03.393570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"f26ba8be-c13e-4c99-bd2e-0a6d3a7c996b","year":2015},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:2cb641cbd1b875db8c495cd0bf25aa156527eb0fa5f76965b1ab4e45745b7f4c","observation_id":"58c11fcd-da1a-4903-9a15-dbe16d061edc","resolution":{"observed_at":"2026-05-14T18:42:03.397839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Score-based generative modeling through stochastic differ- ential equations","venue":null,"work_id":"d12b46d8-a115-4b29-9970-6893668d5d9d","year":2021},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:fd615de610644ecb30fb4a5f9ef3be1f0a5241590b0dba2332886eca53a032a5","observation_id":"020fc850-bc8d-43e2-a2aa-39c23398f2a6","resolution":{"observed_at":"2026-05-14T18:42:03.402472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"a867846d-8be1-42b3-9218-4c8cef102795","year":2020},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:b100a4c4a5281881393131eb33a26c72c87a16d38c7231fb4880efd0595081c9","observation_id":"626b02fb-8c49-498f-a941-0d56457318cf","resolution":{"observed_at":"2026-05-14T18:42:03.406763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion implicit models","venue":null,"work_id":"9dacba58-90a8-4262-b112-f65cc57e099f","year":2021},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:bc5c26d163a94ffb6bdd595eeddb3e1327c7c67f2253ca0e72e52e5ca011037f","observation_id":"d295fc6d-51d4-4670-a1e0-49097dfa3b5c","resolution":{"observed_at":"2026-05-14T18:42:03.411177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05543","last_updated":"2023-11-26T22:26:12Z","snapshot_observed_at":"2026-08-04T15:27:22.366324Z","submitted_at":"2023-02-10T23:12:37Z","title":"Adding Conditional Control to Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":"2302.05543","doi":"10.1145/3240323.3241729","metadata_source":"pith","pith_arxiv_id":"2302.05543","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adding Conditional Control to Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"226c10cc-8cc0-4c01-9358-f23db6c470c7","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2302.05543","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:a51e54b84c2a8f7cefdc5f4787cdd9723293cea4ef829d4f9cc9d264d27578fd","observation_id":"4672fd26-301d-4972-afa2-f243e495c65f","resolution":{"observed_at":"2026-05-16T22:43:11.169114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:0d7c2963c9bf21d213e6659409a2fedac2fad02cdab1474fdb4432171a4f1459","observation_id":"bd8ea729-be5e-477f-8d2f-4fe0a3743754","resolution":{"observed_at":"2026-05-14T18:42:03.230991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"d4d279f2-4f0d-4805-91ad-e084009eb920","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:9ce88a3f125e8f6c6fea389e44138c6a5bdc70649ff2a5a1471ad0f721d5f819","observation_id":"b67829bd-60fe-4e5c-a384-8bcecd2ad8c3","resolution":{"observed_at":"2026-05-14T18:42:03.415291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08453","last_updated":"2023-03-20T10:52:26Z","snapshot_observed_at":"2026-07-31T21:11:02.534986Z","submitted_at":"2023-02-16T17:56:08Z","title":"T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":"2302.08453","doi":"10.48550/arxiv.2302.08453","metadata_source":"pith","pith_arxiv_id":"2302.08453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"2337b26e-9ca1-4157-be2a-438971c5fef3","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2302.08453","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:cf3d8899ce0fd2be3c74e801428ced263d0dc70f49dc91cce64a59c713c70260","observation_id":"c6088f87-ea1e-44e9-b06b-9bbc4f115da1","resolution":{"observed_at":"2026-05-16T22:47:50.630300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Collaborative diffusion for multi-modal face generation and editing","venue":null,"work_id":"30a7aae4-f6cb-4f14-87a1-2e3b9b5885bd","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:4c3af301d133b6689644b88030151d75725ceeb7bd3b5db5f5154a7be7921420","observation_id":"2947b7a6-d793-4a72-8739-008030b7d37a","resolution":{"observed_at":"2026-05-14T18:42:03.421002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CogView: Mastering text-to-image generation via transformers","venue":null,"work_id":"78bfa341-dd5e-4a01-a632-beb2c4648d38","year":2021},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:d708311af25a19bfd898a69dd6b209a024bc9d489b0f6c188d1b4091d45187fa","observation_id":"fe9c68e6-615f-45dd-859b-60d0484661b6","resolution":{"observed_at":"2026-05-14T18:42:03.424880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cogview2: Faster and better text-to-image generation via hierarchical transformers","venue":null,"work_id":"05cfc8e8-1fc9-4c56-8d27-56a9e6e03e8d","year":2022},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:72b2fb77bf6789a30cfd4f9638b022d6f2920bf4c00e0d64916fa53a0a7adddc","observation_id":"15ad4a1f-5cf1-4142-b688-5826b408c6fd","resolution":{"observed_at":"2026-05-14T18:42:03.429684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2210.02303","doi":"10.48550/arxiv.2210.02303","metadata_source":"pith","pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","venue":"cs.CV","work_id":"bb20d241-dc6f-4b0a-b071-fd43a2cbd57f","year":2022},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:10406cf25f7014f9e9aaf1e6e21feb93c358d2311a41bd709eef00ebe04de9b2","observation_id":"72de7d59-0577-4115-b29c-f8158decc8ee","resolution":{"observed_at":"2026-05-14T18:42:03.293731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":"1312.6114","doi":"10.2139/ssrn.4269703","metadata_source":"pith","pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Auto-Encoding Variational Bayes","venue":"stat.ML","work_id":"97d95295-30e1-42b4-bbf6-85f0fa4edb44","year":2013},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:7746093430847cd2d6a65fa27a6767a2613fd68cac000e45ee6ee5484852051b","observation_id":"5773b77c-aa12-4d88-940c-bdb27c410734","resolution":{"observed_at":"2026-05-14T18:42:03.299662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural discrete representation learning","venue":null,"work_id":"d31b0117-5c41-4dde-8312-00f436f8a788","year":2017},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:f8e674bf37ff21fef3f67e21683d9121feec7e65cf8c544f6fc011137e3a842c","observation_id":"18c38134-9789-4c5a-8e63-9133e55bcc95","resolution":{"observed_at":"2026-05-14T18:42:03.434179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming transformers for high- resolution image synthesis","venue":null,"work_id":"12b6e464-dabc-41ea-827b-23438c9ae78e","year":2021},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:710a4c9a67f2bc4d5cd0ed655ba09b4249169cd3961de924b731bd7edf2e2f74","observation_id":"2ecde4b6-6175-4201-8b6b-cc300ee384ad","resolution":{"observed_at":"2026-05-14T18:42:03.439291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2307.01952","doi":"10.48500/arxiv.2307.01952","metadata_source":"pith","pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"8034c587-fba6-4941-87ba-c98f2ac962cb","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:dcab665b41469f925060bdaa9a01ceee9b5090c49c92639d0a44d0e96c755aed","observation_id":"0bb84220-036c-4ded-a13e-2e85e919627d","resolution":{"observed_at":"2026-05-14T18:42:03.325190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magvit: Masked generative video transformer","venue":null,"work_id":"4954922e-63c2-45e9-9832-d1fc1fecff87","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:03100a7d2bfbdc4ff0f9e1d311f65b4fa90589db5bd415a515aa55444105e6b1","observation_id":"cac0a3e3-4a3d-4053-a6f0-906e2846d551","resolution":{"observed_at":"2026-05-14T18:42:03.443625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:a12629e19129dc387ff2ac38d8f0a7b26d9f8df8fea222169800b556425f312c","observation_id":"953fb594-95b7-46bd-b6dc-7358a049a127","resolution":{"observed_at":"2026-05-14T18:42:03.336558Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":"2212.09748","doi":"10.48550/arxiv.2212.09748","metadata_source":"pith","pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable Diffusion Models with Transformers","venue":"cs.CV","work_id":"a3a05169-18b1-42bb-8775-eada50163437","year":2022},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:0e5a26e2f1b8dbc89ed952c7ebde5762c2de26b66e1fa66e794a10b37838bf81","observation_id":"fad64694-d0e8-418a-a68a-9a8d2dc671e2","resolution":{"observed_at":"2026-05-14T18:42:03.342098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:30.266292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:30.266292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videofusion: Decomposed diffusion models for high-quality video generation","venue":null,"work_id":"849d648f-b326-4dee-9e04-78e87831cc90","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:0186ee8f7089107a9d8de6e9e6ed34c20449f790916f5aab2718d1303135d687","observation_id":"4ed68ca9-affb-4168-95b9-7da6861273de","resolution":{"observed_at":"2026-05-14T18:42:03.447912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:964d82a7aec4cded2361e173425f67122eb49bb26d39f10b442bd851dba8ca17","observation_id":"2116d735-d45d-4b37-9f38-714c5765e739","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":"2211.11018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-07-11T01:57:50.042360Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","venue":"cs.CV","work_id":"aad71b40-2721-438d-8e8c-97f84063ed39","year":2022},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:7a3e4b79a7ed92d796cc160abfcf30ad544a4f1700844ea00b1a35ec8ac1783a","observation_id":"a94c373d-5d63-47f6-9fca-05f9b0f2495e","resolution":{"observed_at":"2026-05-15T18:47:57.649874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15818","last_updated":"2025-05-30T03:55:20Z","snapshot_observed_at":"2026-08-05T00:59:34.191472Z","submitted_at":"2023-09-27T17:44:18Z","title":"Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":"2309.15818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.15818","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Show-1: Marrying pixel and latent diffusion models for text-to-video generation","venue":null,"work_id":"2d474f0d-9f50-441f-a8be-68bdb765d647","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2309.15818","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:05adc1d417c4876360be6329fd6b9856ffb33ab4aa15e1d55b3a4142c7e1acef","observation_id":"79daf691-163a-4b8d-a35a-e57b70bf965e","resolution":{"observed_at":"2026-05-14T18:42:03.022934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Preserve your own correlation: A noise prior for video diffusion models","venue":null,"work_id":"81d50eee-7ad7-4857-a91f-5c8a494120f4","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:fd75256aaea65b8b82e0854e1e39751d05ac7576968d0a97dfe0f26a591f270e","observation_id":"7afdc277-4732-46c2-8d0c-17d14610ad6e","resolution":{"observed_at":"2026-05-14T18:42:03.452601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":"b472dede-2b92-49bb-adf6-7d9e0214333e","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:47daa898d2db6070296399dafbd51624aa6300342eab05f658509b637587a89e","observation_id":"631ac26c-9748-4ee5-8489-1f0ced631733","resolution":{"observed_at":"2026-05-14T18:42:03.457294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13439","last_updated":"2023-03-23T17:01:59Z","snapshot_observed_at":"2026-08-02T10:20:57.683645Z","submitted_at":"2023-03-23T17:01:59Z","title":"Text2Video-Zero: Text-to-Image Diffusion Models are Zero-Shot Video Generators","version":1},"cited_work":{"arxiv_id":"2303.13439","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.13439","snapshot_observed_at":"2026-06-29T17:53:46.729515Z","title":"arXiv preprint arXiv:2303.13439 , year=","venue":null,"work_id":"ddea38b0-8bf6-45cd-9c6b-9a5d839f9224","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2303.13439","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:059332c91208333dc3614153832c1c77bb9f0c2d0f959b01ebe796c83a71d1ae","observation_id":"7f7ad92f-57d9-425b-b565-19e92af455aa","resolution":{"observed_at":"2026-05-14T18:42:03.042078Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:89e7a908788b1e152570a3d3d538ff74d252fa96dbae6d08e7ccefd6e5c3b2e7","observation_id":"f035c9d1-27e7-4124-846a-0f4a687a0fc8","resolution":{"observed_at":"2026-05-14T18:42:03.048515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:9ba92dd20244891cb01f26f061f92e3e9cf43457910aabe385aec8a40cc28af8","observation_id":"ccc8dbbc-c5fa-4857-9c86-a53272c1d1af","resolution":{"observed_at":"2026-05-14T18:42:03.055974Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":"85d82dbb-f65b-46e2-a304-5715c2d417c1","year":2025},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:782e4750de4ec90c7ed4ba4d51720fe35109dc2ff93e3499706befeb4d6f88e6","observation_id":"8be8bbcb-7323-4df3-99c8-eeb53d52e18b","resolution":{"observed_at":"2026-05-14T18:42:03.461626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:9787c60fb3bb59e161e4b6ba45172e4a571689db036584f842175bd6ee9c56ce","observation_id":"31dcae6c-86f1-42e0-880c-09d71cdcfaf0","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Team, “Minmax,” Accessed August 31, 2024 [Online] https: //hailuoai.com/","venue":null,"work_id":"938c1dc8-98d1-4f00-9da6-90c39124c9dd","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:94e1d0af46ef1ebe4d782b145e10bef6ee1840c485e67a89185b083c9de3c725","observation_id":"5508daed-cfb5-4eb8-be50-6b1fe5a4610f","resolution":{"observed_at":"2026-05-14T18:42:03.465947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08453","last_updated":"2025-01-14T21:53:11Z","snapshot_observed_at":"2026-07-06T20:21:09.148018Z","submitted_at":"2025-01-14T21:53:11Z","title":"Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models","version":1},"cited_work":{"arxiv_id":"2501.08453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08453","snapshot_observed_at":"2026-07-04T13:19:51.141627Z","title":"Vchitect-2.0: Parallel transformer for scaling up video diffusion models.arXiv preprint arXiv:2501.08453","venue":null,"work_id":"4bed9bae-f24a-4316-9d52-06cda3f3fcd7","year":2025},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2501.08453","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:d64e538e24ada0cb3c0beabd68db19dccc08a9388a0986952aed74d339f813d5","observation_id":"bc835403-83a4-48e5-873d-630c80b32ee4","resolution":{"observed_at":"2026-05-14T18:42:03.081613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08994","last_updated":"2025-01-15T18:20:37Z","snapshot_observed_at":"2026-08-04T06:44:30.960627Z","submitted_at":"2025-01-15T18:20:37Z","title":"RepVideo: Rethinking Cross-Layer Representation for Video Generation","version":1},"cited_work":{"arxiv_id":"2501.08994","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08994","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Repvideo: Rethink- ing cross-layer representation for video generation","venue":null,"work_id":"0aa48302-dd53-4fca-b5b7-2e29c304faa5","year":2025},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2501.08994","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:79c84b5b2ccc90d5fbcd320ac16cd91a03ea5a0ee46e3717b3c52a42931b8462","observation_id":"a29b4045-5aca-4cfb-909a-de0895d41532","resolution":{"observed_at":"2026-05-14T18:42:03.088487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-02T11:33:41.662779Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":"2503.09642","doi":"10.48550/arxiv.2503.09642","metadata_source":"pith","pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","venue":"cs.GR","work_id":"c22f9060-268c-4cc9-8018-dee486a23da1","year":2025},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:efe5aaa4102f819ce0e1459677118fb02157f31a5f244e0886cc25b1ebae8ecd","observation_id":"920a82e0-214c-4678-a179-f6e5abbeb42f","resolution":{"observed_at":"2026-05-16T12:09:39.930389Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GANs trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":"274551a5-868f-45c9-8168-f6a42dffb9ed","year":2017},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:0423cccfec2764a5d3551793fa311855796a249facc6a0aaba3fcdf43447971d","observation_id":"36a0d02e-62d3-4cb4-96d8-31ed49942f54","resolution":{"observed_at":"2026-05-14T18:42:03.470397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved techniques for training gans","venue":null,"work_id":"c043f873-aa59-4682-b064-4ec6e41b8b7e","year":2016},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:8dcb881c62791d13e8a5cdd334744339f017da01e32f89f424782f8af02f2f03","observation_id":"9e9d2415-b372-4502-8d10-9216a1ec7b63","resolution":{"observed_at":"2026-05-14T18:42:03.474841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FVD: A new metric for video generation","venue":null,"work_id":"827cbd76-4d6e-4496-b098-5304b6896038","year":2019},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:cc29405a02d2eaac9b6adb3c0f5df00a91503a9b9cbfc66e80939f9e5e3e88c6","observation_id":"f1a6d1c4-2072-4c5b-8318-f4640ea123f5","resolution":{"observed_at":"2026-05-14T18:42:03.479242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fetv: A benchmark for fine-grained evaluation of open-domain text-to-video generation","venue":null,"work_id":"d4e61afd-f471-4851-a08f-a829de5e23df","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:4bf3097962b3af6af31b36f01063dd066383080d63d14a84dde6c67fa599c73d","observation_id":"5992c6f6-e435-4c0f-9796-34fc64b654a9","resolution":{"observed_at":"2026-05-14T18:42:03.483812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09645","last_updated":"2025-08-20T18:39:27Z","snapshot_observed_at":"2026-07-06T20:06:13.565435Z","submitted_at":"2024-12-10T18:52:39Z","title":"Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models","version":3},"cited_work":{"arxiv_id":"2412.09645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09645","snapshot_observed_at":"2026-07-03T05:07:38.842004Z","title":"arXiv preprint arXiv:2412.09645 , year =","venue":null,"work_id":"c6095669-7de8-48cf-8ade-c967f0a2f115","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2412.09645","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:f8b9e0c9d1492b3b1c508bb5b0e7f648f7cfd3653efe9385b5409c9afca09b54","observation_id":"adc5faa4-c36c-44e8-b045-06c54c93d8c4","resolution":{"observed_at":"2026-05-14T18:42:03.126020Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-07-06T19:29:14.335016Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"cited_work":{"arxiv_id":"2410.05363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.05363","snapshot_observed_at":"2026-07-08T07:14:45.198485Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","venue":"cs.CV","work_id":"644e2886-7387-436d-ac11-d848af5fcc71","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2410.05363","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:d1190dc805ff22be551aba3a8d7633a8d45606521b5809460626fc806ca673e1","observation_id":"e2e6eac7-7da8-447c-bb74-dd796e7ece3c","resolution":{"observed_at":"2026-05-18T14:40:00.221207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:2ab441fa70d07e6b61db66e25676ef0db81719a848118b72772c8e098299df53","observation_id":"c3e7287d-1a9d-48af-9ee4-ebd163dfbe9e","resolution":{"observed_at":"2026-05-14T18:42:03.138921Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16211","last_updated":"2024-12-17T23:00:42Z","snapshot_observed_at":"2026-07-06T20:11:11.053567Z","submitted_at":"2024-12-17T23:00:42Z","title":"Is Your World Simulator a Good Story Presenter? A Consecutive Events-Based Benchmark for Future Long Video Generation","version":1},"cited_work":{"arxiv_id":"2412.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16211","snapshot_observed_at":"2026-07-01T13:45:45.961646Z","title":"Is your world simulator a good story presenter? a consecutive events-based benchmark for future long video generation","venue":null,"work_id":"d80920d4-a135-4fe3-bc68-480d67292f88","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2412.16211","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:28688c287f98ab738895cf246f412e4e587e3d05a4a011fe8fd698c0849b90c7","observation_id":"736f7829-6ae8-437e-a342-9e09d3c5c1a5","resolution":{"observed_at":"2026-05-14T18:42:03.145783Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":"2410.02713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-07-09T21:36:34.348434Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","venue":"cs.CV","work_id":"e598f516-d992-449a-ab6d-6c788b3a1d7b","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:9e71616b282ef4eeed6806977e11611a84218806ab232dbbf82099567578abc7","observation_id":"28953e7a-4738-41e5-8848-730399223951","resolution":{"observed_at":"2026-05-14T18:42:03.151308Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:c06c700dabc6802bc2f382abbf410b14a42967b785e825fedb95c9c6cffdb1ae","observation_id":"b9edc57b-42a4-46a4-bd98-c10ff3a6f1dc","resolution":{"observed_at":"2026-05-14T18:42:03.157051Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simmim: A simple framework for masked image modeling","venue":null,"work_id":"07f67870-5f12-4bb6-a79d-df5aaccf410c","year":2022},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:86bb58fc4abb2409441c16e08c30407ece6fa5a25a50add2cae2a1c6371ad308","observation_id":"c843e642-3527-4423-8485-b7d014e60095","resolution":{"observed_at":"2026-05-14T18:42:03.488586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yolo- world: Real-time open-vocabulary object detection","venue":null,"work_id":"6cdddf1b-21a9-4f34-a374-6bfc60c93119","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:2d588f265219426dabac4fe3361d0ca7168808707d6d3137408ffa9049b5b1fa","observation_id":"19a1c183-6010-4650-bea0-f95e76e3d8c9","resolution":{"observed_at":"2026-05-14T18:42:03.492963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Humanrefiner: Benchmarking abnormal human generation and refining with coarse-to-fine pose-reversible guidance","venue":null,"work_id":"9391be39-cdc8-4c57-859b-06a839e3b960","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:86ee2de7faf8c7e219a2be4e8db4a3e3bb893707cb1344b8c58895683d3d44e3","observation_id":"aa281663-f70a-4c83-ada8-bb9c7d645aff","resolution":{"observed_at":"2026-05-14T18:42:03.497553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":"c18437dc-a1af-41ce-8c23-6c9aa54148b5","year":2019},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:ac35f2455925c82082dc579f2ae902e15553f34ff9d651631516a7369524cc78","observation_id":"14e98149-ded4-4d1f-b8c1-4d3197d7c68f","resolution":{"observed_at":"2026-05-14T18:42:03.501878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retinaface: Single-shot multi-level face localisation in the wild","venue":null,"work_id":"7b2e87a7-84b6-4ad0-996d-14163a7bd776","year":2020},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:1f0a7305bce822b281f05145568416e3e060c444ed73aa0ebe08d55e98f03ba2","observation_id":"5499d47b-2e78-4aee-afd7-cc054eaed578","resolution":{"observed_at":"2026-05-14T18:42:03.506340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":"eebb1da0-e811-4146-bc71-1b53d987dfed","year":2015},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:eeb36864475dcbd38e5e3de22d4bd4c934da7d6efbd622ffaa4a460bf095361e","observation_id":"43d002d4-3b19-499c-ab73-b073569f8172","resolution":{"observed_at":"2026-05-14T18:42:03.510549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.06576","last_updated":"2015-09-02T08:24:59Z","snapshot_observed_at":"2026-07-06T04:27:45.692332Z","submitted_at":"2015-08-26T17:14:42Z","title":"A Neural Algorithm of Artistic Style","version":2},"cited_work":{"arxiv_id":"1508.06576","doi":"10.1111/papa","metadata_source":"pith","pith_arxiv_id":"1508.06576","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"A Neural Algorithm of Artistic Style","venue":"cs.CV","work_id":"d2d26c58-703b-4026-8fb7-fea9af58cdf2","year":2015},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/1508.06576","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:ab1355c8f07b7d20e367d57caf7d04fef7f9d284576315d49072ee220dcc0e00","observation_id":"2f400fc0-205e-42a1-a6f6-f7fd6170ef87","resolution":{"observed_at":"2026-05-14T18:42:03.224471Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cotracker: It is better to track together","venue":null,"work_id":"2d1d54ef-f38a-4941-ba6b-6d740f11a20f","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:bc87979967539da255220ca079d9814b6fc6313a951c1defa0b8ae2db0dbecd2","observation_id":"032b2326-a66f-4d5b-997c-a3ff1055e39a","resolution":{"observed_at":"2026-05-14T18:42:03.514988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17403","last_updated":"2024-02-27T10:49:05Z","snapshot_observed_at":"2026-07-06T17:36:05.934286Z","submitted_at":"2024-02-27T10:49:05Z","title":"Sora Generates Videos with Stunning Geometrical Consistency","version":1},"cited_work":{"arxiv_id":"2402.17403","doi":"10.48550/arxiv.2402.17403","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.17403","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sora generates videos with stunning geometrical consistency","venue":"arXiv (Cornell University)","work_id":"8abd93c7-2d35-490b-ba01-eafee4be5f19","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2402.17403","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:a37023065a595f43767c8933903fb642aafab0adba3d442c59e13b4edff18f7f","observation_id":"c6e732e8-35ef-492b-82e6-61fb5ae2c0d9","resolution":{"observed_at":"2026-05-14T18:42:03.237706Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sift-the scale invariant feature transform","venue":null,"work_id":"782874bd-60b3-4f0e-9bb4-cbcd2f6da014","year":2004},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:4e7ddc39b1bb17c02ae355236fd741992216bb1fe1c78ebda93d5d0b14751db7","observation_id":"3f80b2d5-fbe4-4959-8f47-8201f690eb89","resolution":{"observed_at":"2026-05-14T18:42:03.519714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast approximate nearest neighbors with automatic algorithm configuration","venue":null,"work_id":"87291987-220d-4e84-aebf-9be26bea17b6","year":2009},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:0d122c63bfb61afc4271f910d87c1c444b05f68c0bd813b31c50c3f8a7830ed0","observation_id":"e7cb0722-131d-4622-80b1-ac6d69f54b70","resolution":{"observed_at":"2026-05-14T18:42:03.523517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Random sample consensus: a paradigm for model fitting with applications to image analysis and automated cartography","venue":null,"work_id":"3d7e6def-7ab7-4f87-a8c1-eea77aa2025f","year":1981},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:f6b6dfa0268fdac57b7adacd6bde995dde8863acb66f002722e3753634f8f2e9","observation_id":"03e0f3e9-a660-407d-8101-a251e15fd2c2","resolution":{"observed_at":"2026-05-14T18:42:03.527608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":"aeb040d6-bbdd-42b6-b794-6401bd80be39","year":2020},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:3ad4a4f5aab02dc53ce25727be32200020631a627adb263af2862a3739494d18","observation_id":"41289fae-0ad5-47f7-978b-e5ac333fd3de","resolution":{"observed_at":"2026-05-14T18:42:03.531919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:e743411dcb65742a749063245e840de813bf06e58cd6840fc6ac1df5e7c87220","observation_id":"7a86cda7-44f5-4ef5-9ed8-d0697f2581ae","resolution":{"observed_at":"2026-05-14T18:42:03.269357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02265","last_updated":"2024-11-06T09:15:27Z","snapshot_observed_at":"2026-08-04T12:39:25.666793Z","submitted_at":"2024-11-04T16:56:26Z","title":"Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent","version":3},"cited_work":{"arxiv_id":"2411.02265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02265","snapshot_observed_at":"2026-07-04T20:10:07.812289Z","title":"Hunyuan$large: An open$source moe model with 52 billion activated parameters by tencent","venue":null,"work_id":"05bfc742-1ecf-49a7-8616-8c7db577a7f5","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2411.02265","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:1411017460684373f78a967113168186c402c576fef3fb4fb6d0ebbc798e68f9","observation_id":"f47bb99f-d1ac-4019-9fa0-df0c51e5d463","resolution":{"observed_at":"2026-05-14T18:42:03.275424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces","venue":null,"work_id":"cabde4ac-7910-4a5f-b570-f0a204f109df","year":2025},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:e38be1dd8e667256661d347b3f159d0aebacad037fd47b52b3280ea4c01a0d3b","observation_id":"cf11a842-9673-4075-8df7-be6e953242eb","resolution":{"observed_at":"2026-05-14T18:42:03.536170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.21356","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:40:00.924244Z","title":"Shotbench: Expert-level cinematic understanding in vision-language models","venue":null,"work_id":"b272857b-e5ad-4a8d-9e2c-ead8905cf793","year":2025},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:847fe8e233be2f1994cf32936640efc25003faeb6ff386ed4aadf1f0af08ba18","observation_id":"085d88d7-c439-492c-bdea-529675975e09","resolution":{"observed_at":"2026-05-14T18:42:03.287472Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synthetic vision: Training vision-language models to understand physics","venue":null,"work_id":"6499d9ec-3acf-4cad-9804-2577488e1a16","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:59cacb3a9ea5a7f3b164fd7d8f55c34856b32c9f2b422a9da6302a99cdc4d144","observation_id":"c45d38c6-c3bb-4f31-95e0-3c3354ccb47d","resolution":{"observed_at":"2026-05-14T18:42:03.541135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unibench: Visual reasoning requires rethinking vision- language beyond scaling","venue":null,"work_id":"c566c016-95d4-4258-ab90-086c7de96996","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:a10d0f7b3932ed1ef1887e48abcf78a67f6ba4b33754b25fd65f453d1011015a","observation_id":"45b627b5-d178-46e2-ab38-308587535c17","resolution":{"observed_at":"2026-05-14T18:42:03.546455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yinan He is currently a Research Engineer at Shanghai AI Laboratory, where he is a member of the OpenGVLab","venue":null,"work_id":"965ff057-305d-4b61-b645-3f2e44faa1a5","year":2019},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:9a0ae223e7d497104fa3aa11546d3e363db61c9f7ec9e19e2114a480f651b964","observation_id":"03147edd-8351-4874-8f66-55bf7d83f6f5","resolution":{"observed_at":"2026-05-14T18:42:03.347038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":47,"verified_fuzzy":45},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 100 inbound Pith citation observations for arXiv:2503.21755."}