{"as_of":"2026-08-09T04:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f69cd097b9870216ce25fbde9c43595342c6e6e65f30b2a6bfe81b1e4e6148d8","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T19:07:58.535598Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T04:39:22.400458Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T04:40:23.162451Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"cited_work":{"arxiv_id":"2502.05503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05503","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5b362e41-6f7c-4552-a91d-7e9476a25964","year":2025},"citing_paper":{"arxiv_id":"2605.23699","last_updated":"2026-05-22T14:51:22Z","snapshot_observed_at":"2026-07-06T23:33:53.870540Z","submitted_at":"2026-05-22T14:51:22Z","title":"CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T04:39:22.400458Z"},"links":{"cited_paper":"/paper/2502.05503","citing_paper":"/paper/2605.23699"},"observation_digest":"sha256:c80fe7e50dde301fcefb61a987428822aafc2d439c591c33e0199fd3e32b4ad4","observation_id":"560fa5f9-410a-468d-a39f-088e8b0260b2","resolution":{"observed_at":"2026-05-25T04:40:23.166018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.05503/citation-record","integrity":"/paper/2502.05503/integrity","json":"/paper/2502.05503/citation-record.json","paper":"/paper/2502.05503"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:59.076326Z","title":"Keling1.5","venue":null,"work_id":"2aca1e12-fb0d-47bf-9411-517368b5e1b1","year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.336373Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:353aba2d89f9472fa8a84a088413b5eef83d025cbbc2aed1d225f1b724787fcd","observation_id":"aacfe9df-39c6-452c-b5e1-be52c6c51e9d","resolution":{"observed_at":"2026-08-08T19:07:59.079601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:59.067303Z","title":"Dream machine","venue":null,"work_id":"1061d670-42f3-423c-947a-4bb543c21865","year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.341952Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:708b42f37a29f7d2d3089a46f3cf9e3c14dc373acd38c853b79347e37371257c","observation_id":"ac4dd7b1-0c23-4aae-a005-a6d13101170e","resolution":{"observed_at":"2026-08-08T19:07:59.070167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03520","snapshot_observed_at":"2026-08-08T19:07:58.345968Z","title":"Videophy: Evaluating physical commonsense for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.345968Z"},"links":{"cited_paper":"/paper/2406.03520","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:033151bc13656baa12f586b1dfce1f9c1ccc5c617f378370689f9e899c049fa0","observation_id":"ebda91a0-3626-43f6-b6b0-1c102d52d5e9","resolution":{"observed_at":"2026-08-08T19:07:58.345968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-08T19:07:58.349998Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.349998Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:d5f0b0205e5fcb165db96fa423d441fad7aeca1136d6e6647cd62ce2c20afdbf","observation_id":"1ff5507f-4e73-4feb-a4b0-afa44b692e63","resolution":{"observed_at":"2026-08-08T19:07:58.349998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.354214Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.354214Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:64b31ea402635c326b0daa4103b242e760533961aae47bb5ea416b8545570962","observation_id":"798ff80a-2cd3-4354-9295-160645abd189","resolution":{"observed_at":"2026-08-08T19:07:58.354214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-08T19:07:58.357975Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.357975Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:1118b13e74aa60233e6d3b12c56c1e5b5a761591ca1cfc7c4ed1b83f1c4b766d","observation_id":"c440b295-9d94-4df7-9a64-df2c877c113f","resolution":{"observed_at":"2026-08-08T19:07:58.357975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:59.050833Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":"2070ea15-2b30-4f0a-85ac-456a6bc4a3a3","year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.362012Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:8d56477128af2fc953d8eb3c6e82f746a84d6783ca5c3453952603b761baaabb","observation_id":"14b9ae6f-d62c-4202-91ae-3efb178e7bc9","resolution":{"observed_at":"2026-08-08T19:07:59.054343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14404","last_updated":"2023-04-27T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:50.194742Z","submitted_at":"2023-04-27T17:59:32Z","title":"Motion-Conditioned Diffusion Model for Controllable Video Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14404","snapshot_observed_at":"2026-08-08T19:07:58.366235Z","title":"Motion-conditioned diffu- sion model for controllable video synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.366235Z"},"links":{"cited_paper":"/paper/2304.14404","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:c0606830dc4505ae991db5abc79fa5a7efa678c3c2fa98260bfba3d54500db6c","observation_id":"64f19260-1f72-4b51-be90-1074ea98a5a3","resolution":{"observed_at":"2026-08-08T19:07:58.366235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:59.040638Z","title":"Haa500: Human-centric atomic action dataset with curated videos","venue":null,"work_id":"af6d353d-a2bc-4d0b-8d5d-9bbe1cde97a2","year":2021},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.370007Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:1e2bc4bfc5050b54deee68b88bcc038f3d8ba3779264c52c53fcaf1d18c6c209","observation_id":"c3fe1dba-0b35-4c5f-92eb-5d952da7792c","resolution":{"observed_at":"2026-08-08T19:07:59.044283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.373673Z","title":"Flownet: Learning optical flow with convolutional networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.373673Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:fe51ea869c8f915d6daa8b81087c689efad8746defe4c30021a4d432557614ef","observation_id":"26206c47-5205-47c1-902b-e11ee92308d9","resolution":{"observed_at":"2026-08-08T19:07:58.373673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.377446Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.377446Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:de4a134e93010c0f3eacdb00162577564a835e54acba0eaea891eaa9e442cdbc","observation_id":"2ee13d42-b45f-48ce-b2c0-b1086aff403a","resolution":{"observed_at":"2026-08-08T19:07:58.377446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:59.018391Z","title":"Seer: Language instructed video prediction with latent diffusion models","venue":null,"work_id":"2a0e7bf6-9974-4da0-b61f-456bd4838c71","year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.381582Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:6609b0b1ff57243cbf0b20657a1c42f573133aa8daadb93fd5c88307f876f2e5","observation_id":"6b3e5c32-8e82-4621-8ec0-7c55200786c7","resolution":{"observed_at":"2026-08-08T19:07:59.021871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:59.007888Z","title":"Animatediff: Animate your personalized text-to- image diffusion models without specific tuning","venue":null,"work_id":"f7b0d32e-26a2-4f04-a472-67d0642793c0","year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.384854Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:38c2c08d6e7289492ef7e519f2caeb5e3adb9fbf3df7fbd0ff3ffd7a66b9efad","observation_id":"b671a80c-858d-4972-a793-055171c7fc59","resolution":{"observed_at":"2026-08-08T19:07:59.011921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.997717Z","title":"Flexible diffusion modeling of long videos","venue":null,"work_id":"7c305ed4-bbf1-40c9-9694-20c1d16b12da","year":2022},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.388306Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:ec9b3136ef3c561194a041907d6a9ed432759791f13c0fa05f0a28fefea1d114","observation_id":"986d7164-f394-4f8e-84c3-6235e1844c9d","resolution":{"observed_at":"2026-08-08T19:07:59.001272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-08T19:07:58.391643Z","title":"Latent video diffusion models for high-fidelity long video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.391643Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:810dc4e0234a89cba76198e52fd55d6764e9bd377fddc74125709f33262f23a1","observation_id":"72201789-ecd8-4991-884a-e568932fc65a","resolution":{"observed_at":"2026-08-08T19:07:58.391643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.395852Z","title":"CLIPScore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.395852Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:fdb0cfd955815a8d5c8ce232bddaaa2a341b89e0ddaaab22a6a97754dc0f4fdd","observation_id":"b7b007f1-8ca3-4ef6-92ea-d60006a5144d","resolution":{"observed_at":"2026-08-08T19:07:58.395852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.399178Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.399178Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:f05444cde98710d607f454ac0b459999f9171674c26ba3cc8b2b832214aca0f8","observation_id":"d72a3536-7862-4bf4-882f-b53258223c92","resolution":{"observed_at":"2026-08-08T19:07:58.399178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.974863Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"b09cab23-0e1b-4a7e-aa2e-02e987a18f7a","year":2020},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.402508Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:c0354579fd453b147a91dd56e0f759e3a796d67f0dc121632b6d41bf9b895a77","observation_id":"6223fdd1-b4f0-4227-addb-9a575b2461f6","resolution":{"observed_at":"2026-08-08T19:07:58.978522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-08T19:07:58.405880Z","title":"Imagen video: High definition video generation with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.405880Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:6ae0adc296ff8da6f778614f1df23f968671a4dac7406f1564415cc2e70e395b","observation_id":"3a5afeaa-0a9e-4650-980a-8e0523f45d91","resolution":{"observed_at":"2026-08-08T19:07:58.405880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.410074Z","title":"Video dif- fusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.410074Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:d1058a111521319df9006ed8d32f09264f9ac498a21a9d278bd371e17b3f2ed0","observation_id":"8afc2389-46a0-4e76-bf98-656e9d2f75e6","resolution":{"observed_at":"2026-08-08T19:07:58.410074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.958329Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":"99699772-1de0-4c69-beb2-865caf9eec51","year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.413504Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:312f0ba33f250dc30708ec54124c65a2e6baed6fec03260600e13dd4520ccc5a","observation_id":"0c714bc0-a28f-4aa7-9615-12c6b8845cbf","resolution":{"observed_at":"2026-08-08T19:07:58.962116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.948182Z","title":"T2vbench: Benchmarking temporal dynamics for text-to- video generation","venue":null,"work_id":"8d66ca1d-0510-495e-8dea-ac36b316af2f","year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.416535Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:5807449774af56d3ed2035748e04df743b578ebb9dad0450b8df4bac7c4cb745","observation_id":"3fe6320b-88ad-4825-8377-c3406790a430","resolution":{"observed_at":"2026-08-08T19:07:58.951655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.938068Z","title":"Text2performer: Text- driven human video generation","venue":null,"work_id":"3e8cb11b-f7f4-4a8d-8a3d-2efa0b5d416b","year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.420098Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:84d31d4bf48b08f661ce99358021da2b737ffea6fbfb1f2a19fd281f3d21cc53","observation_id":"aa4652ee-d295-4a5f-b6c8-3a22b2d993d0","resolution":{"observed_at":"2026-08-08T19:07:58.941907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.928416Z","title":"Text2video-zero: Text- to-image diffusion models are zero-shot video generators","venue":null,"work_id":"08208de3-6177-499a-9082-4aa0bd952eb4","year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.424020Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:8b098c19c13ad43e44da773a2cd54d7159115257fb8276f52dcb2df774d12bc0","observation_id":"7941c066-3b2c-4ed5-a730-85ba33d1374d","resolution":{"observed_at":"2026-08-08T19:07:58.931873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.918792Z","title":"Fu- ture frame prediction for anomaly detection–a new baseline","venue":null,"work_id":"5ccddb43-8e9c-44cf-a6e1-adf5750de9f1","year":2018},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.427768Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:8c36387d8796905e92e4aa9900fbc206055e24eb68eae82b78b35e75adc16987","observation_id":"217e425d-fe78-4f18-8ab1-25d69403966a","resolution":{"observed_at":"2026-08-08T19:07:58.922207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.908431Z","title":"Evalcrafter: Benchmarking and evalu- ating large video generation models","venue":null,"work_id":"c9d45dbf-6490-411b-a803-4e459117b602","year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.431488Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:53ac8bf517367d9844389466cd342966f9effa2aff2feac8798b5b3e6791b7d2","observation_id":"dd920b3e-31b5-4301-9e8a-12b94d5b5970","resolution":{"observed_at":"2026-08-08T19:07:58.911811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-08T19:07:58.435122Z","title":"Sora: A review on background, technology, limitations, and opportunities of large vision models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.435122Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:8dd73aba9ea2902484d4a9a4f8da676bbec2e2333b5a018cae1a08ab247417ea","observation_id":"9e8b2b9e-6a69-49ba-ba44-134adaf51296","resolution":{"observed_at":"2026-08-08T19:07:58.435122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.899262Z","title":"A hybrid video anomaly detection framework via memory-augmented flow reconstruction and flow-guided frame prediction","venue":null,"work_id":"446393fb-b102-4dd9-b06f-981b37ad2ed3","year":2021},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.439841Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:bba2de7e592e322be28e434103b4cb5ad359745db5303d7c38423c1f3d34e20a","observation_id":"838d67dc-4286-41c8-aec5-d3fed257a187","resolution":{"observed_at":"2026-08-08T19:07:58.902288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-08T19:07:58.444466Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.444466Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:86714a4f379fc2ba35677dfbf44a7265feafc5c0e497d39c67a97412a4004f00","observation_id":"a13e4214-535c-4e0e-833e-07f69f9abf1f","resolution":{"observed_at":"2026-08-08T19:07:58.444466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.890117Z","title":"Anomaly detec- tion in video sequence with appearance-motion correspon- dence","venue":null,"work_id":"d1171c98-ac45-4e91-a914-cd681eb57dc6","year":2019},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.449990Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:8d4ac9349978287b343e6d2d4d96e50ae283a982959b3f812fccfaffd799f137","observation_id":"7720d487-6810-4223-82e4-78b4030889a0","resolution":{"observed_at":"2026-08-08T19:07:58.893328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.880441Z","title":"Conditional image-to-video gener- ation with latent flow diffusion models","venue":null,"work_id":"79e7271a-dbd2-4607-8cbe-55bac82f69f8","year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.456819Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:9c1e93e6bae8ef1178df3737a5d20afc7912d67d72fb8c3c7cb7c30feb2a6f8d","observation_id":"4a515592-1148-40bd-a624-61e167a8afec","resolution":{"observed_at":"2026-08-08T19:07:58.883730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.869072Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"22b06c36-e3f7-417e-ac5e-6502a8ac348f","year":2022},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.460361Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:2da77d5dec971b8262c08738b847e735295d51b10242dae1103292e27776e597","observation_id":"57ebd623-431f-4304-ac8a-565380684eec","resolution":{"observed_at":"2026-08-08T19:07:58.872850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.857687Z","title":"Gen-3 alpha","venue":null,"work_id":"ec1471f2-e604-4e70-99dc-6fcf7705cc21","year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.464109Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:db6835474c0e277434a50555dbaa78e0fba635f951382e49ae07a81a16ab8a14","observation_id":"a1923c1d-32ea-49fc-94b7-cadfaee4c4e9","resolution":{"observed_at":"2026-08-08T19:07:58.862037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.467503Z","title":"Improved techniques for training gans","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.467503Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:16e37139b3976d0da65e0a4fd3c1d68b3a23d124d97f56421aa184079c8e2f7e","observation_id":"0d0e1072-f738-4ce8-8764-d828ea64158f","resolution":{"observed_at":"2026-08-08T19:07:58.467503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.840654Z","title":"Flowformer++: Masked cost volume autoen- coding for pretraining optical flow estimation","venue":null,"work_id":"496eec8c-30bb-48de-937a-5a1afea119b5","year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.470767Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:5e72a8b6c70ee846f62f5a3c6191175fc65e32913a2563025ee63fc8af10fde3","observation_id":"8af7054e-578d-49ab-8bab-cf2cc931b67e","resolution":{"observed_at":"2026-08-08T19:07:58.844508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-08T19:07:58.473951Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.473951Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:602a23b59590d6e54078f9d5d6ddddf79a6dfd3ae94e0311ddacf63d68569538","observation_id":"40e2eef0-db38-4197-8c5b-49b3c8ad3160","resolution":{"observed_at":"2026-08-08T19:07:58.473951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-08T19:07:58.477854Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.477854Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:010cfbe6d1943ddc08adfb75d24ac0cc84fb3c7665231eba89e5b44d25996ee2","observation_id":"8dc8c0aa-e6b9-47a5-8613-26ba16df7514","resolution":{"observed_at":"2026-08-08T19:07:58.477854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.829598Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":"ffdc3858-bab8-40ea-9238-2cc34373cd23","year":2019},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.481856Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:cf5ad4552d772a17a5d3a03e4d07c27c52e8309446c10f5a4a0b719612521ec5","observation_id":"e8bf2cdb-1fb7-4c40-8265-1da70dd2b5e3","resolution":{"observed_at":"2026-08-08T19:07:58.833145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-07T17:54:54.749604Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-08T19:07:58.485289Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.485289Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:74de8e53639b1042481f57cfebc823d31a76c38cb1d0b84d0a0ed37e6c424563","observation_id":"969b66bb-f100-427d-8c42-7dd76cd86847","resolution":{"observed_at":"2026-08-08T19:07:58.485289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.488954Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.488954Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:73fcd2c0b64df1ebb4cb37c4fa5c67b54c04ea37768f87ba88d621fb91d6c471","observation_id":"c0849c7b-f4ac-474d-a11a-5c8d5921ca20","resolution":{"observed_at":"2026-08-08T19:07:58.488954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.812328Z","title":"Physics 101: Learning phys- ical object properties from unlabeled videos","venue":null,"work_id":"2254d023-5af2-4408-a6a9-28b8fa613544","year":2016},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.492328Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:1d26c42956f52a386567a1c360d12a1341f7916f6b65c0df465b878dfcb9be3c","observation_id":"252d19db-03ee-4e5a-87e4-57a7b091b105","resolution":{"observed_at":"2026-08-08T19:07:58.816422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.801187Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":"61a83536-fb6b-47f4-ad3a-5a8f14e5c410","year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.495794Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:3e168ea5bf886670b821bd0374459dcfe65405f5e31a47ef61062a15b515f7da","observation_id":"18aa7581-19b7-4363-9cd9-bc4c7d889d10","resolution":{"observed_at":"2026-08-08T19:07:58.805369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.789930Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"a9b73b50-eb40-48cf-9fd1-06bd3ec1ad31","year":2025},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.499135Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:1d6635811d4eb7f4d85780a3be2d68c08eb5bac22cc160ba345082c99b24213c","observation_id":"7ba1da60-6668-4085-acde-f8c7f2cdd3e0","resolution":{"observed_at":"2026-08-08T19:07:58.793865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06465","last_updated":"2024-06-10T17:02:08Z","snapshot_observed_at":"2026-08-02T18:07:43.330243Z","submitted_at":"2024-06-10T17:02:08Z","title":"AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06465","snapshot_observed_at":"2026-08-08T19:07:58.502170Z","title":"Aid: Adapting image2video diffusion mod- els for instruction-guided video prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.502170Z"},"links":{"cited_paper":"/paper/2406.06465","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:3a8222fd9857c73379affb4a033683e431ea2be1b9a5e1b0373365a37a4bb782","observation_id":"760dfc1b-dff9-4059-9ec1-ce7c0eb813d3","resolution":{"observed_at":"2026-08-08T19:07:58.502170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-08T19:07:58.505717Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.505717Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:1344984957e278c2213e73354f1f1774779d8a473acb33dc5d82364d09ad5176","observation_id":"51d3eea7-44f7-4d0c-b1e3-7e6cb019ae1a","resolution":{"observed_at":"2026-08-08T19:07:58.505717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.777155Z","title":"Video event restoration based on keyframes for video anomaly detection","venue":null,"work_id":"c64f9e1c-e853-49c8-a6a0-70385ee04952","year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.510028Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:1db64a77e16d5acf8c72b4428248066d085c5bdd70abb157aaf8284f805cb85b","observation_id":"8d69ffdf-297a-4ffa-bcd2-28472ca2b2bc","resolution":{"observed_at":"2026-08-08T19:07:58.781024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.766681Z","title":"Old is gold: Redefining the adversari- ally learned one-class classifier training paradigm","venue":null,"work_id":"a992057f-633e-487a-9a35-9aa9bfa0426a","year":2020},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.514117Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:6a36b441a4cddc8ba26081f05aa1c90fd789c8a371c09cba14b0e080e77f53e1","observation_id":"9f965f28-18f7-4268-83d3-846089dbc865","resolution":{"observed_at":"2026-08-08T19:07:58.770133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.755355Z","title":"From actemes to action: A strongly-supervised repre- sentation for detailed action understanding","venue":null,"work_id":"e11d19d9-b796-45b9-a39e-beb4b2abd3a3","year":2013},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.518220Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:a0ccc7bc3fbc8952cac616edf885328bc3a81b7c85119bf168f6a6a420d08dd1","observation_id":"7bdc9441-8f93-4852-bb64-77aa9eac0ed0","resolution":{"observed_at":"2026-08-08T19:07:58.759635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12935","last_updated":"2025-01-22T15:06:30Z","snapshot_observed_at":"2026-08-07T01:27:03.735858Z","submitted_at":"2025-01-22T15:06:30Z","title":"3D Object Manipulation in a Single Image using Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12935","snapshot_observed_at":"2026-08-08T19:07:58.522326Z","title":"3d object manipulation in a single image using generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.522326Z"},"links":{"cited_paper":"/paper/2501.12935","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:4cf1c83ea5555ec75b14301a4f74e7a20cbb680d8424f8e9ac0e58f99bd4e24a","observation_id":"6cbaa88b-b97b-4adf-a4a1-4cd48afd9b07","resolution":{"observed_at":"2026-08-08T19:07:58.522326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.743465Z","title":"Open-sora: Democratizing efficient video production for all, 2024","venue":null,"work_id":"580e9fbb-c1dc-4af3-96c8-66fb06524a27","year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.526717Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:d2a0fe744a257b460ba2689d90f7662a42a0612607f0c81d8f810067d503222d","observation_id":"cbaae48b-53d0-41b8-bdd0-fa6c9046feac","resolution":{"observed_at":"2026-08-08T19:07:58.748383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-08T19:07:58.531238Z","title":"The output of the MLM","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.531238Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:d50589f327f36a8cb817d58ca821d20b1a9bce759d03663f08130ea4d9bdd523","observation_id":"cca730df-da82-4a9d-b7ec-7c967d999e6d","resolution":{"observed_at":"2026-08-08T19:07:58.531238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.729887Z","title":"2 > 1 > 3 > 4,","venue":null,"work_id":"5efa88ef-2dc1-4088-9a5c-11b4c35fb9f3","year":null},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.535598Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:351ffd30fc687a5ffd4cebd3f9b07442a0b4a244d8bcc03eda483b245e85ca27","observation_id":"c0c941da-6f29-4d31-9bce-eef5b89bf89d","resolution":{"observed_at":"2026-08-08T19:07:58.735388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 1 inbound Pith citation observation for arXiv:2502.05503."}