{"as_of":"2026-08-07T18:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:698a70c4eaef7e43f748093827743c8a145e3346c87a029ca2dfb92bfaf6e6df","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:43:29.373928Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T13:52:46.919098Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T19:45:01.081306Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2507.18107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.18107","snapshot_observed_at":"2026-06-30T19:45:01.081306Z","title":"Google DeepMind","venue":null,"work_id":"8dbb4c54-6562-4bd1-9af7-79df43942e6d","year":null},"citing_paper":{"arxiv_id":"2605.16716","last_updated":"2026-07-19T13:03:10Z","snapshot_observed_at":"2026-08-02T13:52:46.310476Z","submitted_at":"2026-05-16T00:01:18Z","title":"When Cultures Move: Measuring and Improving Multicultural Text-to-Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T21:59:44.030267Z"},"links":{"cited_paper":"/paper/2507.18107","citing_paper":"/paper/2605.16716"},"observation_digest":"sha256:d4aaa9b7488d295adecc5e7fa3d73df19c11959e23df0603fea1319127576a01","observation_id":"5cecbf39-9341-4f50-af95-bab82f51714e","resolution":{"observed_at":"2026-05-19T22:02:49.017149Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2507.18107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.18107","snapshot_observed_at":"2026-06-30T19:45:01.081306Z","title":"Google DeepMind","venue":null,"work_id":"8dbb4c54-6562-4bd1-9af7-79df43942e6d","year":null},"citing_paper":{"arxiv_id":"2605.16716","last_updated":"2026-07-19T13:03:10Z","snapshot_observed_at":"2026-08-02T13:52:46.310476Z","submitted_at":"2026-05-16T00:01:18Z","title":"When Cultures Move: Measuring and Improving Multicultural Text-to-Video Generation","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T19:36:43.654439Z"},"links":{"cited_paper":"/paper/2507.18107","citing_paper":"/paper/2605.16716"},"observation_digest":"sha256:8e0ba6d1ccbde2d9d9e6d400fb721348ddc8274c2773de4d1a0c207098b104d9","observation_id":"679c137a-7961-44d9-8afb-6e82d2b9685b","resolution":{"observed_at":"2026-06-30T19:45:01.084251Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18107","snapshot_observed_at":"2026-08-02T13:52:46.919098Z","title":"Bingjie Gao, Qianli Ma, Xiaoxue Wu, Shuai Yang, Guanzhou Lan, Haonan Zhao, Jiaxuan Chen, Qingyang Liu, Yu Qiao, Xinyuan Chen, Yaohui Wang, and Li Niu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.16716","last_updated":"2026-07-19T13:03:10Z","snapshot_observed_at":"2026-08-02T13:52:46.310476Z","submitted_at":"2026-05-16T00:01:18Z","title":"When Cultures Move: Measuring and Improving Multicultural Text-to-Video Generation","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T13:52:46.919098Z"},"links":{"cited_paper":"/paper/2507.18107","citing_paper":"/paper/2605.16716"},"observation_digest":"sha256:aec61bc75da6aa5da2499057b06b45afa3304935f3302ac4971bcf30af3dc4c6","observation_id":"b902979e-6979-4c9a-a65f-2676f69f5e6a","resolution":{"observed_at":"2026-08-02T13:52:46.919098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18107","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2507.18107 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":275,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2507.18107","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:761bbc78fa31b2481f5e2602d40f130426661ef96d171ac99bcd089225cd84a6","observation_id":"7ad27d03-0e21-4575-af15-1942fd954d65","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.18107/citation-record","integrity":"/paper/2507.18107/integrity","json":"/paper/2507.18107/citation-record.json","paper":"/paper/2507.18107"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.00688","last_updated":"2025-02-02T06:19:59Z","snapshot_observed_at":"2026-07-06T20:29:45.369233Z","submitted_at":"2025-02-02T06:19:59Z","title":"High-Order Matching for One-Step Shortcut Diffusion Models","version":1},"cited_work":{"arxiv_id":"2502.00688","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.00688","snapshot_observed_at":"2026-08-06T14:43:31.760566Z","title":"High-Order Matching for One-Step Shortcut Diffusion Models","venue":"cs.CV","work_id":"38edf73a-a87b-4abf-b3b1-e90441b5bd3e","year":2025},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:25.915523Z"},"links":{"cited_paper":"/paper/2502.00688","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:8a00c4292e7f9241dcaf63a2dff77387d61faefb37222422d52be5472f6354a5","observation_id":"92c1b818-85ba-4dc2-b5df-3d432c487fe1","resolution":{"observed_at":"2026-08-06T14:43:31.834179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00500","last_updated":"2025-02-04T15:19:12Z","snapshot_observed_at":"2026-08-03T21:42:04.473194Z","submitted_at":"2025-02-01T17:40:11Z","title":"Video Latent Flow Matching: Optimal Polynomial Projections for Video Interpolation and Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00500","snapshot_observed_at":"2026-08-06T14:43:26.067995Z","title":"Video latent flow matching: Optimal polynomial projections for video interpolation and extrapolation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:26.067995Z"},"links":{"cited_paper":"/paper/2502.00500","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:92b96e0c9a61b382a2255222d6182e3ab56d320adc4977bddbc793303d9dc4ae","observation_id":"9bec5562-9131-44ae-a44c-c4234785d5e4","resolution":{"observed_at":"2026-08-06T14:43:26.067995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.11343","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:43:31.523487Z","title":"Teaching video diffusion model with latent physical phenomenon knowledge","venue":null,"work_id":"52d8291c-85ec-4dc3-a768-65c352d0d4d0","year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:26.202610Z"},"links":{"citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:e318eb513ae6af11323f1304bb6d847c0fbb9c85032ecf5dc0e52d2e7b64a4eb","observation_id":"2529b481-d0d2-492a-aa39-456354a6e29d","resolution":{"observed_at":"2026-08-06T14:43:31.646230Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-06T14:43:26.298363Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:26.298363Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:ec55acbfa3397502818bf2c69bf3974e0975820cd3684554229ae4179e39dcf4","observation_id":"66558e01-953a-4bcc-91e7-70f36cf8d7ba","resolution":{"observed_at":"2026-08-06T14:43:26.298363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-07-06T18:29:58.140132Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-06T14:43:26.566236Z","title":"Tc-bench: Benchmarking temporal compositionality in text-to-video and image-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:26.566236Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:725cf141551a45e2f476a7a0101f17ae20e8b01d4957060f40bdc3311429e983","observation_id":"f2308e59-9a08-42ce-a73a-64f2db7c1330","resolution":{"observed_at":"2026-08-06T14:43:26.566236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04051","last_updated":"2025-04-05T04:13:06Z","snapshot_observed_at":"2026-08-07T16:08:27.784868Z","submitted_at":"2025-04-05T04:13:06Z","title":"Can You Count to Nine? A Human Evaluation Benchmark for Counting Limits in Modern Text-to-Video Models","version":1},"cited_work":{"arxiv_id":"2504.04051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.04051","snapshot_observed_at":"2026-08-06T14:43:30.979940Z","title":"Can You Count to Nine? A Human Evaluation Benchmark for Counting Limits in Modern Text-to-Video Models","venue":"cs.CV","work_id":"2b45b7b3-73a8-4982-b03c-3c27f5556f54","year":2025},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:26.715490Z"},"links":{"cited_paper":"/paper/2504.04051","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:0e496524f78f4edf8752ef301064e689fd15f8cc9409db55de9546440be7e33d","observation_id":"be962982-bf37-4abe-85b8-77a9ad39f63e","resolution":{"observed_at":"2026-08-06T14:43:31.054443Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.16490","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:43:30.739625Z","title":"On computational limits of flowar models: Expressivity and efficiency","venue":null,"work_id":"23ec745d-02e6-4f17-9358-df562783743f","year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:26.809779Z"},"links":{"citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:f2f43147fcf4e07d54bbeb8b5a0c1d56371ea784780ac2aa319276a7262a14f4","observation_id":"298f97a3-a323-45cf-be4c-fc3780e6deff","resolution":{"observed_at":"2026-08-06T14:43:30.870779Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09069","last_updated":"2025-03-12T05:07:07Z","snapshot_observed_at":"2026-08-07T17:11:05.537724Z","submitted_at":"2025-03-12T05:07:07Z","title":"Theoretical Guarantees for High Order Trajectory Refinement in Generative Flows","version":1},"cited_work":{"arxiv_id":"2503.09069","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.09069","snapshot_observed_at":"2026-08-06T14:43:30.447616Z","title":"Theoretical Guarantees for High Order Trajectory Refinement in Generative Flows","venue":"cs.LG","work_id":"95403f55-c0b7-400f-86e6-84b3ef75ef51","year":2025},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:26.916198Z"},"links":{"cited_paper":"/paper/2503.09069","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:cc0e737e347334885f8ca447c090b18a0522e8ccf2d3644f700b880697e1e793","observation_id":"ab0ca69c-8306-4440-befc-9133fde33526","resolution":{"observed_at":"2026-08-06T14:43:30.541324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-06T14:43:27.179259Z","title":"Ltx-video: Realtime video latent diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:27.179259Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:ae10b39ac2a8b24be14c42ab7867027df8abf29fd6943485d552836abffdf1dd","observation_id":"a7e7c662-bed0-4a72-8304-ca3397338ab3","resolution":{"observed_at":"2026-08-06T14:43:27.179259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:43:32.361114Z","title":"Clip- score: A reference-free evaluation metric for image captioning","venue":null,"work_id":"b48c35de-693a-4669-bf8b-47af3b463ac7","year":2021},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:27.268445Z"},"links":{"citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:cf494ba1f88961aa80037cd13a8ddb8c3cf06cd90ff94dda20f099986bdc296a","observation_id":"1fd64acc-23e9-44ef-bcc2-3aa6adb17767","resolution":{"observed_at":"2026-08-06T14:43:32.455034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13503","last_updated":"2024-11-20T17:54:41Z","snapshot_observed_at":"2026-07-06T19:53:17.024873Z","submitted_at":"2024-11-20T17:54:41Z","title":"VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13503","snapshot_observed_at":"2026-08-06T14:43:27.444843Z","title":"Vbench++: Com- prehensive and versatile benchmark suite for video generative models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:27.444843Z"},"links":{"cited_paper":"/paper/2411.13503","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:377ec1e6026e70827edb3c355d910b075aa7183b3e83c40f439879633c7d5592","observation_id":"50e821e1-e885-4f81-8044-39e13fd45158","resolution":{"observed_at":"2026-08-06T14:43:27.444843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04377","last_updated":"2025-02-02T23:48:36Z","snapshot_observed_at":"2026-07-06T20:18:07.618215Z","submitted_at":"2025-01-08T09:34:15Z","title":"On Computational Limits and Provably Efficient Criteria of Visual Autoregressive Models: A Fine-Grained Complexity Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04377","snapshot_observed_at":"2026-08-06T14:43:27.628258Z","title":"On computational limits and provably efficient criteria of visual autoregressive models: A fine-grained complexity analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:27.628258Z"},"links":{"cited_paper":"/paper/2501.04377","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:755c0612aea95937a5b6e7fd4f9d15a2a19c2930e01cb495bfefdda4277910d1","observation_id":"b4c53871-a608-4c6e-a2b8-531d646177a5","resolution":{"observed_at":"2026-08-06T14:43:27.628258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:43:32.164109Z","title":"Notice of removal: Videofusion: Decom- posed diffusion models for high-quality video generation","venue":null,"work_id":"38732c5a-f317-414d-b4e7-65ef1f8c3a64","year":2023},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:27.792912Z"},"links":{"citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:451c3a0fc82945f160d129d4a3a0654a3b65e4aca658b0afdaf811d210e519f3","observation_id":"b4d811d3-a2f3-492b-8c58-04ec05dd3b1b","resolution":{"observed_at":"2026-08-06T14:43:32.220942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08032","last_updated":"2025-03-11T04:29:22Z","snapshot_observed_at":"2026-08-07T17:14:25.164380Z","submitted_at":"2025-03-11T04:29:22Z","title":"HOFAR: High-Order Augmentation of Flow Autoregressive Transformers","version":1},"cited_work":{"arxiv_id":"2503.08032","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.08032","snapshot_observed_at":"2026-08-06T14:43:30.156366Z","title":"HOFAR: High-Order Augmentation of Flow Autoregressive Transformers","venue":"cs.CV","work_id":"7de09537-a5de-4512-a76d-5c9b43a24d6f","year":2025},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:27.886027Z"},"links":{"cited_paper":"/paper/2503.08032","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:3b783e2461dbacf56a3b02792a855510f11e3246816fd5953fe716b1158e3238","observation_id":"76a748e0-7dfa-426f-8b3b-cc4d3a86b326","resolution":{"observed_at":"2026-08-06T14:43:30.267032Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14076","last_updated":"2025-03-18T09:53:48Z","snapshot_observed_at":"2026-08-07T16:55:25.217661Z","submitted_at":"2025-03-18T09:53:48Z","title":"Theoretical Foundation of Flow-Based Time Series Generation: Provable Approximation, Generalization, and Efficiency","version":1},"cited_work":{"arxiv_id":"2503.14076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.14076","snapshot_observed_at":"2026-08-06T14:43:29.963009Z","title":"Theoretical Foundation of Flow-Based Time Series Generation: Provable Approximation, Generalization, and Efficiency","venue":"cs.LG","work_id":"962591e8-bcc0-46ff-961f-15f09cf5c51b","year":2025},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:27.999806Z"},"links":{"cited_paper":"/paper/2503.14076","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:b43f14df6fe627b34790677c736970f55a423f854a9bd55e40a21ec5966c39b3","observation_id":"27533d8d-7326-422c-b2a2-489628cfbf32","resolution":{"observed_at":"2026-08-06T14:43:30.055100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-07-06T19:29:14.335016Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05363","snapshot_observed_at":"2026-08-06T14:43:28.111649Z","title":"Towards world simulator: Craft- ing physical commonsense-based benchmark for video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:28.111649Z"},"links":{"cited_paper":"/paper/2410.05363","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:1bc1b8850919714fb61eea8fd6c4c201634e2398bbcd7f037609990d685dde82","observation_id":"18bb0530-6737-4913-a8b3-e6fdfda92216","resolution":{"observed_at":"2026-08-06T14:43:28.111649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11802","last_updated":"2024-09-21T06:53:58Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:49:01Z","title":"PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11802","snapshot_observed_at":"2026-08-06T14:43:28.205279Z","title":"Phybench: A phys- ical commonsense benchmark for evaluating text-to-image models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:28.205279Z"},"links":{"cited_paper":"/paper/2406.11802","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:5196582ea4318c7d4f3d71a6df87c592cb1f6267000c9d8455df821b1b52fa4e","observation_id":"5453c6f9-a506-460b-9980-5845d7faea3d","resolution":{"observed_at":"2026-08-06T14:43:28.205279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-08-06T14:43:28.300529Z","title":"Wise: A world knowledge-informed semantic evaluation for text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:28.300529Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:78f8f92fc6a41c423bd0c105f959231202d8f9da8e19f94db6ef0cc1e56d12cf","observation_id":"b47293cc-c440-4ca9-9be2-f32f7ce3527c","resolution":{"observed_at":"2026-08-06T14:43:28.300529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10076","last_updated":"2025-02-09T05:57:42Z","snapshot_observed_at":"2026-08-05T03:06:51.748183Z","submitted_at":"2024-10-14T01:39:56Z","title":"VideoAgent: Self-Improving Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10076","snapshot_observed_at":"2026-08-06T14:43:28.431568Z","title":"Videoagent: Self-improving video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:28.431568Z"},"links":{"cited_paper":"/paper/2410.10076","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:cd42ecfc563a29d83232fe8245404dc8b5709a48f43465eeba92f0caab3bcc2a","observation_id":"bb9a2f4f-e8cd-4ca9-949d-7106bdbfec88","resolution":{"observed_at":"2026-08-06T14:43:28.431568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-07-06T20:35:30.739339Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08639","snapshot_observed_at":"2026-08-06T14:43:28.546293Z","title":"Cinemaster: A 3d-aware and controllable framework for cinematic text-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:28.546293Z"},"links":{"cited_paper":"/paper/2502.08639","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:09ee41db036ca395679ea3c7daddfe575d06fea592bbceeec5cb0d885ce8e261","observation_id":"cb7e9486-d713-4478-a10c-2d229f39f468","resolution":{"observed_at":"2026-08-06T14:43:28.546293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01689","last_updated":"2025-06-02T13:52:21Z","snapshot_observed_at":"2026-08-07T11:33:24.365181Z","submitted_at":"2025-06-02T13:52:21Z","title":"Respond Beyond Language: A Benchmark for Video Generation in Response to Realistic User Intents","version":1},"cited_work":{"arxiv_id":"2506.01689","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01689","snapshot_observed_at":"2026-08-06T14:43:29.626729Z","title":"Respond Beyond Language: A Benchmark for Video Generation in Response to Realistic User Intents","venue":"cs.AI","work_id":"06e99de3-85a3-4fed-b6f2-0a0d3a31584e","year":2025},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:28.645576Z"},"links":{"cited_paper":"/paper/2506.01689","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:cadeb2936f841d938c9f26ff534a986c6b87e96bdd3787055075bd2437d37b1c","observation_id":"4130ca2c-7267-4061-9698-8a788c1bc156","resolution":{"observed_at":"2026-08-06T14:43:29.751683Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T14:43:28.752436Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:28.752436Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:e108305fb01e08410fd558f7bdc1325d8a0b93a321da8e977024413f98879dcd","observation_id":"7682beda-3ac6-47a1-b1d2-f7ceac977725","resolution":{"observed_at":"2026-08-06T14:43:28.752436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08089","snapshot_observed_at":"2026-08-06T14:43:28.850378Z","title":"Dragnuwa: Fine-grained control in video generation by integrating text, image, and trajectory","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:28.850378Z"},"links":{"cited_paper":"/paper/2308.08089","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:ddbe0183430401fa0842c48ccf33b9c6e06919822b1906f1569346705cc9fe15","observation_id":"dac80bea-a751-49ef-b9b7-622125bdc448","resolution":{"observed_at":"2026-08-06T14:43:28.850378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17139","last_updated":"2024-02-27T02:05:29Z","snapshot_observed_at":"2026-08-04T02:50:42.922408Z","submitted_at":"2024-02-27T02:05:29Z","title":"Video as the New Language for Real-World Decision Making","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17139","snapshot_observed_at":"2026-08-06T14:43:28.927615Z","title":"Video as the new language for real-world decision making","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:28.927615Z"},"links":{"cited_paper":"/paper/2402.17139","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:3ff52f47c81f96d1a0b197ae0c45368ea57b1b4c06e9b4ff77c6802b70166c01","observation_id":"9d3b7601-69a2-4004-9bce-c21bbd9453f9","resolution":{"observed_at":"2026-08-06T14:43:28.927615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17258","last_updated":"2025-02-24T15:39:14Z","snapshot_observed_at":"2026-08-07T17:52:56.955667Z","submitted_at":"2025-02-24T15:39:14Z","title":"VideoGrain: Modulating Space-Time Attention for Multi-grained Video Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17258","snapshot_observed_at":"2026-08-06T14:43:29.013225Z","title":"Videograin: Modulating space-time attention for multi-grained video editing.arXiv preprint arXiv:2502.17258,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:29.013225Z"},"links":{"cited_paper":"/paper/2502.17258","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:9d850507050ade4d1755f33f2b94b2ffc16f7a1493d1c8da08b2a94cd5bae574","observation_id":"027ee29f-06ac-4f6e-bd18-d0d7008e79e9","resolution":{"observed_at":"2026-08-06T14:43:29.013225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-06T14:43:29.146951Z","title":"Vbench-2.0: Advancing video gen- eration benchmark suite for intrinsic faithfulness","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:29.146951Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:e86b0bc7508473f53ed559e55700058edebc0b94b8e8e0eadf24fadee39cc776","observation_id":"bc6bc7aa-ff22-4fd8-a8e4-53196d715c5a","resolution":{"observed_at":"2026-08-06T14:43:29.146951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01490","last_updated":"2025-05-02T17:59:06Z","snapshot_observed_at":"2026-08-07T15:56:58.971781Z","submitted_at":"2025-05-02T17:59:06Z","title":"WorldGenBench: A World-Knowledge-Integrated Benchmark for Reasoning-Driven Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01490","snapshot_observed_at":"2026-08-06T14:43:29.263437Z","title":"Worldgenbench: A world- knowledge-integrated benchmark for reasoning-driven text-to-image generation.arXiv preprint arXiv:2505.01490,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:29.263437Z"},"links":{"cited_paper":"/paper/2505.01490","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:2b41378830c286ba398a94c441e76a30101062da253ff2d04b9d8de27b024e2d","observation_id":"a8c39ae7-e055-461f-a386-58e2306950d9","resolution":{"observed_at":"2026-08-06T14:43:29.263437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07909","last_updated":"2024-11-08T06:19:33Z","snapshot_observed_at":"2026-08-03T20:36:12.167885Z","submitted_at":"2023-03-14T13:49:54Z","title":"Text-to-image Diffusion Models in Generative AI: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07909","snapshot_observed_at":"2026-08-06T14:43:29.373928Z","title":"Text-to- image diffusion models in generative ai: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:29.373928Z"},"links":{"cited_paper":"/paper/2303.07909","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:cf376c9e59d4c562cafeafd09d7f538ba7aeaea1581b0b6c89f7c7952bb5f1c0","observation_id":"05078804-f07f-451b-8d23-3dc46e03ae6e","resolution":{"observed_at":"2026-08-06T14:43:29.373928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T14:43:27.052258Z","title":"Deepseek-r1: Incentivizing rea- soning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:27.052258Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:4e8cc32be2465a4e720520f5d271f72b2ef35aaffc91e975327e88ba242183bb","observation_id":"f819865a-45e4-4785-91c8-d755bb621ce8","resolution":{"observed_at":"2026-08-06T14:43:27.052258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12538","last_updated":"2024-05-21T07:07:44Z","snapshot_observed_at":"2026-07-06T18:17:08.160308Z","submitted_at":"2024-05-21T07:07:44Z","title":"Bridging the Intent Gap: Knowledge-Enhanced Visual Generation","version":1},"cited_work":{"arxiv_id":"2405.12538","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.12538","snapshot_observed_at":"2026-08-06T14:43:31.200842Z","title":"Bridging the Intent Gap: Knowledge-Enhanced Visual Generation","venue":"cs.CV","work_id":"2ccf89a9-32c3-409c-850b-48de29a5b570","year":2024},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:26.437179Z"},"links":{"cited_paper":"/paper/2405.12538","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:83b2f53a056244063e99302748025d949c770ef6385707eff8159fb8e3a7e01f","observation_id":"892524c3-6cab-4818-bf8f-fb37bb2bda70","resolution":{"observed_at":"2026-08-06T14:43:31.279683Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:43:25.702508Z","title":"Text-to-image diffusion models cannot count, and prompt refinement cannot help","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:25.702508Z"},"links":{"citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:b91279293bdb9e29c602046978198da670195eddf8fcba364c9864287402a2d3","observation_id":"976ff85a-d8b6-4c8a-a4c1-e05f07d77f4e","resolution":{"observed_at":"2026-08-06T14:43:25.702508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09982","last_updated":"2025-02-02T23:53:56Z","snapshot_observed_at":"2026-07-06T20:22:19.281265Z","submitted_at":"2025-01-17T06:46:10Z","title":"RichSpace: Enriching Text-to-Video Prompt Space via Text Embedding Interpolation","version":2},"cited_work":{"arxiv_id":"2501.09982","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09982","snapshot_observed_at":"2026-08-06T14:43:31.919025Z","title":"RichSpace: Enriching Text-to-Video Prompt Space via Text Embedding Interpolation","venue":"cs.CV","work_id":"efbe81ae-6ef5-4623-8ad6-f9d808eb9255","year":2025},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:25.772164Z"},"links":{"cited_paper":"/paper/2501.09982","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:bc34302c1d4101687e03e06c7deeceb511c1b58a579caf9265e80b2c8aa2f5bb","observation_id":"c1d808e7-dfae-4833-bd0e-fd732a312339","resolution":{"observed_at":"2026-08-06T14:43:32.009026Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T14:36:17.487067Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":10,"verified_fuzzy":2},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 4 inbound Pith citation observations for arXiv:2507.18107."}