{"as_of":"2026-08-07T15:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7ca176ed954e93030fcc05c47cd56433f40b6a26f3adf08e50d50395fedf901b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:39:37.046057Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:39:50.643820Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-07-06T19:29:14.335016Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-18T14:39:59.870039Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2410.05363"},"observation_digest":"sha256:1dded90ce8ff940ce24ca352f49548d96d116e03663be5514edd036ad6208678","observation_id":"4314d572-971a-4298-8ccd-03925a8e9be6","resolution":{"observed_at":"2026-05-18T14:40:00.025640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2411.15115","last_updated":"2026-04-20T17:59:36Z","snapshot_observed_at":"2026-08-02T10:06:23.710148Z","submitted_at":"2024-11-22T18:31:47Z","title":"Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-23T08:25:01.468957Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2411.15115"},"observation_digest":"sha256:532b3025fe8493d7848811264e339423c1070533bbc38da5d591b09ae1b18f7a","observation_id":"991a8122-6b02-489c-83ee-e497003b3735","resolution":{"observed_at":"2026-05-23T08:25:29.416102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:5ce5139d156197079fe4f72d09e6f1904868fdc2bf44a0c3c1854af5e70fb3ba","observation_id":"c3e7287d-1a9d-48af-9ee4-ebd163dfbe9e","resolution":{"observed_at":"2026-05-14T18:42:03.138921Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2504.17180","last_updated":"2026-04-03T02:52:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-24T01:34:12Z","title":"We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback","version":4},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-22T18:56:39.735334Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2504.17180"},"observation_digest":"sha256:ee5f23d1eafaf703c49325bd67a0058b53f4c18f8ea5170eab12445fe0e708f4","observation_id":"dbaf1bcc-bd34-48b7-88c3-6562d37530b3","resolution":{"observed_at":"2026-05-22T18:56:58.291372Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-07T14:39:37.046057Z","title":"T2v-compbench: A comprehensive benchmark for compositional text-to-video generation.arXiv preprint arXiv:2407.14505, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T14:33:30.486704Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:37.046057Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:69cd4c12184ab56de206bfee48c9e40a8b74b06ff3e2f03c379c2e31c255b9cd","observation_id":"295ef70f-8597-41db-824d-ae06ac631d1a","resolution":{"observed_at":"2026-08-07T14:39:37.046057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-06T16:30:52.375066Z","title":"T2v-compbench: A comprehensive benchmark for compositional text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13428","last_updated":"2026-05-26T08:34:24Z","snapshot_observed_at":"2026-08-06T16:22:35.916708Z","submitted_at":"2025-07-17T17:54:09Z","title":"\"PhyWorldBench\": A Comprehensive Evaluation of Physical Realism in Text-to-Video Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:52.375066Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2507.13428"},"observation_digest":"sha256:3c2f7104f81009cd72ec560cb0a5c00bf31a971721a6f72ac5c837699b5e33b4","observation_id":"e9c22929-79e6-4272-95b3-dc5859d79c97","resolution":{"observed_at":"2026-08-06T16:30:52.375066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T21:28:41.904725Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2508.05635"},"observation_digest":"sha256:74af05f21997ffa4dbf7a3eaa5b0db2c2408ca81b586201b1ea83e100c235554","observation_id":"2c7118b9-ed99-4b24-a5e8-b6ac002c0669","resolution":{"observed_at":"2026-05-15T21:28:42.060128Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-05T23:17:31.309031Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05636","last_updated":"2025-08-07T17:59:59Z","snapshot_observed_at":"2026-08-07T05:04:18.585365Z","submitted_at":"2025-08-07T17:59:59Z","title":"FaceAnonyMixer: Cancelable Faces via Identity Consistent Latent Space Mixing","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:31.309031Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2508.05636"},"observation_digest":"sha256:d185735044ec02d7c093a37c0076719cc98f8f4a92a8a728aec5ef23c6897191","observation_id":"48546cb2-cd8b-442f-891b-28f49d5ca583","resolution":{"observed_at":"2026-08-05T23:17:31.309031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2510.20206","last_updated":"2026-05-14T08:53:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-23T04:45:09Z","title":"RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-18T05:13:42.934115Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2510.20206"},"observation_digest":"sha256:e7955fdbe2a8033db20366455d960b1382fac0fa7f84211bc1761f9b9fe8af86","observation_id":"d487a349-1bf0-491c-aebc-9b6f35056bb6","resolution":{"observed_at":"2026-05-18T05:15:54.355622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-02T14:24:57.691309Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.10579","last_updated":"2026-07-30T05:06:10Z","snapshot_observed_at":"2026-08-02T23:16:55.313881Z","submitted_at":"2026-05-11T13:50:47Z","title":"VISTA: A Controllable Platform for Generating and Auditing Egocentric Assistance Scenarios","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T14:24:57.691309Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2605.10579"},"observation_digest":"sha256:731f9cd71e8336553012bffb8cc31c44d4ae5e09c9675216ea4d65044ddc8f53","observation_id":"da9d1af9-c0c1-4893-98ca-f018a65e10ee","resolution":{"observed_at":"2026-08-02T14:24:57.691309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2605.14269","last_updated":"2026-05-14T02:12:13Z","snapshot_observed_at":"2026-08-02T12:45:57.975749Z","submitted_at":"2026-05-14T02:12:13Z","title":"PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T02:49:21.291716Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2605.14269"},"observation_digest":"sha256:d7863219a474041d9465f3df3360e7724d943f5918474fac002e5c226da45d9d","observation_id":"cac5b9e1-84df-4e74-adba-e8b1e2f91ecc","resolution":{"observed_at":"2026-05-15T02:49:41.450400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2605.15185","last_updated":"2026-05-14T17:59:04Z","snapshot_observed_at":"2026-08-03T12:57:56.209990Z","submitted_at":"2026-05-14T17:59:04Z","title":"Quantitative Video World Model Evaluation for Geometric-Consistency","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T03:11:03.060052Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2605.15185"},"observation_digest":"sha256:219ff42092cd6977536263182a18ff1bb4d731407ef4281ee539078034628d5c","observation_id":"1893dce7-7ebd-43a9-ba47-f36ad7896b2b","resolution":{"observed_at":"2026-05-15T03:14:53.044179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2605.29360","last_updated":"2026-05-28T04:58:15Z","snapshot_observed_at":"2026-08-06T11:23:36.274726Z","submitted_at":"2026-05-28T04:58:15Z","title":"MiraBench: Evaluating Action-Conditioned Reliability in Robotic World Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T07:46:28.469913Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2605.29360"},"observation_digest":"sha256:063c9737c3be3f9acc7f7ef4dade2b9652671d0c719f64f8f2b8eee2a9df4375","observation_id":"0248baeb-cf3c-4be0-96fe-2dc3abe2c403","resolution":{"observed_at":"2026-06-29T07:53:13.902525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2606.01481","last_updated":"2026-05-31T22:46:35Z","snapshot_observed_at":"2026-08-06T16:16:18.407347Z","submitted_at":"2026-05-31T22:46:35Z","title":"SafeGen-Bench: Benchmarking Safety in Image-Conditioned Text-to-Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T17:05:57.685728Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2606.01481"},"observation_digest":"sha256:0fc5ef88288c9d8b52094fd5d2089bf7c3e9cffd1648b42076f7d9e59049f4a3","observation_id":"d57fe3b7-a99a-4b5a-86bb-b7540b419bf8","resolution":{"observed_at":"2026-06-28T17:12:25.192683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2606.26769","last_updated":"2026-06-25T08:54:17Z","snapshot_observed_at":"2026-08-04T06:31:49.540535Z","submitted_at":"2026-06-25T08:54:17Z","title":"ResilPhase: Plug-and-Play Phase Mapping and Noise-Resilient Macro-Trajectory Extrapolation for Diffusion Acceleration","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-26T05:03:22.182138Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2606.26769"},"observation_digest":"sha256:882f8f36e14d9a3318ec15bafea12f9623d8eed3f65d0bdcf81436272cc2a5ff","observation_id":"1ae5a96b-ff39-49e1-9527-3163a8c5ce69","resolution":{"observed_at":"2026-07-04T13:39:50.645701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2606.31026","last_updated":"2026-06-30T01:46:54Z","snapshot_observed_at":"2026-08-03T00:20:08.577196Z","submitted_at":"2026-06-30T01:46:54Z","title":"OTCache: Optimal Transport for Geometry-Aware Caching in Diffusion Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-01T06:21:22.905093Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2606.31026"},"observation_digest":"sha256:71b06876a203f6f353ca7bc3a543c6898741a65f1769dc7ddbafd8ae37b2bcde","observation_id":"5c6e1ef0-5f68-456e-91c7-3e8ea85a550a","resolution":{"observed_at":"2026-07-01T09:45:39.517240Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-14T03:51:24.547781Z","title":"arXiv preprint arXiv:2407.14505 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11689","last_updated":"2026-07-13T15:22:56Z","snapshot_observed_at":"2026-08-02T18:20:32.168835Z","submitted_at":"2026-07-13T15:22:56Z","title":"From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence","version":1},"reference_index":172,"source":"arxiv_source","source_observed_at":"2026-07-14T03:51:24.547781Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2607.11689"},"observation_digest":"sha256:b3071169063da7634bac7c629482759d0242fa67f09da7c1789e5c9db56d37fa","observation_id":"bde72b70-1241-49ce-9aa6-f821b323897d","resolution":{"observed_at":"2026-07-14T03:51:24.547781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-02T02:56:21.282757Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14202","last_updated":"2026-07-15T17:46:12Z","snapshot_observed_at":"2026-08-07T15:13:00.036289Z","submitted_at":"2026-07-15T17:46:12Z","title":"KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T02:56:21.282757Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2607.14202"},"observation_digest":"sha256:5c8d7b602ecf3614f0b04d57a8a9d55334c4577c1154435d6c2887e5487ae6e3","observation_id":"afc33395-3294-46e4-92b3-c5ad9d5b2ddc","resolution":{"observed_at":"2026-08-02T02:56:21.282757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-01T20:07:42.500888Z","title":"T2v- compbench: A comprehensive benchmark for compositional text-to- video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-06T11:00:29.424014Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:42.500888Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:35b4995fa367d3bf024753bf0c3f57fc8d862977717d7f5af94b8aea0023f837","observation_id":"2a76ccff-3e84-469b-ac40-77cb35f8d457","resolution":{"observed_at":"2026-08-01T20:07:42.500888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.14505/citation-record","integrity":"/paper/2407.14505/integrity","json":"/paper/2407.14505/citation-record.json","paper":"/paper/2407.14505"},"outbound":[],"paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:49:10.964379Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2407.14505."}