{"as_of":"2026-08-17T21:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:34d7cafbd7d243e37e77316954af46b4c8748ad8420bab74a64bc53276737fea","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":33,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:32:32.292029Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T12:26:56.718648Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-12T16:22:43.974551Z","title":"Consisti2v: Enhancing visual consistency for image- to-video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13503","last_updated":"2024-11-20T17:54:41Z","snapshot_observed_at":"2026-08-12T19:44:40.357419Z","submitted_at":"2024-11-20T17:54:41Z","title":"VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:43.974551Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2411.13503"},"observation_digest":"sha256:3ddf5b294dd652aa49537d0e0b98bf780ffe5db3435b8cdcd2a2e15f67155c4d","observation_id":"24de4270-0359-4f10-9093-23e45bc574ec","resolution":{"observed_at":"2026-08-12T16:22:43.974551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-12T11:11:52.102699Z","title":"Consisti2v: Enhanc- ing visual consistency for image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-16T21:14:14.600627Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.102699Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:a7c38a7bb07593ea773ecc204b6b71597179993dcc2011a5906bd88bba78e397","observation_id":"7a508ef1-e9d1-41a8-8578-68e9141c205f","resolution":{"observed_at":"2026-08-12T11:11:52.102699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-12T04:27:23.889110Z","title":"Consisti2v: Enhanc- ing visual consistency for image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01429","last_updated":"2024-12-02T12:10:00Z","snapshot_observed_at":"2026-08-15T11:14:44.922577Z","submitted_at":"2024-12-02T12:10:00Z","title":"CPA: Camera-pose-awareness Diffusion Transformer for Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:27:23.889110Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2412.01429"},"observation_digest":"sha256:26f3775169ca694e72fbdb06069a7ba56918bcedfcec22fd1b4924be8683e0ec","observation_id":"8a359540-bf12-4bcb-b7d8-9f162e88ed74","resolution":{"observed_at":"2026-08-12T04:27:23.889110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-11T22:12:35.592721Z","title":"Consisti2v: Enhancing visual consistency for image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03756","last_updated":"2024-12-04T22:49:40Z","snapshot_observed_at":"2026-08-17T17:41:52.073638Z","submitted_at":"2024-12-04T22:49:40Z","title":"Multi-view Image Diffusion via Coordinate Noise and Fourier Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:35.592721Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2412.03756"},"observation_digest":"sha256:ec476f79bce5a1deffb9775e89b65f232e506a9605b174765fca2d61ad6fb146","observation_id":"87cd3522-8cfd-4da0-b788-34e2ff75fd81","resolution":{"observed_at":"2026-08-11T22:12:35.592721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-11T20:20:36.804152Z","title":"Consisti2v: Enhancing visual consistency for image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-17T14:37:25.234568Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.804152Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:48b4fda174f2263840305dbf4a0c8e536b84347513f5daad5ea116ac4f217f49","observation_id":"02b0e638-f71c-48c4-94d1-711af8f7b426","resolution":{"observed_at":"2026-08-11T20:20:36.804152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-11T16:58:05.544504Z","title":"Consisti2v: Enhancing visual consistency for image-to-video gen- eration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09600","last_updated":"2024-12-12T18:59:01Z","snapshot_observed_at":"2026-08-17T19:44:42.836082Z","submitted_at":"2024-12-12T18:59:01Z","title":"Owl-1: Omni World Model for Consistent Long Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T16:58:05.544504Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2412.09600"},"observation_digest":"sha256:9284c59ce92c90e0fca10f0d43f2ae23dfcdc1db16c6449cb9aefbed0ee732ba","observation_id":"4be4b610-4317-4e0a-85a7-14bcb55040cd","resolution":{"observed_at":"2026-08-11T16:58:05.544504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-11T10:49:06.615135Z","title":"Consisti2v: Enhanc- ing visual consistency for image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-14T15:17:16.823557Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.615135Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:c3698856941f8cd047eda5199c8b96adb7fa1367577ae8ddffcfa5377549b9eb","observation_id":"1851ffcd-1ad3-4806-8e0e-b75bdf7dc961","resolution":{"observed_at":"2026-08-11T10:49:06.615135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2402.04324","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-07-02T12:26:56.718648Z","title":"ConsistI2V: Enhancing Vi- sual Consistency for Image-to-Video Generation","venue":null,"work_id":"19dbbe7f-675b-4f8d-a42e-59fde7969cf5","year":2024},"citing_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"reference_index":165,"source":"pdf_text","source_observed_at":"2026-05-10T23:38:44.933410Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2501.03575"},"observation_digest":"sha256:d238312c27c789a8591e9b2343a9757b9343b444464309e4f27357f02eed5d9f","observation_id":"a188cb9c-5c6e-4277-9a5c-759daaa34643","resolution":{"observed_at":"2026-05-10T23:38:45.870867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-15T22:32:32.292029Z","title":"Consisti2v: Enhanc- ing visual consistency for image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.292029Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:1ec59fa294a0732a5a0a83d62394b5ddb48ad79b8989bfdb4b2bbef47e74a627","observation_id":"bf9e5834-838b-4c05-9750-bc45d6cea47b","resolution":{"observed_at":"2026-08-15T22:32:32.292029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-15T21:32:18.251877Z","title":"Consisti2v: Enhancing visual consistency for image-to-video generation.arXiv preprint arXiv:2402.04324, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-17T19:44:08.732058Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.251877Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:d1ec7b6a72b858b702c64ae14c8e6814f7683aad0bc4d9c19bdfece5f90bf4df","observation_id":"02dcdb2d-2833-45d9-b127-20242b58f7ac","resolution":{"observed_at":"2026-08-15T21:32:18.251877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-07T14:31:30.407849Z","title":"Consisti2v: Enhanc- ing visual consistency for image-to-video generation.arXiv preprint arXiv:2402.04324, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18650","last_updated":"2025-05-24T11:35:09Z","snapshot_observed_at":"2026-08-15T04:44:37.706143Z","submitted_at":"2025-05-24T11:35:09Z","title":"ProphetDWM: A Driving World Model for Rolling Out Future Actions and Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:30.407849Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2505.18650"},"observation_digest":"sha256:83f1920076854fcc754d474eb1757193186c326ad84e0d6f0c631d866d3696dd","observation_id":"b39b2c4c-8420-4344-bfce-08ecfb75d86d","resolution":{"observed_at":"2026-08-07T14:31:30.407849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-07T11:54:19.929505Z","title":"Consisti2v: Enhancing visual consistency for image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01144","last_updated":"2025-06-04T07:45:25Z","snapshot_observed_at":"2026-08-17T04:56:26.147278Z","submitted_at":"2025-06-01T19:55:33Z","title":"FlowMo: Variance-Based Flow Guidance for Coherent Motion in Video Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:19.929505Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2506.01144"},"observation_digest":"sha256:0ea9daa5d0460ab040db84b8d310f3f029b03105f72ed64193cfa7c108367190","observation_id":"beb7080d-8567-44d0-9290-5c3ebd28c418","resolution":{"observed_at":"2026-08-07T11:54:19.929505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-07T11:16:13.762485Z","title":"arXiv:2402.04324 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03082","last_updated":"2025-06-13T17:00:16Z","snapshot_observed_at":"2026-08-16T18:18:36.105480Z","submitted_at":"2025-06-03T17:02:38Z","title":"SG2VID: Scene Graphs Enable Fine-Grained Control for Video Synthesis","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:13.762485Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2506.03082"},"observation_digest":"sha256:d8039edc1704a061ae26bad2f8ceeab0c2d444c05d056cb26e6693c477cd1e83","observation_id":"9cde2286-4f02-421b-b88b-826c90dba0db","resolution":{"observed_at":"2026-08-07T11:16:13.762485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-07T00:30:28.553504Z","title":"Consisti2v: Enhancing visual consistency for image-to-video generation.arXiv preprint arXiv:2402.04324, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14168","last_updated":"2025-06-18T09:44:09Z","snapshot_observed_at":"2026-08-13T05:38:52.343886Z","submitted_at":"2025-06-17T04:08:18Z","title":"VideoMAR: Autoregressive Video Generatio with Continuous Tokens","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:28.553504Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2506.14168"},"observation_digest":"sha256:e7095564a1b4f810b3c96ab00b179e87102de3cd3adf9617028e4d69d35b170a","observation_id":"360b7f72-7319-4319-a130-7942352bb4c9","resolution":{"observed_at":"2026-08-07T00:30:28.553504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-07T00:15:37.083671Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14769","last_updated":"2025-08-09T11:31:44Z","snapshot_observed_at":"2026-08-17T20:05:10.958878Z","submitted_at":"2025-06-17T17:59:12Z","title":"CDP: Towards Robust Autoregressive Visuomotor Policy Learning via Causal Diffusion","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.083671Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2506.14769"},"observation_digest":"sha256:c452990c4b4761ab6b73a365b5c504f206f7a307e8fcea59317788a9e1871efc","observation_id":"3c888a1d-5501-4228-a630-c25230f0aa78","resolution":{"observed_at":"2026-08-07T00:15:37.083671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2402.04324","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-07-02T12:26:56.718648Z","title":"ConsistI2V: Enhancing Vi- sual Consistency for Image-to-Video Generation","venue":null,"work_id":"19dbbe7f-675b-4f8d-a42e-59fde7969cf5","year":2024},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:dc2a21f20d31bb72e79864f609a6e18963a5260abe552b170ae248da8d610053","observation_id":"14b92abe-cd74-46b7-8abc-c47fd4930527","resolution":{"observed_at":"2026-05-12T18:51:15.560100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-06T21:23:12.735107Z","title":"Weiming Ren, Harry Yang, Ge Zhang, Cong Wei, Xinrun Du, Stephen Huang, and Wenhu Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-14T23:20:29.901643Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.735107Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:ef7354af5786f24664394f661b3f2165b13c5dedde4320815a9cde2e4277e981","observation_id":"a2aed091-cead-4adc-91d6-3e620802ca67","resolution":{"observed_at":"2026-08-06T21:23:12.735107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-06T20:44:02.396979Z","title":"Consisti2v: Enhanc- ing visual consistency for image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-16T21:52:33.168650Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.396979Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:f134fe88cb9c648098f07aab3cb09cb9d18a2731b2ad32cfc363b98aa3981052","observation_id":"0e9d9cd6-f653-43ae-84d8-114b51743f50","resolution":{"observed_at":"2026-08-06T20:44:02.396979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-06T19:25:28.396056Z","title":"Consisti2v: En- hancing visual consistency for image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05678","last_updated":"2025-07-08T05:00:17Z","snapshot_observed_at":"2026-08-06T19:17:57.988428Z","submitted_at":"2025-07-08T05:00:17Z","title":"LiON-LoRA: Rethinking LoRA Fusion to Unify Controllable Spatial and Temporal Generation for Video Diffusion","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:28.396056Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2507.05678"},"observation_digest":"sha256:e4be382677b8d7f4e3fcef66dd91d8d217c15aeacf96dfe1d3206c9f92126a15","observation_id":"bcba4b91-6999-41c5-9b81-fac20d222ce1","resolution":{"observed_at":"2026-08-06T19:25:28.396056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-15T17:51:14.976026Z","title":"Consisti2v: Enhanc- ing visual consistency for image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20331","last_updated":"2025-07-29T03:14:12Z","snapshot_observed_at":"2026-08-16T22:44:54.703473Z","submitted_at":"2025-07-27T15:49:07Z","title":"From Gallery to Wrist: Realistic 3D Bracelet Insertion in Videos","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:14.976026Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2507.20331"},"observation_digest":"sha256:151555cad00318dd96078bd92b8ae1fbb54e4b1d1e5af3e300ce5e1bbd6148f5","observation_id":"527440f2-b55d-49b9-a06e-062d0a92ab46","resolution":{"observed_at":"2026-08-15T17:51:14.976026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-05T17:19:17.468308Z","title":"Consisti2v: Enhancing visual consistency for image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16512","last_updated":"2025-08-22T16:35:19Z","snapshot_observed_at":"2026-08-15T21:47:45.565508Z","submitted_at":"2025-08-22T16:35:19Z","title":"Seeing Clearly, Forgetting Deeply: Revisiting Fine-Tuned Video Generators for Driving Simulation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T17:19:17.468308Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2508.16512"},"observation_digest":"sha256:37b5c6b5e829874de9c015acfc7bb5112342dbee6f110d04e4a8d371c89bb307","observation_id":"3ab387ad-e0ec-4bce-abd9-936490fcf032","resolution":{"observed_at":"2026-08-05T17:19:17.468308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2402.04324","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-07-02T12:26:56.718648Z","title":"ConsistI2V: Enhancing Vi- sual Consistency for Image-to-Video Generation","venue":null,"work_id":"19dbbe7f-675b-4f8d-a42e-59fde7969cf5","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-08-16T09:10:11.531906Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:f7b85da1cc81f7cafaa75f2dd698ff5ed878d42d841de99c27d0f7882c885aa4","observation_id":"63b3ad56-8949-4c4a-b915-0d2cd404cc00","resolution":{"observed_at":"2026-05-11T23:31:14.829831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2402.04324","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-07-02T12:26:56.718648Z","title":"ConsistI2V: Enhancing Vi- sual Consistency for Image-to-Video Generation","venue":null,"work_id":"19dbbe7f-675b-4f8d-a42e-59fde7969cf5","year":2024},"citing_paper":{"arxiv_id":"2605.11723","last_updated":"2026-05-28T12:50:43Z","snapshot_observed_at":"2026-08-15T04:15:38.380944Z","submitted_at":"2026-05-12T08:08:33Z","title":"CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T06:00:31.582714Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2605.11723"},"observation_digest":"sha256:35cc44f443bc7b845542a9de28be287054973822a7310b7ca96e3560985d24a9","observation_id":"9ee1e9fb-dc18-450f-ab76-549068143888","resolution":{"observed_at":"2026-05-13T06:02:22.032854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2402.04324","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-07-02T12:26:56.718648Z","title":"ConsistI2V: Enhancing Vi- sual Consistency for Image-to-Video Generation","venue":null,"work_id":"19dbbe7f-675b-4f8d-a42e-59fde7969cf5","year":2024},"citing_paper":{"arxiv_id":"2605.11723","last_updated":"2026-05-28T12:50:43Z","snapshot_observed_at":"2026-08-15T04:15:38.380944Z","submitted_at":"2026-05-12T08:08:33Z","title":"CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T22:38:43.102769Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2605.11723"},"observation_digest":"sha256:3e01846e5c5c1633a6c2a1fb9d104a39629f14a1fdc4b3d673a2d687ef198804","observation_id":"68b3728e-38d4-4453-8bc6-92642cdd91ef","resolution":{"observed_at":"2026-07-01T13:55:45.248057Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2402.04324","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-07-02T12:26:56.718648Z","title":"ConsistI2V: Enhancing Vi- sual Consistency for Image-to-Video Generation","venue":null,"work_id":"19dbbe7f-675b-4f8d-a42e-59fde7969cf5","year":2024},"citing_paper":{"arxiv_id":"2605.14843","last_updated":"2026-05-14T13:48:17Z","snapshot_observed_at":"2026-08-15T09:26:47.809996Z","submitted_at":"2026-05-14T13:48:17Z","title":"MechVerse: Evaluating Physical Motion Consistency in Video Generation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T21:37:15.414734Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2605.14843"},"observation_digest":"sha256:2609b7f3411e5c163c3872fba792c7ff4845ff5fb38f88c7a89b39c8a6d9bf33","observation_id":"2c1768b2-3bb8-4674-a92d-a06b1c5d4d5e","resolution":{"observed_at":"2026-07-01T14:25:46.362561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2402.04324","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-07-02T12:26:56.718648Z","title":"ConsistI2V: Enhancing Vi- sual Consistency for Image-to-Video Generation","venue":null,"work_id":"19dbbe7f-675b-4f8d-a42e-59fde7969cf5","year":2024},"citing_paper":{"arxiv_id":"2605.14988","last_updated":"2026-05-14T15:50:25Z","snapshot_observed_at":"2026-08-17T11:52:57.884743Z","submitted_at":"2026-05-14T15:50:25Z","title":"Compositional Video Generation via Inference-Time Guidance","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T21:33:27.227307Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2605.14988"},"observation_digest":"sha256:94dd9f32acaab04dfd9fa8cbfadc36076aa74e11515d96ee582182fe7a01ee58","observation_id":"ff47a64d-837b-4fdd-b8c7-37da5e8f36a6","resolution":{"observed_at":"2026-06-30T21:35:04.327033Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2402.04324","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-07-02T12:26:56.718648Z","title":"ConsistI2V: Enhancing Vi- sual Consistency for Image-to-Video Generation","venue":null,"work_id":"19dbbe7f-675b-4f8d-a42e-59fde7969cf5","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-16T00:14:17.051626Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:263557e7ba6ec25307c9da5a50209f43a71d110e83dbc253956e5f31ff484a74","observation_id":"b925b51b-5b2a-43ff-90fa-978e17d156c0","resolution":{"observed_at":"2026-05-20T15:08:24.892899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2402.04324","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-07-02T12:26:56.718648Z","title":"ConsistI2V: Enhancing Vi- sual Consistency for Image-to-Video Generation","venue":null,"work_id":"19dbbe7f-675b-4f8d-a42e-59fde7969cf5","year":2024},"citing_paper":{"arxiv_id":"2605.23245","last_updated":"2026-05-22T05:28:56Z","snapshot_observed_at":"2026-07-06T23:33:29.550551Z","submitted_at":"2026-05-22T05:28:56Z","title":"SimInsert: Seamless Video Object Insertion via Regional Sparse Attention Fusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-25T04:46:50.749223Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2605.23245"},"observation_digest":"sha256:8bd4f073985d9b2aa5b3806cd3dc5d9d4cce855adab1799400cf5910300bdcf0","observation_id":"cd36089a-67c3-4de9-abb7-aa3b6b5e13c2","resolution":{"observed_at":"2026-05-25T04:50:21.406931Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2402.04324","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-07-02T12:26:56.718648Z","title":"ConsistI2V: Enhancing Vi- sual Consistency for Image-to-Video Generation","venue":null,"work_id":"19dbbe7f-675b-4f8d-a42e-59fde7969cf5","year":2024},"citing_paper":{"arxiv_id":"2605.24674","last_updated":"2026-05-23T17:22:14Z","snapshot_observed_at":"2026-08-16T20:40:06.154055Z","submitted_at":"2026-05-23T17:22:14Z","title":"Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T13:37:09.892339Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2605.24674"},"observation_digest":"sha256:e822a653c1e9cc8fe0d9f851289b69b561d3bfc379bd1e05719bb83c5cf23cdf","observation_id":"32cd5295-0a3c-4be0-a2d9-63af6d288c91","resolution":{"observed_at":"2026-06-30T13:44:41.188918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2402.04324","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-07-02T12:26:56.718648Z","title":"ConsistI2V: Enhancing Vi- sual Consistency for Image-to-Video Generation","venue":null,"work_id":"19dbbe7f-675b-4f8d-a42e-59fde7969cf5","year":2024},"citing_paper":{"arxiv_id":"2606.01481","last_updated":"2026-05-31T22:46:35Z","snapshot_observed_at":"2026-08-13T00:51:45.121124Z","submitted_at":"2026-05-31T22:46:35Z","title":"SafeGen-Bench: Benchmarking Safety in Image-Conditioned Text-to-Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T17:05:57.685728Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2606.01481"},"observation_digest":"sha256:7a76c3aee719e763029ae7a9c5f3b074f197b875cd7d2ae289f1d9237f57cfa1","observation_id":"85982292-68a1-4b05-b1ca-3d575db7cb16","resolution":{"observed_at":"2026-06-28T17:12:25.181985Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2402.04324","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-07-02T12:26:56.718648Z","title":"ConsistI2V: Enhancing Vi- sual Consistency for Image-to-Video Generation","venue":null,"work_id":"19dbbe7f-675b-4f8d-a42e-59fde7969cf5","year":2024},"citing_paper":{"arxiv_id":"2606.01556","last_updated":"2026-06-01T02:02:12Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T02:02:12Z","title":"TwinQuant: Learnable Subspace Decomposition for 4-Bit LLM Quantization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T13:07:53.001390Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2606.01556"},"observation_digest":"sha256:23925fceb438b19a03afe8700fa8c73ee12231c88e332a5969f1af690a65fc1a","observation_id":"cada755a-d091-41f4-8a7e-404393c97d0f","resolution":{"observed_at":"2026-07-02T00:56:24.868349Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2402.04324","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-07-02T12:26:56.718648Z","title":"ConsistI2V: Enhancing Vi- sual Consistency for Image-to-Video Generation","venue":null,"work_id":"19dbbe7f-675b-4f8d-a42e-59fde7969cf5","year":2024},"citing_paper":{"arxiv_id":"2606.06309","last_updated":"2026-06-04T15:49:37Z","snapshot_observed_at":"2026-08-12T12:55:14.826506Z","submitted_at":"2026-06-04T15:49:37Z","title":"RhymeFlow: Training-Free Acceleration for Video Generation with Asynchronous Denoising Flow Scheduling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T02:08:44.257127Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2606.06309"},"observation_digest":"sha256:6f067c4a8ab9dd95bcd3a4c32d84aa1b0dd3dd8288fb4f0643c239db3ad9ba78","observation_id":"45078ee4-9602-48f0-bfed-aac38e150c70","resolution":{"observed_at":"2026-07-02T12:26:56.721337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-01T04:06:00.204348Z","title":"Con- sisti2v: Enhancing visual consistency for image-to- video generation.arXiv preprint arXiv:2402.04324, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22959","last_updated":"2026-07-25T00:02:37Z","snapshot_observed_at":"2026-08-16T22:12:32.337835Z","submitted_at":"2026-07-25T00:02:37Z","title":"HALLELUAI: A Hallucination-Aware AI System for Ultra-Realistic Image-to-Video Generation at Scale","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T04:06:00.204348Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2607.22959"},"observation_digest":"sha256:5a0171139e63bb8945779df6cbf5b28cf00c0b1864b7d9698f7782c1434284ad","observation_id":"c944ca27-df1d-4d84-9848-c20740d323ee","resolution":{"observed_at":"2026-08-01T04:06:00.204348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.04324/citation-record","integrity":"/paper/2402.04324/integrity","json":"/paper/2402.04324/citation-record.json","paper":"/paper/2402.04324"},"outbound":[],"paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 33 inbound Pith citation observations for arXiv:2402.04324."}