{"as_of":"2026-08-08T19:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5dc45f996013c97a4b8415c94d0511a0a72b37f627a9cd9780c8ba5c6d0a2343","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T01:59:48.820112Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.03509/citation-record","integrity":"/paper/2607.03509/integrity","json":"/paper/2607.03509/citation-record.json","paper":"/paper/2607.03509"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Lu- miere: A space-time diffusion model for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:854e36385cd2cc323e29bc80f8b5c5bf7fc1c54428e80b0ed0aee195147a70ca","observation_id":"69d8c160-5a09-48ef-8828-6f16a4e1ade0","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:31c6f1a12b1f0e2590eb12a63e4778a6b1822f6c9d8db2a4dd46d231c190b188","observation_id":"174dead5-5553-4d99-80a6-51bcdf90a37d","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Autoregressive video generation without vector quantization.arXiv preprint arXiv:2412.14169,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:a9f884ff744712dc8efc582a4d25733d215c155757156828cf92f8b117943adc","observation_id":"47d66d47-afbf-432e-b25a-c946ecd9fb70","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Ltx-2: Efficient joint audio-visual foundation model.arXiv preprint arXiv:2601.03233,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:d8b45af506b24f984eb7f98e918958f6a60c4fe3b45e05b37688c60dbd9a90b5","observation_id":"e086230e-37d7-4281-9da3-07a255d16e06","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13009","last_updated":"2026-04-07T11:37:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-18T15:28:53Z","title":"Matrix-game 2.0: An open-source real-time and streaming interactive world model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13009","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Matrix-game 2.0: An open-source real-time and streaming interactive world model.arXiv preprint arXiv:2508.13009,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2508.13009","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:cf58bb5b9a04533a289ec8a7f85fd32f8a92e0d6b4cac5c623c142253274e7d8","observation_id":"1e119891-68e1-413e-9fd6-369f3ad42cb5","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"P., Poole, B., Norouzi, M., Fleet, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:5afad85622e953273587b1db1ad2c1df72ecae7cee2e788ded061abaf9e90a09","observation_id":"bbfc8c0a-c8fa-4b3a-8a58-d732a41457f7","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Relic: Interactive video world model with long-horizon memory.arXiv preprint arXiv:2512.04040,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:e5ad9f7134c1856608dc93197cb9811a76980888771d3f54f27f865fa3007df9","observation_id":"8ea93a1b-e05b-478e-b009-493155291a1b","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Self forcing: Bridging the train-test gap in autoregressive video diffusion.arXiv preprint arXiv:2506.08009, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:5da87ed8314b03c3c1e8fe4346ef253fbcab433ff28343cd76e355d0fe9f384e","observation_id":"8a02a0f3-5cec-4a4d-81fa-a082e62b8a36","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Vbench++: Comprehensive and versatile benchmark suite for video generative models.IEEE Transactions on Pattern Analy- sis and Machine Intelligence, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:982dd041fdd3240f34ce2d3b191695c1a95fbdea318238f320d3c9cfd4673c36","observation_id":"e9b49ffe-830e-4fe1-9cc4-e6d8ff074d6d","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Pyramidal flow matching for efficient video generative modeling.arXiv preprint arXiv:2410.05954,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:2c339311be606125bf60eea00aa92e26c71dea2739113ffdb19d166dfe3ecb31","observation_id":"d1aa40a4-af87-4e1a-ac96-ec107a9418f8","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:b86c47c5312d341af8f3ff74b7c65d23018c4ba53f5ba4f72c46d38c98b62ff9","observation_id":"5dfcac67-850e-4af2-ac7e-5a9fc77ab63d","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Diffusion adversarial post-training for one-step video generation.arXiv preprint arXiv:2501.08316,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:21d647638e0ada26c3cfac13a7d5d57f520ec15dc7df62908dc18a38063c2093","observation_id":"25cef500-4352-436c-b31f-6950fb3bb55b","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25161","last_updated":"2025-09-29T17:57:14Z","snapshot_observed_at":"2026-08-08T11:22:22.336902Z","submitted_at":"2025-09-29T17:57:14Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.25161","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Rolling forcing: Autoregressive long video diffusion in real time.arXiv preprint arXiv:2509.25161,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2509.25161","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:12d516eaccceddcead7ab501ccea300370e873cb48bfbddcedf9f6fe88e692e6","observation_id":"f26305c2-3290-4210-9a48-9242a96ccc64","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08320","last_updated":"2023-10-13T01:43:04Z","snapshot_observed_at":"2026-08-05T15:11:09.163965Z","submitted_at":"2023-03-15T02:16:39Z","title":"VideoFusion: Decomposed Diffusion Models for High-Quality Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08320","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Videofusion: Decomposed diffusion models for high-quality video generation.arXiv preprint arXiv:2303.08320,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2303.08320","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:d2452aca70f0dea5738f0e2fd8b57b6f7ab1762a8ba8e0a385098bd7ea5c94ad","observation_id":"a493f91e-91fb-43c9-9c1f-76d66a316974","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Transition matching distillation for fast video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:0366438a2072035d27016046453167842ee8b8ff4d9785b412708c3436ef1588","observation_id":"bdaaf74c-c500-4547-a7f8-4625837baf13","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Make-a- video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:3e2e71e0225cae08ac3fa8116c1565797042020f9e0d732aca68206d201c5e97","observation_id":"58c3ae38-f099-4445-aff1-d67a5a3f014b","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13211","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Magi-1: Au- toregressive video generation at scale.arXiv preprint arXiv:2505.13211,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2505.13211","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:261a65fd69711d4182ba51e85e98f9dd6ca709de1059451e227284e7819760ef","observation_id":"fac11016-3098-4af1-8cd8-3bfba2cbe280","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02399","last_updated":"2022-10-05T17:18:28Z","snapshot_observed_at":"2026-08-04T09:09:48.463217Z","submitted_at":"2022-10-05T17:18:28Z","title":"Phenaki: Variable Length Video Generation From Open Domain Textual Description","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02399","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"T., Castro, S., Kunze, J., and Erhan, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2210.02399","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:726a56b7b5a68a92d6fb66640208e8965407533f33fcfa884a5b6adfe0688d07","observation_id":"0b0cdfac-4c53-40c0-a1e9-a11b4a11543e","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:ef8063da8de28a5463e3113219c3904338fb69a73d8eec2c8acd74d98833cacb","observation_id":"320ce937-6531-48f7-9fa1-52e8880f371c","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Loong: Generating minute-level long videos with autoregressive language models.arXiv preprint arXiv:2410.02757,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:34c41fbd9c972e824f339fb287798340ad66dd4d973fbd84dce1f3e485e96afe","observation_id":"d0ac97ba-c813-4b6a-9385-ec4ecb60ab98","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Hunyuanvideo 1.5 technical report.arXiv preprint arXiv:2511.18870,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:90b1c6a8dc328cf2d22cb79f85cd768a60fa1cf9f3db0348a8b45a1522d2e78d","observation_id":"ab8d08a0-d781-4073-a655-4e8c70149b23","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Videogpt: Video generation using vq-vae and transformers.arXiv preprint arXiv:2104.10157,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:a6fa5b5878ee4c5a57b7ea6b81e164aa7b59ea71474c555b77eed3ea37f8353d","observation_id":"fe6804b5-7c7a-46b3-a7a7-6670abda5110","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22622","last_updated":"2025-10-13T22:41:26Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T17:48:24Z","title":"LongLive: Real-time Interactive Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.22622","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Longlive: Real- time interactive long video generation.arXiv preprint arXiv:2509.22622,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2509.22622","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:bf8076f03dc709ee9bc041d00fe093d7426ff4a0062e638485c321ae8125acd9","observation_id":"134e62b3-3d46-441d-aa59-7bcdb47ac31b","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Cogvideox: Text-to-video diffusion models with an ex- pert transformer.arXiv preprint arXiv:2408.06072,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:31449b43f3bcdc618fbf3d1867682072258b16004a941ec801fab07fbe9368ef","observation_id":"63a0398c-e8c3-4739-b53d-f5a0edd7e90a","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:56c5efdcfa6fcee12ea6b0627efc7fb0b53f685d63e9552b630787776f47e4b3","observation_id":"2e67f528-4e4c-4e6f-9027-b207be67e14f","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Lumos-1: On autoregressive video generation from a unified model perspective.arXiv preprint arXiv:2507.08801,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:de1029da5900331d2abe3a0fa005657ab67c263b89793b22fd44e475634dfee7","observation_id":"f21f283d-ba0d-456b-b927-2ba674849a56","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08431","last_updated":"2026-05-06T15:49:52Z","snapshot_observed_at":"2026-08-06T18:36:14.975364Z","submitted_at":"2025-10-09T16:45:30Z","title":"Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08431","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Large scale diffusion distillation via score-regularized continuous- time consistency.arXiv preprint arXiv:2510.08431,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2510.08431","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:8ed1733471166792acaa22aa5ccc83bf427a43ce9d9742aaee807aa233dbe28e","observation_id":"895bcccd-5781-4627-a0f8-3c6af1209b65","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2607.03509."}