{"as_of":"2026-08-12T04:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8a8d5ea4557eaf1c493270ad292ec9137a805b52e8cf35dc9484c46553722764","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:56:31.626723Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:52:49.585526Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T04:52:50.130247Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.03118","snapshot_observed_at":"2026-07-30T23:47:57.729629Z","title":"Vidu s1: A real-time interactive video generation model,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-07T09:33:33.406786Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.729629Z"},"links":{"cited_paper":"/paper/2607.03118","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:51d070f7c3e5331197afe07bd2018aeba4d10c1cc2a274199cfddd88c6d672fe","observation_id":"07857c41-bc51-4ef3-80d4-f446320f17d1","resolution":{"observed_at":"2026-07-30T23:47:57.729629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"cited_work":{"arxiv_id":"2607.03118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.03118","snapshot_observed_at":"2026-08-05T04:52:50.130247Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","venue":"cs.CV","work_id":"e2fbb4bc-6939-4266-847d-fc26bd69671b","year":2026},"citing_paper":{"arxiv_id":"2608.03974","last_updated":"2026-08-04T17:40:48Z","snapshot_observed_at":"2026-08-07T23:12:45.946866Z","submitted_at":"2026-08-04T17:40:48Z","title":"JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T04:52:49.585526Z"},"links":{"cited_paper":"/paper/2607.03118","citing_paper":"/paper/2608.03974"},"observation_digest":"sha256:47570c3138751688fe8e57652f08c3d3a57a95f5741ad6f6d5c926e1e2c91a9e","observation_id":"8c4e5496-cf18-4387-9ff8-e09321f7374c","resolution":{"observed_at":"2026-08-05T04:52:50.219179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.03118/citation-record","integrity":"/paper/2607.03118/integrity","json":"/paper/2607.03118/citation-record.json","paper":"/paper/2607.03118"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.463504Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.463504Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:0002a403e2cd5d4dedd6d0957b01637a7407a14671be1e65ffaf139d73025c3a","observation_id":"3e363ebb-bca1-4d0b-a364-4ccab1a3f003","resolution":{"observed_at":"2026-08-02T08:56:31.463504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.467458Z","title":"Veo: A text-to-video generation system","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.467458Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:7d5e89de925c29b21bf9a341a9f631510f61af09a2373d47430dc81a663ea115","observation_id":"3aeb8d28-103a-4275-8e24-ceb48a86870c","resolution":{"observed_at":"2026-08-02T08:56:31.467458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-02T08:56:31.470703Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.470703Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:d73e135d318037a73fa9c8d4eea19e4652a7e06e0fc888cc4fe3c53994530f8d","observation_id":"cab3bf8a-6dcd-4df4-9eef-844027cd223d","resolution":{"observed_at":"2026-08-02T08:56:31.470703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-08-11T10:01:39.973258Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-02T08:56:31.474238Z","title":"Seedance 2.0: Advancing video generation for world complexity","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.474238Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:efc38e8b744eb8272e167211739d5c4c384ca7c545faf8605d01e1c784450726","observation_id":"d3c08625-a7aa-4c0a-be1f-03b1b8be0acf","resolution":{"observed_at":"2026-08-02T08:56:31.474238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.477580Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.477580Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:9effcf5d631cc47e8f683fba91275e0681f11968611747d6fb84311c912448cb","observation_id":"ecccb5ee-80b0-48a0-a499-e5cf55ef0736","resolution":{"observed_at":"2026-08-02T08:56:31.477580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.480537Z","title":"Fifo-diffusion: Generating infinite videos from text without training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.480537Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:00fd15b868c7f3da4c13f901cdd495be8aa8a9d3145164ec943c43495121c129","observation_id":"b6abb58f-af3c-4794-80ac-d74398402727","resolution":{"observed_at":"2026-08-02T08:56:31.480537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.483719Z","title":"Streamingt2v: Consistent, dynamic, and extendable long video generation from text","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.483719Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:40934b794f92a587754dd0a726d7926241ce3711ad770e9892d23ef8a36f611f","observation_id":"ff47484f-91e5-47ee-ace7-21a04e51327f","resolution":{"observed_at":"2026-08-02T08:56:31.483719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06764","last_updated":"2025-07-24T03:58:47Z","snapshot_observed_at":"2026-08-07T11:01:49.684719Z","submitted_at":"2025-02-10T18:44:25Z","title":"History-Guided Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06764","snapshot_observed_at":"2026-08-02T08:56:31.486576Z","title":"History-guided video diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.486576Z"},"links":{"cited_paper":"/paper/2502.06764","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:d666d5aab3c13d2f94701e403a22239ea8f47fe420561e45ac287236ac07b279","observation_id":"581655c9-ad42-4b91-8ac9-1c790b4fdbe3","resolution":{"observed_at":"2026-08-02T08:56:31.486576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25161","last_updated":"2025-09-29T17:57:14Z","snapshot_observed_at":"2026-08-09T09:15:39.740119Z","submitted_at":"2025-09-29T17:57:14Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.25161","snapshot_observed_at":"2026-08-02T08:56:31.489618Z","title":"Rolling forcing: Autoregressive long video diffusion in real time","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.489618Z"},"links":{"cited_paper":"/paper/2509.25161","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:c1a4c4fa212452c81fb6130d490ff33b05e159040a361d67b189255aaabd0174","observation_id":"c4b0d531-7a5c-4974-a016-ad469f72aa68","resolution":{"observed_at":"2026-08-02T08:56:31.489618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.492622Z","title":"Ar-diffusion: Asynchronous video generation with auto-regressive diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.492622Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:dd5a6475b632f2ff74d78bfa4b8d7684dbee4a595f31a4598ab5d1b3af8df57f","observation_id":"0c05cea9-6547-4cc4-ac7f-d63ab2c9fc8e","resolution":{"observed_at":"2026-08-02T08:56:31.492622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.495691Z","title":"Progressive autoregressive video diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.495691Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:0429fa37c37ac5748b745aa36999055b1ca3c59c4d52f76ab687ed1554adaa43","observation_id":"b2c57829-ae31-4cc4-ba59-fdf2bc436448","resolution":{"observed_at":"2026-08-02T08:56:31.495691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.498709Z","title":"Streamdiffusionv2: A streaming system for dynamic and interactive video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.498709Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:155d48da7aa810ee277a0f8dbb8b30b865c105cfeedcc2fd6a2033056807cdc4","observation_id":"5d57c7ad-8073-405f-8070-3b48af4375bd","resolution":{"observed_at":"2026-08-02T08:56:31.498709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.501590Z","title":"From slow bidirectional to fast autoregressive video diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.501590Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:756143ef40bc9c8bbb87af95b307e823dab140ddb7e48572cf48fd89026fbeea","observation_id":"c4a4b9e2-570e-40f6-b829-1a6faac2be07","resolution":{"observed_at":"2026-08-02T08:56:31.501590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.504457Z","title":"Self forcing: Bridging the train-test gap in autoregressive video diffusion","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.504457Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:c3bec67b8259c9b4505b8420a73649234911149a619549907653241fc455132f","observation_id":"067a425a-2ee4-429b-8fc8-d83be035a332","resolution":{"observed_at":"2026-08-02T08:56:31.504457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-03T05:30:22.346810Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02214","snapshot_observed_at":"2026-08-02T08:56:31.507401Z","title":"Causal forcing: Autoregressive diffusion distillation done right for high-quality real-time interactive video generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.507401Z"},"links":{"cited_paper":"/paper/2602.02214","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:8806d2097cfb6ddff3f909261bdadcdc0b12fd725790755826f12f57e6c924bf","observation_id":"3248f336-7196-4c2b-a7a5-984225c59fa5","resolution":{"observed_at":"2026-08-02T08:56:31.507401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15141","last_updated":"2026-06-01T14:27:49Z","snapshot_observed_at":"2026-07-06T23:26:28.006734Z","submitted_at":"2026-05-14T17:46:36Z","title":"Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15141","snapshot_observed_at":"2026-08-02T08:56:31.510408Z","title":"Causal forcing++: Scalable few-step autoregressive diffusion distillation for real-time interactive video generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.510408Z"},"links":{"cited_paper":"/paper/2605.15141","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:f736b0e6af36ca05b3a0e3576a215ca0956ce115a6d11940c9aade0616081f0e","observation_id":"348b9833-f2b8-4e1b-a326-4bcb07919cf1","resolution":{"observed_at":"2026-08-02T08:56:31.510408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22622","last_updated":"2025-10-13T22:41:26Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T17:48:24Z","title":"LongLive: Real-time Interactive Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.22622","snapshot_observed_at":"2026-08-02T08:56:31.513461Z","title":"Longlive: Real-time interactive long video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.513461Z"},"links":{"cited_paper":"/paper/2509.22622","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:c8b6e7442781664e60e1b31b2dd5c979a8ab9c4af4b55a88584dffd21e9511b0","observation_id":"bc26c285-1f33-44d8-af4e-02ca1c9744fc","resolution":{"observed_at":"2026-08-02T08:56:31.513461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13211","snapshot_observed_at":"2026-08-02T08:56:31.516388Z","title":"Magi-1: Autoregressive video generation at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.516388Z"},"links":{"cited_paper":"/paper/2505.13211","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:a861a25ab0f944a07545133ad9a40fc0b489695ffd74038391bf7e9503b3da27","observation_id":"a82db0fd-a0c7-46b3-b959-ff2f213dfb0c","resolution":{"observed_at":"2026-08-02T08:56:31.516388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-08-02T08:56:31.519369Z","title":"Skyreels-v2: Infinite-length film generative model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.519369Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:10d546be20262ea6668686807a41144881f66ebc675d632d146a5e75f2826676","observation_id":"f7ef0785-6436-4487-a2d4-6e82a188ba99","resolution":{"observed_at":"2026-08-02T08:56:31.519369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.522348Z","title":"Packing input frame context in next-frame prediction models for video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.522348Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:4ecf0102180b9814b82062cdf3967ba56cb582b74886c66a7b7901b42b4efd7a","observation_id":"2218d08e-c25b-4132-993c-bcb47a358fec","resolution":{"observed_at":"2026-08-02T08:56:31.522348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-02T08:56:31.525012Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.525012Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:c90258eadf236a441a736037cd48644581c7b539d38001151c90b305161eb319","observation_id":"f9925a27-de13-409c-9838-6f113ba0d756","resolution":{"observed_at":"2026-08-02T08:56:31.525012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.527895Z","title":"Turbodiffusion: Accelerating video diffusion models by 100-200 times","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.527895Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:6c83f832a8f3a0887709b97c376fdab503ce5ad9cb4773d270dd050ff51fe431","observation_id":"2bd93fa1-c131-48d6-95ee-b48d84c7e2b8","resolution":{"observed_at":"2026-08-02T08:56:31.527895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.19271","last_updated":"2026-06-17T16:48:36Z","snapshot_observed_at":"2026-08-05T21:43:31.886249Z","submitted_at":"2026-06-17T16:48:36Z","title":"TurboServe: Serving Streaming Video Generation Efficiently and Economically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.19271","snapshot_observed_at":"2026-08-02T08:56:31.530403Z","title":"Turboserve: Serving streaming video generation efficiently and economically","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.530403Z"},"links":{"cited_paper":"/paper/2606.19271","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:cc2f09a210644946f82372fa2cfc9cab6e2086a07b786feb70c846a942c4f2e4","observation_id":"91a812e8-d2b7-461d-ba52-e2324aa14959","resolution":{"observed_at":"2026-08-02T08:56:31.530403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-02T08:56:31.533158Z","title":"Qwen3-omni technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.533158Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:29786e9d707a00b64e23adfcbb40b84ef05142856e7292ed82c3a1795e1e753c","observation_id":"80dde387-c348-401a-89c8-e55c6bc8a88a","resolution":{"observed_at":"2026-08-02T08:56:31.533158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-02T08:56:31.535865Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.535865Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:3ba0241596229c5e096ff56b33af5b80faf4f8f2360cf08cec562ea0179938fc","observation_id":"c5e46572-31eb-402d-8272-29e4bf9de353","resolution":{"observed_at":"2026-08-02T08:56:31.535865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.538797Z","title":"Ca2-vdm: Efficient autoregres- sive video diffusion model with causal generation and cache sharing, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.538797Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:2e216138377b882c921d0b9aa53dc2e201c892d18e7ac04bc77acb435744c8ef","observation_id":"90abec4b-4c0b-4ca5-830a-35c121473a6d","resolution":{"observed_at":"2026-08-02T08:56:31.538797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.541421Z","title":"Pyramidal flow matching for efficient video generative modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.541421Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:9e97b371b1b065243803d19ab71da61b4cf0592d72e47cb56438034d11fb31d3","observation_id":"844b100c-1434-4ba1-be53-fb5578ab5542","resolution":{"observed_at":"2026-08-02T08:56:31.541421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.543850Z","title":"One-step diffusion with distribution matching distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.543850Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:2579c19e680c5e747d57f07a704c58bdd1c3be1516553f5e86b836d67a79e007","observation_id":"f53fc15a-4014-4084-926d-6038ff82afdd","resolution":{"observed_at":"2026-08-02T08:56:31.543850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.546327Z","title":"Phased consistency models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.546327Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:f555ce730473de174aaa521d8550beae9a0f7458235db02dc4b6d6c457ade615","observation_id":"e483012a-357b-4ffd-a522-b4d0a5dd4aa3","resolution":{"observed_at":"2026-08-02T08:56:31.546327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.548773Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.548773Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:18195521bf1b9f79c8c61ab96b49b85dcc096498480150dd3f8db5c4fd5d6349","observation_id":"32310bdd-18a0-4d66-8659-30afe28ceb70","resolution":{"observed_at":"2026-08-02T08:56:31.548773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.551331Z","title":"Infinity-rope: Action-controllable infinite video generation emerges from autoregressive self-rollout","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.551331Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:34b3416bd9958fef52e1a095cca0a5209cf0cff0b4b61138c3a04d200ddc24f7","observation_id":"a3526f36-03ed-4c48-8697-14a7388cfa1f","resolution":{"observed_at":"2026-08-02T08:56:31.551331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.553831Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.553831Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:a0c0ee84d4cad3e3ee3a5569ec7d4b256f6c873262c063b964867e5832463a6a","observation_id":"20b37558-ec6d-4ac8-856c-26e2e753c268","resolution":{"observed_at":"2026-08-02T08:56:31.553831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.556217Z","title":"Deep forcing: Training-free long video generation with deep sink and participative compression","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.556217Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:5eb904180fa0121b00998d25f39c97b8516d1f3c89975cc06fff6a66af8df88b","observation_id":"d3d86871-2b0a-4c2d-b6c6-f19a4c8bd6ab","resolution":{"observed_at":"2026-08-02T08:56:31.556217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07775","last_updated":"2026-05-03T01:49:14Z","snapshot_observed_at":"2026-08-11T08:37:21.032068Z","submitted_at":"2026-02-08T02:16:02Z","title":"Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.07775","snapshot_observed_at":"2026-08-02T08:56:31.558808Z","title":"Rolling sink: Bridging limited-horizon training and open-ended testing in autoregressive video diffusion","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.558808Z"},"links":{"cited_paper":"/paper/2602.07775","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:61138aa025f55ba4f7f6dd7db1aefd76d0b2a0b12034e72d9a4e82f0c9a86ae6","observation_id":"3a63176c-696c-445e-ba39-027af13592af","resolution":{"observed_at":"2026-08-02T08:56:31.558808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06939","last_updated":"2026-04-13T17:35:53Z","snapshot_observed_at":"2026-08-11T14:27:06.457070Z","submitted_at":"2026-04-08T11:03:22Z","title":"Grounded Forcing: Bridging Time-Independent Semantics and Proximal Dynamics in Autoregressive Video Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06939","snapshot_observed_at":"2026-08-02T08:56:31.561574Z","title":"Grounded forcing: Bridging time-independent semantics and proximal dynamics in autoregressive video synthesis","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.561574Z"},"links":{"cited_paper":"/paper/2604.06939","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:e01f90e6190da89e153f143228419a1960de918fdb62983083254a7071ba15fe","observation_id":"fc8ac0a1-ce5a-4ddc-a3f6-eeeeb1e2d13f","resolution":{"observed_at":"2026-08-02T08:56:31.561574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.564278Z","title":"Memrope: Training-free infinite video generation via evolving memory tokens","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.564278Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:39c223ec6854fb3b4dc31b7fcb7641fb3202a495f97e7751ca74de29cfdc15db","observation_id":"f8ad4ad4-25dd-4bc8-9e75-e6d9a8d17dd9","resolution":{"observed_at":"2026-08-02T08:56:31.564278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-11T13:45:30.173834Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-08-02T08:56:31.566881Z","title":"Live avatar: Streaming real-time audio-driven avatar generation with infinite length","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.566881Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:5a67d1b097759431715e68ac67060eecdc15395e9dd532dad7f9bfcdc5bae692","observation_id":"40026c4a-3386-4c42-9dce-a3c30f010f97","resolution":{"observed_at":"2026-08-02T08:56:31.566881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.25473","last_updated":"2026-06-24T06:58:02Z","snapshot_observed_at":"2026-08-05T22:45:50.916812Z","submitted_at":"2026-06-24T06:58:02Z","title":"Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.25473","snapshot_observed_at":"2026-08-02T08:56:31.569666Z","title":"Causal-rcm: A unified teacher-forcing and self-forcing open recipe for autoregressive diffusion distillation in streaming video generation and interactive world models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.569666Z"},"links":{"cited_paper":"/paper/2606.25473","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:f74fd67f22f35460a1896b7b7dfdf3143a394eb418cf50597d7b583c2f34741d","observation_id":"9b39dc43-2355-46b4-a07e-7ba9e4f8bba1","resolution":{"observed_at":"2026-08-02T08:56:31.569666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.07823","last_updated":"2026-04-14T22:09:01Z","snapshot_observed_at":"2026-07-06T22:57:05.146373Z","submitted_at":"2026-04-09T05:26:09Z","title":"LPM 1.0: Video-based Character Performance Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.07823","snapshot_observed_at":"2026-08-02T08:56:31.572316Z","title":"Lpm 1.0: Video-based character performance model","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.572316Z"},"links":{"cited_paper":"/paper/2604.07823","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:63227aef92e2f5d33e32ac6de7ca456eeb4ebf4ceb11fdd2e96683acb6fbba83","observation_id":"4d6cf2d9-c8ad-4f51-90cd-55ef574df26e","resolution":{"observed_at":"2026-08-02T08:56:31.572316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.575254Z","title":"Efficient attention methods: Hardware-efficient, sparse, compact, and linear attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.575254Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:ee864bc25766be8b86ad8dfc7f4f6c1731e3a15ccab8a1dfac595225822d5809","observation_id":"a5fbe3e1-45f0-46e9-9495-94e6005945bc","resolution":{"observed_at":"2026-08-02T08:56:31.575254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.577869Z","title":"Sageattention: Accurate 8-bit attention for plug-and-play inference acceleration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.577869Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:e1f4ccf063ae439863ee97722a93641d4d03a3bf3e282aec807489056c3e4a8b","observation_id":"aea88014-b7a7-4c7a-b921-e7557d3be766","resolution":{"observed_at":"2026-08-02T08:56:31.577869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.580166Z","title":"Sageattention2: Efficient attention with thorough outlier smoothing and per-thread int4 quantization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.580166Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:33e8caa11394edc62750fb460afcddca1f42a300e942eeda8c9c83998275d156","observation_id":"89b775ef-041d-4a9c-b2e2-24aa4c7dd394","resolution":{"observed_at":"2026-08-02T08:56:31.580166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21136","last_updated":"2025-06-06T07:47:22Z","snapshot_observed_at":"2026-08-10T06:09:22.229605Z","submitted_at":"2025-05-27T12:50:36Z","title":"SageAttention2++: A More Efficient Implementation of SageAttention2","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21136","snapshot_observed_at":"2026-08-02T08:56:31.582638Z","title":"Sageattention2++: A more efficient implementation of sageattention2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.582638Z"},"links":{"cited_paper":"/paper/2505.21136","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:dddcaceffe11c057d5289092309ccb5d77d4033fca0cfaf87d7d69863891c4ba","observation_id":"c63f6e16-8a37-4f22-ad1a-41449ec5fce3","resolution":{"observed_at":"2026-08-02T08:56:31.582638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.585274Z","title":"Sageattention3: Microscaling fp4 attention for inference and an exploration of 8-bit training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.585274Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:57a8b722d7674579809d738aa7f5d9af22b6a356c8c683c803aa1f81adf2317f","observation_id":"12bb74d1-4e59-4bca-9baa-a160ba739091","resolution":{"observed_at":"2026-08-02T08:56:31.585274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.587582Z","title":"Sagebwd: A trainable low-bit attention","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.587582Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:1e34e02d700fd6e4c9136b1baca4ce1f0d2da4245a4c0184b3455e4a5b86a124","observation_id":"89b897d3-425f-466e-9771-2ae98351a798","resolution":{"observed_at":"2026-08-02T08:56:31.587582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.589966Z","title":"Spargeattention: Accurate and training-free sparse attention accelerating any model inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.589966Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:b895a3dde1aa724fdd964b28ad32cfa4cec73b5ea12e2b81a9a069028bbd450b","observation_id":"e2343944-edae-4aab-9f22-0a80487b7aca","resolution":{"observed_at":"2026-08-02T08:56:31.589966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.592261Z","title":"Spargeattention2: Trainable sparse attention via hybrid top-k+ top-p masking and distillation fine-tuning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.592261Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:a04389fdcee03c74996d9186323f3788615c8f4b05643474cfa9b6a84f81408e","observation_id":"585f5161-1ea3-4582-bcb9-015ff28b0062","resolution":{"observed_at":"2026-08-02T08:56:31.592261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.594594Z","title":"Gonzalez, Jun Zhu, and Jianfei Chen","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.594594Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:fd3762d015df1d213f1b42cd3f5b647c4d25cdd4b87a7849abd0cd2a42a25147","observation_id":"26d5b5f4-4764-4b0e-a758-e474bc62ee61","resolution":{"observed_at":"2026-08-02T08:56:31.594594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.596847Z","title":"Sla2: Sparse-linear attention with learnable routing and qat","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.596847Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:3ea04e2314335d73a77e79a58a9ec19e48011ce7f5b42855d8098a13253549c6","observation_id":"e94ba322-1a22-4e46-817b-4fe618e2438c","resolution":{"observed_at":"2026-08-02T08:56:31.596847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-02T08:56:31.599291Z","title":"Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.599291Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:0b035fb1df0fc4c3316e1b46a03531bd87c48dd8192e0867bfb5257953c0b830","observation_id":"880d7b0c-8379-4b62-ba22-fee057930146","resolution":{"observed_at":"2026-08-02T08:56:31.599291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.601964Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.601964Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:bf72d1d206142e240681d195942234f38c1670f8addc68fbf4828f2e4f924234","observation_id":"ec607be8-1c1d-4669-bcc2-c93d41decb29","resolution":{"observed_at":"2026-08-02T08:56:31.601964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.604304Z","title":"Heygen ai video avatar","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.604304Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:a83e03ed0895fa125a2b520053f452f860ba9194eddc212ebeedb1343bf12d5d","observation_id":"b0ef7be3-eaa4-4688-8e47-b50b0d1cae7e","resolution":{"observed_at":"2026-08-02T08:56:31.604304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.606615Z","title":"Lemonslice studio: Create talking and singing ai avatar videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.606615Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:7c7efe82ed9d07539c4be1c84b762935baf5e28d221bb98c52216e7e5d279195","observation_id":"a1cfbc37-775c-4c06-b731-a8d685c99c37","resolution":{"observed_at":"2026-08-02T08:56:31.606615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.611583Z","title":"Klingavatar 2.0 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.611583Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:86e4245546aa7126f03a69f9b58ecceb587ed5cc2bfd1ee869016a788e6f5e90","observation_id":"21712d40-31e3-45b6-a168-1421154120c9","resolution":{"observed_at":"2026-08-02T08:56:31.611583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18866","last_updated":"2025-06-23T17:33:03Z","snapshot_observed_at":"2026-08-06T23:13:02.949681Z","submitted_at":"2025-06-23T17:33:03Z","title":"OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18866","snapshot_observed_at":"2026-08-02T08:56:31.614075Z","title":"Omniavatar: Efficient audio-driven avatar video generation with adaptive body animation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.614075Z"},"links":{"cited_paper":"/paper/2506.18866","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:5bf8433ac1244d0f8f6b8cbaf3242489b8ef4304ba37709129cc7f5bbad57685","observation_id":"0d4e942e-947d-46e0-95e1-092e8fcd4b2d","resolution":{"observed_at":"2026-08-02T08:56:31.614075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.616682Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with video diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.616682Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:0f21454ad372baafecede3141d0adc9ec9073095a5ae7588caa25836b3085c5f","observation_id":"8f59d1de-8a7f-4be0-ae84-aaea78b0a6da","resolution":{"observed_at":"2026-08-02T08:56:31.616682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-09T13:51:49.495355Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-08-02T08:56:31.619017Z","title":"Stableavatar: Infinite-length audio-driven avatar video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.619017Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:f1644cd270c2d496e9e55adf8c15b63a3f682708c6dc452e878c1496244c7714","observation_id":"62419ab1-da7b-4530-bc99-fb8a4f8b7e7d","resolution":{"observed_at":"2026-08-02T08:56:31.619017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.621637Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.621637Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:4293035d859945d842daea2c6645b9abc734635b37d83e336f646708930b3ad3","observation_id":"cf1e41b7-bd69-4204-bff0-6aa2dc81e491","resolution":{"observed_at":"2026-08-02T08:56:31.621637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.624150Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.624150Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:5c38f966b8b1e760ba6a031713dba64f62fd600c80fa2edcbee6ea0b3729036e","observation_id":"e8267e36-cfb7-4f07-ad67-2fe614302a9a","resolution":{"observed_at":"2026-08-02T08:56:31.624150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.626723Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.626723Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:e9781037d9775b06d090e08e6bf596b05c6df5bf3fde3ecfb17a550e34cb1905","observation_id":"0a2c29d2-6d73-401b-937d-778037eea38a","resolution":{"observed_at":"2026-08-02T08:56:31.626723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.609050Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.609050Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:7ae930f0ac2835172d0b6f2184e3db2383f42f1043a3ba8507ad9d919f1e3ba4","observation_id":"dea6cf42-a1ea-4d65-850d-f2713d97858c","resolution":{"observed_at":"2026-08-02T08:56:31.609050Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T23:56:53.588061Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":60,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 2 inbound Pith citation observations for arXiv:2607.03118."}