{"as_of":"2026-08-06T01:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9e104e910205d28ac05332b82156a71ffbc484a423ae6da4e996ec3ce05db61d","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T01:35:37.817082Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":60,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:31:25.390048Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T01:46:40.967365Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2601.20540","last_updated":"2026-01-28T12:37:01Z","snapshot_observed_at":"2026-08-03T01:29:14.204066Z","submitted_at":"2026-01-28T12:37:01Z","title":"Advancing Open-source World Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-16T09:07:00.904794Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2601.20540"},"observation_digest":"sha256:17c416bb242ad189ab7f19f786433db74fb6f3aca4b47acd1c33062d35180749","observation_id":"55a6e127-874b-4c91-b116-cb2d1a1a8d04","resolution":{"observed_at":"2026-05-16T09:07:01.029493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2601.23286","last_updated":"2026-06-07T21:12:04Z","snapshot_observed_at":"2026-08-03T06:13:17.430436Z","submitted_at":"2026-01-30T18:59:57Z","title":"VideoGPA: Distilling Geometry Priors for 3D-Consistent Video Generation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T09:16:57.528410Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2601.23286"},"observation_digest":"sha256:7ea839d062d0774da459ad05e93927c2d7ee42de9898859675b136b1afc7df28","observation_id":"024ba903-39c0-40c0-b4df-1157cf7cfc0c","resolution":{"observed_at":"2026-05-16T09:17:40.232943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-08-03T06:13:20.174545Z","title":"Team Wan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.23286","last_updated":"2026-06-07T21:12:04Z","snapshot_observed_at":"2026-08-03T06:13:17.430436Z","submitted_at":"2026-01-30T18:59:57Z","title":"VideoGPA: Distilling Geometry Priors for 3D-Consistent Video Generation","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T06:13:20.174545Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2601.23286"},"observation_digest":"sha256:9ce56ad3cb7d1e3d3e20b4ad241e41c9a84233746bdb6464d1ef9cbe97a8f30e","observation_id":"9799fc07-5978-45b9-a96b-bbbc67cff83a","resolution":{"observed_at":"2026-08-03T06:13:20.174545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-08-03T05:23:35.355587Z","title":"Seedance 1.5 pro: A native audio- visual joint generation foundation model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02465","last_updated":"2026-06-10T12:52:04Z","snapshot_observed_at":"2026-08-03T05:23:28.259581Z","submitted_at":"2026-02-02T18:49:06Z","title":"MentisOculi: Revealing the Limits of Reasoning with Mental Imagery","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T05:23:35.355587Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2602.02465"},"observation_digest":"sha256:60f2bcbddaf0721471465979ec837534e27189e32623ecc25e7fed88fe91de55","observation_id":"8637e93c-8edd-4f5f-b589-3ac5489179c3","resolution":{"observed_at":"2026-08-03T05:23:35.355587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-08-03T00:03:26.232585Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.11790","last_updated":"2026-05-31T04:10:48Z","snapshot_observed_at":"2026-08-03T12:52:27.367861Z","submitted_at":"2026-02-12T10:14:36Z","title":"Beyond End-to-End Video Models: An LLM-Based Multi-Agent System for Educational Video Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T00:03:26.232585Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2602.11790"},"observation_digest":"sha256:16da4c7e5911312ff6131c78a9abe45b230145758931d9e5ba67233b0ed1f142","observation_id":"f0911bc8-102d-48be-85a2-62d5e9d9493d","resolution":{"observed_at":"2026-08-03T00:03:26.232585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-13T22:49:03.259461Z","title":"arXiv preprint arXiv:2512.13507 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.17975","last_updated":"2026-06-28T11:09:46Z","snapshot_observed_at":"2026-07-13T22:49:02.789541Z","submitted_at":"2026-03-18T17:39:05Z","title":"AHOY! Animatable Humans under Occlusion from YouTube Videos with Gaussian Splatting and Video Diffusion Priors","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T22:49:03.259461Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2603.17975"},"observation_digest":"sha256:b0a0f8d1f2d482b01eba0cf3ceea719e307d2e485a833b608437ccf8b6152109","observation_id":"8d33bf0a-a2ed-4b87-bd82-cfda7b2d1ba8","resolution":{"observed_at":"2026-07-13T22:49:03.259461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2604.07958","last_updated":"2026-04-23T12:58:42Z","snapshot_observed_at":"2026-07-06T22:57:09.435331Z","submitted_at":"2026-04-09T08:22:09Z","title":"ImVideoEdit: Image-learning Video Editing via 2D Spatial Difference Attention Blocks","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T17:49:33.822264Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2604.07958"},"observation_digest":"sha256:f8daa3262c800ec177b5f3410cd3f5a61d2d54769f1bf1d91b764faf79492787","observation_id":"f18323a4-deaa-4549-a06b-b52460545fb6","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2604.08363","last_updated":"2026-04-09T15:27:22Z","snapshot_observed_at":"2026-07-06T22:57:26.678728Z","submitted_at":"2026-04-09T15:27:22Z","title":"CapTalk: Unified Voice Design for Single-Utterance and Dialogue Speech Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T17:15:28.918204Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2604.08363"},"observation_digest":"sha256:a13cadbc965e5dd3f3c51955379da781216d565acc5e3679dd22260bb4c1459a","observation_id":"229b929c-a899-4e47-951c-85c9d90227d1","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2604.08540","last_updated":"2026-04-09T17:59:39Z","snapshot_observed_at":"2026-08-02T21:13:25.946486Z","submitted_at":"2026-04-09T17:59:39Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:14:30.737975Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2604.08540"},"observation_digest":"sha256:8b3ec9bad5cbeeffc1c6f926fdbec538302f1ac55dfcfafad65436b053ebf447","observation_id":"9000eaa8-df4c-4b49-ac77-9d85d0512ddc","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2604.10980","last_updated":"2026-04-13T04:39:49Z","snapshot_observed_at":"2026-07-06T22:59:27.499664Z","submitted_at":"2026-04-13T04:39:49Z","title":"Tracking High-order Evolutions via Cascading Low-rank Fitting","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-10T15:55:27.722919Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2604.10980"},"observation_digest":"sha256:4b37e79361e1102a8e03e4b2193dc91a35c2bd9361bbbc8e7b2bbc03ff20f6e0","observation_id":"28c59f1c-b38f-4447-9df4-95506d2bd04d","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2604.11521","last_updated":"2026-04-13T14:23:31Z","snapshot_observed_at":"2026-07-31T08:57:40.954187Z","submitted_at":"2026-04-13T14:23:31Z","title":"Continuous Adversarial Flow Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T15:25:53.420119Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2604.11521"},"observation_digest":"sha256:ec51ee5a9d27b8ddca7c2d024143e41270b03f2c1634958cac9cab6bfb0a67bc","observation_id":"23575bc6-0b87-4592-baa2-0e8499704df1","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:3308810d7bad1d467a5426b4cf2fd9d253a7861289b3f56571364924d8db0026","observation_id":"d234a1bb-a95d-4a21-870b-5da508d07eaa","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T13:34:36.248186Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2604.14148"},"observation_digest":"sha256:71657f49e6510b0080d1f62263a4e7e84250a053757031e213978fe2d3bf5a71","observation_id":"d44bfb3c-8401-40f5-bb6f-2176210b7468","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2604.15911","last_updated":"2026-04-17T10:11:39Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:11:39Z","title":"Efficient Video Diffusion Models: Advancements and Challenges","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T08:28:29.706249Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2604.15911"},"observation_digest":"sha256:4c26bc62518ee97bf7417a51baa4caa25323eb41c3d995c1df609c74082d5589","observation_id":"0ef97cae-6400-408f-ac71-639cc673a27d","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2604.16503","last_updated":"2026-05-19T02:31:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T15:09:39Z","title":"Motif-Video 2B: Technical Report","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T15:50:04.001693Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2604.16503"},"observation_digest":"sha256:bce9d061d89acd62ea7298fc5c49510907f99936f61c96de56a73b2dbcc2b1ca","observation_id":"8c0fda48-d7d0-4dd7-9b2e-7a83bc068b62","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2604.16503","last_updated":"2026-05-19T02:31:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T15:09:39Z","title":"Motif-Video 2B: Technical Report","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T00:12:23.096146Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2604.16503"},"observation_digest":"sha256:3125c002d1f023d99789bc7257d40c4d27e002e826719e3afb8d70bf75dcaaee","observation_id":"2bab4669-4972-4e97-a733-64d368830bd0","resolution":{"observed_at":"2026-05-21T00:13:53.094129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2604.18326","last_updated":"2026-05-30T12:42:13Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:28:51Z","title":"OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T05:19:49.671136Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2604.18326"},"observation_digest":"sha256:5ae75300db5b6c5473ffb98ad3db388e0ef6c5da6256a97d82fd1960deaa13e6","observation_id":"c7420079-6a16-4658-9abd-e0a195f14955","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2604.18326","last_updated":"2026-05-30T12:42:13Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:28:51Z","title":"OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-05T12:34:41.758238Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2604.18326"},"observation_digest":"sha256:c185ddd598a13918dc59cf716e27406dd47f20070f5183b8f199a9343063b532","observation_id":"fa5ece1a-5850-478c-b8e9-8622d87273e5","resolution":{"observed_at":"2026-07-05T12:41:04.374148Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:6782cf064db8476a55bef9d3f83768db76550089268e12d91b2c3966b66e8934","observation_id":"d55cae8b-62ff-4634-900c-ff5b9440ef24","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2604.24953","last_updated":"2026-04-29T03:07:25Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T19:49:06Z","title":"ViPO: Visual Preference Optimization at Scale","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:47.226661Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2604.24953"},"observation_digest":"sha256:139d3316b79a28db1e46a066adaa93cb265a818bcf27f853745e5ad691d3f417","observation_id":"4ae96787-b8e6-434b-9c83-f93a03b1b1a5","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2604.27505","last_updated":"2026-05-20T07:08:10Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:54:39Z","title":"Leveraging Verifier-Based Reinforcement Learning in Image Editing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-07T08:00:33.307429Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2604.27505"},"observation_digest":"sha256:79ab7e2f5e17f632efd37eb2a43ee8c2c26a359c01f84b1e5ace9fe777972e41","observation_id":"c8ebb340-0d7f-4826-a686-8bebeedb0c54","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2604.27505","last_updated":"2026-05-20T07:08:10Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:54:39Z","title":"Leveraging Verifier-Based Reinforcement Learning in Image Editing","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-21T09:11:02.183133Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2604.27505"},"observation_digest":"sha256:faf6da798ad2d7f4cc3ffb5926e4f7425bb661d667fb56337916ed36cf3f2831","observation_id":"83c0e3ed-76a5-478a-b508-084bed995916","resolution":{"observed_at":"2026-05-21T09:14:05.908619Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2605.01761","last_updated":"2026-05-03T07:49:51Z","snapshot_observed_at":"2026-07-06T23:14:57.459903Z","submitted_at":"2026-05-03T07:49:51Z","title":"TrajShield: Trajectory-Level Safety Mediation for Defending Text-to-Video Models Against Jailbreak Attacks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T19:27:00.278658Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2605.01761"},"observation_digest":"sha256:ceeef52f2d44a13f93327b6ce657f1f1bea51f2bf0c13534268c1b6a8dfabc75","observation_id":"3d12dd9e-dbdd-441f-b418-43deb0fbb4c8","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2605.03652","last_updated":"2026-05-11T07:22:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T11:36:52Z","title":"AniMatrix: An Anime Video Generation Model that Thinks in Art, Not Physics","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T01:23:27.990472Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2605.03652"},"observation_digest":"sha256:3af8c7413c98ab8e8df671e3a3dab7fb0f54b279ba3d4eac279a6eee34ac72a5","observation_id":"5123ef35-7542-4490-8c50-f85e298b1d28","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2605.03652","last_updated":"2026-05-11T07:22:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T11:36:52Z","title":"AniMatrix: An Anime Video Generation Model that Thinks in Art, Not Physics","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T19:04:02.414172Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2605.03652"},"observation_digest":"sha256:2c76bc222d0865ca44e1631dbd6af0b3153534e0c9c3feb93c527cf1da0c4181","observation_id":"f62a5cc8-59ba-41eb-b556-402bcd456ca8","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2605.03652","last_updated":"2026-05-11T07:22:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T11:36:52Z","title":"AniMatrix: An Anime Video Generation Model that Thinks in Art, Not Physics","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:47.335022Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2605.03652"},"observation_digest":"sha256:587b35fa73828b2e1bc63c85eb9944635842914e9a3c986aab6fe3a5fcdd5ef9","observation_id":"46a78ab4-7914-4833-8bc5-0a69b6157d21","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:4066c4933afe99d8bf2fab577fa535dae5de7d63ea7500cc8840ed04d5f87f43","observation_id":"122855f6-e584-415f-b32a-af388ff8196a","resolution":{"observed_at":"2026-07-01T00:25:09.297592Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2605.07503","last_updated":"2026-05-08T09:37:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T09:37:46Z","title":"Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T01:58:25.291448Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2605.07503"},"observation_digest":"sha256:cb5444e0fa8a02b7d8418c83efcdcfda9c23e3b1ca8a1e982248200295830f88","observation_id":"75a61d9e-d97b-4b21-baee-d70d7d641625","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2605.12179","last_updated":"2026-05-12T14:22:13Z","snapshot_observed_at":"2026-08-02T10:11:30.309923Z","submitted_at":"2026-05-12T14:22:13Z","title":"SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T07:01:40.333448Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2605.12179"},"observation_digest":"sha256:e93f1e0d00d274b430d78c38213e87a54b8c8424d7d7c6ffd4c83f60ffc4c2f9","observation_id":"3ca4b3dc-3d86-42b9-bc83-c43bce547d9e","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-12T16:57:23.214654Z","title":"Seedance 1.5 pro: A native audio-visual joint generation foundation model.arXiv preprint arXiv:2512.13507,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.12479","last_updated":"2026-07-06T08:55:19Z","snapshot_observed_at":"2026-07-12T16:57:22.059952Z","submitted_at":"2026-05-12T17:56:29Z","title":"Cutting rules in strong field QED with application to trident pair production","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T16:57:23.214654Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2605.12479"},"observation_digest":"sha256:429ac55ff744709a99f6cb7aaae7bcee9c3bb5fdfde369a7927186694dfba5f2","observation_id":"16684474-5ee6-48f8-a121-c0781104fe1b","resolution":{"observed_at":"2026-07-12T16:57:23.214654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2605.12480","last_updated":"2026-05-12T17:56:59Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:56:59Z","title":"OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T06:16:20.612291Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2605.12480"},"observation_digest":"sha256:3e63ccea2edb5bac8d296f2d9741f4141a7a61c1d7b036ef67a894d2bc644933","observation_id":"1ebd594e-cd1e-4c7a-bae8-2a85e5baa869","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2605.15190","last_updated":"2026-05-14T17:59:30Z","snapshot_observed_at":"2026-08-03T08:24:27.614764Z","submitted_at":"2026-05-14T17:59:30Z","title":"RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T20:38:28.328436Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2605.15190"},"observation_digest":"sha256:6281fcbab9f37a737cc8a35b62658d20c5546e33d711809c42f41bef9485b1e9","observation_id":"29dd4af4-57b7-4dfc-8b38-6cdcf2c9b781","resolution":{"observed_at":"2026-07-01T14:35:47.242206Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2605.22570","last_updated":"2026-05-21T14:48:35Z","snapshot_observed_at":"2026-08-02T20:47:32.000183Z","submitted_at":"2026-05-21T14:48:35Z","title":"VGenST-Bench: A Benchmark for Spatio-Temporal Reasoning via Active Video Synthesis","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-22T07:12:02.612292Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2605.22570"},"observation_digest":"sha256:f2d73f3701b19adead11bdf3f8a9f46cdc765e59ba261895c05461e887f1cf3d","observation_id":"b786b1b1-b1ae-4645-9463-46c154088a4e","resolution":{"observed_at":"2026-05-22T07:14:42.803212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-05T06:28:41.139206Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:bce2b924745c286cbac426f8f3ebe28456f8b7636e06cce4089766f100444dfc","observation_id":"82d8deff-88c0-487b-9608-c46a012b312e","resolution":{"observed_at":"2026-06-30T13:44:41.253589Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2605.25874","last_updated":"2026-05-25T14:01:31Z","snapshot_observed_at":"2026-07-06T23:35:46.157653Z","submitted_at":"2026-05-25T14:01:31Z","title":"WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-29T22:57:08.381846Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2605.25874"},"observation_digest":"sha256:1f8770faee2205b7b311c7a71746cce77fe59f13968319b4851368812340d153","observation_id":"946c3892-ee94-42a7-8583-3b70a44bd39b","resolution":{"observed_at":"2026-06-29T23:14:02.270565Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2605.27589","last_updated":"2026-05-26T19:02:26Z","snapshot_observed_at":"2026-08-05T09:42:53.562841Z","submitted_at":"2026-05-26T19:02:26Z","title":"What-If World: A Causal Benchmark for General World Models in Embodied Scenarios","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:22.987086Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2605.27589"},"observation_digest":"sha256:e3c179026e6cbd5eb54a993e96808f104fe05c2836c1135e797fadc51918d877","observation_id":"f8a645cc-70f2-4ce5-9cf5-c13afee3d265","resolution":{"observed_at":"2026-06-29T18:23:50.358946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2606.02564","last_updated":"2026-06-27T07:03:15Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:54:26Z","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T15:26:21.284810Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2606.02564"},"observation_digest":"sha256:a65769db4e5a673a8613affa3821f98a1444d2e1d7c393a389a02b52b85f54bb","observation_id":"44dc19ab-35b6-4beb-bc2a-431100d36e52","resolution":{"observed_at":"2026-07-01T22:26:17.328846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2606.02564","last_updated":"2026-06-27T07:03:15Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:54:26Z","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T10:38:22.619277Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2606.02564"},"observation_digest":"sha256:5453feab415af43a325c996b4f73bceba6a8478b3f71c6361b299803eb15c22b","observation_id":"b99d2df6-a381-4f4e-9bbe-e844073b73ad","resolution":{"observed_at":"2026-06-30T10:44:36.759022Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2606.21030","last_updated":"2026-06-19T01:44:15Z","snapshot_observed_at":"2026-08-02T11:04:44.284637Z","submitted_at":"2026-06-19T01:44:15Z","title":"FlowCodec: One-Step Flow Prior for Generative Image Compression","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T13:28:49.915679Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2606.21030"},"observation_digest":"sha256:d3ecfa712e011ba5193c74d6cb6572c64c4aeea6fdab8b5be30ad55dcb6a79e0","observation_id":"c871ff8a-3064-43b8-8b6f-f530e697afec","resolution":{"observed_at":"2026-07-04T07:29:38.428163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2606.25496","last_updated":"2026-06-24T07:23:20Z","snapshot_observed_at":"2026-07-06T23:59:57.346004Z","submitted_at":"2026-06-24T07:23:20Z","title":"Recommendation as Generation: Unifying Personalized Video Generation and Recommendation at Industrial Scale","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-25T20:21:09.611166Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2606.25496"},"observation_digest":"sha256:9f69c1c5bd92002fd2c1310dc283a61bcbbdbe793983255521ded845b7b3e157","observation_id":"819fa507-37af-4d40-89d6-f66a1c77f7fe","resolution":{"observed_at":"2026-07-04T20:20:07.211661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2606.26058","last_updated":"2026-06-24T17:33:13Z","snapshot_observed_at":"2026-07-07T00:00:26.827253Z","submitted_at":"2026-06-24T17:33:13Z","title":"DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-25T19:00:23.260939Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2606.26058"},"observation_digest":"sha256:e2388ce2b0c2b4e1ff39a7d575f9c92ba3576ba2c9f12cba3c5fa105a88c782e","observation_id":"5a5dce90-d21f-4971-9bef-90c7f02ae522","resolution":{"observed_at":"2026-07-04T21:10:09.687040Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2606.26668","last_updated":"2026-06-25T07:01:05Z","snapshot_observed_at":"2026-07-07T00:01:01.437499Z","submitted_at":"2026-06-25T07:01:05Z","title":"Disco-LoRA: Disentangled Composition of Content, Style, and Motion for Multi-concept Video Customization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T05:51:29.839498Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2606.26668"},"observation_digest":"sha256:a86fb7fa3dacb082b6ad5dde73a72ebe7751e1b81332170540ff62f0ae257a40","observation_id":"95225cc9-4e3a-4cfd-a44a-86e3b6b83be3","resolution":{"observed_at":"2026-07-04T12:49:52.793549Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2606.28128","last_updated":"2026-06-26T14:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-26T14:30:18Z","title":"PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T04:34:38.286863Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2606.28128"},"observation_digest":"sha256:47302d071647e629fbc8849e696ea537ed496561338924b1ddc311986f859075","observation_id":"5c9586da-043c-4bf1-910f-9380fe8d4511","resolution":{"observed_at":"2026-06-29T20:03:56.964014Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2606.31946","last_updated":"2026-07-14T06:00:42Z","snapshot_observed_at":"2026-07-17T23:18:07.162455Z","submitted_at":"2026-06-30T16:52:53Z","title":"World Narrative Model for Highly Controllable Video Generation: A Paradigm Shift from Pixel Sampling to Physical World Orchestration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-01T05:31:43.678762Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2606.31946"},"observation_digest":"sha256:744db4b70ae809ec4063d9b0bbdbd4841df165045de17ce550609d8094e50d74","observation_id":"54a8519e-bdde-4167-bfd3-06ee27c731c2","resolution":{"observed_at":"2026-07-01T10:25:41.688593Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-15T10:20:59.147440Z","title":"Seedance 1.5 pro: A native audio-visual joint generation foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.31946","last_updated":"2026-07-14T06:00:42Z","snapshot_observed_at":"2026-07-17T23:18:07.162455Z","submitted_at":"2026-06-30T16:52:53Z","title":"World Narrative Model for Highly Controllable Video Generation: A Paradigm Shift from Pixel Sampling to Physical World Orchestration","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-15T10:20:59.147440Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2606.31946"},"observation_digest":"sha256:2fed2dbc22a8e660b5818ce38656c3913d8603e68b2fcc71b294bb911b9b0b31","observation_id":"1cf158ce-4548-49c4-bf50-44b718672a01","resolution":{"observed_at":"2026-07-15T10:20:59.147440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-12T08:04:48.963890Z","title":"Seedance 1.5 pro: A native audio-visual joint generation foundation model.arXiv preprint arXiv:2512.13507, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02642","last_updated":"2026-07-02T17:02:43Z","snapshot_observed_at":"2026-08-03T12:39:47.539491Z","submitted_at":"2026-07-02T17:02:43Z","title":"GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-07-12T08:04:48.963890Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2607.02642"},"observation_digest":"sha256:50761fa3f3a727ada30089a96c53299a8ea94c7f52a3d24013557e3883dc276d","observation_id":"1a9f6eed-5699-4ddb-82e4-fb62d456eb54","resolution":{"observed_at":"2026-07-12T08:04:48.963890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2607.06216","last_updated":"2026-08-03T15:49:45Z","snapshot_observed_at":"2026-08-06T00:33:59.042883Z","submitted_at":"2026-07-07T12:41:19Z","title":"MoWorld: A Flash World Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-08T13:10:31.940263Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2607.06216"},"observation_digest":"sha256:19b0d925602f58668c8918077ee5a3b8cc9b4119bcd13f1c44789d3b136fd35b","observation_id":"640a63ec-b9ac-4165-b587-66919f5e2402","resolution":{"observed_at":"2026-07-08T13:14:53.141871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-08-04T04:32:03.964414Z","title":"Seedance 1.5 pro: A native audio-visual joint generation foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06216","last_updated":"2026-08-03T15:49:45Z","snapshot_observed_at":"2026-08-06T00:33:59.042883Z","submitted_at":"2026-07-07T12:41:19Z","title":"MoWorld: A Flash World Model","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T04:32:03.964414Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2607.06216"},"observation_digest":"sha256:89b9e4599ce68f9aaab0a69b40e78f62d90687a11f3a61a9f737892e8434236d","observation_id":"ef7ecc3c-17f7-47b5-8297-f3e530923d1e","resolution":{"observed_at":"2026-08-04T04:32:03.964414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:a923cc30d73d16a66f1c52d6c65b573e915aec7a0bf17e6f35b02fd441616ac0","observation_id":"414590e5-777f-4818-ab82-213f3920114d","resolution":{"observed_at":"2026-07-10T01:46:40.968677Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-13T01:59:43.167178Z","title":"arXiv preprint arXiv:2512.13507 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09581","last_updated":"2026-07-17T08:46:32Z","snapshot_observed_at":"2026-08-03T17:36:21.028438Z","submitted_at":"2026-07-10T16:30:29Z","title":"Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T01:59:43.167178Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2607.09581"},"observation_digest":"sha256:8c1ff77ea7111ed53c923991b03d19f099fd041878be6a9f648e82953990d862","observation_id":"1df2c8ca-31b2-47fa-a3de-c07bda2fee73","resolution":{"observed_at":"2026-07-13T01:59:43.167178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-14T15:10:13.757131Z","title":"arXiv preprint arXiv:2512.13507 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09581","last_updated":"2026-07-17T08:46:32Z","snapshot_observed_at":"2026-08-03T17:36:21.028438Z","submitted_at":"2026-07-10T16:30:29Z","title":"Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T15:10:13.757131Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2607.09581"},"observation_digest":"sha256:21e6fd281096a56c22aae46d02ecc6449b5390b3df48b77f1c372cfe25cf5a50","observation_id":"32cf42fd-4a8a-4d25-a7c6-5f04a555ca2a","resolution":{"observed_at":"2026-07-14T15:10:13.757131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-08-02T07:35:24.824730Z","title":"arXiv preprint arXiv:2512.13507 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09581","last_updated":"2026-07-17T08:46:32Z","snapshot_observed_at":"2026-08-03T17:36:21.028438Z","submitted_at":"2026-07-10T16:30:29Z","title":"Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T07:35:24.824730Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2607.09581"},"observation_digest":"sha256:69e39d96f7a0d67e0dbb9df16d3099eaf51f20f0ed2f8db99374d8bbe5374f36","observation_id":"9bbae4a9-445f-4ba9-8f7d-0a1b3abff41f","resolution":{"observed_at":"2026-08-02T07:35:24.824730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-08-01T21:07:27.053016Z","title":"Seedance 1.5 pro: A native audio-visual joint generation foundation model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16401","last_updated":"2026-07-17T18:00:05Z","snapshot_observed_at":"2026-08-02T23:36:27.285941Z","submitted_at":"2026-07-17T18:00:05Z","title":"Apple-$\\pi$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T21:07:27.053016Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2607.16401"},"observation_digest":"sha256:8e966b273e15da5aca943bb2a2b25dadb0ad79b3af35b6a6554cdfd638c70a1a","observation_id":"9586fda1-1b63-4658-82d5-53bfb2ef1cfd","resolution":{"observed_at":"2026-08-01T21:07:27.053016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-08-01T18:33:05.156863Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17279","last_updated":"2026-07-19T14:52:31Z","snapshot_observed_at":"2026-08-01T18:33:02.333809Z","submitted_at":"2026-07-19T14:52:31Z","title":"Between Safe Boundaries: Exploiting Temporal Consistency for Jailbreaking Text-To-Video Generation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:05.156863Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2607.17279"},"observation_digest":"sha256:9bee6d0f823826b5a9b635e4794865e2c14f2f58a84b485fa3cc0bf8f7afe6b7","observation_id":"5056ec1f-3f18-4bf9-a550-51a1da8591fe","resolution":{"observed_at":"2026-08-01T18:33:05.156863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-08-01T17:22:32.116181Z","title":"Seedance 1.5 pro: A native audio- visual joint generation foundation model.arXiv preprint arXiv:2512.13507, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17675","last_updated":"2026-07-20T08:27:18Z","snapshot_observed_at":"2026-08-03T01:44:20.390965Z","submitted_at":"2026-07-20T08:27:18Z","title":"ShotPlan: Cinematic Video Generation with Learnable Planning Token","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T17:22:32.116181Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2607.17675"},"observation_digest":"sha256:8abd628903da55130d1411658e05ed3d95de2ed498ad2af4358d3dd05ec06602","observation_id":"d935e25e-d83a-49b5-99c2-74c849191c30","resolution":{"observed_at":"2026-08-01T17:22:32.116181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-08-01T15:42:24.521015Z","title":"Seedance 1.5 pro: A native audio-visual joint generation foundation model.arXiv preprint arXiv:2512.13507, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18217","last_updated":"2026-07-21T02:55:50Z","snapshot_observed_at":"2026-08-01T15:42:14.349456Z","submitted_at":"2026-07-20T17:51:35Z","title":"HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enhancement","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:24.521015Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2607.18217"},"observation_digest":"sha256:8b516920bcdcd8f051ce32f67067eacb440941627c7ef4f1268b88152420bd70","observation_id":"c0b97634-0ed4-4fe9-a3bf-81d665ef5566","resolution":{"observed_at":"2026-08-01T15:42:24.521015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-08-01T11:29:24.944764Z","title":"arXiv preprint arXiv:2512.13507 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19876","last_updated":"2026-07-22T08:04:17Z","snapshot_observed_at":"2026-08-03T07:20:30.384717Z","submitted_at":"2026-07-22T08:04:17Z","title":"KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T11:29:24.944764Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2607.19876"},"observation_digest":"sha256:3b092eaf7fb21749737104fab28873feed6a52d5e1b87a40ce93cb406e79fd5a","observation_id":"84e1bf0e-39e2-4539-9807-18a55528360e","resolution":{"observed_at":"2026-08-01T11:29:24.944764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-08-03T09:43:31.793781Z","title":"Seedance 1.5 pro: A native audio-visual joint generation foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29302","last_updated":"2026-07-31T11:18:17Z","snapshot_observed_at":"2026-08-05T23:13:12.125591Z","submitted_at":"2026-07-31T11:18:17Z","title":"BWM: A Low-Cost High-Fidelity World Simulator for Robot Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:31.793781Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2607.29302"},"observation_digest":"sha256:4d3294145535503bd025a23998cfc5b1721a4683616905db82444f223d6c83a9","observation_id":"bdf94772-5f16-4d36-805e-1eabfb43d16e","resolution":{"observed_at":"2026-08-03T09:43:31.793781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-08-06T00:31:25.390048Z","title":"Seedance 1.5 pro: A native audio-visual joint generation foundation model.arXiv preprint arXiv:2512.13507, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01157","last_updated":"2026-08-02T11:28:13Z","snapshot_observed_at":"2026-08-06T00:31:22.130387Z","submitted_at":"2026-08-02T11:28:13Z","title":"InteracVid: Building a Real Interactive Audio-Visual Response Dataset from Live-Chat Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T00:31:25.390048Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2608.01157"},"observation_digest":"sha256:8d2857f7820b7c9db0ae23f17cca6bcef9e541238d8832b50adc612cb88c7b5f","observation_id":"b9e22e23-37b8-4396-a7cb-14c463d29827","resolution":{"observed_at":"2026-08-06T00:31:25.390048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-08-04T06:45:46.185168Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-06T00:37:21.266955Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.185168Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:ffefab3e5a36125d87e80d1d0fe6c70aa7ec8ebfcd7a55fc935247bb1b24e454","observation_id":"c3c5a997-5f97-462a-833d-4b2535c98401","resolution":{"observed_at":"2026-08-04T06:45:46.185168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.13507/citation-record","integrity":"/paper/2512.13507/integrity","json":"/paper/2512.13507/citation-record.json","paper":"/paper/2512.13507"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:57:26.583184Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"3d3628d5-0f93-4e87-a1fd-d22fed308442","year":2024},"citing_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T01:35:37.817082Z"},"links":{"citing_paper":"/paper/2512.13507"},"observation_digest":"sha256:ba4804507b2ef2e61f1e341a0854975664ffe96f6e41c17555e937e01793d830","observation_id":"a154751c-5818-4559-9135-217fcac24530","resolution":{"observed_at":"2026-05-16T01:35:37.952137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11346","last_updated":"2025-06-28T11:46:35Z","snapshot_observed_at":"2026-07-06T21:09:50.780345Z","submitted_at":"2025-04-15T16:19:07Z","title":"Seedream 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":"2504.11346","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11346","snapshot_observed_at":"2026-07-04T07:29:38.429370Z","title":"Seedream 3.0 Technical Report","venue":"cs.CV","work_id":"013e56d0-7f47-4d0e-bbca-e9540fc0e0cc","year":2025},"citing_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T01:35:37.817082Z"},"links":{"cited_paper":"/paper/2504.11346","citing_paper":"/paper/2512.13507"},"observation_digest":"sha256:f16dd14e7962828a40f06718abd4c9af18ba2836fdd1df555c482885b89dab29","observation_id":"2bff16ca-2f0a-42e3-8572-e457da3bd9bc","resolution":{"observed_at":"2026-05-16T01:35:37.848814Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09113","last_updated":"2025-06-28T11:58:23Z","snapshot_observed_at":"2026-08-01T16:09:18.068564Z","submitted_at":"2025-06-10T17:56:11Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","version":2},"cited_work":{"arxiv_id":"2506.09113","doi":"10.48550/arxiv.2506.09113","metadata_source":"pith","pith_arxiv_id":"2506.09113","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","venue":"cs.CV","work_id":"b2e36b5d-99e4-45b4-9358-64f6d3501983","year":2025},"citing_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T01:35:37.817082Z"},"links":{"cited_paper":"/paper/2506.09113","citing_paper":"/paper/2512.13507"},"observation_digest":"sha256:3c134dbd018b5ceb78d8b15a13c87ce3e87ff098b9b3a666613ac73df0a1256f","observation_id":"8e203a5e-1bed-447a-abfa-a1690171a891","resolution":{"observed_at":"2026-05-16T01:35:37.855835Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13447","last_updated":"2025-05-19T17:59:42Z","snapshot_observed_at":"2026-07-06T21:26:30.087184Z","submitted_at":"2025-05-19T17:59:42Z","title":"Mean Flows for One-step Generative Modeling","version":1},"cited_work":{"arxiv_id":"2505.13447","doi":"10.48550/arxiv.2505.13447","metadata_source":"pith","pith_arxiv_id":"2505.13447","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mean Flows for One-step Generative Modeling","venue":"cs.LG","work_id":"07a52ad5-0f82-4095-9a66-559b09fea1ae","year":2025},"citing_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T01:35:37.817082Z"},"links":{"cited_paper":"/paper/2505.13447","citing_paper":"/paper/2512.13507"},"observation_digest":"sha256:c28e2c536c3f01daba1792d75da722c2dd86ae5ec69b147972a15d1ad2db14a5","observation_id":"0cecc482-d108-4a0a-9912-ed62dc43d2d0","resolution":{"observed_at":"2026-05-16T01:35:37.862500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07703","last_updated":"2025-03-10T17:58:33Z","snapshot_observed_at":"2026-07-06T20:50:09.622181Z","submitted_at":"2025-03-10T17:58:33Z","title":"Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2503.07703","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.07703","snapshot_observed_at":"2026-07-03T17:18:43.965269Z","title":"Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model","venue":"cs.CV","work_id":"e285b9d3-0bf4-4f98-ba3a-e545425ab960","year":2025},"citing_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T01:35:37.817082Z"},"links":{"cited_paper":"/paper/2503.07703","citing_paper":"/paper/2512.13507"},"observation_digest":"sha256:cb042ccc2f3ce8a2b829c8af51a03ebea0b0a5053287701f9f9c48dd01467f2c","observation_id":"ffb81dba-fdad-487e-aff6-9960638aa0c1","resolution":{"observed_at":"2026-05-17T08:27:36.473449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T01:35:37.817082Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.13507"},"observation_digest":"sha256:2020110501c6db868aa342c4da887c1784eede4de49c410c0e5cd8f73ffd128f","observation_id":"576ba46b-a0b7-4efe-a2b4-84cfe3b974c7","resolution":{"observed_at":"2026-05-16T01:35:37.877410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"cited_work":{"arxiv_id":"2505.05470","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.05470","snapshot_observed_at":"2026-07-09T02:25:55.898592Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","venue":"cs.CV","work_id":"bf1e8e81-ff31-401a-a5dc-d9c49df168ab","year":2025},"citing_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T01:35:37.817082Z"},"links":{"cited_paper":"/paper/2505.05470","citing_paper":"/paper/2512.13507"},"observation_digest":"sha256:74f2fefabc1d1a8bef9eaca78bbaea70c38f760cdb06ff2cca822827df1d7320","observation_id":"82689190-fb0c-4e7c-9713-9689aee4be71","resolution":{"observed_at":"2026-05-16T01:35:37.884638Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hyper-sd: Trajectory segmented consistency model for efficient image synthesis.Advancesin Neural Information Processing Systems, 37:117340–117362","venue":null,"work_id":"d1872332-158a-492e-9bbb-55f0442be235","year":2025},"citing_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T01:35:37.817082Z"},"links":{"citing_paper":"/paper/2512.13507"},"observation_digest":"sha256:21122f947b7a80d35fd50e79b52b979ca08a6164f9faf921ff64f390b7a5ed98","observation_id":"2f63d48b-84d7-407a-91ea-c0881407107a","resolution":{"observed_at":"2026-05-16T01:35:37.946888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20427","last_updated":"2025-12-10T16:37:54Z","snapshot_observed_at":"2026-07-06T22:30:41.141182Z","submitted_at":"2025-09-24T17:59:04Z","title":"Seedream 4.0: Toward Next-generation Multimodal Image Generation","version":3},"cited_work":{"arxiv_id":"2509.20427","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.20427","snapshot_observed_at":"2026-07-11T00:07:42.259448Z","title":"Seedream 4.0: Toward Next-generation Multimodal Image Generation","venue":"cs.CV","work_id":"15c839a0-48a3-4218-82b6-cac5b7f66e13","year":2025},"citing_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T01:35:37.817082Z"},"links":{"cited_paper":"/paper/2509.20427","citing_paper":"/paper/2512.13507"},"observation_digest":"sha256:8cff16784c15c4fbfac59cb473324fcec236df44cbc2a7e2edd0c28dc393c217","observation_id":"759511f3-b2ac-4f27-881c-9e5bd12f1e48","resolution":{"observed_at":"2026-05-16T01:35:37.911093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07699","last_updated":"2025-03-25T06:11:23Z","snapshot_observed_at":"2026-07-06T20:50:09.622181Z","submitted_at":"2025-03-10T17:20:52Z","title":"RayFlow: Instance-Aware Diffusion Acceleration via Adaptive Flow Trajectories","version":2},"cited_work":{"arxiv_id":"2503.07699","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07699","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rayflow: Instance-aware diffusion acceleration via adaptive flow trajectories","venue":null,"work_id":"fe133e56-0030-4c7f-8519-405d140d3c90","year":2025},"citing_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T01:35:37.817082Z"},"links":{"cited_paper":"/paper/2503.07699","citing_paper":"/paper/2512.13507"},"observation_digest":"sha256:7d1a0fcd55317d93649fba5365dfc9bb85b0b06246ad9c6e0837967c29a57e0f","observation_id":"01546bdc-a5a8-406c-9d70-b20390575ca1","resolution":{"observed_at":"2026-05-16T01:35:37.918949Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T01:35:37.817082Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2512.13507"},"observation_digest":"sha256:e084a052bad6247c81eaf27c835599546a7d1fe7d8bb30fe26ecb34987afdcb9","observation_id":"269c8758-fb39-4af2-be86-659a234a75c0","resolution":{"observed_at":"2026-05-16T01:35:37.927025Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T01:35:37.817082Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2512.13507"},"observation_digest":"sha256:6c33834abd0b480957c0c42a1e71c0d62cf580cbdaca6a5811691e68b918c2be","observation_id":"c3c14651-8f78-453b-a76e-1ae5ee9090de","resolution":{"observed_at":"2026-05-16T01:35:37.934166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2508.02324","doi":"10.48550/arxiv.2508.02324","metadata_source":"pith","pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Image Technical Report","venue":"cs.CV","work_id":"d06d7ecc-7579-4f89-a60b-4278a0f3c562","year":2025},"citing_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T01:35:37.817082Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2512.13507"},"observation_digest":"sha256:9afa32f05e5a4ff35e27909de2a1f697dbf4ac033c9c61b4f164a690dd8c20ab","observation_id":"1d33587f-4047-4b0b-96ed-863cab106466","resolution":{"observed_at":"2026-05-16T01:35:37.941453Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08826","last_updated":"2025-09-10T17:59:31Z","snapshot_observed_at":"2026-08-04T20:08:51.890283Z","submitted_at":"2025-09-10T17:59:31Z","title":"RewardDance: Reward Scaling in Visual Generation","version":1},"cited_work":{"arxiv_id":"2509.08826","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08826","snapshot_observed_at":"2026-07-04T10:39:45.924030Z","title":"Rewarddance: Reward scaling in visual generation","venue":null,"work_id":"eb1c8722-7fb8-4284-9c9d-37b91aa2cebf","year":2025},"citing_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T01:35:37.817082Z"},"links":{"cited_paper":"/paper/2509.08826","citing_paper":"/paper/2512.13507"},"observation_digest":"sha256:2b2280f7966ec49f57902e92fc18c63b551d9adb8417634947d516bf064ed224","observation_id":"8e67035b-89db-48f8-9eda-19f252874dad","resolution":{"observed_at":"2026-05-16T01:35:37.891530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-07-31T14:51:03.625964Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":"2505.07818","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-07-09T03:05:55.316091Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","venue":"cs.CV","work_id":"7404dd36-8f9c-478f-b089-ef9f8189c711","year":2025},"citing_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T01:35:37.817082Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2512.13507"},"observation_digest":"sha256:9166d184c4c1fda5ceb72083627676cca099fe68baab9ef5c60ae24814dcc498","observation_id":"d0e33d47-11d2-454e-89eb-f16eebb9e1cb","resolution":{"observed_at":"2026-05-16T01:35:37.903853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05595","last_updated":"2024-11-26T12:12:50Z","snapshot_observed_at":"2026-07-06T17:57:14.899058Z","submitted_at":"2024-04-08T15:14:20Z","title":"UniFL: Improve Latent Diffusion Model via Unified Feedback Learning","version":3},"cited_work":{"arxiv_id":"2404.05595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05595","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unifl: Improve stable diffusion via unified feedback learning","venue":null,"work_id":"204c64d3-f0e4-4401-90f4-cd47aacf38cf","year":2024},"citing_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T01:35:37.817082Z"},"links":{"cited_paper":"/paper/2404.05595","citing_paper":"/paper/2512.13507"},"observation_digest":"sha256:be5f78f105fbdabd450fc1ccb660c53d5889313501d9a0a81aec7c3250893949","observation_id":"477427bb-38a9-4fa8-a6d2-beccd759686b","resolution":{"observed_at":"2026-05-16T01:35:37.841848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":14,"verified_fuzzy":2},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 60 inbound Pith citation observations for arXiv:2512.13507."}