{"as_of":"2026-07-27T10:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b71e12e836c2c0e3b8497086078735535c747b07d700e55bda26e7e3d60c27fe","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T02:31:34.927101Z","state":"measured"},{"denominator":114,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":114,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-27T06:30:09.085275+00:00","state":"measured"},{"denominator":92,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T22:56:23.337858Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T01:46:40.932396Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T01:35:37.817082Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2512.13507"},"observation_digest":"sha256:729d6d0e37a7548fb8204f6ac0777fb0d05a99d5e7420b0a3df6097e8b7b9727","observation_id":"c3c14651-8f78-453b-a76e-1ae5ee9090de","resolution":{"observed_at":"2026-05-16T01:35:37.934166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2512.23994","last_updated":"2026-05-18T09:30:21Z","snapshot_observed_at":"2026-07-06T22:40:23.205898Z","submitted_at":"2025-12-30T05:22:31Z","title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T19:43:37.604351Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2512.23994"},"observation_digest":"sha256:1de2416fe3d47d4f3757be1eaa806d84ad9f95b56304e97d5707a3310a054a82","observation_id":"ea475063-bd54-4d56-8573-ace881f7231f","resolution":{"observed_at":"2026-05-16T19:48:21.886862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2512.23994","last_updated":"2026-05-18T09:30:21Z","snapshot_observed_at":"2026-07-06T22:40:23.205898Z","submitted_at":"2025-12-30T05:22:31Z","title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T16:10:31.015783Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2512.23994"},"observation_digest":"sha256:524ee4f766e96acf30afadd52f8820f9fcad7b39312843182a6d9a15bf69b23d","observation_id":"e24e5d36-135a-496a-b8ca-199d364dc033","resolution":{"observed_at":"2026-05-21T16:14:15.305066Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2602.02958","last_updated":"2026-05-05T23:46:52Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-03T00:54:32Z","title":"Quant VideoGen: Auto-Regressive Long Video Generation via 2-Bit KV-Cache Quantization","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T07:58:24.456859Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2602.02958"},"observation_digest":"sha256:46f4badb424011308a00fa51a86401d4c2b4622b8a74f7312f16140dcd18a7cd","observation_id":"dd9ccffc-1869-4ec5-93e5-694d55861d8a","resolution":{"observed_at":"2026-05-16T08:00:44.696647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2603.11755","last_updated":"2026-06-29T14:21:14Z","snapshot_observed_at":"2026-07-14T22:39:44.966501Z","submitted_at":"2026-03-12T10:02:23Z","title":"Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T12:18:45.538658Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2603.11755"},"observation_digest":"sha256:0795135db22f2b5e039820cc83568edb10d0bb32b692ab0eb10c788cf6584c96","observation_id":"92020938-9e8a-4ebd-9fa8-15238fff0e27","resolution":{"observed_at":"2026-05-15T12:20:00.572071Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-14T22:56:23.337858Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13402","last_updated":"2026-06-29T23:43:05Z","snapshot_observed_at":"2026-07-14T22:56:22.302687Z","submitted_at":"2026-03-12T00:16:56Z","title":"Event-Driven Video Generation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T22:56:23.337858Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2603.13402"},"observation_digest":"sha256:56cad383b5cde772938f041db07497deb0e3d095fbf82f93829b4d65c6df547d","observation_id":"fe7062fc-2f92-4826-8fe2-0881415960f2","resolution":{"observed_at":"2026-07-14T22:56:23.337858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-13T23:09:50.674516Z","title":"arXiv preprint arXiv:2511.18870 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.17461","last_updated":"2026-06-29T18:39:41Z","snapshot_observed_at":"2026-07-13T23:09:44.395868Z","submitted_at":"2026-03-18T08:07:01Z","title":"AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T23:09:50.674516Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2603.17461"},"observation_digest":"sha256:509920082f36d91b0319b6b3cc15a157f18534aef38ef754e695a98de9cc7a6f","observation_id":"320f5560-124d-4af2-9cc2-49ad315cf1a4","resolution":{"observed_at":"2026-07-13T23:09:50.674516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-13T22:49:03.259461Z","title":"arXiv preprint arXiv:2511.18870 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.17975","last_updated":"2026-06-28T11:09:46Z","snapshot_observed_at":"2026-07-13T22:49:02.789541Z","submitted_at":"2026-03-18T17:39:05Z","title":"AHOY! Animatable Humans under Occlusion from YouTube Videos with Gaussian Splatting and Video Diffusion Priors","version":2},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-07-13T22:49:03.259461Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2603.17975"},"observation_digest":"sha256:a852bae34f667bbc0d1a8a256314a2cfd7f7f73f739f1fcca65c2b1b75f93ee1","observation_id":"b31b73c2-245a-44cf-a9cb-8580ac71cb2d","resolution":{"observed_at":"2026-07-13T22:49:03.259461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-13T18:01:19.034578Z","title":"Hunyuanvideo 1.5 technical report.arXiv preprint arXiv:2511.18870, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.25743","last_updated":"2026-06-29T08:23:47Z","snapshot_observed_at":"2026-07-13T18:01:17.626372Z","submitted_at":"2026-03-26T17:59:57Z","title":"RefAlign: Representation Alignment for Reference-to-Video Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T18:01:19.034578Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2603.25743"},"observation_digest":"sha256:87b9df4b2a2221c2b4197c5409c8cca41b7fa21fb72410664d8cc599dd3112bf","observation_id":"043c7744-cfda-4d64-b20c-5d9d47f0f56b","resolution":{"observed_at":"2026-07-13T18:01:19.034578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2603.28489","last_updated":"2026-07-04T13:25:12Z","snapshot_observed_at":"2026-07-13T16:20:09.384386Z","submitted_at":"2026-03-30T14:23:45Z","title":"Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-14T01:35:14.878069Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2603.28489"},"observation_digest":"sha256:9f4d1dd7a231e782147cac1eadc2d8b1bf69fdfb9cb67e0d929aea862caafac5","observation_id":"894e4985-5e14-452c-9bec-8a3323f95371","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2604.02817","last_updated":"2026-04-03T07:32:24Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:32:24Z","title":"MMPhysVideo: Scaling Physical Plausibility in Video Generation via Joint Multimodal Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T20:20:16.538920Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2604.02817"},"observation_digest":"sha256:f40a3a05d04e0736ed61290878918aa33ecc3bca0b81952553502f7cdc58f357","observation_id":"65b25897-9858-4db5-b300-f4241f263d40","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2604.08646","last_updated":"2026-04-09T17:59:02Z","snapshot_observed_at":"2026-07-06T22:57:40.773778Z","submitted_at":"2026-04-09T17:59:02Z","title":"InsEdit: Towards Instruction-based Visual Editing via Data-Efficient Video Diffusion Models Adaptation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T17:39:59.791758Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2604.08646"},"observation_digest":"sha256:c626a0d7da1105b339fcf18139253e084b55a54b09791fdb16fd5d9112ad431f","observation_id":"23c06a9f-cea7-417d-8a06-53492e61d630","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:7cc3b9d7f5b096bbd73d0edb7aeee79812082f7e25364bf6e86cd3be83a43c21","observation_id":"b9539934-7b00-4ba7-b8a8-243a28e219ed","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2604.15299","last_updated":"2026-04-16T17:57:08Z","snapshot_observed_at":"2026-07-06T23:02:53.677687Z","submitted_at":"2026-04-16T17:57:08Z","title":"AnimationBench: Are Video Models Good at Character-Centric Animation?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T11:47:27.131584Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2604.15299"},"observation_digest":"sha256:d1f923556cbb8b79aa31444f98e965a160d22a5d20a5f8fbe28451ef09516d1c","observation_id":"2549a6e4-658e-4178-9629-ab67c34c697e","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2604.15911","last_updated":"2026-04-17T10:11:39Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:11:39Z","title":"Efficient Video Diffusion Models: Advancements and Challenges","version":1},"reference_index":145,"source":"pdf_text","source_observed_at":"2026-05-10T08:28:29.706249Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2604.15911"},"observation_digest":"sha256:35a67356920c4747805eb16cc465b379d842cdd1a61516e94dd45ca65027d21a","observation_id":"dbfd3aa6-ccf0-4b84-a10c-9040a5ecd5e8","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2604.16503","last_updated":"2026-05-19T02:31:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T15:09:39Z","title":"Motif-Video 2B: Technical Report","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T15:50:04.001693Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2604.16503"},"observation_digest":"sha256:cd09af43231d3c34855cba8051b4ddb8abe80184e171299a2167d3aa376d28d7","observation_id":"cebacc3b-6b36-4b0b-b7e7-2feb1f3b4bb8","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2604.16503","last_updated":"2026-05-19T02:31:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T15:09:39Z","title":"Motif-Video 2B: Technical Report","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T00:12:23.096146Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2604.16503"},"observation_digest":"sha256:70e12bb00e7965bc37c6fbf3140d0cc4c0909822ebc71e69f51e2d67fc43148a","observation_id":"d8d1b169-a855-49c2-a604-3fdfd7e9485e","resolution":{"observed_at":"2026-05-21T00:13:53.056813Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2604.17673","last_updated":"2026-04-20T00:02:00Z","snapshot_observed_at":"2026-07-06T23:04:41.564912Z","submitted_at":"2026-04-20T00:02:00Z","title":"Grokking of Diffusion Models: Case Study on Modular Addition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T05:28:08.221886Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2604.17673"},"observation_digest":"sha256:ced8f8ed602d5258f67dd9dfcddc9ae33f2e3b8bc6d6badccede84b789a6d85c","observation_id":"2a7e5d68-3cbe-4502-a603-69b025ad4836","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2604.18047","last_updated":"2026-04-20T10:11:05Z","snapshot_observed_at":"2026-07-06T23:04:59.629739Z","submitted_at":"2026-04-20T10:11:05Z","title":"GS-STVSR: Ultra-Efficient Continuous Spatio-Temporal Video Super-Resolution via 2D Gaussian Splatting","version":1},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-05-10T04:46:39.643664Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2604.18047"},"observation_digest":"sha256:eae2f395ad3fd47fb31d4074171430f1d5bebed743073a3b603b0935f3440511","observation_id":"eba4af88-2a4d-4965-98be-67e626308349","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2604.19092","last_updated":"2026-05-14T07:32:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T05:09:56Z","title":"RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T03:02:26.084185Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2604.19092"},"observation_digest":"sha256:9741faad81ef476e516e880341d4a9dcf1a781b1c2db3e49fb82ed8cd8e969fd","observation_id":"8101dc12-79ce-4ad2-9ed3-8358d041fe1d","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2604.19092","last_updated":"2026-05-14T07:32:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T05:09:56Z","title":"RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T06:15:32.881140Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2604.19092"},"observation_digest":"sha256:85b4befdd85ed2e28f5ff235b63dc0c4ae0c727745aa1f450c1eb1592a383c6f","observation_id":"aea06abc-2a99-47b2-b350-2f0f81b4f5bb","resolution":{"observed_at":"2026-05-15T06:19:50.189549Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:1a8786f87f683b1dafde4b71f377601bde916be77c55a25aa80c240de8df2c76","observation_id":"06ff4caa-f75b-473e-bc92-ddbc2fb7deae","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2604.19679","last_updated":"2026-06-29T16:38:23Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T16:57:23Z","title":"MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T02:55:09.008954Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2604.19679"},"observation_digest":"sha256:1d0943b206f8c6ee829937dc6d170b7e9030abc2a9e02a0ef916cd91e6f42164","observation_id":"69810b9d-620a-4e03-94dd-99a7dd562332","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2604.20157","last_updated":"2026-04-22T03:51:19Z","snapshot_observed_at":"2026-07-06T23:06:40.154278Z","submitted_at":"2026-04-22T03:51:19Z","title":"HumanScore: Benchmarking Human Motions in Generated Videos","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T01:17:16.513512Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2604.20157"},"observation_digest":"sha256:429aa5cb9bd327c9cb9417f9ca3671c4815637356296f0a3c8512b6edb56979d","observation_id":"c7755a19-b87e-430a-8478-cf9a389f5ba3","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.02641","last_updated":"2026-05-04T14:26:33Z","snapshot_observed_at":"2026-07-06T23:15:41.793878Z","submitted_at":"2026-05-04T14:26:33Z","title":"Mamoda2.5: Enhancing Unified Multimodal Model with DiT-MoE","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T18:26:58.696936Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.02641"},"observation_digest":"sha256:e1e69d16b78b6dda34d1a390a7e04ca43e5a5faf72cd3dd7333b2779174364dc","observation_id":"14281051-45a9-478f-94e8-38d542af2b94","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:b817dbbf55c198566c293a2477334d18d6b9d2f1ea6acd5318ef75e6fde06885","observation_id":"a9579c60-9668-48c0-b4a7-66cbc4e9aa29","resolution":{"observed_at":"2026-07-01T00:25:09.391588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.06356","last_updated":"2026-05-09T12:33:33Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:34:23Z","title":"SwiftI2V: Efficient High-Resolution Image-to-Video Generation via Conditional Segment-wise Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T13:28:05.540719Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.06356"},"observation_digest":"sha256:02a80cd1b8cd9a9481700c21d3b81e2bd3693c97917e55306d41cb14cfeb32e9","observation_id":"38408528-28da-4693-9509-d3f009e5d03a","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.06356","last_updated":"2026-05-09T12:33:33Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:34:23Z","title":"SwiftI2V: Efficient High-Resolution Image-to-Video Generation via Conditional Segment-wise Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T01:50:30.588220Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.06356"},"observation_digest":"sha256:caffd4a3f2fecb286c55dd134ad4393942748317eafd057485a13d451042b84b","observation_id":"bb43f715-51cf-4357-aea3-39246c09534e","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.06512","last_updated":"2026-05-07T16:22:21Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T16:22:21Z","title":"DCR: Counterfactual Attractor Guidance for Rare Compositional Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T13:06:56.964670Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.06512"},"observation_digest":"sha256:b8eca81f517e9a2a81b938453a2f6cbbfadfab98af197437bd25054fedd4812b","observation_id":"db06403d-836f-438b-8591-fb889395c645","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.07800","last_updated":"2026-06-09T17:19:58Z","snapshot_observed_at":"2026-07-06T23:20:06.574823Z","submitted_at":"2026-05-08T14:36:32Z","title":"SARA: Semantically Adaptive Relational Alignment for Video Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T02:21:52.861714Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.07800"},"observation_digest":"sha256:d9d109c21fc3d1645f7dcd056d2a1bfc03bdac882e00ba5bf5ff40d2a7854efc","observation_id":"03ebb172-73e1-4737-a43b-41d0ead91a9f","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.07800","last_updated":"2026-06-09T17:19:58Z","snapshot_observed_at":"2026-07-06T23:20:06.574823Z","submitted_at":"2026-05-08T14:36:32Z","title":"SARA: Semantically Adaptive Relational Alignment for Video Diffusion Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T23:13:31.195562Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.07800"},"observation_digest":"sha256:0dd991e455957ca4c0e46cfd24200f3f3e213c0a3be1ee01afb01c61d5c1d2de","observation_id":"0324c496-34fd-4377-94d0-8098f2cc8e37","resolution":{"observed_at":"2026-06-30T23:15:07.981524Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.12271","last_updated":"2026-05-26T13:34:33Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:35:34Z","title":"Beyond Text Prompts: Visual-to-Visual Generation as A Unified Paradigm","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T06:02:39.114660Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.12271"},"observation_digest":"sha256:55e0cca0869c6afeb3cd895882adbb63d8afc76c75c0a1ebec2cc318aec7719a","observation_id":"05854b68-a6f5-4c83-90d4-ebf0765c6b90","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.12271","last_updated":"2026-05-26T13:34:33Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:35:34Z","title":"Beyond Text Prompts: Visual-to-Visual Generation as A Unified Paradigm","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T22:18:55.933311Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.12271"},"observation_digest":"sha256:d4149d27ada021afdb929b7ad806713f614bf39dc0368c8483fd05253ecc04e2","observation_id":"7378e38a-87a4-4805-80b1-215eec5cfcbb","resolution":{"observed_at":"2026-07-01T14:05:46.675275Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.13565","last_updated":"2026-05-13T14:04:56Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T14:04:56Z","title":"Qwen-Image-VAE-2.0 Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T19:53:25.849049Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.13565"},"observation_digest":"sha256:bf406aac5f951b43a45f6d32aa2352da012ae43debf9c7ad904cc3a9d2b1bdd8","observation_id":"7a749445-6ff2-4355-a954-171b4f1d4dc4","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.14382","last_updated":"2026-06-29T03:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T05:06:57Z","title":"Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:14.874049Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.14382"},"observation_digest":"sha256:383aea8f35b41570f1017be0ef568fdc40db9a584db5b275122620e9bc6109d2","observation_id":"116f539c-be3c-430f-8b23-5da29894b766","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.14382","last_updated":"2026-06-29T03:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T05:06:57Z","title":"Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T21:54:33.902256Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.14382"},"observation_digest":"sha256:fc10f910ca9556a273a08970d345bc07312e5c4b955ebc5a7cca713120033815","observation_id":"4e8a8b6e-85d7-4865-878c-2cf9b72ee414","resolution":{"observed_at":"2026-05-20T21:59:06.473511Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.14382","last_updated":"2026-06-29T03:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T05:06:57Z","title":"Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T09:12:35.777810Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.14382"},"observation_digest":"sha256:66f34e67ab2af600b6d82614b228b774b6af7ee4f687ce4c558cec5c11ce4b74","observation_id":"4180eef5-2db7-4a8a-9a1a-52276d6857a5","resolution":{"observed_at":"2026-05-21T09:14:05.603127Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.14382","last_updated":"2026-06-29T03:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T05:06:57Z","title":"Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T21:44:21.427570Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.14382"},"observation_digest":"sha256:2e21dc5d0e50234e3849485cc902220817b06575beadc435681be9bb69bed208","observation_id":"35981e8a-d7a5-4290-b0e2-875d5b4c2c69","resolution":{"observed_at":"2026-06-30T21:45:05.487201Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.15190","last_updated":"2026-05-14T17:59:30Z","snapshot_observed_at":"2026-07-06T23:26:32.979566Z","submitted_at":"2026-05-14T17:59:30Z","title":"RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T20:38:28.328436Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.15190"},"observation_digest":"sha256:bceee17938e8ba7f359aedf06e842ec1cfc27b7399b3228075204e99f4b1f083","observation_id":"731143ad-0172-4744-a0c9-9f6aa2021052","resolution":{"observed_at":"2026-07-01T14:35:47.239870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.15458","last_updated":"2026-05-14T22:40:56Z","snapshot_observed_at":"2026-07-06T23:26:46.595393Z","submitted_at":"2026-05-14T22:40:56Z","title":"Video Models Can Reason with Verifiable Rewards","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T15:03:14.894952Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.15458"},"observation_digest":"sha256:6dd100fe88f224ff5b01741b8bc7028624de5f46c6b1d40d9ac54296257d4fc3","observation_id":"533edb80-44f4-4873-b739-37ecd2602d54","resolution":{"observed_at":"2026-05-19T15:07:37.149746Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.15964","last_updated":"2026-05-15T13:55:39Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T13:55:39Z","title":"WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T17:47:32.953903Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.15964"},"observation_digest":"sha256:43eb97c0c28846c103b7a6a3624f42fba5b29920ba18e21c538f95ab1023408e","observation_id":"20a04c84-8abd-4f68-aa9c-21c6a07dd67b","resolution":{"observed_at":"2026-05-20T17:48:48.678477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.15980","last_updated":"2026-06-16T09:11:40Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:13:39Z","title":"Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T18:28:06.253200Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.15980"},"observation_digest":"sha256:39e0fc094552dcd6bef8d6ea1173a18feb605b526897723b90e76de8bff51844","observation_id":"9c94c22f-7410-44c9-9f72-acc05bc989a6","resolution":{"observed_at":"2026-05-20T18:28:52.886558Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.15980","last_updated":"2026-06-16T09:11:40Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:13:39Z","title":"Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T19:37:18.563704Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.15980"},"observation_digest":"sha256:668aaf443bfb29801766dfb13201ebd2481dd53bc295bdadf5a2a6d6ec35d840","observation_id":"4335b79f-d33f-41f7-82b7-546c41e35a2b","resolution":{"observed_at":"2026-06-30T19:45:00.993154Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.16649","last_updated":"2026-05-15T21:39:46Z","snapshot_observed_at":"2026-07-06T23:27:48.303599Z","submitted_at":"2026-05-15T21:39:46Z","title":"AtlasVid: Efficient Ultra-High-Resolution Long Video Generation via Decoupled Global-Local Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T18:26:57.735246Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.16649"},"observation_digest":"sha256:215075a77ee89575c3e5f2df39a2e0a76961fd6edde1c78a9629a3401a8e7804","observation_id":"e5c4828c-7aaf-4598-b6b4-797770656d9a","resolution":{"observed_at":"2026-05-20T18:28:53.048976Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.17423","last_updated":"2026-05-17T12:38:21Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T12:38:21Z","title":"Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T13:15:54.413960Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.17423"},"observation_digest":"sha256:871953ddffe0e47c48bc9483aecdb067e67f44a10722f51052278449438eade1","observation_id":"3790b864-45ec-45d6-9c9a-6e2571fc5b43","resolution":{"observed_at":"2026-05-20T13:18:18.296922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.18346","last_updated":"2026-05-18T12:58:13Z","snapshot_observed_at":"2026-07-06T23:29:14.916114Z","submitted_at":"2026-05-18T12:58:13Z","title":"Focused Forcing: Content-Aware Per-Frame KV Selection for Efficient Autoregressive Video Diffusion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T11:19:21.721494Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.18346"},"observation_digest":"sha256:391f0a52563dc4c3cf802a472a9b1309fcf42306dac54dc2d43265b45b128d7a","observation_id":"42345b3c-f0ed-406d-9511-7115948825bd","resolution":{"observed_at":"2026-05-20T11:23:14.172519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":1},"reference_index":122,"source":"pdf_text","source_observed_at":"2026-05-20T11:46:52.658984Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:4640d894a7371dff904b9639e0844b4f881f880b7dd41188fd11d69b71847e8d","observation_id":"f0377d96-986e-4d56-8eaa-8b19bde9ce0e","resolution":{"observed_at":"2026-05-20T11:48:14.793795Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:1c638d26d6110e96268cdf356fbf2d6f113952b0b319f14e14d25a5d5b7a0eec","observation_id":"0d136636-b823-402b-817a-141c3379105c","resolution":{"observed_at":"2026-05-21T07:59:50.493452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.19398","last_updated":"2026-06-03T07:04:53Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:50:24Z","title":"Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T05:57:44.096941Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.19398"},"observation_digest":"sha256:1a3e0f083b9368df1d6051ebb032bb69934d85192085dd9a3e52089e30bf7fc7","observation_id":"d55ed59d-2b9f-486a-b9dd-11f512311cee","resolution":{"observed_at":"2026-05-20T05:58:04.987325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.19398","last_updated":"2026-06-03T07:04:53Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:50:24Z","title":"Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T07:55:40.616049Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.19398"},"observation_digest":"sha256:0840259bcd937b961f3088ecea219fba7697de62c35c730ba001c4bd0b5da923","observation_id":"c2d581a7-e343-40c7-b4c4-00abce1b1f0c","resolution":{"observed_at":"2026-05-21T07:59:50.816126Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.19398","last_updated":"2026-06-03T07:04:53Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:50:24Z","title":"Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T18:33:44.480873Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.19398"},"observation_digest":"sha256:6384ef768da8d7cd40a3b6ba5030b65522c0fa9859d259398387ffa23f1893f1","observation_id":"7d702089-65c2-43e6-a76a-6ac12c768e73","resolution":{"observed_at":"2026-06-30T18:35:00.134242Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.21042","last_updated":"2026-05-20T11:24:02Z","snapshot_observed_at":"2026-07-06T23:31:32.577242Z","submitted_at":"2026-05-20T11:24:02Z","title":"Dynamic Video Generation: Shaping Video Generation Across Time and Space","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T05:42:41.925474Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.21042"},"observation_digest":"sha256:67a4718ee30cf05e008437e95553609097c62270c549de2cfe3a401027a28364","observation_id":"11860ab0-da1c-4fc4-b38f-776e703622a9","resolution":{"observed_at":"2026-05-21T05:43:58.833433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.21072","last_updated":"2026-05-20T11:58:30Z","snapshot_observed_at":"2026-07-06T23:31:32.577242Z","submitted_at":"2026-05-20T11:58:30Z","title":"Q-ARVD: Quantizing Autoregressive Video Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T05:29:04.061943Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.21072"},"observation_digest":"sha256:c0b289024e3b9e5d7d1c7a90b37c2b6c583b2d3c80b8f5dd1777eeca768072d2","observation_id":"a7a83167-a7b5-4fea-8bc1-4c19df01d55f","resolution":{"observed_at":"2026-05-21T05:29:39.498841Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.23891","last_updated":"2026-05-22T17:54:54Z","snapshot_observed_at":"2026-07-06T23:34:03.934151Z","submitted_at":"2026-05-22T17:54:54Z","title":"Smart-Insertion-V: Photorealistic Video Insertion via a Closed-Loop Feedback Dual-Stream Framework","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-25T04:30:20.593882Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.23891"},"observation_digest":"sha256:fa8e4614ea3a42e9921beeceddf37e0e30157acbd3017882cba4fdb7b77030e1","observation_id":"cadac9a3-cb6d-4ad6-bf7b-8cd27e5ed40f","resolution":{"observed_at":"2026-05-25T04:35:21.950304Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:0a033f606c51f0e40416b0286961faebca6790241bcc5bed42c40b6c013ed039","observation_id":"92a5747c-166e-44e6-8b77-cfdf55f6c109","resolution":{"observed_at":"2026-06-29T23:04:01.962319Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.25801","last_updated":"2026-05-25T12:50:49Z","snapshot_observed_at":"2026-07-06T23:35:41.527169Z","submitted_at":"2026-05-25T12:50:49Z","title":"PixelWizard: Towards Efficient High-Fidelity Video Generation at Ultra-Large Spatial Resolution","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T22:24:50.679950Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.25801"},"observation_digest":"sha256:3027bc04aac7d3f18afa3379b5f622836db34d2349c73f209476315fc3e0bf7d","observation_id":"fd5da662-09d6-472c-bc06-3e42efb75423","resolution":{"observed_at":"2026-06-29T22:34:02.336354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-07-06T23:36:06.135765Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:9c1df5a17e876decf43394311d5663f7bd266c80f96547aa90de0b2846ba5310","observation_id":"9053dbd1-5cce-43c2-936a-35aa59f5743c","resolution":{"observed_at":"2026-06-29T22:54:00.770105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.27589","last_updated":"2026-05-26T19:02:26Z","snapshot_observed_at":"2026-07-06T23:37:16.981482Z","submitted_at":"2026-05-26T19:02:26Z","title":"What-If World: A Causal Benchmark for General World Models in Embodied Scenarios","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:22.987086Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.27589"},"observation_digest":"sha256:a368cd47dcfbe437d57fd7d16f7fba543e2cc4d0f17117a25b69110382bfdaf1","observation_id":"02e07769-2bae-43ab-9b93-72549519475a","resolution":{"observed_at":"2026-06-29T18:23:50.370134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.28230","last_updated":"2026-05-27T09:44:18Z","snapshot_observed_at":"2026-07-06T23:37:50.157617Z","submitted_at":"2026-05-27T09:44:18Z","title":"Proprio: Latent Self-Scoring and Inference-Time Refinement for Physically Plausible Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T12:55:24.689338Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.28230"},"observation_digest":"sha256:7b22dcd754c1b316f19d280dea5f569389b803b71009f856fd5b7c0e5ee44525","observation_id":"439620f1-8ac6-4676-949b-d140e014f53d","resolution":{"observed_at":"2026-06-29T13:03:26.614749Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.28691","last_updated":"2026-05-27T16:19:45Z","snapshot_observed_at":"2026-07-06T23:38:14.056361Z","submitted_at":"2026-05-27T16:19:45Z","title":"OSP-Next: Efficient High-Quality Video Generation with Sparse Sequence Parallelism, HiF8 Quantization, and Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T13:06:02.201607Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.28691"},"observation_digest":"sha256:049f2e03b308dc49bc994d07896109d2e6a185b91686b77e5b95ba59272d3915","observation_id":"cefbdf58-6d8b-4293-aa95-26680fe87449","resolution":{"observed_at":"2026-06-29T13:13:27.511276Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.30083","last_updated":"2026-05-28T15:30:04Z","snapshot_observed_at":"2026-07-06T23:39:24.682426Z","submitted_at":"2026-05-28T15:30:04Z","title":"Future Forcing: Future-aware Training-free KV Cache Policy for Autoregressive Video Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-29T08:30:00.438334Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.30083"},"observation_digest":"sha256:9ff8c8eeb4b7f2bfa9dfdc4250ea24ad261caa87da4bf0fad3bece391f80f7ed","observation_id":"893374a4-eee2-4e68-b34c-4b7a94016c6a","resolution":{"observed_at":"2026-06-29T08:33:15.209905Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.30116","last_updated":"2026-07-22T15:41:46Z","snapshot_observed_at":"2026-07-25T23:21:30.548098Z","submitted_at":"2026-05-28T15:50:55Z","title":"SGMD: Score Gradient Matching Distillation for Few-Step Video Diffusion Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T08:16:26.055531Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.30116"},"observation_digest":"sha256:388c56e69252a2f89d5f4460efc137296fcaf3ce0b512a26240a466f82e296c8","observation_id":"9eb56e12-8f3e-4051-bb77-598ad2a43bca","resolution":{"observed_at":"2026-06-29T08:23:15.593683Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.30325","last_updated":"2026-05-28T17:57:07Z","snapshot_observed_at":"2026-07-06T23:39:38.845840Z","submitted_at":"2026-05-28T17:57:07Z","title":"Veda: Scalable Video Diffusion via Distilled Sparse Attention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T07:54:13.390911Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.30325"},"observation_digest":"sha256:5d5785ecc1448a08e4cbcc3999ff321184920e5530c3edf91466a1f12b13bbd1","observation_id":"a3309dd5-dde4-48af-8b5b-c94f2b2e4eca","resolution":{"observed_at":"2026-06-29T08:03:14.684920Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.00499","last_updated":"2026-05-30T03:13:00Z","snapshot_observed_at":"2026-07-06T23:41:10.825760Z","submitted_at":"2026-05-30T03:13:00Z","title":"OptiWorld: Optimal Control for Video World Generation under Physical Constraints","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-28T19:02:51.848742Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.00499"},"observation_digest":"sha256:b4bc6ca4ed1dfb0d3b6dd2beebc1e033a64bc18d3b528bc7f2b0982a4b0402dc","observation_id":"bd9a3eb0-f8fc-451d-be40-fe037314d86e","resolution":{"observed_at":"2026-06-28T19:32:35.501898Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-07-06T23:41:48.357871Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:d7d1740c50659b245c1a1f997b7a9bc7b14f0378fcc9c7a8aa8c2c13b1968279","observation_id":"3687c8b7-7fb8-4512-b102-88a8532d02cb","resolution":{"observed_at":"2026-07-01T21:16:14.921309Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.01285","last_updated":"2026-05-31T15:11:07Z","snapshot_observed_at":"2026-07-06T23:41:53.635605Z","submitted_at":"2026-05-31T15:11:07Z","title":"Knowledge-Intensive Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T17:33:07.941924Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.01285"},"observation_digest":"sha256:645255b8c013978ee8d6986c6d5495e594be7108b9481273cd64367417b595ee","observation_id":"3994fd89-0ad8-410d-a5e0-b3a34d81fb3c","resolution":{"observed_at":"2026-07-01T21:06:13.328812Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.01636","last_updated":"2026-06-01T03:41:04Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T03:41:04Z","title":"Pave-GRPO: Beyond Instantaneous Guidance through Principled Average Velocity Decomposition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T15:33:30.182150Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.01636"},"observation_digest":"sha256:2f816c63c70a2c1bd6c142fe6b25790566cbe191c06d3f75e11f28a923065e34","observation_id":"85443a78-47eb-44f9-976d-5ebfaaff036d","resolution":{"observed_at":"2026-07-01T22:16:16.541461Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.02111","last_updated":"2026-06-01T11:43:53Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T11:43:53Z","title":"Jailbreaking Multimodal Large Language Models using Multi-Clip Video","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T15:16:48.957645Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.02111"},"observation_digest":"sha256:5936550bdc9e03c5f9a4c9b9ea3c4558bcfff6872ae1fd46fd3a6a0884ccd23a","observation_id":"44c5b63b-14a6-490a-b656-14428afb31ea","resolution":{"observed_at":"2026-07-01T22:36:17.110021Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.02441","last_updated":"2026-06-01T16:12:18Z","snapshot_observed_at":"2026-07-06T23:42:49.173711Z","submitted_at":"2026-06-01T16:12:18Z","title":"Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T15:25:22.778550Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.02441"},"observation_digest":"sha256:30e6c42d0c481fbb9ab267feec04d3b9e26839ae174c5a7f22d8aa5d96169a72","observation_id":"aebb9130-59e5-41ee-b521-7724d831771f","resolution":{"observed_at":"2026-07-01T22:26:17.455204Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.02564","last_updated":"2026-06-27T07:03:15Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:54:26Z","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-28T15:26:21.284810Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.02564"},"observation_digest":"sha256:690ff458a4d621a0e900fa27710514d169983e4e0b8cb1ef18d08f2200b0835b","observation_id":"cbe2bc01-c21a-40de-8179-12492ca3b449","resolution":{"observed_at":"2026-07-01T22:26:17.284174Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.02564","last_updated":"2026-06-27T07:03:15Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:54:26Z","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-30T10:38:22.619277Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.02564"},"observation_digest":"sha256:32f133a3153c357974711321f959220e4bf3523b8bbe27c67c3f49fd0d35134b","observation_id":"f089b9a7-c3f6-4acc-9969-812f1bfda836","resolution":{"observed_at":"2026-06-30T10:44:36.863984Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.06828","last_updated":"2026-06-05T02:07:08Z","snapshot_observed_at":"2026-07-06T23:46:33.376471Z","submitted_at":"2026-06-05T02:07:08Z","title":"AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T22:54:21.740892Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.06828"},"observation_digest":"sha256:4c2f9c44a9a8f5324dae3dd36fd9d874301ea78896062815ddc189778f15583b","observation_id":"f41710e2-ee9a-4359-b726-735e5a8ec7e7","resolution":{"observed_at":"2026-07-02T16:17:08.919704Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.09150","last_updated":"2026-06-08T07:45:03Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T07:45:03Z","title":"Ultra Flash: Scaling Real-Time Streaming Video Generation to High Resolutions","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-27T17:07:57.743780Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.09150"},"observation_digest":"sha256:3f88d33da898279f7e129b3c24f3b67f1846c1c119119994639e331e530c1991","observation_id":"18a90366-213c-4a09-9293-5ecc600e4f47","resolution":{"observed_at":"2026-07-03T00:37:29.763218Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.09639","last_updated":"2026-06-11T05:58:22Z","snapshot_observed_at":"2026-07-06T23:48:58.206424Z","submitted_at":"2026-06-08T15:35:51Z","title":"CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-27T17:30:25.371658Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.09639"},"observation_digest":"sha256:a6ab3b9d937ffb37ac50cad7a7f33721054767ce004dae9d812d6c134e2c9582","observation_id":"1a5c88ee-4b45-416b-8bc4-aa873ba680dd","resolution":{"observed_at":"2026-07-03T00:07:28.081103Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.11969","last_updated":"2026-06-10T11:49:54Z","snapshot_observed_at":"2026-07-06T23:50:58.297354Z","submitted_at":"2026-06-10T11:49:54Z","title":"SpecLoR: Spectral Lookahead Rectification for Motion-Coherent Text-to-Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T10:00:35.608696Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.11969"},"observation_digest":"sha256:f44e950aa9073dc60ef01b9c19b0c0a3c5b6fe4bb815de37572f0e949dd2db49","observation_id":"cfb34154-509c-417f-9c85-875e4035cc33","resolution":{"observed_at":"2026-07-03T10:27:56.760937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.12072","last_updated":"2026-06-10T13:40:19Z","snapshot_observed_at":"2026-07-06T23:51:02.805629Z","submitted_at":"2026-06-10T13:40:19Z","title":"World Model Self-Distillation: Training World Models to Solve General Tasks","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T10:16:35.511426Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.12072"},"observation_digest":"sha256:4faaaaf4d7f206dcde7497ecdcdc10a5b951ebac11af37c37169fed9a9aafec9","observation_id":"5f945e09-2b15-422a-8d1b-65c8d98dcf10","resolution":{"observed_at":"2026-07-03T10:07:55.835992Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.17257","last_updated":"2026-06-15T20:03:09Z","snapshot_observed_at":"2026-07-06T23:52:52.701429Z","submitted_at":"2026-06-15T20:03:09Z","title":"Pulling The REINS: Training-Free Safety Alignment of Video Diffusion Models via Representation Steering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T03:44:36.071488Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.17257"},"observation_digest":"sha256:2667c7f6f69cd33139400e7cde5e09616f8f68baa9f608111dd98f2af23113c8","observation_id":"04453cd5-5eb9-4505-adda-7c43a1c49891","resolution":{"observed_at":"2026-07-03T17:48:45.908421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:375b91b5429f8fcb015476a889b232d594c284081abea8d092cf84491d4bf950","observation_id":"a1900dbd-2862-4953-90ca-7f747d6346cb","resolution":{"observed_at":"2026-07-03T20:48:55.745718Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.19889","last_updated":"2026-06-18T07:47:28Z","snapshot_observed_at":"2026-07-06T23:55:05.932014Z","submitted_at":"2026-06-18T07:47:28Z","title":"SurgVista: Long-Horizon Surgical World Modeling with Plausible Instrument-Tissue Dynamics","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T18:09:48.872541Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.19889"},"observation_digest":"sha256:1591f1a09bd312a79fffdc900047378efc862a69103be23915dae5767ebacaee","observation_id":"04000111-bb93-476d-8c54-cb4a4d5a7549","resolution":{"observed_at":"2026-07-04T03:19:31.471412Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.21572","last_updated":"2026-06-19T16:14:12Z","snapshot_observed_at":"2026-07-06T23:56:31.454439Z","submitted_at":"2026-06-19T16:14:12Z","title":"Robot Critics that Sweat the Small Stuff","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-26T14:20:37.905355Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.21572"},"observation_digest":"sha256:a18cd2798675fc2d9a2c14ba75920881276f9337c8ca0e82eba055cce7927126","observation_id":"4325faab-2047-45b1-88ca-6603811d1f2d","resolution":{"observed_at":"2026-07-04T06:39:37.252551Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.23105","last_updated":"2026-06-22T09:46:36Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T09:46:36Z","title":"Compression and Retrieval: Implicit Memory Retrieval for Video World Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T08:46:28.619102Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.23105"},"observation_digest":"sha256:c723ded12a2bff26a17555eb956d3040252b90b485dc3149643cf95fad15c961","observation_id":"e9abb76b-3fa6-484b-8efb-32d7f8269478","resolution":{"observed_at":"2026-07-04T10:29:45.459303Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.23743","last_updated":"2026-06-24T14:59:15Z","snapshot_observed_at":"2026-07-06T23:58:25.400508Z","submitted_at":"2026-06-21T17:23:20Z","title":"Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T11:05:44.972128Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.23743"},"observation_digest":"sha256:5e7bf0c6cac57f98204b3a9750a50dea9dd3169f5f202e3cffdb152e6c3696b7","observation_id":"d5299c41-1b7d-466b-90a6-c55cc07675be","resolution":{"observed_at":"2026-07-04T08:49:41.553281Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.24829","last_updated":"2026-06-23T17:12:21Z","snapshot_observed_at":"2026-07-06T23:59:23.407216Z","submitted_at":"2026-06-23T17:12:21Z","title":"GeoT2V-Bench: Benchmarking 3D Consistency in Text-to-Video Models via 3D Reconstruction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T00:28:33.734545Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.24829"},"observation_digest":"sha256:9d9f84b0de6a944d0af21971550fc6a4b661e6cf9500df499cacb1d5fedcef0f","observation_id":"982f6187-0bcc-4bdf-830e-0630c0ffa1a8","resolution":{"observed_at":"2026-07-04T16:39:57.134619Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.28128","last_updated":"2026-06-26T14:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-26T14:30:18Z","title":"PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T04:34:38.286863Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.28128"},"observation_digest":"sha256:9702254a62765b71c236973ed1ee7d9259d6f25648748146a0e35574cbe7fffe","observation_id":"555ea8b6-a318-4410-ac26-1b030a4e1c37","resolution":{"observed_at":"2026-06-29T20:03:56.901700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.29473","last_updated":"2026-07-13T12:28:13Z","snapshot_observed_at":"2026-07-16T23:19:38.740232Z","submitted_at":"2026-06-28T16:01:04Z","title":"MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-30T07:18:20.501369Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.29473"},"observation_digest":"sha256:e4929f043bec8172b39d0e8442d1bd090757a3e44e2e084d07c74d8c89d163ca","observation_id":"7385868b-901f-4737-9c47-64d2a2bce09d","resolution":{"observed_at":"2026-06-30T07:24:21.605409Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-14T17:03:01.432145Z","title":"arXiv preprint arXiv:2511.18870 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29473","last_updated":"2026-07-13T12:28:13Z","snapshot_observed_at":"2026-07-16T23:19:38.740232Z","submitted_at":"2026-06-28T16:01:04Z","title":"MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-14T17:03:01.432145Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.29473"},"observation_digest":"sha256:ba727ec4359368ed80c22159ce55e035ef0f8c50c928c0fa7cee4e9815b45fc1","observation_id":"77cf3235-a7e9-4882-86ed-331e5a8d681b","resolution":{"observed_at":"2026-07-14T17:03:01.432145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Hunyuanvideo 1.5 technical report.arXiv preprint arXiv:2511.18870,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-07-12T01:59:48.109164Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:be2a736db073b8b3c6fe95918c7fd60400598e67eadfa3ae9cde395cb17f95db","observation_id":"ab8d08a0-d781-4073-a655-4e8c70149b23","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-11T22:42:31.529313Z","title":"Hunyuanvideo 1.5 technical report.arXiv preprint arXiv:2511.18870, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03964","last_updated":"2026-07-04T17:45:38Z","snapshot_observed_at":"2026-07-11T22:42:30.176180Z","submitted_at":"2026-07-04T17:45:38Z","title":"Worldscape-MoE: A Unified Mixture-of-Experts World Model for Scalable Heterogeneous Action Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T22:42:31.529313Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2607.03964"},"observation_digest":"sha256:72e16c916b284c19f9f1cc6c41d24eb5d30ea2d38c1f409085fff1d5e983a8a0","observation_id":"713685f0-0768-4bc2-abdd-126c5f9b0bb2","resolution":{"observed_at":"2026-07-11T22:42:31.529313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-07-11T23:20:19.799297Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:3efcb82cba485ff79f983e83e2c9ea02077d4334ce05158f9aa389bca91ac838","observation_id":"92dec690-f942-4ca3-bad2-b96f9f3fe8bc","resolution":{"observed_at":"2026-07-09T03:05:55.325480Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-07-12T23:18:59.792543Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:11fe3bad1a268e2bf36c967cf1afae9658c6a70e264f42d95cc56f5557ac481f","observation_id":"c0047a30-0832-4b0f-8df6-e7a5a46116af","resolution":{"observed_at":"2026-07-10T01:46:40.933515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-13T01:59:43.167178Z","title":"arXiv preprint arXiv:2511.18870 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09581","last_updated":"2026-07-17T08:46:32Z","snapshot_observed_at":"2026-07-22T23:19:15.046858Z","submitted_at":"2026-07-10T16:30:29Z","title":"Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T01:59:43.167178Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2607.09581"},"observation_digest":"sha256:cf27cc09487444e3f8478f129762da59dd4e933186af4fcd8fa9f2feb4af7783","observation_id":"ca15b249-4a57-4b0a-98c4-1f7588e0ada2","resolution":{"observed_at":"2026-07-13T01:59:43.167178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-14T15:10:13.757131Z","title":"arXiv preprint arXiv:2511.18870 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09581","last_updated":"2026-07-17T08:46:32Z","snapshot_observed_at":"2026-07-22T23:19:15.046858Z","submitted_at":"2026-07-10T16:30:29Z","title":"Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T15:10:13.757131Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2607.09581"},"observation_digest":"sha256:570fe4d4f296a01add7427e36308b8d3d66b39da7816c7a732e9b7dab337138a","observation_id":"94f7c0cc-586d-470f-b013-4de1c34a86af","resolution":{"observed_at":"2026-07-14T15:10:13.757131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.18870/citation-record","integrity":"/paper/2511.18870/integrity","json":"/paper/2511.18870/citation-record.json","paper":"/paper/2511.18870"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kling 2.5 turbo","venue":null,"work_id":"9ae2d3cd-8371-44d1-80ca-132a95e1c9e6","year":2025},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:a6d1f3bde5ea96c9624debc1009aeeb2cb9a00708cb151fbbdfeb54bef84faeb","observation_id":"abbb5b02-510e-438a-a4ef-898e49fa6929","resolution":{"observed_at":"2026-05-15T02:31:35.099816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Veo 3.1.https://deepmind.google/technologies/veo/","venue":null,"work_id":"f9cff5d1-11c7-4d3f-b828-e6191b2a8fb8","year":2025},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:89dfb36d92a2b06c54104f9dd8b7d07520457c99c1bb0e4b6e3e478710d29fe9","observation_id":"ca220547-9405-4cdc-8e26-0a2721c40d37","resolution":{"observed_at":"2026-05-15T02:31:35.104706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sora 2.https://openai.com/sora","venue":null,"work_id":"6637c1d2-6ab4-4033-8851-f02ca9f82247","year":2025},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:f9947a0077e6d4328e05c55f7cf9d12c274a681d93e8bc4222850023acb0a5be","observation_id":"b813c304-dc66-4bef-b07f-db5b610e8e5f","resolution":{"observed_at":"2026-05-15T02:31:35.107218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-07-11T01:07:45.135143Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:a58d2f61bdb845da36cc2f5984eaecbe68f5147904f7613b6d58abc251c10cef","observation_id":"2822162d-e4c3-4759-a83f-4f402d5bb595","resolution":{"observed_at":"2026-05-15T02:31:35.082213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:4663285566af71eafcfad49baa280bfe7624157ebc3264af52116ea9aa97c151","observation_id":"e52145d8-551f-44ff-963f-decce4ea2148","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:26c7cd5b1bd511fdd21f85104dbe906248cece027bc3f5f9cd75114f242bc9b7","observation_id":"7ceba260-f889-4af7-9865-9bdaa8037902","resolution":{"observed_at":"2026-05-15T02:31:35.094328Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-07-06T18:44:53.587276Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"cited_work":{"arxiv_id":"2407.08608","doi":"10.48550/arxiv.2407.08608","metadata_source":"pith","pith_arxiv_id":"2407.08608","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","venue":"cs.LG","work_id":"12a0982c-8c36-42c7-88e1-4a8bfb2aa44d","year":2024},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"cited_paper":"/paper/2407.08608","citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:4a747a58f818f4a3f82a0e37a69c5494f6d624c2015163fe85176a493975f8a2","observation_id":"0f1a2b6a-3f42-4e8a-9a11-91018c7f07c5","resolution":{"observed_at":"2026-05-20T19:45:36.571697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":"2507.20534","doi":"10.1145/3448609","metadata_source":"pith","pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Kimi K2: Open Agentic Intelligence","venue":"cs.LG","work_id":"7f18284c-12d3-4137-bea1-1da97e8cf3c1","year":2025},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:95d43e6bb177439d5632ca58ad0dc1d23f2c678db812837d4ecc6c155942f7b7","observation_id":"4a51cd60-77dc-4f30-bc7d-bfa46a4f0e87","resolution":{"observed_at":"2026-05-15T02:31:35.074047Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23951","last_updated":"2026-06-26T07:53:46Z","snapshot_observed_at":"2026-07-06T22:31:00.843452Z","submitted_at":"2025-09-28T16:14:10Z","title":"HunyuanImage 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.23951","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.23951","snapshot_observed_at":"2026-07-04T16:59:57.981208Z","title":"HunyuanImage 3.0 Technical Report","venue":"cs.CV","work_id":"36511e33-8360-43dd-9407-dddf867c1d7c","year":2025},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"cited_paper":"/paper/2509.23951","citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:6209f6171ad275bbd0851bde242bfc9d6eb1ea53f0ba30a769acf37402d3d281","observation_id":"b5cc9bd6-3b26-44b8-9c17-2fe92737ee70","resolution":{"observed_at":"2026-05-16T02:02:32.945705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pyscenedetect: A python library for video scene detection","venue":null,"work_id":"3d0cb9e0-6077-4371-b9af-6bb6948a2ebd","year":2020},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:7e9a7e2ac9c139302e68f29a0879ea417ee8c9307d8d6884ef9edbe45e163c76","observation_id":"c6dc4143-9cdb-4a32-ba40-18121d295eb3","resolution":{"observed_at":"2026-05-15T02:31:35.109670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives","venue":null,"work_id":"dd60dfe3-695f-4416-a7e3-69dc2e8386d0","year":2023},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:e5cd01509f0b9d832f6db5325bb545453414f7aa0c7db93c9404a6f2c9a3f703","observation_id":"da1cfeba-56a3-4515-8532-c9121ddf667d","resolution":{"observed_at":"2026-05-15T02:31:35.112196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating hallucina- tions in large vision-language models via dpo: On-policy data hold the key","venue":null,"work_id":"3454b8d0-2691-4055-b81e-230fb5f605a3","year":2025},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:3fb66c212f0282ceec8652da57b5bf60f6923949a72dbb3cc3090b525b6cc155","observation_id":"e679c718-595f-438a-9d05-a23ab068ce7a","resolution":{"observed_at":"2026-05-15T02:31:35.114927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:13:49.537511Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":"8cce8101-1a0a-4da5-a8d4-8b72b9d0c60f","year":null},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:28f189f52050257f39591d2195ee7cc020188eff96565f30ee1586b3f96627e2","observation_id":"d0078e77-e31e-4181-b3f8-9357aed782e5","resolution":{"observed_at":"2026-05-15T02:31:35.117579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-11T01:17:45.013705Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:17da3c7dbab70211b710f897b139c5ab48c24089e384049f7726fef4d3c692bf","observation_id":"ca0c21a5-5328-43db-919d-1a6f8851cd57","resolution":{"observed_at":"2026-05-15T02:31:35.061741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09622","last_updated":"2024-07-12T16:39:31Z","snapshot_observed_at":"2026-07-06T17:44:45.924645Z","submitted_at":"2024-03-14T17:55:33Z","title":"Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text Rendering","version":2},"cited_work":{"arxiv_id":"2403.09622","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.09622","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glyph-byt5: A customized text encoder for accurate visual text rendering","venue":null,"work_id":"2f97666b-aab2-4ed7-9c99-6060f10246de","year":2024},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"cited_paper":"/paper/2403.09622","citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:d9240935a78fed6a877078700a491c12dfba660474771c62d20af024d75caa87","observation_id":"718f4ae6-c5c1-403f-8f50-088c7a54fdc7","resolution":{"observed_at":"2026-05-15T02:31:35.065831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04507","last_updated":"2025-06-04T23:21:39Z","snapshot_observed_at":"2026-07-06T20:32:33.426258Z","submitted_at":"2025-02-06T21:17:09Z","title":"Fast Video Generation with Sliding Tile Attention","version":3},"cited_work":{"arxiv_id":"2502.04507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.04507","snapshot_observed_at":"2026-07-11T01:07:44.493549Z","title":"Spargeattn: Accurate sparse attention accelerat- ing any model inference","venue":"cs.CV","work_id":"c53350cf-72d0-42b0-af6c-8d19e35404e8","year":2025},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"cited_paper":"/paper/2502.04507","citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:778139905e9f5b9cc5b57925028588dbbefbcf9af79969b7602e508333c30523","observation_id":"4eac0e83-1ee5-4226-ad6d-468d9fb9bdeb","resolution":{"observed_at":"2026-05-15T02:31:35.070439Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"flex-block-attn: an efficient block sparse attention communication library","venue":null,"work_id":"e012515e-f12f-4654-a8d2-9b05e0502c63","year":2025},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:c401dfd337ebb067541677bb521ad02c6cc8e8df51d962fbbb3680a1c0e81640","observation_id":"b096ec8e-31c9-4b26-af91-c8997878217d","resolution":{"observed_at":"2026-05-15T02:31:35.119796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spector, Simran Arora, Aaryan Singhal, Daniel Y","venue":null,"work_id":"3cbfbd09-5fae-42bd-9702-493c104b7273","year":2024},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:cf4bc8e5ad72d60ca916cdb6573104c2cb4329d36b6f5955f70fe3730f363448","observation_id":"74f98148-9944-40e3-a888-474eb78c1940","resolution":{"observed_at":"2026-05-15T02:31:35.122078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:24:54.779001Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":"3561a0ff-7939-4f07-9620-be9f8868052e","year":2024},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:156e44d5fd50c42b352b0b0b3b3a0157718c817fc1a31072b6eeef04362b0d18","observation_id":"1f51a624-17a1-4ad0-987f-482923111294","resolution":{"observed_at":"2026-05-15T02:31:35.124922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:465ba4d4e0ec1d2990525a86e7e37de5dc637b494813b29103d745ceda944622","observation_id":"a53b66a3-d14b-4c2e-9068-81b22b044828","resolution":{"observed_at":"2026-05-15T02:31:35.086217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:34:01.614833Z","title":"Diffusion model alignment using direct preference optimization","venue":null,"work_id":"a8c7901c-d939-4b88-9e70-2af38e4aed5f","year":2024},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:5990571b842c8bf964525960da3652163816367b4279602ca9e59f332a47742f","observation_id":"a38b6fba-204b-43d4-b002-30c1d75d7fcd","resolution":{"observed_at":"2026-05-15T02:31:35.097504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sageatten- tion2: Efficient attention with thorough outlier smoothing and per-thread int4 quantization","venue":null,"work_id":"066cb5b6-803c-4ec7-8cdf-6ca3c36483c1","year":2025},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:ca8cd1617045b0f8c11b3fb0766e1bebaa318953a6cd0e6636ed5ff13e3ccff5","observation_id":"dde183c8-8d77-4d11-98eb-8c5fb64de53f","resolution":{"observed_at":"2026-05-15T02:31:35.102097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":9,"verified_fuzzy":12},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"thesis":"As of 27 July 2026, this Paper Citation Record lists 22 of 22 outbound references and 92 inbound Pith citation observations for arXiv:2511.18870."}