{"as_of":"2026-08-08T18:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1a6f44dacf7cf527538344ad3654ce0317409f8b3f3b504d9d7793f9c753ef0b","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:16:52.552901Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05803/citation-record","integrity":"/paper/2608.05803/integrity","json":"/paper/2608.05803/citation-record.json","paper":"/paper/2608.05803"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00830","snapshot_observed_at":"2026-08-07T23:16:52.478464Z","title":"Zhengcong Fei, Hao Jiang, Di Qiu, Baoxuan Gu, Youqiang Zhang, Jiahua Wang, Jialin Bai, Debang Li, Mingyuan Fan, Guibin Chen, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.478464Z"},"links":{"cited_paper":"/paper/2506.00830","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:400471521ea49415fee5cfe864bc393942a35610db5cfd3be91e4f87aa61e6e6","observation_id":"085f7559-aa81-4101-b8b4-4d893902df8a","resolution":{"observed_at":"2026-08-07T23:16:52.478464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:16:52.482667Z","title":"Dreamid-omni: Unified framework for controllable human-centric audio-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.482667Z"},"links":{"citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:4bb9ad143c1ed9b428a2f9f1079cff31fd3275e54da473ea33ea1e4b5f399a22","observation_id":"b7705bf0-d6d7-4bb3-a837-1f6f546c3682","resolution":{"observed_at":"2026-08-07T23:16:52.482667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:16:53.580232Z","title":"Mmdisco: Multi-modal discriminator- guided cooperative diffusion for joint audio and video generation","venue":null,"work_id":"300adf10-fd85-4deb-b4a7-bfaa89167346","year":2025},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.491684Z"},"links":{"citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:435d1bfe12c796583d59978b28d82db9bb5ee21156010a76791cf20f2f5ff59b","observation_id":"efce4dc6-b3b2-4491-864c-6a11ebde837e","resolution":{"observed_at":"2026-08-07T23:16:53.584280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-08-07T23:16:52.495601Z","title":"Hunyuanvideo 1.5 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.495601Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:642f45dc9885660a401de5d7cf2e4ede9873a8337cb2affa4d20ea6782b54860","observation_id":"c560d014-c578-457c-b133-377d5f55c84e","resolution":{"observed_at":"2026-08-07T23:16:52.495601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30073","last_updated":"2026-05-28T15:21:45Z","snapshot_observed_at":"2026-07-06T23:39:24.682426Z","submitted_at":"2026-05-28T15:21:45Z","title":"Native Audio-Visual Alignment for Generation","version":1},"cited_work":{"arxiv_id":"2605.30073","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.30073","snapshot_observed_at":"2026-08-07T23:16:52.955762Z","title":"Native Audio-Visual Alignment for Generation","venue":"cs.CV","work_id":"10a77f0e-8244-462c-aa9b-2797e6dda174","year":2026},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.499515Z"},"links":{"cited_paper":"/paper/2605.30073","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:1ac40837020487e9d9c3d37641624182241478049bff423e50ae6e76428c7ea1","observation_id":"3da2db8c-0201-4506-a4fd-aed8acb3510d","resolution":{"observed_at":"2026-08-07T23:16:52.959820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16776","last_updated":"2025-12-18T17:08:12Z","snapshot_observed_at":"2026-07-06T22:39:28.855621Z","submitted_at":"2025-12-18T17:08:12Z","title":"Kling-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.16776","snapshot_observed_at":"2026-08-07T23:16:52.502930Z","title":"Kling-omni technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.502930Z"},"links":{"cited_paper":"/paper/2512.16776","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:a2729080c33f2464d5a6b12de1c2470974f5941785718680e6d3afeda27ecdc3","observation_id":"5b81f74d-1820-4e9d-8c3f-7ca0ab47edb7","resolution":{"observed_at":"2026-08-07T23:16:52.502930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19679","last_updated":"2026-06-29T16:38:23Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T16:57:23Z","title":"MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation","version":3},"cited_work":{"arxiv_id":"2604.19679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19679","snapshot_observed_at":"2026-08-07T23:16:52.924147Z","title":"MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation","venue":"cs.CV","work_id":"64a255c0-3084-4561-a9b5-dd83ccea0c8d","year":2026},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.506326Z"},"links":{"cited_paper":"/paper/2604.19679","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:84f07c256c1f4b162714f4f8c43a11beaf290e8e8a43deb2756e5fdfc2fe8ec8","observation_id":"9ccd18d3-a82e-4af8-9f5d-da02fe9e350a","resolution":{"observed_at":"2026-08-07T23:16:52.929357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T23:16:52.509929Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.509929Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:3d458b28aef81859f725913d80ce3d33b897380f6cb4fc9bb670ae266ccd83e8","observation_id":"787248e6-93ad-49ca-9c0f-a24ddfdf72b8","resolution":{"observed_at":"2026-08-07T23:16:52.509929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-07T23:16:52.513807Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.513807Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:833d590b24f7b99b24efe67323caa875421938dac69d440d63b84c87cb7d75c4","observation_id":"9468b1d8-23a1-490a-82c1-a3b1ef9b346b","resolution":{"observed_at":"2026-08-07T23:16:52.513807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:16:52.521689Z","title":"Team OpenMOSS","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.521689Z"},"links":{"citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:97ce40ec99f49fa9e6a697d5fa710a35cadfc458f1409fb7977f16af9493ed13","observation_id":"89ef2161-5831-4a26-a182-418b358c793b","resolution":{"observed_at":"2026-08-07T23:16:52.521689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-08-07T23:16:52.529134Z","title":"Team Seedance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.529134Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:00494fec4257a7d07b7ac59291104bc8007cb6ed2ec7fee2b0731e41d347ed40","observation_id":"ae50f3a9-5f51-43d7-b4ea-c0c1fc095286","resolution":{"observed_at":"2026-08-07T23:16:52.529134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.25195","last_updated":"2026-06-01T01:54:28Z","snapshot_observed_at":"2026-08-02T06:55:53.214062Z","submitted_at":"2026-05-24T17:55:11Z","title":"Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation","version":2},"cited_work":{"arxiv_id":"2605.25195","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.25195","snapshot_observed_at":"2026-08-07T23:16:52.629424Z","title":"Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation","venue":"cs.CV","work_id":"b100cb7f-1ae8-4527-8b95-6f471be49d09","year":2026},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.532992Z"},"links":{"cited_paper":"/paper/2605.25195","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:224d87c768d86e81ed224c1db0b0ce11ae3590d54ed1170b9947129dcceafbb6","observation_id":"7d54ed40-72b2-4164-9ea7-829bc0695111","resolution":{"observed_at":"2026-08-07T23:16:52.635253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-05T00:05:44.790684Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06155","snapshot_observed_at":"2026-08-07T23:16:52.540959Z","title":"Universe-1: Unified audio-video generation via stitching of experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.540959Z"},"links":{"cited_paper":"/paper/2509.06155","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:897f777af32b744b248941051f3dbd06fba71917b2c1e3e429f52e07cf21cd85","observation_id":"b30009e5-84ca-4f87-a714-af268271ee5b","resolution":{"observed_at":"2026-08-07T23:16:52.540959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:16:53.567986Z","title":"Uniavgen: Unified audio and video generation with asymmetric cross-modal interactions","venue":null,"work_id":"ccc57d5d-76af-4ab6-a071-36f46d67bf0c","year":1950},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.544882Z"},"links":{"citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:7414653b7f598fbcd953099d535c6f3f0c6c87959250399b76246849fcac0250","observation_id":"d2b55d41-71fa-4823-8db6-cac76c6ffe71","resolution":{"observed_at":"2026-08-07T23:16:53.571568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-07-06T20:32:05.164336Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03897","snapshot_observed_at":"2026-08-07T23:16:52.548806Z","title":"Uniform: A unified multi-task diffusion transformer for audio-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.548806Z"},"links":{"cited_paper":"/paper/2502.03897","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:2cedf42465c3a58e8cb17ae6d91cf71dacae7f1853c17eb5bccc4480d51fa2ec","observation_id":"dd650d56-eda4-4d06-80ef-7bbfaa557f56","resolution":{"observed_at":"2026-08-07T23:16:52.548806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18467","last_updated":"2026-05-18T14:27:05Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:27:05Z","title":"InstructAV2AV: Instruction-Guided Audio-Video Joint Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18467","snapshot_observed_at":"2026-08-07T23:16:52.552901Z","title":"Instructav2av: Instruction-guided audio-video joint editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.552901Z"},"links":{"cited_paper":"/paper/2605.18467","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:35781f7d79611bd613fc711d4d112ce31085b3ad265a9c2f2a62ba3628b6b08c","observation_id":"d846b8d5-983e-4fe4-b01d-7996cf6fe358","resolution":{"observed_at":"2026-08-07T23:16:52.552901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:16:52.464969Z","title":"Guibin Chen, Dixuan Lin, Jiangping Yang, Youqiang Zhang, Zhengcong Fei, Debang Li, Sheng Chen, Chaofeng Ao, Nuo Pang, Yiming Wang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.464969Z"},"links":{"citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:0e273e5b276bdc95b9f5931c22a05679dd9589e0cd343bd99905551de593c55f","observation_id":"088567b2-ec9d-4d18-bd2c-453312f10e2e","resolution":{"observed_at":"2026-08-07T23:16:52.464969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T23:16:52.536889Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.536889Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:ee6c94e4db8764aacae34e778d1501dd234c5ea9351f9f2daae32341990ada77","observation_id":"87f681e6-8702-48ec-9471-5b10076424dd","resolution":{"observed_at":"2026-08-07T23:16:52.536889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-06T11:49:53.749464Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.01284","snapshot_observed_at":"2026-08-07T23:16:52.517841Z","title":"Ovi: Twin backbone cross-modal fusion for audio-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.517841Z"},"links":{"cited_paper":"/paper/2510.01284","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:861669cd08f2ed9ce3ad3281f58a04ab5b5f948ca9fdefcbd35ffb0e0bbd62b1","observation_id":"8454eb56-0efb-475a-93c2-af9c3b5f0718","resolution":{"observed_at":"2026-08-07T23:16:52.517841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30811","last_updated":"2026-06-29T18:35:17Z","snapshot_observed_at":"2026-08-04T07:33:33.279896Z","submitted_at":"2026-06-29T18:35:17Z","title":"AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation","version":1},"cited_work":{"arxiv_id":"2606.30811","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.30811","snapshot_observed_at":"2026-08-07T23:16:52.660947Z","title":"AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation","venue":"cs.CV","work_id":"ca5d43d6-01cf-4d2a-9080-2c570f2a37dd","year":2026},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.525251Z"},"links":{"cited_paper":"/paper/2606.30811","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:56bf3a112022423dce8ab4a7c64b664fd49d486f7a1fe4dc8e65d9d0e4f180fa","observation_id":"d3063727-59cd-4966-925a-49b47f222a7c","resolution":{"observed_at":"2026-08-07T23:16:52.664679Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09639","last_updated":"2026-06-11T05:58:22Z","snapshot_observed_at":"2026-08-02T02:07:05.154330Z","submitted_at":"2026-06-08T15:35:51Z","title":"CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation","version":2},"cited_work":{"arxiv_id":"2606.09639","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.09639","snapshot_observed_at":"2026-08-07T23:16:53.342690Z","title":"CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation","venue":"cs.CV","work_id":"8db551f4-b935-4639-8c5a-e10ebf06546a","year":2026},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.469576Z"},"links":{"cited_paper":"/paper/2606.09639","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:5b6ad79278a9903bcc58116c2005181fb4e361646e9ccca6ebeabc0d2c71f755","observation_id":"47bbb723-024c-4a6a-8dc9-451b43a86f7e","resolution":{"observed_at":"2026-08-07T23:16:53.347134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:16:52.474289Z","title":"Speed by simplicity: A single-stream architecture for fast audio-video generative foundation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.474289Z"},"links":{"citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:b693ecc14e4f7d57456a6fccc8dd208db09c77d9b5d0e026a2b5f08540effbd5","observation_id":"0fadbedf-3701-49b7-866b-674715952e60","resolution":{"observed_at":"2026-08-07T23:16:52.474289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-08-07T23:16:52.486493Z","title":"Ltx-2: Eﬀicient joint audio-visual foundation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.486493Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:d70d312524e75a4b49acd894a46ad6f6b6e54f44f5b3c3071401983db2577178","observation_id":"ec011e65-83f0-4560-aa54-334be2c026ab","resolution":{"observed_at":"2026-08-07T23:16:52.486493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T18:16:05.277548Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":5,"verified_fuzzy":2},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2608.05803."}