{"as_of":"2026-08-05T11:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e10cd9bf6e558be11c4eb9430f8859b3a2e3fce54e05950955b01d8f395842f4","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T16:26:00.285585Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-05T12:34:41.758238Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-05T12:41:04.375376Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"cited_work":{"arxiv_id":"2512.13677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.13677","snapshot_observed_at":"2026-08-03T03:15:29.416338Z","title":"Jova: Unified multimodal learning for joint video-audio generation","venue":null,"work_id":"db4a0fa0-6496-4b05-893b-51006ad3ac59","year":2025},"citing_paper":{"arxiv_id":"2604.09057","last_updated":"2026-04-16T03:03:01Z","snapshot_observed_at":"2026-07-06T22:58:04.106299Z","submitted_at":"2026-04-10T07:37:03Z","title":"Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T17:13:06.005185Z"},"links":{"cited_paper":"/paper/2512.13677","citing_paper":"/paper/2604.09057"},"observation_digest":"sha256:7e4d0b283d715182a9f223d48d99cd6def43be2e7fe45623604649e52981e3a2","observation_id":"039d90a1-8358-47fe-a869-deab40f14716","resolution":{"observed_at":"2026-08-03T03:15:29.416338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"cited_work":{"arxiv_id":"2512.13677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.13677","snapshot_observed_at":"2026-08-03T03:15:29.416338Z","title":"Jova: Unified multimodal learning for joint video-audio generation","venue":null,"work_id":"db4a0fa0-6496-4b05-893b-51006ad3ac59","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2512.13677","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:1a3be135e0853735a2d5e203274fccae53d8ed73d8dd1a9b61fa5d15fabcfc0d","observation_id":"106168a0-6b39-4c67-a652-01b39ba9afa4","resolution":{"observed_at":"2026-08-03T03:15:29.416338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"cited_work":{"arxiv_id":"2512.13677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.13677","snapshot_observed_at":"2026-08-03T03:15:29.416338Z","title":"Jova: Unified multimodal learning for joint video-audio generation","venue":null,"work_id":"db4a0fa0-6496-4b05-893b-51006ad3ac59","year":2025},"citing_paper":{"arxiv_id":"2604.18326","last_updated":"2026-05-30T12:42:13Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:28:51Z","title":"OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T05:19:49.671136Z"},"links":{"cited_paper":"/paper/2512.13677","citing_paper":"/paper/2604.18326"},"observation_digest":"sha256:de8ab22b60f23dfe3ec3d5c85fcdc33632df62b815108b397a43b333a5559c2d","observation_id":"c01f1bf5-3a78-4e08-b828-3d6f4c924adb","resolution":{"observed_at":"2026-08-03T03:15:29.416338Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"cited_work":{"arxiv_id":"2512.13677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.13677","snapshot_observed_at":"2026-08-03T03:15:29.416338Z","title":"Jova: Unified multimodal learning for joint video-audio generation","venue":null,"work_id":"db4a0fa0-6496-4b05-893b-51006ad3ac59","year":2025},"citing_paper":{"arxiv_id":"2604.18326","last_updated":"2026-05-30T12:42:13Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:28:51Z","title":"OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-05T12:34:41.758238Z"},"links":{"cited_paper":"/paper/2512.13677","citing_paper":"/paper/2604.18326"},"observation_digest":"sha256:4bd0d448168d23171fda53844233bbcca8143614b0297a45f92c1fd1f49a8d75","observation_id":"81c0ff12-b1ad-4d20-94d9-b90843758d4a","resolution":{"observed_at":"2026-08-03T03:15:29.416338Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"cited_work":{"arxiv_id":"2512.13677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.13677","snapshot_observed_at":"2026-08-03T03:15:29.416338Z","title":"Jova: Unified multimodal learning for joint video-audio generation","venue":null,"work_id":"db4a0fa0-6496-4b05-893b-51006ad3ac59","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2512.13677","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:182fa3d08df042dd7cd22e87892e775f83de5c06933f1b5e20179959df331e6e","observation_id":"19ec8ee7-9b08-4f8c-8865-d6376b661e51","resolution":{"observed_at":"2026-08-03T03:15:29.416338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"cited_work":{"arxiv_id":"2512.13677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.13677","snapshot_observed_at":"2026-08-03T03:15:29.416338Z","title":"Jova: Unified multimodal learning for joint video-audio generation","venue":null,"work_id":"db4a0fa0-6496-4b05-893b-51006ad3ac59","year":2025},"citing_paper":{"arxiv_id":"2605.12179","last_updated":"2026-05-12T14:22:13Z","snapshot_observed_at":"2026-08-02T10:11:30.309923Z","submitted_at":"2026-05-12T14:22:13Z","title":"SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T07:01:40.333448Z"},"links":{"cited_paper":"/paper/2512.13677","citing_paper":"/paper/2605.12179"},"observation_digest":"sha256:ea1e81bcbecf55b3d26bab48a7f2eef133651dd3253906e150bf097c4aaf73c1","observation_id":"5dc8bbe9-ae49-4ffe-8850-c4b2235f4e8d","resolution":{"observed_at":"2026-08-03T03:15:29.416338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"cited_work":{"arxiv_id":"2512.13677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.13677","snapshot_observed_at":"2026-08-03T03:15:29.416338Z","title":"Jova: Unified multimodal learning for joint video-audio generation","venue":null,"work_id":"db4a0fa0-6496-4b05-893b-51006ad3ac59","year":2025},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2512.13677","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:654e49e0b6d296d34c232dfd9e303b0349b1fd6068db50618e50d2349e2b5eb5","observation_id":"41339ad0-1024-4195-90ff-7285d7d83b7c","resolution":{"observed_at":"2026-08-03T03:15:29.416338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2512.13677/citation-record","integrity":"/paper/2512.13677/integrity","json":"/paper/2512.13677/citation-record.json","paper":"/paper/2512.13677"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-03T16:25:53.994887Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:53.994887Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:b8674c32ccacd6752cd8731a548c475312c424b285e28c9d4007253e393954bb","observation_id":"b83231be-d556-495e-bca1-e9f384e77472","resolution":{"observed_at":"2026-08-03T16:25:53.994887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-07-06T21:30:46.863005Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-03T16:25:54.145826Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters.arXiv preprint arXiv:2505.20156, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:54.145826Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:591150555cdc44560c19cc4365b3d93165e3af9b88d55140bc5aa87a2ec59962","observation_id":"2818ee41-0988-4952-81f6-d2edff52087b","resolution":{"observed_at":"2026-08-03T16:25:54.145826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:54.310475Z","title":"Mmaudio: Taming multimodal joint training for high-quality video-to-audio synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:54.310475Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:c594c73a0e2013302f83fed9d206ab777377c09b7d9f8acb518e90b4e959814f","observation_id":"935e2106-9a9f-41df-b2d6-650d550ed0ae","resolution":{"observed_at":"2026-08-03T16:25:54.310475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09151","last_updated":"2023-04-18T17:45:50Z","snapshot_observed_at":"2026-08-04T20:02:02.999092Z","submitted_at":"2023-04-18T17:45:50Z","title":"UniMax: Fairer and more Effective Language Sampling for Large-Scale Multilingual Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09151","snapshot_observed_at":"2026-08-03T16:25:54.531863Z","title":"Unimax: Fairer and more effective language sampling for large-scale multilingual pretraining.arXiv preprint arXiv:2304.09151, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:54.531863Z"},"links":{"cited_paper":"/paper/2304.09151","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:545fe5362d16bc1609da94802e1e3bc91102621244c4bb445a7019d05e27f621","observation_id":"d57b0d29-2d33-4b37-8203-aba4a80749cc","resolution":{"observed_at":"2026-08-03T16:25:54.531863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:54.730459Z","title":"Out of time: automated lip sync in the wild","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:54.730459Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:d64c98ade0eb89bea65fa6beb842cbb17575dd58b800ab5248569d40e8bb80df","observation_id":"a8853a92-b483-46c6-86d2-74c9621b13c9","resolution":{"observed_at":"2026-08-03T16:25:54.730459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:54.827406Z","title":"Wan2.5.https://wan.video/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:54.827406Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:6ca2a247afffb834dcc8a5658dfb49420df40164d857be9231885295c622723a","observation_id":"aff03e9e-1449-4dfd-a312-d23a650ece39","resolution":{"observed_at":"2026-08-03T16:25:54.827406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:54.934432Z","title":"Veo3.https://deepmind.google/models/veo/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:54.934432Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:5604467b706e6995490052e15f75315d9e57680cd551512ce3e2c1c4bfef35f1","observation_id":"cfa242a5-ea45-4b8d-8504-44c2213035b3","resolution":{"observed_at":"2026-08-03T16:25:54.934432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:55.065359Z","title":"Clotho: An audio captioning dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:55.065359Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:1556f4b40f8aecb8ea5cd0c2535a5d85527580cc1bf7aa77d09cd468fc2c69a3","observation_id":"23c081a3-7633-48cd-be2c-102805c73517","resolution":{"observed_at":"2026-08-03T16:25:55.065359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:55.273666Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:55.273666Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:38eef8947e4cb6b8021665ac58bb2c18d8648684ec1744d487153460e56186f4","observation_id":"83a2e068-c7a7-4f7b-ba91-9281acb8b475","resolution":{"observed_at":"2026-08-03T16:25:55.273666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18866","last_updated":"2025-06-23T17:33:03Z","snapshot_observed_at":"2026-07-06T21:46:30.250293Z","submitted_at":"2025-06-23T17:33:03Z","title":"OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18866","snapshot_observed_at":"2026-08-03T16:25:55.436179Z","title":"Omniavatar: Efficient audio-driven avatar video generation with adaptive body animation.arXiv preprint arXiv:2506.18866, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:55.436179Z"},"links":{"cited_paper":"/paper/2506.18866","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:eb609e92e7655edacc9dd27f839c135677e56c0421e1be69388d06e589782cd9","observation_id":"10a0ad3d-c642-4bd7-b316-333a7b4bf0a9","resolution":{"observed_at":"2026-08-03T16:25:55.436179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-07-06T22:18:40.868747Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-03T16:25:55.546710Z","title":"Wan-s2v: Audio-driven cinematic video generation.arXiv preprint arXiv:2508.18621, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:55.546710Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:261e95a29ebfff3feafe37cbdfc86abc7a35aa5e7c3006a34e6beefc3f1faca7","observation_id":"f1e3d810-2745-4a83-8ad8-805a95a82067","resolution":{"observed_at":"2026-08-03T16:25:55.546710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.08128","snapshot_observed_at":"2026-08-03T16:25:55.712311Z","title":"Audio flamingo 3: Advancing audio intelligence with fully open large audio language models.arXiv preprint arXiv:2507.08128, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:55.712311Z"},"links":{"cited_paper":"/paper/2507.08128","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:cbe3424c30bfc85c9c28615ae89cc0aa99382bf1f15809fbc110cb4ab9d63a4d","observation_id":"0dedc90e-dc1b-43f1-b792-0ce29ca42ea7","resolution":{"observed_at":"2026-08-03T16:25:55.712311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-07-06T21:33:55.658995Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-03T16:25:55.887395Z","title":"Ace-step: A step towards music generation foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:55.887395Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:70fe44a09a62b5b776e7b1d650655f9cabbf6226bdcbffa6fb890e51743bdfc8","observation_id":"7ae5821c-dec4-4de1-bb54-c93df909c2ee","resolution":{"observed_at":"2026-08-03T16:25:55.887395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-07-06T20:10:24.217625Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15191","snapshot_observed_at":"2026-08-03T16:25:56.032167Z","title":"Av-link: Temporally-aligned diffusion features for cross-modal audio-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:56.032167Z"},"links":{"cited_paper":"/paper/2412.15191","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:b57ffc7b3fff14f1bce242f4e41e33cf75ca1deec49f967ccc08f22e76a170ac","observation_id":"16755c82-6b7f-4480-9a83-682402e864d4","resolution":{"observed_at":"2026-08-03T16:25:56.032167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-03T16:25:56.183618Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:56.183618Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:3e7e362b49b4e9a34691223d22650f63c59e41307767974789f3e87c38e25d32","observation_id":"96a44fdf-00a6-40bc-8e5d-41ecf84ffd9c","resolution":{"observed_at":"2026-08-03T16:25:56.183618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17550","last_updated":"2025-04-09T01:18:01Z","snapshot_observed_at":"2026-08-05T08:44:27.697380Z","submitted_at":"2024-09-26T05:39:52Z","title":"A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17550","snapshot_observed_at":"2026-08-03T16:25:56.290355Z","title":"A simple but strong baseline for sounding video generation: Effective adaptation of audio and video diffusion models for joint generation.arXiv preprint arXiv:2409.17550, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:56.290355Z"},"links":{"cited_paper":"/paper/2409.17550","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:947178b759e62a130892be9657a33d6c1bd49c2765d7d1fcfe3ea87986028634","observation_id":"cee6463b-6430-4500-a5af-9c211722155e","resolution":{"observed_at":"2026-08-03T16:25:56.290355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:56.399787Z","title":"Musiq: Multi-scale image quality transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:56.399787Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:d7162b1a4c190e8b8a2c5b6e754bb841340663466368c5655d9b6fcf765023ca","observation_id":"d3d0283c-3482-443b-8a3a-a6c00bac2951","resolution":{"observed_at":"2026-08-03T16:25:56.399787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:56.574327Z","title":"Audiocaps: Generating captions for audios in the wild","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:56.574327Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:90d2d84c4ac3015cb4f3746d9efa9f97709b2d5d21434d5316bf004b3d7fa256","observation_id":"accb6232-f55c-403a-b743-a096b1edbb8d","resolution":{"observed_at":"2026-08-03T16:25:56.574327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:56.653546Z","title":"Panns: Large-scale pretrained audio neural networks for audio pattern recognition.TASLPRO, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:56.653546Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:49b17175f50e40782322dd66873818d01524e70f7693f9b50346ce58c76ab555","observation_id":"834b6cf6-fc56-4714-9886-927c91e9f777","resolution":{"observed_at":"2026-08-03T16:25:56.653546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T16:25:56.736283Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:56.736283Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:57c86bf5b3d3efb7db6d05528d0535911aeea674014a17cf0db2099d47d9c758","observation_id":"11c20f79-fd10-4c1e-b34b-bba0579a3fc9","resolution":{"observed_at":"2026-08-03T16:25:56.736283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-03T16:25:56.830276Z","title":"Efficient training of audio transformers with patchout","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:56.830276Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:e4b56bc7985c124e3be98b9b584a9c02fc10af883dc9ad4ffdb630a30e859487","observation_id":"d88f42e7-2290-47d5-b122-5dc5d3a2c19f","resolution":{"observed_at":"2026-08-03T16:25:56.830276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-07-06T20:30:02.903743Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01061","snapshot_observed_at":"2026-08-03T16:25:56.942377Z","title":"Omnihuman-1: Rethinking the scaling-up of one-stage conditioned human animation models.arXiv preprint arXiv:2502.01061, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:56.942377Z"},"links":{"cited_paper":"/paper/2502.01061","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:14c3654a62db5adb17bef94e53610ba0ca4b260f1e9b99dcd7f643e852ece6fd","observation_id":"4fd660bf-dc2f-47c7-a7db-6010fe912ec8","resolution":{"observed_at":"2026-08-03T16:25:56.942377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-03T16:25:57.046712Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:57.046712Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:d4dc92b7452eb55aae10636dc3cd5d942c197e551ce99b40349b5c8905960d90","observation_id":"3bf3a7e8-b71c-41e3-8bda-8ebd4f354554","resolution":{"observed_at":"2026-08-03T16:25:57.046712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:57.115445Z","title":"Javisdit: Joint audio-video diffusion transformer with hierarchical spatio-temporal prior synchronization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:57.115445Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:9b30f0ef00732a761d366a0a400b8ee03a20b6af10c6ec03ba57daba7be11016","observation_id":"285ce9c0-83cd-4b94-97cd-2a3c479351a1","resolution":{"observed_at":"2026-08-03T16:25:57.115445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-03T16:25:57.224612Z","title":"Sora: A review on background, technology, limitations, and opportunities of large vision models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:57.224612Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:768f8dac6f2cc0d5f969b337d4916357892c8aa24a9c54f201423b03bc45fed8","observation_id":"6d5f3efb-364d-4b6e-b5f0-50642d1d0df1","resolution":{"observed_at":"2026-08-03T16:25:57.224612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-04T22:22:45.362136Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.01284","snapshot_observed_at":"2026-08-03T16:25:57.336256Z","title":"Ovi: Twin backbone cross-modal fusion for audio-video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:57.336256Z"},"links":{"cited_paper":"/paper/2510.01284","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:6525e11a311aa06aaf10135d52fa465b359c70c34e0ad27e0efd145efe552a94","observation_id":"79ff5cde-cdb9-4555-b3dc-0d72394d7751","resolution":{"observed_at":"2026-08-03T16:25:57.336256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:57.443780Z","title":"Diff-foley: Synchronized video-to-audio synthesis with latent diffusion models.NeurIPS, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:57.443780Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:b5c0e94a655757363f3d746d2646746de88ce2a30f83d28a20a2dda2c2a8d68b","observation_id":"dfa016d6-3512-4940-bc74-a4df94e98d23","resolution":{"observed_at":"2026-08-03T16:25:57.443780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:57.571217Z","title":"Wavcaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal research","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:57.571217Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:fd070fe41b41195ad5f8ef0b975192093549a8714d768d5779b85cbf2f89ebb7","observation_id":"c6557d60-88be-4a3c-a4e0-f3073bef3e71","resolution":{"observed_at":"2026-08-03T16:25:57.571217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:57.752438Z","title":"Sora2.https://openai.com/zh-Hans-CN/index/sora-2/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:57.752438Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:c99b3b32fb1f041cd0e112a2303c0262c99ef422c51c93d74c74be2b88ad7cbb","observation_id":"474e3a89-80a7-420b-a03d-8e6aa4100e9d","resolution":{"observed_at":"2026-08-03T16:25:57.752438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:57.834730Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:57.834730Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:4f4238930025a0e4eff3289a6d494532afdab1ba48df5529153d1d12b70ef71b","observation_id":"eacb55e3-a723-4bd5-8f44-07b12faaa521","resolution":{"observed_at":"2026-08-03T16:25:57.834730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:57.897622Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:57.897622Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:54b1a91c53585cb5ec5aae52b442903588d2f9f15606045b83e4845623f583cb","observation_id":"89690cbb-5a30-4057-b2aa-d2b740fcd615","resolution":{"observed_at":"2026-08-03T16:25:57.897622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:58.028988Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:58.028988Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:0e8bdd92cacf1ef40e580d7d68c730e429a9e63bc835dd5ef9d072d801c6bd9d","observation_id":"d1a0b9b9-30a5-4662-9df1-5e55423b0535","resolution":{"observed_at":"2026-08-03T16:25:58.028988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:58.145178Z","title":"Mm-diffusion: Learning multi-modal diffusion models for joint audio and video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:58.145178Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:e0990a7d1694f015c38791ce69a744b75ee829f6f80ddffb2a626e13e9bd79da","observation_id":"58fe299d-b20e-4aeb-888e-d8472845d91f","resolution":{"observed_at":"2026-08-03T16:25:58.145178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16930","last_updated":"2025-08-23T07:30:18Z","snapshot_observed_at":"2026-07-06T22:17:02.502437Z","submitted_at":"2025-08-23T07:30:18Z","title":"HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.16930","snapshot_observed_at":"2026-08-03T16:25:58.270794Z","title":"Hunyuanvideo- foley: Multimodal diffusion with representation alignment for high-fidelity foley audio generation.arXiv preprint arXiv:2508.16930, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:58.270794Z"},"links":{"cited_paper":"/paper/2508.16930","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:13b3b8aef704fa490812266ca1d82ad1107ba2a48bfeed429323ad0d5dc56a6b","observation_id":"44ecad2f-0840-4635-9386-8dd77c7ae7d4","resolution":{"observed_at":"2026-08-03T16:25:58.270794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-03T16:25:58.357377Z","title":"Dinov3.arXiv preprint arXiv:2508.10104, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:58.357377Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:a120238abf2cbba23ed4b598fa2f65a003aae381ed7914c11dab1b92e812b3c0","observation_id":"da686c8d-b660-4472-81d4-5c950e054d7b","resolution":{"observed_at":"2026-08-03T16:25:58.357377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:58.480419Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:58.480419Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:54fcb1557549c5e43f960b48f8c785c53dba5d2215473d2a7f5e32408815e0a4","observation_id":"1998f3a2-5d6f-4c6b-943a-f96ca72f0e5b","resolution":{"observed_at":"2026-08-03T16:25:58.480419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-03T16:25:58.606661Z","title":"Meta audiobox aesthetics: Unified automatic quality assessment for speech, music, and sound.arXiv preprint arXiv:2502.05139, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:58.606661Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:9b5abd6cdd659d261c8949c122dba9ee567381e045c613173bc5faf01ca00263","observation_id":"62d3aea7-532b-462f-a0df-bdb4706434f2","resolution":{"observed_at":"2026-08-03T16:25:58.606661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-03T16:25:58.675273Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:58.675273Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:2bf6289cf103ffcaafe847b3c035a7138e3ccff5b85bfd1aea75893e7e1324cb","observation_id":"cb05a9c8-7e16-421e-bb07-23ee8354420b","resolution":{"observed_at":"2026-08-03T16:25:58.675273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-05T00:05:44.790684Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06155","snapshot_observed_at":"2026-08-03T16:25:58.726931Z","title":"Universe-1: Unified audio-video generation via stitching of experts.arXiv preprint arXiv:2509.06155, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:58.726931Z"},"links":{"cited_paper":"/paper/2509.06155","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:6c7353fd1e7560a5195f6279abc298a7dddf0a2c5b1e5bbc541b029c64f29871","observation_id":"57ea88af-15b7-443b-b837-fa61829a4c83","resolution":{"observed_at":"2026-08-03T16:25:58.726931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:58.763471Z","title":"Kling-foley: Multimodal diffusion transformer for high-quality video-to-audio generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:58.763471Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:50f230270e1ce6edab95d7b705301f980762532aaf00407235d4bfc81498fbb9","observation_id":"bf7f4057-b622-4a49-ab4a-43c4f13fc4c2","resolution":{"observed_at":"2026-08-03T16:25:58.763471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:58.776199Z","title":"Av-dit: Taming image diffusion transformers for efficient joint audio and video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:58.776199Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:12341447aaf04115bf35c39fd7ae4b24ac5875bfcb9ee86f8cd30168ec4afce0","observation_id":"caab88d7-d3bc-457d-ba24-7955d5933cb6","resolution":{"observed_at":"2026-08-03T16:25:58.776199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-04T21:42:28.338170Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.00733","snapshot_observed_at":"2026-08-03T16:25:58.872482Z","title":"Audiogen-omni: A unified multimodal diffusion transformer for video-synchronized audio, speech, and song generation.arXiv preprint arXiv:2508.00733, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:58.872482Z"},"links":{"cited_paper":"/paper/2508.00733","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:0c2cbfe4005b0197aa4ee17632e2f42e26f7e0a1c15d5fa51aee0d60640dbec4","observation_id":"5db16c02-bee4-4b43-8764-32f82764cc54","resolution":{"observed_at":"2026-08-03T16:25:58.872482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:58.948739Z","title":"Fantasytalking: Realistic talking portrait generation via coherent motion synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:58.948739Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:840d74a7cc67f0331ccfeb79335d35b3b1668f12bd45557c06a747a965a9023d","observation_id":"6fbe48f2-9e25-4364-a75e-8b7cebdb85f4","resolution":{"observed_at":"2026-08-03T16:25:58.948739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-03T16:25:59.060875Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation.arXiv preprint arXiv:2307.06942, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:59.060875Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:f6cffdc4ead01033486a7564428389c45c400ba85bf98847e861af95cf564af6","observation_id":"7ffc17f1-87cf-46b9-890f-4755ca5b67c0","resolution":{"observed_at":"2026-08-03T16:25:59.060875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:59.152970Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:59.152970Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:2c01b6097cd1a5673ca747d7732909d59e30d5dc8d6c0ed6cc0f8cc322f1b444","observation_id":"b7b54d83-a12a-48b5-b8e2-e59d7e19407d","resolution":{"observed_at":"2026-08-03T16:25:59.152970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:59.307542Z","title":"Seeing and hearing: Open-domain visual-audio generation with diffusion latent aligners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:59.307542Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:5d3c1804aedc4fcd097ff0616477ee5f9c55bc485396c2d744ebc109c019c4f1","observation_id":"6b018707-b816-462a-aac6-27b64fe7b027","resolution":{"observed_at":"2026-08-03T16:25:59.307542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-03T16:25:59.436247Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:59.436247Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:09fac1d8d4078bc812f44b571805f02447223ad452e2630f8ceb992cc3f275c9","observation_id":"102b32df-884b-43d1-b960-e2d78ecd357d","resolution":{"observed_at":"2026-08-03T16:25:59.436247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:59.576862Z","title":"Maniqa: Multi-dimension attention network for no-reference image quality assessment","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:59.576862Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:9063cbf9784001528a6753c5b340a2408db364b43dce4e1ce666f2561ad5897e","observation_id":"7fec9ff2-183b-46a0-8969-c4bbb43d83ab","resolution":{"observed_at":"2026-08-03T16:25:59.576862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-03T16:25:59.692876Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:59.692876Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:aa4c158ee1ceec0e9d4f513537c27e3de6c5b9de7b37472cdd7fdc6fc3238792","observation_id":"d3a5c374-d6a5-4f20-8374-6f3f60c15a09","resolution":{"observed_at":"2026-08-03T16:25:59.692876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-07-06T20:20:47.146343Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-03T16:25:59.808955Z","title":"Tarsier2: Advancing large vision-language models from detailed video description to comprehensive video understanding.arXiv preprint arXiv:2501.07888, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:59.808955Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:7b183981220beabea6b1fc385246551a5376d22d55ec0a88a84cc21476d2b742","observation_id":"d8945482-6b3c-4c05-8c01-c345ae36d1ed","resolution":{"observed_at":"2026-08-03T16:25:59.808955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:25:59.923575Z","title":"Uniavgen: Unified audio and video generation with asymmetric cross-modal interactions.arXiv preprint arXiv:2511.03334, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:59.923575Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:a877f2aec227394734d0949a3bdaf4c94c61b1a177a41c683ed0854aaef8f25f","observation_id":"1a7707f2-2d37-44f4-9fee-803663185f88","resolution":{"observed_at":"2026-08-03T16:25:59.923575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-02T19:22:44.420585Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-08-03T16:26:00.037365Z","title":"Waver: Wave your way to lifelike video generation.arXiv preprint arXiv:2508.15761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T16:26:00.037365Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:708dda2ff06c28fed2a0b1ffd895939956dded771d7d65e6f49c4ba664461662","observation_id":"69a06d9f-05bd-435d-9b0d-efe3bfd608a5","resolution":{"observed_at":"2026-08-03T16:26:00.037365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-03T01:05:23.269633Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-03T16:26:00.172036Z","title":"Foleycrafter: Bring silent videos to life with lifelike and synchronized sounds.arXiv preprint arXiv:2407.01494, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T16:26:00.172036Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:5386917af2dcb49d146f69a259aaf21311b237162e9d71df6f8389d981d1ffc2","observation_id":"fd5b86f8-7e4b-42c5-aa90-1aaa05de5c4d","resolution":{"observed_at":"2026-08-03T16:26:00.172036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:26:00.285585Z","title":"Uniform: A unified diffusion transformer for audio-video generation.arXiv e-prints, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T16:26:00.285585Z"},"links":{"citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:1c802f3d4f69618471d043cdc557131b061b222016a95ddb3c365f8cdeb3fb33","observation_id":"83f1c4a2-278e-4948-ad99-b96b99a7765a","resolution":{"observed_at":"2026-08-03T16:26:00.285585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T10:14:11.890164Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 7 inbound Pith citation observations for arXiv:2512.13677."}