{"as_of":"2026-08-09T18:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f86997bd9baa7872cc83d745f34cc30bef681e5763303f84920c71f3c42f16a","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T12:39:00.193571Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T15:37:32.767405Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-01T22:16:16.088895Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"cited_work":{"arxiv_id":"2510.03117","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.03117","snapshot_observed_at":"2026-07-01T22:16:16.088895Z","title":"Taming text-to-sounding video generation via advanced modality condition and interaction","venue":"cs.CV","work_id":"ad177fe9-45ff-4ee9-86e8-10816af29a59","year":2025},"citing_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T07:06:20.470686Z"},"links":{"cited_paper":"/paper/2510.03117","citing_paper":"/paper/2601.03233"},"observation_digest":"sha256:90368df1044069f5a557ac3edca16b41cfb644f544e731b3792da24dad74bdf4","observation_id":"ba269173-b442-4f69-8027-50f31d2a4c67","resolution":{"observed_at":"2026-06-29T02:14:22.202186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"cited_work":{"arxiv_id":"2510.03117","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.03117","snapshot_observed_at":"2026-07-01T22:16:16.088895Z","title":"Taming text-to-sounding video generation via advanced modality condition and interaction","venue":"cs.CV","work_id":"ad177fe9-45ff-4ee9-86e8-10816af29a59","year":2025},"citing_paper":{"arxiv_id":"2604.11244","last_updated":"2026-04-15T07:55:01Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T09:50:36Z","title":"Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T15:07:45.595260Z"},"links":{"cited_paper":"/paper/2510.03117","citing_paper":"/paper/2604.11244"},"observation_digest":"sha256:a14974d7bfdd976050aad5ff7478b1da6f792d51517038e1e0ebc00199e886ab","observation_id":"82aa4fc2-5520-4e25-8caa-efde5e885ae3","resolution":{"observed_at":"2026-06-29T02:14:22.202186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"cited_work":{"arxiv_id":"2510.03117","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.03117","snapshot_observed_at":"2026-07-01T22:16:16.088895Z","title":"Taming text-to-sounding video generation via advanced modality condition and interaction","venue":"cs.CV","work_id":"ad177fe9-45ff-4ee9-86e8-10816af29a59","year":2025},"citing_paper":{"arxiv_id":"2605.12179","last_updated":"2026-05-12T14:22:13Z","snapshot_observed_at":"2026-08-02T10:11:30.309923Z","submitted_at":"2026-05-12T14:22:13Z","title":"SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T07:01:40.333448Z"},"links":{"cited_paper":"/paper/2510.03117","citing_paper":"/paper/2605.12179"},"observation_digest":"sha256:93482da70554de98e26a56d794307d6fcf4d14eae9cb4abdb4f93b15ffddc568","observation_id":"8d553e74-c230-462f-91a2-63a9399b64b8","resolution":{"observed_at":"2026-06-29T02:14:22.202186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"cited_work":{"arxiv_id":"2510.03117","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.03117","snapshot_observed_at":"2026-07-01T22:16:16.088895Z","title":"Taming text-to-sounding video generation via advanced modality condition and interaction","venue":"cs.CV","work_id":"ad177fe9-45ff-4ee9-86e8-10816af29a59","year":2025},"citing_paper":{"arxiv_id":"2606.02073","last_updated":"2026-06-01T11:01:48Z","snapshot_observed_at":"2026-07-06T23:42:30.555538Z","submitted_at":"2026-06-01T11:01:48Z","title":"Planar Symmetric Pattern Generation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-06-28T15:37:32.767405Z"},"links":{"cited_paper":"/paper/2510.03117","citing_paper":"/paper/2606.02073"},"observation_digest":"sha256:04912538504c2b205846667d8178819c59ba43af189eca78609c00bbe2759a08","observation_id":"4f678117-5b37-4ccd-8b31-428359713c1e","resolution":{"observed_at":"2026-07-01T22:16:16.090144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.03117/citation-record","integrity":"/paper/2510.03117/integrity","json":"/paper/2510.03117/citation-record.json","paper":"/paper/2510.03117"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T12:38:56.059462Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:56.059462Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:90390755d8b73578ce1325d7785d91fe33999f1596134c706515b0eade9486be","observation_id":"f6d1085d-4c0f-4aaa-92ba-2decbfb146aa","resolution":{"observed_at":"2026-08-04T12:38:56.059462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:56.528792Z","title":"Clap learning audio concepts from natural language supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:56.528792Z"},"links":{"citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:3486cfed73db01d80ad6e055a2c9e1bbb1050bbce759bda5f10a32c4a7fdcb39","observation_id":"cff80d68-0d8b-4dae-bd22-293af6b01781","resolution":{"observed_at":"2026-08-04T12:38:56.528792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:56.683788Z","title":"Stable audio open","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:56.683788Z"},"links":{"citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:f9aa707a3a53dac601a6b209421f0f3dcd7be3074e7d3d398009f1cd887597d0","observation_id":"914d8b6e-014e-40d0-84c3-b0e5e2701f6f","resolution":{"observed_at":"2026-08-04T12:38:56.683788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16867","last_updated":"2025-08-17T04:23:19Z","snapshot_observed_at":"2026-08-09T11:36:27.497285Z","submitted_at":"2025-03-21T05:52:50Z","title":"ETVA: Evaluation of Text-to-Video Alignment via Fine-grained Question Generation and Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16867","snapshot_observed_at":"2026-08-04T12:38:56.851936Z","title":"Etva: Evaluation of text-to-video alignment via fine-grained question generation and answering.arXiv preprint arXiv:2503.16867,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:56.851936Z"},"links":{"cited_paper":"/paper/2503.16867","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:bda6d0525760dfb07f39fd91947dd59eabe1e6d7bd826358fadd8ba5b0926601","observation_id":"26c57423-8f68-49ee-9012-7e0b38030f66","resolution":{"observed_at":"2026-08-04T12:38:56.851936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17550","last_updated":"2025-04-09T01:18:01Z","snapshot_observed_at":"2026-08-05T08:44:27.697380Z","submitted_at":"2024-09-26T05:39:52Z","title":"A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17550","snapshot_observed_at":"2026-08-04T12:38:57.293402Z","title":"A simple but strong baseline for sounding video generation: Effective adaptation of audio and video diffusion models for joint generation.arXiv preprint arXiv:2409.17550,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:57.293402Z"},"links":{"cited_paper":"/paper/2409.17550","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:69ada80297b73629849a48b6279b7c6802c9a4f3c63b7a5b2fcec3577c8de406","observation_id":"295887da-3bab-4ee3-bbf4-dd8932dc092b","resolution":{"observed_at":"2026-08-04T12:38:57.293402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-04T12:38:57.563801Z","title":"Inc Kuaishou","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:57.563801Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:301c480a8751f611b17a2ea7023315a74285aeb07033c9dc3a7353a667bfb27c","observation_id":"4dca9b91-a497-4647-95c1-47c63dbb5973","resolution":{"observed_at":"2026-08-04T12:38:57.563801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08402","last_updated":"2024-06-12T16:51:54Z","snapshot_observed_at":"2026-08-08T11:03:41.693497Z","submitted_at":"2024-06-12T16:51:54Z","title":"Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08402","snapshot_observed_at":"2026-08-04T12:38:57.654823Z","title":"Chun-Yi Kuan, Wei-Ping Huang, and Hung-yi Lee","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:57.654823Z"},"links":{"cited_paper":"/paper/2406.08402","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:aa2237a9113295a2ca9f2295a193a57cabf4d8020d979e7503dc85ae44f16c0a","observation_id":"c92327c4-f020-4527-9237-4970f7d13999","resolution":{"observed_at":"2026-08-04T12:38:57.654823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:57.785794Z","title":"Sound-guided semantic video generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:57.785794Z"},"links":{"citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:7f9b460ce583a8a5b98709c198795f9b58777b763b145b3f7d95e7b3f94031b3","observation_id":"34bee314-c44f-4b11-9eb2-b14abdf8bebe","resolution":{"observed_at":"2026-08-04T12:38:57.785794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-04T12:38:57.889197Z","title":"Open-sora plan: Open-source large video generation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:57.889197Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:de945660c54b09b50303f7ab6f4aa33347feedb20f74e96396e9f0da95e6b3d3","observation_id":"c586ab46-a947-48f8-b992-f7cbc7d348af","resolution":{"observed_at":"2026-08-04T12:38:57.889197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-04T12:38:58.063672Z","title":"Flow matching for generative modeling.arXiv preprint arXiv:2210.02747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:58.063672Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:fddaf0b291758e21a1bdd74381fa3a264ac5409f7650298cd4c30e0cb4c80dd5","observation_id":"007728a7-707a-4f8d-9c87-3944ee18eaef","resolution":{"observed_at":"2026-08-04T12:38:58.063672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-04T12:38:58.198477Z","title":"Audioldm: Text-to-audio generation with latent diffusion models.arXiv preprint arXiv:2301.12503,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:58.198477Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:f05399bd0a62602a46e72551080b5d7df2fdb7543d5586d2e28de7e8524de3fd","observation_id":"cf197551-189e-4413-bfbb-75800a2a5d56","resolution":{"observed_at":"2026-08-04T12:38:58.198477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-07-06T20:10:24.217625Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15220","snapshot_observed_at":"2026-08-04T12:38:58.383496Z","title":"Syncflow: Toward temporally aligned joint audio-video generation from text.arXiv preprint arXiv:2412.15220, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:58.383496Z"},"links":{"cited_paper":"/paper/2412.15220","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:4c173a3cf788d5025bca1778046c57706ca25a39d396b670d89f1a476f8177bf","observation_id":"42b6baa9-358b-4bba-97f5-d90724595e5d","resolution":{"observed_at":"2026-08-04T12:38:58.383496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09774","last_updated":"2024-01-18T07:50:07Z","snapshot_observed_at":"2026-08-08T14:40:01.471920Z","submitted_at":"2024-01-18T07:50:07Z","title":"On the Audio Hallucinations in Large Audio-Video Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09774","snapshot_observed_at":"2026-08-04T12:38:58.546588Z","title":"On the audio hallucinations in large audio- video language models.arXiv preprint arXiv:2401.09774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:58.546588Z"},"links":{"cited_paper":"/paper/2401.09774","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:a1363e26e02efec26cfa54d33569567ce97a02ddae3b60e55359a2e00984a04c","observation_id":"aa6800e8-532a-4740-b0e4-4bc2e4687a68","resolution":{"observed_at":"2026-08-04T12:38:58.546588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-04T12:38:58.741505Z","title":"Scalable diffusion models with transformers.arXiv preprint arXiv:2212.09748,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:58.741505Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:db2f5c71895e23f243f6edb94db686fa9b332c7168fc8819964780c1462e0909","observation_id":"55358733-e763-4e3a-98b1-45ca7a1da5a8","resolution":{"observed_at":"2026-08-04T12:38:58.741505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-08-09T18:51:51.917654Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-04T12:38:58.851352Z","title":"Progressive distillation for fast sampling of diffusion models.arXiv preprint arXiv:2202.00512,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:58.851352Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:2f678e944478e9c1573b4f8f0bf59fc4860fd4547980929da31af27334fc7b96","observation_id":"596cd1fa-c47f-4aef-92c1-d4af1235c8dd","resolution":{"observed_at":"2026-08-04T12:38:58.851352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18325","last_updated":"2025-03-17T08:14:35Z","snapshot_observed_at":"2026-08-04T07:32:52.841771Z","submitted_at":"2024-10-23T23:36:06Z","title":"AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18325","snapshot_observed_at":"2026-08-04T12:38:58.958481Z","title":"Avhbench: A cross-modal hallucination benchmark for audio-visual large language models.arXiv preprint arXiv:2410.18325,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:58.958481Z"},"links":{"cited_paper":"/paper/2410.18325","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:48de95ebc7347469f8be2daa909fb1762ec4847815a428a338477e393950938b","observation_id":"89fd54c6-55f7-4915-982e-afac26dd7711","resolution":{"observed_at":"2026-08-04T12:38:58.958481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:59.139436Z","title":"Atom of thoughts for markov llm test-time scaling.arXiv preprint arXiv:2502.12018,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:59.139436Z"},"links":{"citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:5d1a1b1957f675a108455e79132049875d24d0b0a8dedf5efcceedae2601fba1","observation_id":"88a031f4-e492-4d90-9bbb-c414ab844e1b","resolution":{"observed_at":"2026-08-04T12:38:59.139436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-04T12:38:59.220106Z","title":"Towards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:59.220106Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:3b294ff972203474dee0b0c1edbd9cb701824e04096a7e6ea0da5cf8d40c90c8","observation_id":"2c3c091a-23c9-4a18-8790-7f1f7a60d5a1","resolution":{"observed_at":"2026-08-04T12:38:59.220106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:38:59.384196Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:59.384196Z"},"links":{"citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:4252f8aedf954df36a27cc06585431def45a9aa6dc8eb76062b67a8a2c3c2faf","observation_id":"4125dad3-9ae4-4b57-a919-f3c7a845552b","resolution":{"observed_at":"2026-08-04T12:38:59.384196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-04T12:38:59.460371Z","title":"Shuchen Weng, Haojie Zheng, Zheng Chang, Si Li, Boxin Shi, and Xinlong Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:59.460371Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:5120cf7de50cc58ea63d0a43c5d5669ce8249626dc9e6c1a50bf6f53301a2596","observation_id":"d0ec8403-afbd-4bd5-8376-38d561ef2c3f","resolution":{"observed_at":"2026-08-04T12:38:59.460371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-04T12:38:59.540892Z","title":"Yazhou Xing, Yingqing He, Zeyue Tian, Xintao Wang, and Qifeng Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:59.540892Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:bff8d15f0d59ddce1456d2f3c545453b890ca4edc060da95af989e6f92aeacb7","observation_id":"6af38f93-5e40-4170-9be7-204739b9be4c","resolution":{"observed_at":"2026-08-04T12:38:59.540892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-04T12:38:59.637474Z","title":"Qwen2.5-omni technical report.arXiv preprint arXiv:2503.20215,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:59.637474Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:79233f340ea82682e9a423f10e7e11f7c0edb9a0c7a44f6d18eeccc9e45b7645","observation_id":"f022d557-bf23-4f7e-953e-ee71902b74ad","resolution":{"observed_at":"2026-08-04T12:38:59.637474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-04T12:38:59.738442Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:59.738442Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:3e3fa5c819c28b8afdbe3ded9905c0cc55ec4f8849f3d97cde855d2c227d8d22","observation_id":"2ebabfad-8135-401c-ad68-f327bf9b834e","resolution":{"observed_at":"2026-08-04T12:38:59.738442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03897","snapshot_observed_at":"2026-08-04T12:38:59.844041Z","title":"Uniform: A unified multi-task diffusion transformer for audio-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:59.844041Z"},"links":{"cited_paper":"/paper/2502.03897","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:1829b9b3e83467825128d953fb5fe27a6d98e8813b3c7ad697831669380efeed","observation_id":"fe916510-e314-4523-bf4a-49e286c8d953","resolution":{"observed_at":"2026-08-04T12:38:59.844041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-04T12:38:59.929675Z","title":"Open-sora: Democratizing efficient video production for all","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:59.929675Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:bb5f0ef81b1faacfe67467baeca5c2babe8306e7c5ddd1b764f93ba9792ef8c6","observation_id":"04060fd3-7145-471d-96fb-d3432a5d9c37","resolution":{"observed_at":"2026-08-04T12:38:59.929675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:39:00.193571Z","title":"This technique steers the generation pro- cess towards a desired conditionc(e.g., a text prompt) without needing an external classifier","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T12:39:00.193571Z"},"links":{"citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:5dee524ed7af4f6f08bc66fc56d157507101dd8765ba08ffde222311e12817dc","observation_id":"6b6a6274-63ef-4a1d-bc98-7fe359387da2","resolution":{"observed_at":"2026-08-04T12:39:00.193571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06650","last_updated":"2016-06-21T16:42:20Z","snapshot_observed_at":"2026-08-08T13:52:24.420776Z","submitted_at":"2016-06-21T16:42:20Z","title":"3D U-Net: Learning Dense Volumetric Segmentation from Sparse Annotation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06650","snapshot_observed_at":"2026-08-04T12:39:00.038859Z","title":"14 A THEUSE OFLARGELANGUAGEMODELS In this work, Large Language Models (LLMs) are used solely for enhancing writing clarity and En- glish expression","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-04T12:39:00.038859Z"},"links":{"cited_paper":"/paper/1606.06650","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:b3d087fe40748ce6b39dfe4be0158ac7b72d42766bfceb27d47cff7f4341509e","observation_id":"d3105885-199f-46f0-ad1f-7ea8fa4ef1b7","resolution":{"observed_at":"2026-08-04T12:39:00.038859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-04T12:38:59.279588Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:59.279588Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:711fee84f0560c501ea11a81f293b011a17d2b0fe688a198ff24bbd31efa1c0c","observation_id":"d25f7a8e-4b31-46dd-bab6-4a479a67d7ec","resolution":{"observed_at":"2026-08-04T12:38:59.279588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-07-06T09:30:47.469703Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-04T12:38:57.138823Z","title":"Jiawei Huang, Yi Ren, Rongjie Huang, Dongchao Yang, Zhenhui Ye, Chen Zhang, Jinglin Liu, Xiang Yin, Zejun Ma, and Zhou Zhao","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:57.138823Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:4e84a8e87e9ae9c07db4e96a6d3119e21344ae465044dc898fd9d1be9efc1e1a","observation_id":"b2e16779-9699-405d-8958-8f66d33a3c9f","resolution":{"observed_at":"2026-08-04T12:38:57.138823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-04T12:38:56.384224Z","title":"Mmaudio: Taming multimodal joint training for high-quality video-to-audio synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:56.384224Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:4e4426473377a48db0a65afdb9715b382de7857bdcecad00453e499ef91c5dd9","observation_id":"23e273f7-3da5-4cf4-9ee3-4e4cefa5f5fa","resolution":{"observed_at":"2026-08-04T12:38:56.384224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-08T16:07:44.435146Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-04T12:38:57.438703Z","title":"Fr\\’echet audio distance: A metric for evaluating music enhancement algorithms.arXiv preprint arXiv:1812.08466,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:57.438703Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:0730ff66f33cbc8ce8d1d83faf8d2e1c6f39afd109eb1fd6c7da95f3c192bcc6","observation_id":"e8144d74-5a43-4bb6-85dd-216833630784","resolution":{"observed_at":"2026-08-04T12:38:57.438703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-04T12:38:56.194933Z","title":"Tim Brooks, Bill Peebles, Connor Holmes, Will DePue, Yufei Guo, Li Jing, David Schnurr, Joe Taylor, Troy Luhman, Eric Luhman, Clarence Ng, Ricky Wang, and Aditya Ramesh","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:56.194933Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:f8a08b135b5d9edb936cc3fe0f6925cb295f7a447ceeaf1f58432a9f98adf616","observation_id":"a00d6439-4197-49e2-a6c5-bfd1049acff1","resolution":{"observed_at":"2026-08-04T12:38:56.194933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04948","last_updated":"2024-04-02T04:39:08Z","snapshot_observed_at":"2026-08-07T22:29:55.641913Z","submitted_at":"2023-10-08T00:02:25Z","title":"TEMPO: Prompt-based Generative Pre-trained Transformer for Time Series Forecasting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04948","snapshot_observed_at":"2026-08-04T12:38:56.312366Z","title":"Defu Cao, Furong Jia, Sercan O Arik, Tomas Pfister, Yixiang Zheng, Wen Ye, and Yan Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:56.312366Z"},"links":{"cited_paper":"/paper/2310.04948","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:57c25906d121e77f940bebe390654f3d6ade3ae8e136d2603f5b78fecafd85b9","observation_id":"11f089b3-86bc-4e12-8093-03ad70f608d8","resolution":{"observed_at":"2026-08-04T12:38:56.312366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-04T12:38:56.998200Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:56.998200Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:143d2284a510f802bdcf708d1e8f267d82dd05d370b2b516b5a2c77eb0ad2304","observation_id":"4fc2be78-903a-4988-b3c2-2a40cfc66194","resolution":{"observed_at":"2026-08-04T12:38:56.998200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 4 inbound Pith citation observations for arXiv:2510.03117."}