{"as_of":"2026-08-19T23:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ad20cb3971a13217f4ff43dee67f1442f9db94ab190a13cb13fd0365a109119f","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:46:32.585912Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:46:32.435054Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-04T23:46:32.951229Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"cited_work":{"arxiv_id":"2509.06389","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.06389","snapshot_observed_at":"2026-08-04T23:46:32.951229Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","venue":"cs.SD","work_id":"01546693-e1cb-44c2-9e79-ba11953f1c5e","year":2025},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.435054Z"},"links":{"cited_paper":"/paper/2509.06389","citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:50f772f9300fb3681b73be936aaf5ee7b1d1cb9753a530fbbfcd369df7bb1a10","observation_id":"3600fb9b-cce2-4bb8-a054-c5e367bbf70a","resolution":{"observed_at":"2026-08-04T23:46:32.956166Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.06389/citation-record","integrity":"/paper/2509.06389/integrity","json":"/paper/2509.06389/citation-record.json","paper":"/paper/2509.06389"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"cited_work":{"arxiv_id":"2509.06389","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.06389","snapshot_observed_at":"2026-08-04T23:46:32.951229Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","venue":"cs.SD","work_id":"01546693-e1cb-44c2-9e79-ba11953f1c5e","year":2025},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.435054Z"},"links":{"cited_paper":"/paper/2509.06389","citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:50f772f9300fb3681b73be936aaf5ee7b1d1cb9753a530fbbfcd369df7bb1a10","observation_id":"3600fb9b-cce2-4bb8-a054-c5e367bbf70a","resolution":{"observed_at":"2026-08-04T23:46:32.956166Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.358231Z","title":"On top of this backbone, MeanFlow formulation is introduced which directly models the average velocity to enable native one-step generation","venue":null,"work_id":"119316b5-126a-4577-a006-08ec6fe0eb9d","year":null},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.440419Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:d12b682181d4baa85ee0316879317ce3f9e7ac323e04404ac7ec00b85df82aa2","observation_id":"03f5461a-ad39-404e-a58c-f6d106d9c3ad","resolution":{"observed_at":"2026-08-04T23:46:33.363058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.344185Z","title":"Multimodal Dataset The proposed MF-MJT is trained on multimodal datasets comprising both audio-video-text and audio-text pairs","venue":null,"work_id":"2871a917-55b9-4680-a5a9-14d43bcd0ca1","year":null},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.444989Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:8548d7f502eaab8c77feac5b3ed1654b716db2552540a7d2b9c3e4b4c8a5184c","observation_id":"3fd227ec-169f-479e-8daf-41354811e4b9","resolution":{"observed_at":"2026-08-04T23:46:33.348985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0820.5420","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:32.922480Z","title":"Comparison with Baselines Table 1 summarizes the performance of the proposed MF-MJT against representative VTA synthesis baselines on the VGGSound test set","venue":null,"work_id":"cae97577-e466-4ea6-8aa3-30eb61feca7e","year":null},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.449742Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:660fe226d6cb882354fa3b2d5ae75dba3ff9cb5f6b11fecfbdc01ecc07ac7184","observation_id":"5f345c19-dbae-41e8-8956-f0fc65fd41f9","resolution":{"observed_at":"2026-08-04T23:46:32.934088Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.329630Z","title":null,"venue":null,"work_id":"4d75c02b-b8b6-4ffe-8e47-2cdab73b6ca1","year":null},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.455488Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:ef805b13cceb94cf67ea5bf58eeaff54b8477cc75e56805f933028248217fc04","observation_id":"5f5c05e2-f170-4adf-a37d-ab118d5c469f","resolution":{"observed_at":"2026-08-04T23:46:33.334130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.315243Z","title":"Frieren: Efficient video- to-audio generation network with rectified flow matching,","venue":null,"work_id":"b9f69183-563b-4f3b-ae87-a551a2b67398","year":2024},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.459826Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:9b73e29ea2a3cf1ef40b503bf953a9bb6b77bc08fe8df351807d3ece1ce485f9","observation_id":"a67df04d-e494-46b0-a727-aed4387b61e6","resolution":{"observed_at":"2026-08-04T23:46:33.319821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.299879Z","title":"LoV A: Long-form video- to-audio generation,","venue":null,"work_id":"67477282-856d-44fb-b143-6571c9bddd14","year":2025},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.464269Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:fbc7dc430278144e5dd58573cc75358f3489d1d9aa64a30ab62fe1d8c836c734","observation_id":"b2172030-e743-4194-8873-e560323e78b9","resolution":{"observed_at":"2026-08-04T23:46:33.304827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.284985Z","title":"AudioLDM: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":"ec11555d-12a9-4e99-880c-da37c7fd76c9","year":2023},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.468413Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:6cb7a36692dbfe8022d18d968cc0f719a659b5e7824369de52d5ee5f147f35e6","observation_id":"042929a9-f966-4f2d-a360-4236041ad7a7","resolution":{"observed_at":"2026-08-04T23:46:33.289701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.269525Z","title":"ImageBind: One embedding space to bind them all,","venue":null,"work_id":"f02398eb-b78f-420f-8dc9-4e9cf02bfc1c","year":2023},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.472472Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:42bcee35b39fb563708864ddd0a3d2a135d7ea8bc76acaa6822bd2bf33da4600","observation_id":"47b97ae1-b526-4cfb-a4a5-55c4653ba99c","resolution":{"observed_at":"2026-08-04T23:46:33.274510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.252813Z","title":"Seeing and Hearing: Open- domain visual-audio generation with diffusion latent aligners,","venue":null,"work_id":"000a9c90-c349-4c47-a038-00a9d1485ad8","year":2024},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.476656Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:17dc324c76cc25a21cf753c67ad86771e5f638fdc657fc58167731d6f60de423","observation_id":"84baceec-4072-4255-a76d-e439ee6b142b","resolution":{"observed_at":"2026-08-04T23:46:33.257882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-19T13:11:56.801120Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-04T23:46:32.481088Z","title":"FoleyCrafter: Bring silent videos to life with lifelike and synchronized sounds,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.481088Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:c0e463e0f1b12bb09943ba34a8f6c681a2197b149a027c89e98536c652ea1012","observation_id":"0dcbd26a-08fd-4884-adeb-b9529976d844","resolution":{"observed_at":"2026-08-04T23:46:32.481088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.237549Z","title":"TA-V2A: Textually assisted video- to-audio generation,","venue":null,"work_id":"7ccbb407-35a4-4a94-a46d-77f5d9d0b6c3","year":2025},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.485945Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:f266204f31835cce60d1ce48430ca33ea5079d000234333126e976b44f0d4823","observation_id":"6b767ada-39d8-4d89-adaf-751159b082f7","resolution":{"observed_at":"2026-08-04T23:46:33.242030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.223206Z","title":"MMAudio: Tam- ing multimodal joint training for high-quality video-to-audio synthesis,","venue":null,"work_id":"c2d81cba-77fb-4db0-8d29-9295392f5b59","year":2025},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.489971Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:95017669519827b2190eaead195c62fdd490e5c14ff94aada9bbe9e221057161","observation_id":"41ae4ce0-e219-4ab1-9cbe-e6fbf2058de3","resolution":{"observed_at":"2026-08-04T23:46:33.227680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:32.494196Z","title":"Kling-Foley: Multimodal diffusion transformer for high-quality video-to-audio genera- tion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.494196Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:c551be55b9d89d77ae645c24b5e44ca5f98f671c38b7890917add29e2e21c7b7","observation_id":"30f5277f-ba65-4eef-bdb6-289bf375842d","resolution":{"observed_at":"2026-08-04T23:46:32.494196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.207601Z","title":"Denoising diffusion probabilis- tic models,","venue":null,"work_id":"fa4aa8f7-51e7-4cae-9dd1-04dc93691255","year":2020},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.498259Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:faaa8dd24d92c050b4c85da27cb37025169bc6d9cdb328e7db991fe5a06fc438","observation_id":"4e0faab3-cb83-47e5-9dbc-ff112b26a7bd","resolution":{"observed_at":"2026-08-04T23:46:33.212191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.193204Z","title":"Flow straight and fast: Learn- ing to generate and transfer data with rectified flow,","venue":null,"work_id":"f390451a-c91e-49ee-b29b-a2a5f65e1104","year":2023},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.502378Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:42e5ba8306a0851820bdf1dcc7aca1f5f9e28e9e259e118f2474d9ad05a5534f","observation_id":"2bb2793f-c683-49cd-bbe6-6032eff702ec","resolution":{"observed_at":"2026-08-04T23:46:33.197545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.178976Z","title":"Instaflow: One step is enough for high-quality diffusion-based text-to-image generation,","venue":null,"work_id":"b93f2522-39eb-4032-98a7-5081bfce9a38","year":2024},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.506431Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:3dc60da8cbefe17297335eb8a8ffc5b7b2dc108edb0d9b190f4dd01ed470a9dc","observation_id":"a9688b03-26c1-46ab-b37e-091350255898","resolution":{"observed_at":"2026-08-04T23:46:33.183440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13447","last_updated":"2025-05-19T17:59:42Z","snapshot_observed_at":"2026-08-17T11:34:19.285953Z","submitted_at":"2025-05-19T17:59:42Z","title":"Mean Flows for One-step Generative Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13447","snapshot_observed_at":"2026-08-04T23:46:32.510295Z","title":"Mean flows for one-step generative modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.510295Z"},"links":{"cited_paper":"/paper/2505.13447","citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:c47ab9d5600714d1b8a364ce61bbb2289da97f9888e3bd061c81abbe65dd6e49","observation_id":"896d1435-b761-40ad-a5be-728234741047","resolution":{"observed_at":"2026-08-04T23:46:32.510295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-04T23:46:32.514602Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.514602Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:2d098b56ac94465a4365758eff57c5063d907c3e0308e5f074eb10da404e75f8","observation_id":"1c1debeb-1c45-4715-bfe5-e3a9505e361b","resolution":{"observed_at":"2026-08-04T23:46:32.514602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18886","last_updated":"2025-04-03T09:03:32Z","snapshot_observed_at":"2026-08-16T12:47:15.960378Z","submitted_at":"2025-03-24T16:59:57Z","title":"CFG-Zero*: Improved Classifier-Free Guidance for Flow Matching Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18886","snapshot_observed_at":"2026-08-04T23:46:32.518893Z","title":"CFG-Zero*: Im- proved classifier-free guidance for flow matching models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.518893Z"},"links":{"cited_paper":"/paper/2503.18886","citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:3a3285cdf60740d7872b7062481fc52724ef6ad08471f69df1546c2569746be9","observation_id":"992acc49-5a1e-412d-86bd-554aa35a69ab","resolution":{"observed_at":"2026-08-04T23:46:32.518893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.164980Z","title":"Scaling rectified flow transformers for high-resolution image synthesis,","venue":null,"work_id":"1c05f1b9-7619-4c74-aa56-6cb252a059ea","year":2024},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.523361Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:642b3e9a6921044ba5ac1f225a0e1bc715a511076ff89f703419821e5c48c7b2","observation_id":"d78d1673-8707-46fe-967c-4e491df61e79","resolution":{"observed_at":"2026-08-04T23:46:33.169343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.150356Z","title":"Scalable diffusion models with trans- formers,","venue":null,"work_id":"40932e82-d8a1-4344-af72-dc5dc8fba6c6","year":2023},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.527401Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:7be624ee7044f3bbce52a8e0efa3409847c9caff4e01210a5d09feeab496c1ff","observation_id":"56f499bf-339a-48f6-a196-eb479603b0a3","resolution":{"observed_at":"2026-08-04T23:46:33.154757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.135927Z","title":"Learning transfer- able visual models from natural language supervision,","venue":null,"work_id":"f193e46c-61a7-4593-bb97-ee836b4cd56d","year":2021},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.531552Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:675b97b37a0dae3ff3fcc7169da58a781beb678d837171bf6baa8d65a51fe27f","observation_id":"a1303cec-94e9-40a7-8d4f-5d6781368649","resolution":{"observed_at":"2026-08-04T23:46:33.140434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.121674Z","title":"A versatile diffusion transformer with mixture of noise levels for audiovisual gen- eration,","venue":null,"work_id":"9ceb3b9c-2a73-49d0-ad1c-40dee0a128d5","year":2025},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.535534Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:d79927a6735d1d01e84582ff3b28541cd218eeb366ca95ce7b8de976fb7c0695","observation_id":"5079f05a-0c9a-4aeb-b6fc-e0f069be909e","resolution":{"observed_at":"2026-08-04T23:46:33.126195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.107332Z","title":"Synchformer: Efficient syn- chronization from sparse cues,","venue":null,"work_id":"32594aa3-9a14-4580-be6d-7502e43118af","year":2024},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.542615Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:cd6c780350ef0180a161ca46fc0373afa53980cd5981a4bf5a1b0f5e2d64daa0","observation_id":"358179d5-ffae-4870-b6d1-f346144c9806","resolution":{"observed_at":"2026-08-04T23:46:33.112032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.092814Z","title":"Score-based generative modeling through stochastic differential equations,","venue":null,"work_id":"26449ad7-ee90-47b4-8578-257c952e3539","year":2021},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.546543Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:7aab70ab83d0f9df8e2c29c9aaf29a345e1bec54b1a4887bfbbafd5779d3108d","observation_id":"72ba48a8-6683-4bfb-93da-3286d88a10e2","resolution":{"observed_at":"2026-08-04T23:46:33.097241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.078808Z","title":"VGGSound: A large-scale audio-visual dataset,","venue":null,"work_id":"42ba635b-9ecb-4436-b673-c4eb0878bcc0","year":2020},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.550612Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:856a64b3db152bdf7caf36f0bd86bf41894310673aaf3f5672109de614f813a5","observation_id":"f9c9b6c0-aecb-4e90-bd51-744f0d1fa999","resolution":{"observed_at":"2026-08-04T23:46:33.083256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.063202Z","title":"AudioCaps: Generating cap- tions for audios in the wild,","venue":null,"work_id":"ba50d8bc-5717-43c8-84bc-2c4a776c1f0d","year":2019},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.555203Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:51d92ec9ea126eeaa4b469434b25b436d87487f0e314e7fa3bb76c023f9b3b2d","observation_id":"c7ca1149-03fd-48b4-b82f-a105d0d9e8b4","resolution":{"observed_at":"2026-08-04T23:46:33.067953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.048126Z","title":"WavCaps: A ChatGPT- assisted weakly-labelled audio captioning dataset for audio- language multimodal research,","venue":null,"work_id":"94909913-977d-4c71-96b0-37a1ecd023b0","year":2024},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.559318Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:f95b59380e6217a5a75c9ed593483ef0ba4f301e1b375331faf03b004057ea71","observation_id":"ba099949-7db9-43f2-9403-2a65f35fabf5","resolution":{"observed_at":"2026-08-04T23:46:33.052749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-04T23:46:32.563516Z","title":"Decoupled weight decay regular- ization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.563516Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:ae85c882f757c12e769ce7df8f3a78f79c885522825442671ab48ce6633a3a5a","observation_id":"11b40170-8da9-4314-948a-d1aadc9f118e","resolution":{"observed_at":"2026-08-04T23:46:32.563516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.033089Z","title":"Audio Set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":"86fb40e3-e1dd-4635-8414-297f98852865","year":2017},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.568945Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:983c4f0ae4f418c7ecebb8ffaa17939ef8bcb322c41106137e15fa87a55633e4","observation_id":"d42521d5-2ffb-4f22-a5c0-9e33a9c06816","resolution":{"observed_at":"2026-08-04T23:46:33.038213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.016275Z","title":"PANNs: Large-scale pre- trained audio neural networks for audio pattern recognition,","venue":null,"work_id":"7bd88099-a1be-4986-b149-ca6aca9d85bc","year":2020},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.573072Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:5f15b6a6a9237cd9387f2a0ec72e3efdd426fd54e6790218f0ac5d156be2d6c7","observation_id":"b4f63100-b62e-409a-9b3b-bb3b38fa46af","resolution":{"observed_at":"2026-08-04T23:46:33.020868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:33.000700Z","title":"Efficient train- ing of audio transformers with patchout,","venue":null,"work_id":"6292c60f-791e-4b22-89c1-2c27bca320f5","year":2022},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.577230Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:9646226c9bd7bead3dc6256f750c99c44b4f9ad391a0a10a9dd4e33c7f450fbe","observation_id":"b1ebeab0-251d-4093-bf90-e8ce74829df5","resolution":{"observed_at":"2026-08-04T23:46:33.005535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:32.985120Z","title":"CLAP: Learn- ing audio concepts from natural language supervision,","venue":null,"work_id":"400836eb-db03-4ee8-8942-39807601c479","year":2023},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.581541Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:2f839ae874db18b7e1183911ced855d3173b47e2ec4ab1b69d230f2822d80874","observation_id":"d9a819d7-f750-4095-bbfc-7dc47566a11d","resolution":{"observed_at":"2026-08-04T23:46:32.989932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:32.967707Z","title":"AudioLCM: Efficient and high-quality text-to-audio generation with minimal inference steps,","venue":null,"work_id":"b20ef965-c778-429c-af58-65bf994d07e7","year":2024},"citing_paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T23:46:32.585912Z"},"links":{"citing_paper":"/paper/2509.06389"},"observation_digest":"sha256:8433a6592d49e83c836188e4236298c08bd4148fa327e640f7c41c55c987536e","observation_id":"a7287d51-c426-474d-a050-35f35fa93fdf","resolution":{"observed_at":"2026-08-04T23:46:32.973426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.06389","last_updated":"2025-09-08T07:15:21Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-18T02:43:47.969697Z","submitted_at":"2025-09-08T07:15:21Z","title":"MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":7,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2509.06389."}