{"as_of":"2026-08-10T11:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:411880c9f9d989d1c290d0d57a8e5fbc2c9833978389382b5d93273d0310b18e","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T05:50:17.733574Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.04957/citation-record","integrity":"/paper/2509.04957/integrity","json":"/paper/2509.04957/citation-record.json","paper":"/paper/2509.04957"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.14441","last_updated":"2024-08-26T17:33:47Z","snapshot_observed_at":"2026-08-04T22:41:39.783541Z","submitted_at":"2024-08-26T17:33:47Z","title":"Attend-Fusion: Efficient Audio-Visual Fusion for Video Classification","version":1},"cited_work":{"arxiv_id":"2408.14441","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.14441","snapshot_observed_at":"2026-08-05T05:50:18.130457Z","title":"Attend-Fusion: Efficient Audio-Visual Fusion for Video Classification","venue":"cs.CV","work_id":"a2c24c06-76b1-45df-9541-3f440796c588","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.519723Z"},"links":{"cited_paper":"/paper/2408.14441","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:14c95052455458dab110d7301eb83bac4b8c770cedefe94d1c79db513870f563","observation_id":"f842bb75-a603-4117-9da5-2b066087a606","resolution":{"observed_at":"2026-08-05T05:50:18.135702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.601614Z","title":null,"venue":null,"work_id":"a5a94616-ac61-4aff-bc83-5ce64a8347f8","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.524856Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:c444d13e3f95804620c886bd2f88b5083f7ad95833fd0794982ef7db3da936f8","observation_id":"d92612f5-0f85-4dc3-8993-f96e18ac2a2f","resolution":{"observed_at":"2026-08-05T05:50:18.606540Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.586835Z","title":null,"venue":null,"work_id":"bbd5be1b-da22-4f04-8b76-a412f3351ad7","year":2020},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.529177Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:292a2aec9d3b8b545f70de64cee6d8ebba7d582c3d4106a2165f41887575c2d6","observation_id":"64b80587-6110-4140-a7e1-9e808d6a1dfe","resolution":{"observed_at":"2026-08-05T05:50:18.591054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-05T05:50:17.533640Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.533640Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:015ad637482d29c57da5633c9161450debfd290d319cde2d333122d966fcac79","observation_id":"b083d87c-44e8-4c1f-b798-83715b8af64d","resolution":{"observed_at":"2026-08-05T05:50:17.533640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.572023Z","title":null,"venue":null,"work_id":"e1930de3-7603-4794-9117-c1b64d58bce2","year":2025},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.538704Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:de688fd744e3b658c0ea64c6e789492de4692681a452360a89155b4bc3f3a808","observation_id":"0a4974b8-f164-4803-9450-e0320ed4036e","resolution":{"observed_at":"2026-08-05T05:50:18.576690Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-05T05:50:17.543238Z","title":"Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.543238Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:b2410ad299dd2913bd1c46332ddb1163ff5f02063a44ee2284395d17cfc16fca","observation_id":"8f7afa3b-c735-43ec-b80b-1d9279f0be44","resolution":{"observed_at":"2026-08-05T05:50:17.543238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-05T05:50:17.548517Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.548517Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:de4c50f49a71ea4b042ee0d55fea96f7ef7cc2c7b1316e5c614f001e184900ef","observation_id":"920e750c-87cb-44a9-90a8-487cc2e9d6d9","resolution":{"observed_at":"2026-08-05T05:50:17.548517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.557977Z","title":null,"venue":null,"work_id":"dfa8e494-49e9-4c9b-b4a0-fc26fb1c0995","year":2021},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.553217Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:cee3ae02a4e2b5ff75ff278edeba27111ce62fc282e0d8e875b5efff35ef47dd","observation_id":"2477458d-f157-461f-a77c-3dec81e27925","resolution":{"observed_at":"2026-08-05T05:50:18.562436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.543039Z","title":null,"venue":null,"work_id":"431bc4a7-fab1-474a-ad4f-d33491b85c14","year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.557627Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:bd3e8bac3fc5118d4fe4d89224c0ec768618a7edfdfcaafcf399a7a74aaecfdd","observation_id":"8b65355f-770c-42a0-9601-7638765eca5f","resolution":{"observed_at":"2026-08-05T05:50:18.547989Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.528600Z","title":null,"venue":null,"work_id":"6a3cf09d-4c1f-448f-b15e-b6792317eccf","year":2017},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.562046Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:72e01b6619431b934e7449f1ece3e38ad80c8127416b79f32eb2f50e795ce4e5","observation_id":"01ee2aa1-7ee7-4fd0-95d3-481ff5b6f6b9","resolution":{"observed_at":"2026-08-05T05:50:18.533267Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:17.566407Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.566407Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:c4f423260e3a50b730e165225bf221e084c679bb47e01974f007027075c141de","observation_id":"ccad6bb4-a840-49e3-8c12-ce157375b9ed","resolution":{"observed_at":"2026-08-05T05:50:17.566407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:17.570895Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.570895Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:9f6b4a6e2314c47c4c0f067b66da17a844e578805f874f5e903439a3dbc85814","observation_id":"f2c81e68-5173-487d-a076-ae32126e42b7","resolution":{"observed_at":"2026-08-05T05:50:17.570895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T05:50:17.575495Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.575495Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:d657023653fad0b635e0c3dfac34f499555908eca9a9ae3bb1df264a1d700953","observation_id":"2daa0361-24c5-4086-8f2b-9dbb3aa95cba","resolution":{"observed_at":"2026-08-05T05:50:17.575495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.494930Z","title":null,"venue":null,"work_id":"d47f63d9-9ab5-44b3-a2a0-fd3f29d97fa2","year":2022},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.580136Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:432045ed07fe69cf87437669f51e4d79054bd6b2414bbba93caa8e65946333d6","observation_id":"adad0761-b7c1-48a1-868f-c62c50dd4d3e","resolution":{"observed_at":"2026-08-05T05:50:18.499605Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.480071Z","title":null,"venue":null,"work_id":"5e438ac9-58be-4390-a9f7-fa0f41bb1aa1","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.584412Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:5d1d8e7b648c719cf838341502d2cd39e4ab28f844fad1550e06a99650c13106","observation_id":"99e9fa52-c8de-4799-bf42-bdf00c1033ba","resolution":{"observed_at":"2026-08-05T05:50:18.484811Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.465705Z","title":null,"venue":null,"work_id":"19e7eba3-48cc-4e52-ba55-2334d1351799","year":2019},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.588724Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:59783e378711fd9e2c64983d35c52174839f9d052a20db4080098b99b1a13123","observation_id":"18893818-3c1a-4f82-b771-ea52e6e531cf","resolution":{"observed_at":"2026-08-05T05:50:18.469860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.451533Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"28c554e5-7552-46d5-94d9-2c60dd0f808c","year":2015},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.593020Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:52ba0afe2a5ea7191856bb61743e3e34fbfcacbabd5e808ebb031965b5241f3d","observation_id":"b7ccc4d3-bb00-44a2-a790-a168969d09b1","resolution":{"observed_at":"2026-08-05T05:50:18.456063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.436950Z","title":null,"venue":null,"work_id":"82458efc-2b78-48e5-985b-56fa708c730a","year":2020},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.597490Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:2cb8f709ac12cadbad8ebc472903093f4d530d8ccf3d24a39b73e500ae5b298b","observation_id":"17df4267-1f6d-436d-96a8-c81db972266b","resolution":{"observed_at":"2026-08-05T05:50:18.441960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.421737Z","title":null,"venue":null,"work_id":"c8553fe3-7c2b-478e-89ab-30b2c2b076b0","year":2022},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.601835Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:93be2edd349417f68c536721c680522c3296a77ec5108c5b1b3d654d22fbb785","observation_id":"1108955e-afe4-412a-af83-d5f6f9f2b367","resolution":{"observed_at":"2026-08-05T05:50:18.426643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:17.606300Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.606300Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:bb922f77aefbfce7ab435dfd74474e5c1ebb0de4cb428e91bb07661d6ffd64f0","observation_id":"f37833bb-2ede-4a41-a0f5-d21a26a422e8","resolution":{"observed_at":"2026-08-05T05:50:17.606300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.407450Z","title":null,"venue":null,"work_id":"ad6907ab-6ff6-4b22-99f2-72869f15106e","year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.610788Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:7f3e4e61faac158ee13e2e5ba4ae96e10501f8b36689f5e8aaf94e25fe073dea","observation_id":"1bf7075f-6193-42a6-bd20-d612f08a4319","resolution":{"observed_at":"2026-08-05T05:50:18.411781Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-05T05:50:17.614967Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.614967Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:98cdb7b7f1cfb8a0a6de01cee67ac63fb1bb0c1ccbe0ec693dea95593503084c","observation_id":"975cc498-caf8-4376-b9ce-d025e0bd1d04","resolution":{"observed_at":"2026-08-05T05:50:17.614967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T05:50:17.619399Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.619399Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:ce2e79d434f7c60764adb7ec8c8e6f08ee2dea2b20e25ce59f4d146031904623","observation_id":"66111a53-d5f5-48bc-9bb2-83037c25e61c","resolution":{"observed_at":"2026-08-05T05:50:17.619399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.392707Z","title":null,"venue":null,"work_id":"b6ca300e-bd6e-474c-a45b-4e1234eee67a","year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.623593Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:9dd22dbb7dc76c3e5c56bd99641442bd83cdb9f48117c1714214d4ee6f8e987f","observation_id":"0d32f6cb-e52f-4189-9917-074c376419be","resolution":{"observed_at":"2026-08-05T05:50:18.397292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.33996","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:17.938126Z","title":"Plumbley","venue":null,"work_id":"00fa6bac-67c2-4fbc-bf19-e37c29cd8e35","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.627972Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:c9d864b0cfcb4e8dcd02c54fc3728830edb9503b999fddb5e6365ec13f8af686","observation_id":"d382af3b-d5a5-497c-b424-bca310888960","resolution":{"observed_at":"2026-08-05T05:50:17.945212Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.378672Z","title":null,"venue":null,"work_id":"bda39ba9-d6b1-4bf9-90cc-0435d6ebd11c","year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.632277Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:ca44a6af4e8942538bedbe15e30052ea6730b9a83575a91994ffeb0027ce0c4a","observation_id":"67980384-74a7-4b10-a69f-40e82ae3e346","resolution":{"observed_at":"2026-08-05T05:50:18.383059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.364494Z","title":null,"venue":null,"work_id":"0433b89b-2693-4b27-bbc9-cde0a167bba2","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.636526Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:5d52f9d18288475284f26e4888b1653f5c0164282b62d3b4a055bac0e15a5e5a","observation_id":"2004328e-cec0-4701-ad35-823601a41df6","resolution":{"observed_at":"2026-08-05T05:50:18.368955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.349803Z","title":null,"venue":null,"work_id":"b8223669-7fb1-4fb1-be4e-8fe04ac3b148","year":2019},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.640702Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:19d52c1958a6c71d9e8e518f751a675b9210e6e330360eb355acc5d75aceef94","observation_id":"52cdf0cd-88c2-47ff-8f27-7cf897e9e091","resolution":{"observed_at":"2026-08-05T05:50:18.354042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.335219Z","title":null,"venue":null,"work_id":"5c4db931-59bc-4d1f-b7b1-b917a2a65bff","year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.645138Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:b5ae365eb8e98927eee3bc149446a4c7ae0d96e393d5b56ec15e77654a16d415","observation_id":"31785116-109a-4ac6-a46d-f4f50b0ebf38","resolution":{"observed_at":"2026-08-05T05:50:18.339848Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10537","last_updated":"2023-09-19T11:33:43Z","snapshot_observed_at":"2026-08-03T15:07:22.214539Z","submitted_at":"2023-09-19T11:33:43Z","title":"FoleyGen: Visually-Guided Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10537","snapshot_observed_at":"2026-08-05T05:50:17.649506Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.649506Z"},"links":{"cited_paper":"/paper/2309.10537","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:2ccb251eaca831473bda0c7799f07decac2bba0cd53e5c7087e12135a347f347","observation_id":"e9fa5e75-9146-4be3-b3ce-2a4d7c1b470c","resolution":{"observed_at":"2026-08-05T05:50:17.649506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.321009Z","title":null,"venue":null,"work_id":"e273351e-c3df-40a6-ae97-cd17806728a6","year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.654064Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:18d12d41cbb256d3412801d5b36606307c32d4c323eeccea75515fecee51e6cb","observation_id":"319ee91f-0d9e-4a29-a079-c133b1f3be5e","resolution":{"observed_at":"2026-08-05T05:50:18.325583Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T05:50:17.658718Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.658718Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:5d7bfadcafbafab0af64f35ce80ffe34e29f7c8116435e4b1b86ba7bdc1d3e52","observation_id":"4b766f44-b95b-4d07-87df-f4552eaff303","resolution":{"observed_at":"2026-08-05T05:50:17.658718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.307137Z","title":null,"venue":null,"work_id":"d6bff203-7167-41e1-83cc-d69c2086c4d4","year":2021},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.664093Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:ff9484984ee657b404c0792018cb058b31e70c29eb2cc6639128bd2eb98aa853","observation_id":"17ed6f0b-e814-4182-b78b-2bb016ad8d92","resolution":{"observed_at":"2026-08-05T05:50:18.311338Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.293120Z","title":null,"venue":null,"work_id":"19d5a55c-75a6-4efb-8e80-81567f649300","year":2019},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.668943Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:aeea5f7e742525d17bc6f4053204f91d5e7d7ffeacfcdacda14365b23e6d6c9e","observation_id":"24abc524-30d2-4a93-b5fd-f162697875f6","resolution":{"observed_at":"2026-08-05T05:50:18.297367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.277944Z","title":null,"venue":null,"work_id":"ee9669cf-ffaf-456f-b452-07fd8f6b4435","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.673895Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:b8ae33bf1c15b21ea744e66ac618857b164ee2f639a2b088167c0a02694e610b","observation_id":"b7494c12-2a84-418d-92fb-3603cd230f03","resolution":{"observed_at":"2026-08-05T05:50:18.283544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08601","last_updated":"2025-03-24T04:00:01Z","snapshot_observed_at":"2026-08-09T12:58:51.986437Z","submitted_at":"2024-09-13T07:31:44Z","title":"STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08601","snapshot_observed_at":"2026-08-05T05:50:17.678651Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.678651Z"},"links":{"cited_paper":"/paper/2409.08601","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:450c173737a86779684b8d177197e9ac35e3d0a7332ce9449d5a0c26b4c0a1ac","observation_id":"18a912f6-1e23-49fe-8f26-677563723251","resolution":{"observed_at":"2026-08-05T05:50:17.678651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.264301Z","title":null,"venue":null,"work_id":"39619b08-bc4c-4b9c-91da-bf434abb0c22","year":2022},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.684187Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:d1dddb84014167178dd048d6863a9eb12242fb396cc1aa333afbf273449adbff","observation_id":"7da1f194-15b0-4b70-b537-2d88fe5436de","resolution":{"observed_at":"2026-08-05T05:50:18.268582Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.250297Z","title":null,"venue":null,"work_id":"00e1a9a4-21d1-4b7d-a4f0-74510eb9b28a","year":2020},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.688905Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:429210c927db132ee59f9c77d6e5d891f8913526da935a1a819b099a7430717d","observation_id":"104718a5-30aa-4099-98b6-1dcbbc970e99","resolution":{"observed_at":"2026-08-05T05:50:18.254648Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.235722Z","title":"Stilwell","venue":null,"work_id":"dd897256-980c-4028-b250-5eb87e6b8503","year":2007},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.693279Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:7c1f76c8e27c9b0781f1f60d1de2c629c1745bb8a39a1964453d6348d7531826","observation_id":"99e60a90-e50d-4f49-8c2b-09ca4e1d6b7e","resolution":{"observed_at":"2026-08-05T05:50:18.240302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.221488Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"455aa702-99bd-4a51-a635-a245b3649cff","year":2017},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.697683Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:b706159f0b135fe79dd4e2da8a13712ab2dcf2585ce5932b930ddd9c53501a4d","observation_id":"105322e9-47c3-4fe6-a387-86a7f29ce25e","resolution":{"observed_at":"2026-08-05T05:50:18.226263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13689","last_updated":"2024-09-20T17:59:01Z","snapshot_observed_at":"2026-08-04T07:34:16.448345Z","submitted_at":"2024-09-20T17:59:01Z","title":"Temporally Aligned Audio for Video with Autoregression","version":1},"cited_work":{"arxiv_id":"2409.13689","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.13689","snapshot_observed_at":"2026-08-05T05:50:17.804576Z","title":"Temporally Aligned Audio for Video with Autoregression","venue":"cs.CV","work_id":"77f792bd-3ccf-4add-93d8-381a810ac0bf","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.701833Z"},"links":{"cited_paper":"/paper/2409.13689","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:9db7cf2086f5ea01b63ae05737002b7d0d9bff51d77c80d5e791d113be11e37c","observation_id":"0fdf94d3-d15b-4f2c-90d6-0d5ded89b42b","resolution":{"observed_at":"2026-08-05T05:50:17.811973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.205685Z","title":null,"venue":null,"work_id":"af08d388-9b34-4e18-abf7-3a456090f566","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.706257Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:ac621cb02c5f594d882532545e6899e1a01851331377f0fef629994f36c7c99e","observation_id":"a01090d7-0673-45c0-9e59-9b88d94a7785","resolution":{"observed_at":"2026-08-05T05:50:18.210766Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.190696Z","title":null,"venue":null,"work_id":"c31f0f07-b8e7-47a0-bc20-1ee83f6e201c","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.710751Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:2d8d0116f4e8cdc403bf1fbe413314f5781c8ce628f3765666a3519c5cd3898b","observation_id":"91c118c5-e7c3-42f4-b2af-1d7d9026b95d","resolution":{"observed_at":"2026-08-05T05:50:18.195399Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.175749Z","title":null,"venue":null,"work_id":"c128e823-e4e5-4245-83d9-eaee5778f53b","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.715111Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:7a9a7121e38d86c6ccb5adaf7135e8308466fa5ce34b4ed6371d0a58b9d3fd01","observation_id":"9719fa83-b505-4803-b709-146fe5f4a38a","resolution":{"observed_at":"2026-08-05T05:50:18.180556Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.160715Z","title":null,"venue":null,"work_id":"8c4c8a79-a058-4098-acb1-76bc21e31019","year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.720146Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:25434c1b4d3c4a0df1bc06a800930beccc39e8a1f8cbcfb83305d29aa44f859b","observation_id":"f64d7a23-799d-4b28-95d8-91d5f431c613","resolution":{"observed_at":"2026-08-05T05:50:18.165361Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.145744Z","title":null,"venue":null,"work_id":"6632d242-52d5-458f-a6c6-6ec5f09cc57d","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.724549Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:c96750cf2d7c552e2c6d0a36746049cb8acc87088c7b2b2718cce128badedf0c","observation_id":"27c7109f-22b1-4a40-9825-173789221db5","resolution":{"observed_at":"2026-08-05T05:50:18.150775Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-07T10:46:50.742580Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-05T05:50:17.728841Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.728841Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:256a5a1103ecaf17a0983bb2f130213fd7000a5dfef1d24b056ef464befc5e0a","observation_id":"74f1ff39-134b-41a1-b0fa-820359ac3e42","resolution":{"observed_at":"2026-08-05T05:50:17.728841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T05:50:17.733574Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.733574Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:3e43ae2efb6071fd2c1fd10c6a7edaa5e4fb342b8191d4ff3aa8cf3767abd67b","observation_id":"a6f882af-01b9-441a-9d80-225faee1280e","resolution":{"observed_at":"2026-08-05T05:50:17.733574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":42,"verified_exact":2,"verified_fuzzy":3},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2509.04957."}