{"as_of":"2026-08-20T07:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cc7d48e0dd074e9485f9df7f3c67ba9089f840f30a983c37a7bb044ff8dbbed0","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:21:58.967310Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.22053/citation-record","integrity":"/paper/2505.22053/integrity","json":"/paper/2505.22053/citation-record.json","paper":"/paper/2505.22053"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:21:52.288197Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:52.288197Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:09142769ff07f5ef4184918f110710f1785cdba7bf9cb3ff4d650765e39f8f5c","observation_id":"e59564b0-faa7-4fa2-b063-1cfdf8a78654","resolution":{"observed_at":"2026-08-07T13:21:52.288197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:05.457787Z","title":null,"venue":null,"work_id":"e304daa9-8b6e-4caf-86e8-d8aec0f37a91","year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:52.354675Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:6a74d23c3d43f7c0f404357592d4b1e62a573407fa62b759b4fdf9134cf90d54","observation_id":"64ecccab-f79b-48ec-9a8c-1a3a7fc068e1","resolution":{"observed_at":"2026-08-07T13:22:05.496317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:05.322075Z","title":null,"venue":null,"work_id":"5266fb0f-0b2d-423e-8d8d-84e78d73c1a9","year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:52.455828Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:9d729c43a71a49f22c85f1fc6bdba4be66a0165079f67f688548224ffbdea87f","observation_id":"8bda85d4-81a5-46aa-8b0f-46e61aeb39e2","resolution":{"observed_at":"2026-08-07T13:22:05.393667Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:05.155284Z","title":null,"venue":null,"work_id":"5d29a218-cc94-4c7c-aea9-017793f061c7","year":2020},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:52.587724Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:d542ed95d7ed6f646601d5b93333af7c04cb50039caebab19b38b618b806fb02","observation_id":"df47d99a-1d52-4dd4-9dad-0b517ca5f2f0","resolution":{"observed_at":"2026-08-07T13:22:05.212173Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:05.012133Z","title":null,"venue":null,"work_id":"1989974b-ee25-4882-ab5c-d6b9f9b753d3","year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:52.725127Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:e0e2e27c9f60597ae3bb07a5a7999d460ec03cf3ed900c3b41023107852974bd","observation_id":"ae9c5823-7e1b-47ea-96ea-dbe1f43f8c2f","resolution":{"observed_at":"2026-08-07T13:22:05.079914Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-16T05:58:47.061997Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-07T13:21:52.835786Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:52.835786Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:0b3c389c3096debf7d5afdfdfe91cc6f40a79d2892516b455df41e6e7158bd0d","observation_id":"be4f4d1f-8775-4a22-91e8-4e49ee6ee2dc","resolution":{"observed_at":"2026-08-07T13:21:52.835786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15322","last_updated":"2025-04-07T18:00:00Z","snapshot_observed_at":"2026-08-18T13:59:15.022742Z","submitted_at":"2024-12-19T18:59:55Z","title":"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15322","snapshot_observed_at":"2026-08-07T13:21:53.035618Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:53.035618Z"},"links":{"cited_paper":"/paper/2412.15322","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:704d17581cebe7d54bee4f6e8b3791b189252a537409182716f21a8eea59ca29","observation_id":"30f33d15-5961-462a-a3c1-2596da605e46","resolution":{"observed_at":"2026-08-07T13:21:53.035618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:04.870554Z","title":null,"venue":null,"work_id":"fe96c0e8-614b-45f5-8151-0c54acc4904a","year":2025},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:53.217158Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:4cc2bdf66bbf407dd5400e9c8317f4ad9a87bc4083c774ed47a31fb367efa772","observation_id":"928f9db6-b39d-41bc-8a1f-97fbde115821","resolution":{"observed_at":"2026-08-07T13:22:04.933514Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:04.692469Z","title":null,"venue":null,"work_id":"a7a4cf39-797e-4033-afd7-234cffdd754b","year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:53.359002Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:f8237e6e32a26dc7943f41d6d0cfb8425f8528d32f00a60b67fafb085e718922","observation_id":"0685359b-7a42-4457-841b-712cee014186","resolution":{"observed_at":"2026-08-07T13:22:04.775608Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:04.541018Z","title":null,"venue":null,"work_id":"e37bc3ff-dacc-4fd3-9827-0a2c81aab9c2","year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:53.464057Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:bc3110d5e36e374db92d640c25ef75817005870e2aca5a5c7e407b3ba750a783","observation_id":"a09098c8-da34-4399-b0d1-2434d0bf4d40","resolution":{"observed_at":"2026-08-07T13:22:04.610186Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:04.412637Z","title":null,"venue":null,"work_id":"8cfc71db-d0ba-4ec8-9570-68bef57483e1","year":2023},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:53.581105Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:221a711fa561b8bee99a13e78889efccb299186725f6a6130f3d7d7e2d5b732d","observation_id":"c2beeb1f-e6d0-4a78-b4b4-fed8e7dcf683","resolution":{"observed_at":"2026-08-07T13:22:04.479355Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:04.189595Z","title":null,"venue":null,"work_id":"3b770ae9-d4bd-4814-9c91-19aab69ed983","year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:53.685587Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:7371e5d6affd9f4dd4e233966104cef90c0f21d90b1082c80c15e6acfa13cd59","observation_id":"5b2fb02c-38de-4b22-823a-b4850735da3c","resolution":{"observed_at":"2026-08-07T13:22:04.259543Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:04.034040Z","title":null,"venue":null,"work_id":"6cfc7ffb-fc20-45d3-a0c4-df0f0923fb0f","year":2025},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:53.840769Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:30bbd1b29f723eeb362ca02af2ab57078b2d1ebe4f9b12283e5e130ca9f2f9ce","observation_id":"964a4fce-8618-41b9-907e-7504d1e34885","resolution":{"observed_at":"2026-08-07T13:22:04.129945Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:03.898213Z","title":null,"venue":null,"work_id":"f13dab1d-e345-4462-9194-0b575990844f","year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:54.033089Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:fa2f736b6d022fdc711ffd320c327c627efd0aeb151cec26facbc9401691fa5b","observation_id":"78cc656d-022f-48c5-a905-22c95be6291c","resolution":{"observed_at":"2026-08-07T13:22:03.965988Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17645","last_updated":"2025-05-30T22:33:14Z","snapshot_observed_at":"2026-08-19T10:29:11.319986Z","submitted_at":"2024-02-27T16:15:28Z","title":"SongComposer: A Large Language Model for Lyric and Melody Generation in Song Composition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17645","snapshot_observed_at":"2026-08-07T13:21:54.170893Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:54.170893Z"},"links":{"cited_paper":"/paper/2402.17645","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:6f931cc338d1b4df74f3e2583baa0100cade1b183b6c6dc6ae8654031eebbd9b","observation_id":"6997051a-2caa-4e04-b942-94e18220a095","resolution":{"observed_at":"2026-08-07T13:21:54.170893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-07T13:21:54.288844Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:54.288844Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:588f626cd68ceddddde804e753c80456358346a06358f66a49fe613a1b04feca","observation_id":"6a208771-1651-4bbf-a981-84ba2a535a8c","resolution":{"observed_at":"2026-08-07T13:21:54.288844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:03.734923Z","title":null,"venue":null,"work_id":"95a66b09-90ee-42fa-ba79-7bcbc449a910","year":2004},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:54.478056Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:75b221804e4a98372eaf0e8002018e10590703b68c189e47a9aa1dcdb80c4716","observation_id":"193f254f-3b9a-4d84-9195-336cfade55d6","resolution":{"observed_at":"2026-08-07T13:22:03.816769Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-08-19T09:44:27.064800Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-07T13:21:54.561667Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:54.561667Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:91d58a496e0bd560811e4b9b7765abccb38f43b547c9ee4f966923d402733311","observation_id":"7425d4dc-2ea1-4ce5-9d9b-c5eae321ef72","resolution":{"observed_at":"2026-08-07T13:21:54.561667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15447","last_updated":"2025-08-12T04:20:41Z","snapshot_observed_at":"2026-08-19T12:08:13.453479Z","submitted_at":"2024-11-23T04:27:19Z","title":"Gotta Hear Them All: Towards Sound Source Aware Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15447","snapshot_observed_at":"2026-08-07T13:21:54.732077Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:54.732077Z"},"links":{"cited_paper":"/paper/2411.15447","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:ae320ffb618f87375085ce5927b0c9b7d616a36c4c4e7f0f38d698fd80fa8fa1","observation_id":"d24af8ac-82f1-484e-9ffd-09890d7b1ed3","resolution":{"observed_at":"2026-08-07T13:21:54.732077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17690","last_updated":"2026-04-20T17:56:40Z","snapshot_observed_at":"2026-08-15T05:32:51.959115Z","submitted_at":"2024-11-26T18:57:29Z","title":"Mechanisms of Multimodal Synchronization: Insights from Decoder-Based Video-Text-to-Speech Synthesis","version":3},"cited_work":{"arxiv_id":"2411.17690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.17690","snapshot_observed_at":"2026-08-07T13:21:59.666833Z","title":"Mechanisms of Multimodal Synchronization: Insights from Decoder-Based Video-Text-to-Speech Synthesis","venue":"cs.MM","work_id":"4a606524-0286-48a0-bd81-36011723cdc0","year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:54.818470Z"},"links":{"cited_paper":"/paper/2411.17690","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:5986586387c50a0587cc5d71c1723b719590541dfa84ba987435c44b088a8a7b","observation_id":"921043d0-f78f-4408-9f73-4bbae1471b78","resolution":{"observed_at":"2026-08-07T13:21:59.717273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09313","last_updated":"2024-05-20T05:50:36Z","snapshot_observed_at":"2026-08-16T14:01:04.270624Z","submitted_at":"2024-04-14T18:00:05Z","title":"Text-to-Song: Towards Controllable Music Generation Incorporating Vocals and Accompaniment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09313","snapshot_observed_at":"2026-08-07T13:21:54.970330Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:54.970330Z"},"links":{"cited_paper":"/paper/2404.09313","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:ee8f45def2794055d19bbd16534beaecc4c9355c539b6e44f528084e0a80530e","observation_id":"29723086-15d4-47f6-a5e0-d48190012ec4","resolution":{"observed_at":"2026-08-07T13:21:54.970330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:03.610644Z","title":null,"venue":null,"work_id":"d9e7c39e-79eb-4724-a6ee-547a9b5835b0","year":2023},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:55.087295Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:91b4da6b943c9fa53d5b594f6e039a3a37434b3d1d2097c0f5272aa7d6940928","observation_id":"7d1140f2-2b3c-4537-9ac9-4a4f46771a08","resolution":{"observed_at":"2026-08-07T13:22:03.692016Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:55.133752Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:55.133752Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:ebf90933abe632e5a57dc9fa760c7070fcf6a55ceaec32cd38604c8be492aa75","observation_id":"b8748545-5261-4b8b-8699-f94a5310b7bb","resolution":{"observed_at":"2026-08-07T13:21:55.133752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:03.428879Z","title":null,"venue":null,"work_id":"77e6d251-fda3-44f6-9c51-81e5bad3c126","year":null},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:55.167463Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:c1cb5da1ab17b934cb9c459cf8223dde0aa9d89721900074c3aa454c899d7eff","observation_id":"360dcbc0-7289-4af2-b9c0-c7166dd44bbf","resolution":{"observed_at":"2026-08-07T13:22:03.541309Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:03.322651Z","title":null,"venue":null,"work_id":"5772e5fa-1466-4cae-9ffd-be462a062150","year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:55.358455Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:637c0fec8605eaa86d8e70124b3fad80ab594ad866423906c3ab873266806fc2","observation_id":"0bbc7f0e-0522-47ed-815a-f4588693dde8","resolution":{"observed_at":"2026-08-07T13:22:03.375323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:55.448953Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:55.448953Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:cdf90800bf45b4d78cb8a277738bfb23cbdc0092e3fdf71b58acc1b20c604a4c","observation_id":"1d212153-f057-4e3a-85de-b412b5b71553","resolution":{"observed_at":"2026-08-07T13:21:55.448953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:55.563873Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:55.563873Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:bc7e0ed25cbf46946fa55da7913b694ac30854ceeb553627e35aede7edd3794c","observation_id":"e2ee6235-ff7f-4d09-b72c-2083eda3acd3","resolution":{"observed_at":"2026-08-07T13:21:55.563873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:03.135090Z","title":null,"venue":null,"work_id":"0f383895-f7e3-45c9-a6cd-029ec912aa6c","year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:55.718021Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:a23a7f7abd70f96c44b8ec45f02110d407eb21eae2a0c04880292a9d616f0dc7","observation_id":"d692022e-2746-40d5-9d11-31017794ea97","resolution":{"observed_at":"2026-08-07T13:22:03.214456Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:02.981441Z","title":null,"venue":null,"work_id":"5858a0cd-8958-415d-8323-071ddd571428","year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:55.777053Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:c2de1221247a221658e54416abe3c0f46d6c770e3d1ef9be1658d1e59f99f0e7","observation_id":"bd40c5e1-a6ce-43c3-b3ea-431b489a486e","resolution":{"observed_at":"2026-08-07T13:22:03.043249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:02.836929Z","title":null,"venue":null,"work_id":"51220b26-8220-4eeb-9d40-84d92fa24099","year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:55.849731Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:926c14c30a644c73e4cb61cb67c75ba44efc4164d915d1ae43c4ec4003490579","observation_id":"06fc2d77-1508-4223-baf9-b59640f87fa7","resolution":{"observed_at":"2026-08-07T13:22:02.926757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-16T15:59:22.404915Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-07T13:21:55.918085Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:55.918085Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:9c2f6faaba5bdcf52449a7ce2bc1922d84c5d93046ba8baf1f0fc18bec41f2a2","observation_id":"9d153604-3a49-4782-899a-23fbe1ff70e2","resolution":{"observed_at":"2026-08-07T13:21:55.918085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:02.649487Z","title":null,"venue":null,"work_id":"808f6859-3132-46b4-9423-b9acaed30e5c","year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:55.992831Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:2dba443307ecd20ea458967ea8a9e5ebc850e63d01a0146f446ce4a126b49ce7","observation_id":"9f8cc796-369b-47e0-a23d-e545379c2e1d","resolution":{"observed_at":"2026-08-07T13:22:02.759310Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:02.468175Z","title":null,"venue":null,"work_id":"e6792307-5f96-47c0-88aa-42167952ecf6","year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:56.053796Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:6a5f980c436a956c3640aa657d9678438138ccd2e27dc83210e023bba5d370bc","observation_id":"3a31b0b9-a32c-4fb7-ad95-26b0b4e209d1","resolution":{"observed_at":"2026-08-07T13:22:02.562454Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13128","last_updated":"2025-05-30T06:59:18Z","snapshot_observed_at":"2026-08-16T12:57:12.998351Z","submitted_at":"2025-02-18T18:52:21Z","title":"SongGen: A Single Stage Auto-regressive Transformer for Text-to-Song Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13128","snapshot_observed_at":"2026-08-07T13:21:56.134180Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:56.134180Z"},"links":{"cited_paper":"/paper/2502.13128","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:db5831eb126c9194ff461a42b73890b4fb895a9a1a8f0551a4ab774438d468b9","observation_id":"96db99ca-bf26-4cb7-af47-25339983acc0","resolution":{"observed_at":"2026-08-07T13:21:56.134180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:02.269843Z","title":null,"venue":null,"work_id":"6bc668e7-dce1-4041-a0da-ffdba57190b8","year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:56.257027Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:4f848fd900e6c805f57d3378948573a71fcb6a449396e4b7277beaf956da0410","observation_id":"97f33974-41b7-43ab-8725-76e5cc46a5cc","resolution":{"observed_at":"2026-08-07T13:22:02.358953Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08355","last_updated":"2024-06-03T07:56:23Z","snapshot_observed_at":"2026-08-16T14:43:20.569125Z","submitted_at":"2023-11-14T17:54:38Z","title":"Mustango: Toward Controllable Text-to-Music Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08355","snapshot_observed_at":"2026-08-07T13:21:56.333453Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:56.333453Z"},"links":{"cited_paper":"/paper/2311.08355","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:3d76fdc823905cfdd558e15a38857c52f7e97eb79c5410e1ce87a5d48fbd7866","observation_id":"abcdffa6-0467-4f04-94e8-a8f31291579b","resolution":{"observed_at":"2026-08-07T13:21:56.333453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01183","last_updated":"2025-03-03T05:15:34Z","snapshot_observed_at":"2026-08-18T09:40:58.694553Z","submitted_at":"2025-03-03T05:15:34Z","title":"DiffRhythm: Blazingly Fast and Embarrassingly Simple End-to-End Full-Length Song Generation with Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01183","snapshot_observed_at":"2026-08-07T13:21:56.399053Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:56.399053Z"},"links":{"cited_paper":"/paper/2503.01183","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:e4fbd55e3e42d4c5a1bf2aed11a13e9572c2bc71161e3f027f7deb13c608e248","observation_id":"12aecfa3-8505-4034-927e-37d77f62dbac","resolution":{"observed_at":"2026-08-07T13:21:56.399053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:56.474901Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:56.474901Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:f849082996a5e2ed9eec12c83495ae58d403888fc18d8d5ded013391d7d3838a","observation_id":"f1b6fffd-e5a6-45f6-9d95-7f4a8f3da74d","resolution":{"observed_at":"2026-08-07T13:21:56.474901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07924","last_updated":"2024-06-05T13:23:49Z","snapshot_observed_at":"2026-08-16T00:37:44.307785Z","submitted_at":"2023-07-16T02:11:34Z","title":"ChatDev: Communicative Agents for Software Development","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07924","snapshot_observed_at":"2026-08-07T13:21:56.590613Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:56.590613Z"},"links":{"cited_paper":"/paper/2307.07924","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:8c3be8478e3890aa03ba51b046fea743ff21a6dcc3673679dafb5f6fe5b764ee","observation_id":"3656fd69-9d59-415e-ab82-c11e341767cf","resolution":{"observed_at":"2026-08-07T13:21:56.590613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:02.114350Z","title":null,"venue":null,"work_id":"f8448d72-80cb-452c-8cf0-7a486c3f7c0f","year":null},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:56.660286Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:b613a88ebfc9fcba28f38cb88428a38c11704c920abc2a9d60002a7e1102f223","observation_id":"4cc161f4-586e-45ca-9711-d9f7328f422c","resolution":{"observed_at":"2026-08-07T13:22:02.204467Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:01.712741Z","title":null,"venue":null,"work_id":"8af95f40-414d-4b8f-b13e-91f60d00aafe","year":2025},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:56.812707Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:4137d233c15e8a4a85ea99ff13d7c912daaa3f9deaa905b3e97be6dd13e6dcec","observation_id":"1d9045c3-606d-4115-bc9d-ce538e1310e4","resolution":{"observed_at":"2026-08-07T13:22:01.795737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11002","last_updated":"2025-08-12T15:55:09Z","snapshot_observed_at":"2026-08-16T12:40:59.355251Z","submitted_at":"2025-04-15T09:19:44Z","title":"Dopamine Audiobook: A Training-free MLLM Agent for Emotional and Immersive Audiobook Generation","version":2},"cited_work":{"arxiv_id":"2504.11002","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11002","snapshot_observed_at":"2026-08-07T13:21:59.458203Z","title":"Dopamine Audiobook: A Training-free MLLM Agent for Emotional and Immersive Audiobook Generation","venue":"cs.SD","work_id":"f82159ef-76ce-46c6-858e-cebcc5b1200a","year":2025},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:56.900297Z"},"links":{"cited_paper":"/paper/2504.11002","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:dfaf7afc6c7491bfff79b98f9730100a678a1cd16a3d46bf348cda8d4957024c","observation_id":"a6ac12b9-1b3b-4cf7-b8ca-409ada56db0f","resolution":{"observed_at":"2026-08-07T13:21:59.519543Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:01.860952Z","title":"In IEEE International Conference on Acoustics, Speech and Signal Processing","venue":null,"work_id":"c211fc45-109f-499e-961c-60043d7e17e3","year":null},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:56.747070Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:f7096fedf897e1be8b732ba4b8f4148f356cd7a36016c0595e924d14322f6fd3","observation_id":"f1387cbc-73fd-4394-bae2-6c5afeb6b1ed","resolution":{"observed_at":"2026-08-07T13:22:01.978267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10522","last_updated":"2026-04-15T16:32:32Z","snapshot_observed_at":"2026-07-31T02:51:01.521373Z","submitted_at":"2025-03-13T16:30:59Z","title":"AudioX: A Unified Framework for Anything-to-Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10522","snapshot_observed_at":"2026-08-07T13:21:57.043843Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:57.043843Z"},"links":{"cited_paper":"/paper/2503.10522","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:3522f47e6305ec5b6c2b24eed27c2519cb2d28814e1f35171f55b92efb3027c6","observation_id":"326d0a29-9d5f-440f-bc76-9f74d33031b3","resolution":{"observed_at":"2026-08-07T13:21:57.043843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04321","last_updated":"2025-05-07T15:59:51Z","snapshot_observed_at":"2026-08-16T13:45:24.928440Z","submitted_at":"2024-06-06T17:58:11Z","title":"VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04321","snapshot_observed_at":"2026-08-07T13:21:57.116700Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:57.116700Z"},"links":{"cited_paper":"/paper/2406.04321","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:c459af1b2ed7ebaa914155637cc64da4a982c9aaefe1f3292129a6c0232a9f87","observation_id":"3e247ced-3b1e-4915-8d1c-826888a83921","resolution":{"observed_at":"2026-08-07T13:21:57.116700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:01.499750Z","title":null,"venue":null,"work_id":"7dd9127d-17f8-424f-a125-fe10904308f3","year":2017},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:56.983667Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:8624094af9c8464e6b701c4af14cdba69b8a07b3a01c3627c118fb532d39e6e4","observation_id":"afa97fce-f1a4-4996-a476-ee774eb43c53","resolution":{"observed_at":"2026-08-07T13:22:01.624561Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18983","last_updated":"2024-11-28T08:07:32Z","snapshot_observed_at":"2026-08-16T12:05:07.284509Z","submitted_at":"2024-11-28T08:07:32Z","title":"SPAgent: Adaptive Task Decomposition and Model Selection for General Video Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18983","snapshot_observed_at":"2026-08-07T13:21:57.279182Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:57.279182Z"},"links":{"cited_paper":"/paper/2411.18983","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:94e887dec414cc1d4dfc4782923347bd9225ad0bf7bf874d5b9aea30558eda79","observation_id":"4776d5b9-a466-4f0b-a1e8-cac4f9bcf3ce","resolution":{"observed_at":"2026-08-07T13:21:57.279182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:01.313477Z","title":null,"venue":null,"work_id":"10e60b20-42c6-4705-9279-a2cb25052128","year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:57.362014Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:fbbd14b725a5403656feb45f21026f55cec8db84a53007f787d64729fd8d7d45","observation_id":"4cf3f454-60bd-4915-b3f2-42f6460e0291","resolution":{"observed_at":"2026-08-07T13:22:01.407498Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-08-17T16:15:29.907985Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-07T13:21:57.205800Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:57.205800Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:cdcd3d9a788014db71fcb6c711ee326296b78817d03740dac188c5f5007340f4","observation_id":"ee1da94b-53f1-4c30-9612-d9d262826f7e","resolution":{"observed_at":"2026-08-07T13:21:57.205800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:57.516006Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:57.516006Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:d44804093ab4cf0b5c5635274bf27bb108673cbffd007fd781f6210bd9556113","observation_id":"6f5116c3-0ee9-4230-a820-f812c357912b","resolution":{"observed_at":"2026-08-07T13:21:57.516006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06602","last_updated":"2025-08-25T07:30:54Z","snapshot_observed_at":"2026-08-11T19:26:50.636660Z","submitted_at":"2024-12-09T15:50:25Z","title":"Towards Controllable Speech Synthesis in the Era of Large Language Models: A Systematic Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06602","snapshot_observed_at":"2026-08-07T13:21:57.611094Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:57.611094Z"},"links":{"cited_paper":"/paper/2412.06602","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:896f5d468b3f034035689cacbcddc4a3dcfda509c90751020647d08f7a3911b3","observation_id":"e230f18e-81fa-4d4d-8444-6c259f26b889","resolution":{"observed_at":"2026-08-07T13:21:57.611094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:01.087713Z","title":null,"venue":null,"work_id":"1fdf11e2-d55b-4619-a170-57f89940c8fb","year":2025},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:57.433467Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:73bc462c6a2fd09049d746012ebfd589d10db7e6235fc0d997eb09acae00bb4e","observation_id":"8a373711-a316-4cf0-803a-08a4eba23553","resolution":{"observed_at":"2026-08-07T13:22:01.207554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:57.885000Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:57.885000Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:82b1ab2f4d67599f855dbd7371afa945dd819aa49726b5eb94251a1357acff23","observation_id":"1de571c7-cfc9-4e41-97cf-c729a7956329","resolution":{"observed_at":"2026-08-07T13:21:57.885000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:00.809690Z","title":null,"venue":null,"work_id":"1a6f16c7-8921-4a26-8bfd-9eacab576082","year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:57.958512Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:198560f4a2263798bb028c9e4d3a68d7911db9fe0d0053048d737a18dc8d02a0","observation_id":"b0917101-9ef7-4b39-a02f-bba861ffe3f6","resolution":{"observed_at":"2026-08-07T13:22:00.936519Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08147","last_updated":"2025-03-11T08:05:11Z","snapshot_observed_at":"2026-08-18T14:38:35.319822Z","submitted_at":"2025-03-11T08:05:11Z","title":"FilmComposer: LLM-Driven Music Production for Silent Film Clips","version":1},"cited_work":{"arxiv_id":"2503.08147","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.08147","snapshot_observed_at":"2026-08-07T13:21:59.235734Z","title":"FilmComposer: LLM-Driven Music Production for Silent Film Clips","venue":"cs.CV","work_id":"acd6b801-964a-42ff-875d-c1163199814a","year":2025},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:57.720909Z"},"links":{"cited_paper":"/paper/2503.08147","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:b1216c07fb9ac3a6ba5b3146b4edb98a4d4e98307c04ef0ef0ebf8a485b532e8","observation_id":"139aa635-a8ea-41e0-9d05-f85eccea2155","resolution":{"observed_at":"2026-08-07T13:21:59.315620Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:00.436501Z","title":null,"venue":null,"work_id":"59ecac29-f421-4d94-b49b-56d6ad407918","year":2022},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:58.249634Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:74b37db3835a2a5f7a75dc2f5ba4b87cfca39c9a783a61ea212c2ee45e6f9987","observation_id":"69032484-0ce4-4eda-94c1-ce8dd8ca1928","resolution":{"observed_at":"2026-08-07T13:22:00.537761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:00.233120Z","title":null,"venue":null,"work_id":"02ed8647-cd19-4cb8-972d-7508ec8b482d","year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:58.368130Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:f48086b5d0d9854b19a971f1cb015847093fcff299200a7fc3a551bab4828a9e","observation_id":"ba027057-682c-4a1c-ab32-830c7d5f8b01","resolution":{"observed_at":"2026-08-07T13:22:00.340024Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:00.622571Z","title":null,"venue":null,"work_id":"5b284150-aa68-45fa-b17e-b582814ff0c1","year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:58.120464Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:d77b6b532af411997712a6f7b198afb18fec21c7ec0f818b8e3893a992b98c5b","observation_id":"25181938-4807-45da-87c9-0fc54f7ef63a","resolution":{"observed_at":"2026-08-07T13:22:00.671072Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-19T13:11:56.801120Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-07T13:21:58.600648Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:58.600648Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:129476f1dd24d57d69cf15dbbb1bcd84a49fc4f7256bb87177f100dde9742e45","observation_id":"b264ce73-22ed-4027-9115-481e8ed68cd8","resolution":{"observed_at":"2026-08-07T13:21:58.600648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10719","last_updated":"2025-03-17T05:48:37Z","snapshot_observed_at":"2026-08-16T12:50:27.911756Z","submitted_at":"2025-03-13T07:58:23Z","title":"Long-Video Audio Synthesis with Multi-Agent Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10719","snapshot_observed_at":"2026-08-07T13:21:58.660971Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:58.660971Z"},"links":{"cited_paper":"/paper/2503.10719","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:54ee679c59d375456469246c1d296ffba27f097b2c6b38521b1775fd20dc5c60","observation_id":"d65f4609-06db-4fb8-aea3-36be82c8ab74","resolution":{"observed_at":"2026-08-07T13:21:58.660971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00084","last_updated":"2025-02-28T09:58:25Z","snapshot_observed_at":"2026-08-16T12:54:20.238906Z","submitted_at":"2025-02-28T09:58:25Z","title":"InspireMusic: Integrating Super Resolution and Large Language Model for High-Fidelity Long-Form Music Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00084","snapshot_observed_at":"2026-08-07T13:21:58.501923Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:58.501923Z"},"links":{"cited_paper":"/paper/2503.00084","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:adfe653a22560c8d75be6e2ab25ca854a8c9079a45387381309bf95d8ca4781a","observation_id":"4e5da6fe-d576-431e-9d93-14d25401335d","resolution":{"observed_at":"2026-08-07T13:21:58.501923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:59.866962Z","title":null,"venue":null,"work_id":"2b1b6767-fcaf-4491-b489-a65b6c50e349","year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:58.843271Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:0f9c0833487891120386a925dfb6f6478f1ee0ba367a1cb29d6d365c66ec46a0","observation_id":"507b188f-e57e-4594-b01a-ecc653d8148a","resolution":{"observed_at":"2026-08-07T13:21:59.932941Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09972","last_updated":"2025-01-17T06:30:11Z","snapshot_observed_at":"2026-08-18T01:42:03.563191Z","submitted_at":"2025-01-17T06:30:11Z","title":"GVMGen: A General Video-to-Music Generation Model with Hierarchical Attentions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09972","snapshot_observed_at":"2026-08-07T13:21:58.967310Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:58.967310Z"},"links":{"cited_paper":"/paper/2501.09972","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:00bf4f73c8ee26f987c87c78d59e4939df9bcd21c966165b5e6e09102c7c788c","observation_id":"8dfead22-de67-4f01-b641-00b7cddd2890","resolution":{"observed_at":"2026-08-07T13:21:58.967310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:00.017977Z","title":null,"venue":null,"work_id":"24a249f8-2690-4c0a-84f1-1d979f1abe67","year":2023},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:58.735968Z"},"links":{"citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:d86a4f40b2e80a5d1d8b7a1525d58e04cc988fe560bce2e528bc9af378d4ade3","observation_id":"66786ed3-3f7d-473f-99a3-9763ff2a6414","resolution":{"observed_at":"2026-08-07T13:22:00.143804Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12957","last_updated":"2024-10-16T18:44:56Z","snapshot_observed_at":"2026-08-16T13:08:41.343567Z","submitted_at":"2024-10-16T18:44:56Z","title":"MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12957","snapshot_observed_at":"2026-08-07T13:21:55.658153Z","title":"arXiv preprint arXiv:2410.12957 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:55.658153Z"},"links":{"cited_paper":"/paper/2410.12957","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:10c744a708685f82148486cb4fe3ceefa426f603360e754796093118f70a0f68","observation_id":"f64a50f9-8283-4b54-a678-867818026ec2","resolution":{"observed_at":"2026-08-07T13:21:55.658153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16956","last_updated":"2025-03-21T09:02:38Z","snapshot_observed_at":"2026-08-17T17:11:10.170570Z","submitted_at":"2025-03-21T09:02:38Z","title":"From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16956","snapshot_observed_at":"2026-08-07T13:21:55.261294Z","title":"arXiv preprint arXiv:2503.16956 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:55.261294Z"},"links":{"cited_paper":"/paper/2503.16956","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:f343b16ff26ca64266e25776c27d2d441d5a10313f58a22ea3c17f27b4a1e4e4","observation_id":"bfe3256f-d477-46a4-b171-6e4a6dfa6bf7","resolution":{"observed_at":"2026-08-07T13:21:55.261294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-14T01:23:05.591587Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":3,"verified_fuzzy":1},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2505.22053."}