{"as_of":"2026-08-08T20:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2f6a67ffef9368a41ca58094f4f0109378a35f72ee6ffeedaebaf3289f7ab996","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:40:06.423278Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:40:02.091028Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T19:40:07.168991Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"cited_work":{"arxiv_id":"2507.04955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.04955","snapshot_observed_at":"2026-08-06T19:40:07.168991Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","venue":"cs.SD","work_id":"713f90c0-4cb1-4085-8c16-c5fe351d9c38","year":2025},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.091028Z"},"links":{"cited_paper":"/paper/2507.04955","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:3d7c060a5e6c19c7aed8f48794f31f5609690a0897401880a0129873b0adc2f4","observation_id":"9e40e093-95c3-427f-b276-9e5220945e43","resolution":{"observed_at":"2026-08-06T19:40:07.236634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04955/citation-record","integrity":"/paper/2507.04955/integrity","json":"/paper/2507.04955/citation-record.json","paper":"/paper/2507.04955"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"cited_work":{"arxiv_id":"2507.04955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.04955","snapshot_observed_at":"2026-08-06T19:40:07.168991Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","venue":"cs.SD","work_id":"713f90c0-4cb1-4085-8c16-c5fe351d9c38","year":2025},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.091028Z"},"links":{"cited_paper":"/paper/2507.04955","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:3d7c060a5e6c19c7aed8f48794f31f5609690a0897401880a0129873b0adc2f4","observation_id":"9e40e093-95c3-427f-b276-9e5220945e43","resolution":{"observed_at":"2026-08-06T19:40:07.236634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:13.494249Z","title":"Visual and Motion-Based Control Early interactive sys- tems mapped facial or bodily features directly to sound","venue":null,"work_id":"4b72bf34-d4c9-4493-ba98-e866da74cf61","year":null},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.126591Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:58d093a7d7b13cbe7c82286df3afc741bfecdbe2df50b98556c9c52d7bc2c232","observation_id":"a5161bbe-ecc6-451f-9590-4f7a5a01a468","resolution":{"observed_at":"2026-08-06T19:40:13.582848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:13.395066Z","title":"We froze the parame- ters of the vanilla Musicgen during training to preserve its text understanding ability","venue":null,"work_id":"56b1e1fa-4ba3-4a63-baed-2c3bcb2840ca","year":null},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.174306Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:cb43ee1f9a31cc231254e302a526932c92bb50fb058f740dcb31605b8010241f","observation_id":"f50d091c-f22a-40d2-8453-b09dcb9ae82a","resolution":{"observed_at":"2026-08-06T19:40:13.439452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:13.268495Z","title":"We recruited volunteers to record their facial expressions and upper body movements while listening to 30-second audio clips","venue":null,"work_id":"a93f7946-c0d8-418c-848a-147630a120b5","year":null},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.274703Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:3d669dbf3a32a2dc873a2c6df251adf30ea7f6891ef519a5bc9eb8865f0c634c","observation_id":"c1dde247-c637-4b46-943d-0d3213644c8a","resolution":{"observed_at":"2026-08-06T19:40:13.334019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:13.087642Z","title":null,"venue":null,"work_id":"6bc095f0-82d7-46d2-b41b-a5de6d76e13a","year":null},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.335175Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:9fea840c000fb3044bc173d16bba9112c9e5cc4c7e3db2649ff53e660c49e3d0","observation_id":"28781a49-92c9-4ce2-9d9a-24267fca8f1c","resolution":{"observed_at":"2026-08-06T19:40:13.173796Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:12.947351Z","title":null,"venue":null,"work_id":"b2a82d5f-2722-47f8-b76c-266a4e16b7d3","year":null},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.420427Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:e3826e8179db284479f4c2069bb557c42bea4ba5bbbc2be93ed6eefb82b37a88","observation_id":"33c5a219-3486-401f-9e06-230fdbce7c2e","resolution":{"observed_at":"2026-08-06T19:40:13.017260Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:12.845787Z","title":"Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthe- sis,","venue":null,"work_id":"1652a428-ac2c-43a0-bdd4-bd93191fc082","year":2025},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.506180Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:605a5b23129df76d081f6449f706c2730eb1c1bc97c264eef8b3e0481ce4c77a","observation_id":"5411faeb-ed22-49a3-b1a1-44ddb2381623","resolution":{"observed_at":"2026-08-06T19:40:12.895724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:12.717043Z","title":"Diff-Foley: Syn- chronized Video-to-Audio Synthesis with Latent Dif- fusion Models,","venue":null,"work_id":"933c561d-3999-4e70-a516-16190d441f05","year":2023},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.572574Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:3538615df4da2ecde0cc0054c952f38b4cd4fe3b76c512fdb61b27138928a8c2","observation_id":"9edde2b6-174f-4fb3-9ae6-bb3ffff98c6f","resolution":{"observed_at":"2026-08-06T19:40:12.771095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:12.548778Z","title":"Temporally Aligned Audio for Video with Autoregression,","venue":null,"work_id":"a169798d-6b0f-418c-90c0-a321f7e61d58","year":2025},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.639668Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:a7dedeb210c6dffdd440f21e895b1cc7267bc6b6d89b8b6df7b7e3c43f49b1b5","observation_id":"280c36b4-c927-457d-bcaa-f567ebd5a954","resolution":{"observed_at":"2026-08-06T19:40:12.623336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-07T10:46:50.742580Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-06T19:40:02.722459Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.722459Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:4d04261783b2e3bbba50c9e4d6fce45950c173763667c2cc661b76e98fd8c158","observation_id":"6607a917-256c-4f2f-bd66-2a9b9f04c558","resolution":{"observed_at":"2026-08-06T19:40:02.722459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:12.432355Z","title":"Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching,","venue":null,"work_id":"a0ef1d1b-f173-49d8-88bf-4b8fa3828a8e","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.784427Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:99864e9dbfa3a19199260b94c1c1ad449d22df46474cf75a5a643e718f9d4a92","observation_id":"7ca01989-1023-4bec-a53f-64ee01474ca4","resolution":{"observed_at":"2026-08-06T19:40:12.493699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:12.309795Z","title":"MM-LDM: Multi-Modal Latent Diffusion Model for Sounding Video Generation,","venue":null,"work_id":"b77a4988-4476-4fd7-aeff-d5e25a9efc20","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.871106Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:209fd5eb915b8952623891ac09c5b0534104fbd1590e65f4c507234952682f22","observation_id":"6d1a5a91-9a00-4e55-92d7-7bf31a0b806f","resolution":{"observed_at":"2026-08-06T19:40:12.370291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14598","last_updated":"2024-05-24T15:21:13Z","snapshot_observed_at":"2026-08-08T01:41:09.202426Z","submitted_at":"2024-05-23T14:13:16Z","title":"Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation","version":2},"cited_work":{"arxiv_id":"2405.14598","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14598","snapshot_observed_at":"2026-08-06T19:40:07.019654Z","title":"Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation","venue":"cs.CV","work_id":"1cb08225-16da-4cf4-8ea4-4df274224c3e","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.934968Z"},"links":{"cited_paper":"/paper/2405.14598","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:d37e45cd824c928645fe17fba93e4c34e128678e8b64d431c5ed432272808372","observation_id":"3591a8b3-2211-42de-a461-5c3226339e1f","resolution":{"observed_at":"2026-08-06T19:40:07.069029Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:02.986485Z","title":"Video-Foley: Two-Stage Video-To-Sound Generation via Temporal Event Condition For Foley Sound,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.986485Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:a931b1d7b622eab0ae5b00bff420dcb2a55f5d1050ad3bb4e0e1b264e7e2e29a","observation_id":"347c438d-e88c-4438-a8f0-87b421fa314a","resolution":{"observed_at":"2026-08-06T19:40:02.986485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05937","last_updated":"2024-04-08T11:46:07Z","snapshot_observed_at":"2026-07-06T17:27:37.212340Z","submitted_at":"2024-02-08T18:59:53Z","title":"InstaGen: Enhancing Object Detection by Training on Synthetic Dataset","version":3},"cited_work":{"arxiv_id":"2402.05937","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.05937","snapshot_observed_at":"2026-08-06T19:40:06.763444Z","title":"InstaGen: Enhancing Object Detection by Training on Synthetic Dataset","venue":"cs.CV","work_id":"b719ff9d-629c-48d6-a5d0-368b678352ef","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.033155Z"},"links":{"cited_paper":"/paper/2402.05937","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:43e0e06bafa85a15bda97220843b5bf908345fb71eea0c14614a4c01ae3ec5cd","observation_id":"98613fea-9f29-40f2-a7ed-af9861c212ed","resolution":{"observed_at":"2026-08-06T19:40:06.861777Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07055","last_updated":"2024-06-20T02:24:34Z","snapshot_observed_at":"2026-07-06T17:42:53.395993Z","submitted_at":"2024-03-11T18:00:02Z","title":"Orbital angular momentum of Bloch electrons: equilibrium formulation, magneto-electric phenomena, and the orbital Hall effect","version":2},"cited_work":{"arxiv_id":"2403.07055","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.07055","snapshot_observed_at":"2026-08-06T19:40:06.660391Z","title":"Orbital angular momentum of Bloch electrons: equilibrium formulation, magneto-electric phenomena, and the orbital Hall effect","venue":"cond-mat.mes-hall","work_id":"a37bc8fd-f2b9-4449-883f-809296b2ba10","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.124928Z"},"links":{"cited_paper":"/paper/2403.07055","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:78a5997ae9f2647ed64de1a5cce3b06f9322460b2384db1c4a34372dee4e216f","observation_id":"1914b229-406f-4b65-95f1-44bd64a2e926","resolution":{"observed_at":"2026-08-06T19:40:06.700771Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:12.191594Z","title":"Conditional Generation of Audio from Video via Fo- ley Analogies,","venue":null,"work_id":"c6eedbb1-6c8f-4b51-abc4-29949739a36a","year":2023},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.203009Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:b14b91c5d53c1b309328c4895090a55ac4d343d1723a3ee7a931ac1956679e7c","observation_id":"3268cad6-05c1-4629-991e-60b6452c29b3","resolution":{"observed_at":"2026-08-06T19:40:12.236091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12957","last_updated":"2024-10-16T18:44:56Z","snapshot_observed_at":"2026-07-06T19:34:51.296918Z","submitted_at":"2024-10-16T18:44:56Z","title":"MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12957","snapshot_observed_at":"2026-08-06T19:40:03.310979Z","title":"MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.310979Z"},"links":{"cited_paper":"/paper/2410.12957","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:57e2cffce7cf894e9fdbe29b8366f5567e85bfe8163f9b0b1c0e5cda2d397b40","observation_id":"570ab3ab-09c6-4f44-a80b-eb1002082a44","resolution":{"observed_at":"2026-08-06T19:40:03.310979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:12.066202Z","title":"VMAs: Video-to-Music Generation via Semantic Alignment in Web Music Videos,","venue":null,"work_id":"6d90d234-65e2-4029-992c-359e16045036","year":2025},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.401713Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:2df5b5a051e699ea2c7e8d36c05dd29c2431cd7fe3f8bc859a56d11d0cff6d1b","observation_id":"5c4325b2-3013-4bf5-94e1-01675403956d","resolution":{"observed_at":"2026-08-06T19:40:12.123750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:11.931848Z","title":"Video2Music: Suitable Music Generation from Videos using an Affec- tive Multimodal Transformer model,","venue":null,"work_id":"37a4334f-d172-46b9-a437-28e70b8fb09f","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.480431Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:61aab485fc84053c11c18bf669ed2eaa316165c1d6da0fcd024bb4c3c375fa53","observation_id":"ace31055-2ce3-4c57-9ada-33435a441f6d","resolution":{"observed_at":"2026-08-06T19:40:11.993773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:11.778215Z","title":"V2Meow: Meowing to the Visual Beat via Video-to-Music Generation,","venue":null,"work_id":"642f3a2c-2ac8-494f-ad98-c56ce18b3d3a","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.578377Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:8a37f44a33b734f01a4e16fa41bbcfa73ff3d8c2b54f6666c94c46d5460f2a7a","observation_id":"272d2f30-f92d-4de2-88de-12a9bd7183b7","resolution":{"observed_at":"2026-08-06T19:40:11.847780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:11.624350Z","title":"DanceCom- poser: Dance-to-Music Generation Using a Progressive Conditional Music Generator,","venue":null,"work_id":"0064eff8-0376-4c83-9786-816a1297afc3","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.686152Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:95bab25a4889b9bb91c4aada565fff9fa017892c03a5415af7e2b8055b122865","observation_id":"df50cb85-48d6-4390-8928-3e959bdb753e","resolution":{"observed_at":"2026-08-06T19:40:11.704582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:11.443467Z","title":"Discrete Contrastive Diffusion for Cross- Modal Music and Image Generation,","venue":null,"work_id":"93830bf1-ccdb-4758-8f35-bef7134b44cf","year":2023},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.792531Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:334b650bd285ccf35a8eccc55d3e54fac724ffdf4e649aab37213b70d86e35b4","observation_id":"7e4af507-c12d-48d4-ad6b-2f3f28224bbe","resolution":{"observed_at":"2026-08-06T19:40:11.528547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:11.268030Z","title":"Long- Term Rhythmic Video Soundtracker,","venue":null,"work_id":"adc07e1b-8cb7-46ea-a491-a10cd7a1225c","year":2023},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.912137Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:6419e88663f3e08571badd383e92c0028237648c9ced457447c0290410fcd0b5","observation_id":"7c3a79c2-7f4f-4cd3-a3e4-95985327a9f3","resolution":{"observed_at":"2026-08-06T19:40:11.368600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:11.107349Z","title":"Simple and control- lable music generation,","venue":null,"work_id":"6cc407b6-7a01-4612-8eef-a8700358c9a9","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.992590Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:646397c24d50ce2a81415222a70a2d68d56b6cde924b883cdf22fa6ca7ba3f4b","observation_id":"20b4b726-aaae-4943-aaff-ce82af8fc7c4","resolution":{"observed_at":"2026-08-06T19:40:11.195413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17162","last_updated":"2024-10-06T21:36:20Z","snapshot_observed_at":"2026-08-03T09:34:26.655168Z","submitted_at":"2023-10-26T05:24:38Z","title":"Content-based Controls For Music Large Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17162","snapshot_observed_at":"2026-08-06T19:40:04.068660Z","title":"Content-based controls for music large language modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.068660Z"},"links":{"cited_paper":"/paper/2310.17162","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:97f1e8ca01aace21973066bfa31dbdd9d3d8d0a866af11246bbe0f655b48acdf","observation_id":"8f0bba4b-2550-4491-86ea-2112d40c1c49","resolution":{"observed_at":"2026-08-06T19:40:04.068660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13253","last_updated":"2024-12-10T20:19:18Z","snapshot_observed_at":"2026-08-05T14:37:13.212653Z","submitted_at":"2024-02-20T18:59:26Z","title":"BiMediX: Bilingual Medical Mixture of Experts LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13253","snapshot_observed_at":"2026-08-06T19:40:04.143427Z","title":"Sketch2sound: Controllable audio generation via time-varying signals and sonic imita- tions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.143427Z"},"links":{"cited_paper":"/paper/2402.13253","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:8fecad5770da1b579fdf9d3cffb97d5544cf95d1a0c83c468c42a45c56263eda","observation_id":"867e4e4d-3533-4f57-9782-533fc52b2236","resolution":{"observed_at":"2026-08-06T19:40:04.143427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:10.943376Z","title":"Audioclip: Extending clip to image, text and audio,","venue":null,"work_id":"18487be9-2999-4245-9c2c-58ffaa4f1fa5","year":2022},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.196472Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:e53d03c67688281296c87ca31cbc42edd63ac57a3c9959f554335c8465b29b28","observation_id":"95569952-453b-4786-a063-b217798b55b4","resolution":{"observed_at":"2026-08-06T19:40:11.013911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:04.281404Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.281404Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:0f8f05ba62c2a2bae8f08d73cef6903ac6c8328218fca767b2b110e0e36bb309","observation_id":"660763c1-7f85-49a8-abe1-d7d88733bbf8","resolution":{"observed_at":"2026-08-06T19:40:04.281404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:10.749594Z","title":"Vidmuse: A simple video-to- music generation framework with long-short-term mod- eling,","venue":null,"work_id":"237ba6e0-0fd2-4fea-9e6b-b1db17613c99","year":2025},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.379020Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:cdd7a769c519a62e095e688e313c3703ebe75d4f2038c087978c6fc4b3afd12a","observation_id":"1a77d445-28de-4259-85b5-7470c0e565af","resolution":{"observed_at":"2026-08-06T19:40:10.832849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:10.482150Z","title":"Sonify Your Face: Facial Expressions for Sound Generation,","venue":null,"work_id":"7ce516c4-bd4f-40e8-bf8f-6fbc3c6ce09c","year":2010},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.446437Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:0c1151ce04ea4e5c852f36bcada95d698ce57f54bf9464c1c3a6e9eb7b883410","observation_id":"b3655a34-319f-49d9-8e80-239d6fc3e059","resolution":{"observed_at":"2026-08-06T19:40:10.626318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:10.276655Z","title":"Movement to emotions to music: using whole body emotional expression as an interaction for electronic music genera- tion,","venue":null,"work_id":"a3c5f1bb-d135-46d4-ae2f-a6f1f7b346ae","year":2012},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.532491Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:0f6049b8a85641fbceb5e20c3ef1049ba6ca3f937be10fb427b1a347c55c7799","observation_id":"213f40a7-211f-4da6-aeae-8ee1e726f045","resolution":{"observed_at":"2026-08-06T19:40:10.373609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:10.033632Z","title":"D2MNet for music generation jointly driven by facial expressions and dance movements,","venue":null,"work_id":"ca84bda9-eb71-4e51-9b8e-56bc806da1d5","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.603651Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:6bc28b6787183f6b1bbf5d4246e2e901097c6264494568c0fbdba81605a27f02","observation_id":"5a30467f-308d-41b2-b8e5-4398e4ffedfb","resolution":{"observed_at":"2026-08-06T19:40:10.145199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:09.853039Z","title":"Deep- Tunes: Music Generation based on Facial Emotions using Deep Learning,","venue":null,"work_id":"0bb24285-31fd-4507-b6e7-ac79515ab019","year":2022},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.683328Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:a23f08c0ac90cb9f78da8a7c3507132c212f35112ea29017b541cc4daf2266d6","observation_id":"8beac812-bcff-45fc-9d2a-dfb7b735dc7c","resolution":{"observed_at":"2026-08-06T19:40:09.946722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:09.727121Z","title":"A Contin- uous Emotional Music Generation System Based on Facial Expressions,","venue":null,"work_id":"570905b1-b900-46b9-85f5-a6617e757707","year":2022},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.816135Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:6fc783efaf23ac13baa6debf0a929976668f5a58ae4e4453579a3d50601ee88d","observation_id":"95e5e6ef-e7cd-4911-b0e4-dd7226c2d195","resolution":{"observed_at":"2026-08-06T19:40:09.797652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:09.595112Z","title":"Musiclm: Generating music from text,","venue":null,"work_id":"d83dc688-101d-4c6f-870a-0578422910e1","year":2023},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.908406Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:663bd61bb7abe6374f045240dd1cf47cef18bbb020dbd4e781d692a51a2da932","observation_id":"290f3bdf-e9f3-492b-8641-be59b2b62b56","resolution":{"observed_at":"2026-08-06T19:40:09.655800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:09.435194Z","title":"Audio set: An on- tology and human-labeled dataset for audio events,","venue":null,"work_id":"ffd74edf-4a52-47cb-bc39-a216f3ce45f8","year":2017},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.007593Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:4a25976c3500359dec36c8849a5d26e90a8ab71ee41ffb58d74aee8ac97084e4","observation_id":"437cbddc-94b7-4e31-b553-70831a24277a","resolution":{"observed_at":"2026-08-06T19:40:09.502002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:09.282666Z","title":"Vg- gsound: A large-scale audio-visual dataset,","venue":null,"work_id":"1ba03db0-7978-41ea-8ed2-04df8bc51914","year":2020},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.092253Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:6b7d65282653290d3599acaadc1baaf9786f8662d9c023f45ab84056e67792ec","observation_id":"8d4a48bf-9cba-4a3e-a001-b3488749bedb","resolution":{"observed_at":"2026-08-06T19:40:09.346892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:09.130916Z","title":"Arrange, inpaint, and refine: Steerable long-term music audio generation and editing via content-based controls,","venue":null,"work_id":"9963908e-2911-4a87-aef8-a8265432646a","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.158914Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:5fdc9c3f9dd0b97df4d98411e1c50fb51b1519dde890ae34a5a5badab58df824","observation_id":"22542eab-239f-45f9-a1d1-3db28816f211","resolution":{"observed_at":"2026-08-06T19:40:09.182866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:08.980054Z","title":"Marlin: Masked autoencoder for facial video representation learning,","venue":null,"work_id":"c94c06cd-05de-4099-a6a7-c8146c796a77","year":2023},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.230502Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:0f12284022a091b0f929570bc1aeaa325f4eed36db733e0619653c99d0c6d64f","observation_id":"c29f1b56-bd19-4960-bb1b-e28fac85f60b","resolution":{"observed_at":"2026-08-06T19:40:09.043876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:08.851107Z","title":"Synch- former: Efficient synchronization from sparse cues,","venue":null,"work_id":"1232425a-973e-4948-9810-018f1d21882e","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.317236Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:6b79e665577430ddfa8c72fd27c3508e98acbc396fcdf11bdf7e3616bb93b112","observation_id":"83659852-de37-4dcc-a2fc-0941b0e9eaea","resolution":{"observed_at":"2026-08-06T19:40:08.910894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:08.709608Z","title":"Raft: Recurrent all-pairs field transforms for optical flow,","venue":null,"work_id":"54b72f33-8c57-4b80-8109-871444731f5c","year":2020},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.387260Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:9fc544bfec5e53cba4547cb1cf4e7f91af037295ac2c1bda304b224a18113688","observation_id":"8ee1745e-fb97-48c2-8d7c-8b64bbcdc768","resolution":{"observed_at":"2026-08-06T19:40:08.790842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:08.588242Z","title":"Salmonn: Towards generic hear- ing abilities for large language models,","venue":null,"work_id":"2561053d-d309-4015-b5d3-45ddb2127d83","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.475020Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:befcb8cba9e272c1a72a7cf57e47bd88f30b6687d3a2df4316dbfd7b639aeb7c","observation_id":"30df38f1-ba3e-4b42-9166-3b4bc2c8f2e6","resolution":{"observed_at":"2026-08-06T19:40:08.638745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-06T19:40:05.562715Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.562715Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:5abf933e50e5a1a4f013cb760fa5bc9f1b4cd772cc1d777530adff7549efbda9","observation_id":"a906a825-ceb7-4767-a58c-469be428b1c0","resolution":{"observed_at":"2026-08-06T19:40:05.562715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:08.414748Z","title":"Video2music: Suitable music generation from videos using an affective multimodal transformer model,","venue":null,"work_id":"6942d5a0-459b-461b-8d4f-74667c0a4f41","year":null},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.646574Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:c2f70015b65ea7b1dd9c9471075e1c31fede47e0194791ca473a33ed70ada2d1","observation_id":"3570c2dd-fc12-4839-94ba-a278eac465da","resolution":{"observed_at":"2026-08-06T19:40:08.478892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-07T05:10:33.059352Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-06T19:40:06.423278Z","title":"Languagebind: Extending video-language pretraining to n-modality by language- based semantic alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:06.423278Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:4099d7afdc6e17bf5ca8bbb54cb37e1b73a807602acb34f7e960ec4593194f1a","observation_id":"4d498afb-aabf-454d-b1f7-7cb6a779273d","resolution":{"observed_at":"2026-08-06T19:40:06.423278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:08.266230Z","title":"Frechet audio distance: A reference-free metric for evaluating music enhancement algorithms,","venue":null,"work_id":"1808b9be-7c70-4d6a-9cf0-5893bebadbe7","year":2019},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.802192Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:80839b66d27e086ee4cdb654382fcbe4e0463b7375e485644191238b0f5f0bb8","observation_id":"2109cd34-ce37-4fb4-ab09-158242398ce3","resolution":{"observed_at":"2026-08-06T19:40:08.324059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:08.130020Z","title":"Cnn architectures for large-scale audio classification,","venue":null,"work_id":"a5d0e539-c82e-4f80-8b90-c4cff9b26429","year":2017},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.915584Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:43c0399eecc22a3f111ff86ecd28c8c86a67e80d1ef58013c5113251824a0c68","observation_id":"b3b0825d-f5ef-4181-bdd0-f6dda41b6f6c","resolution":{"observed_at":"2026-08-06T19:40:08.184873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:07.971523Z","title":"Panns: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":"361ad834-3f4f-4309-93b3-e2c4c54dde63","year":2020},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:06.008469Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:c68dca8fa6fa25e8afe7f8a6f9c1b7086eb3f110fab00fadcbb0893deb9b9877","observation_id":"9bc0bd82-ac09-487d-ae91-6404e14bdf0a","resolution":{"observed_at":"2026-08-06T19:40:08.043067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:07.806971Z","title":"Efficient training of audio transform- ers with patchout,","venue":null,"work_id":"a1d8844c-4f05-4744-8282-23577d065ca6","year":2022},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:06.095672Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:c8eaa9a4c7a24aa0af3b8814ac3f93613b4b125ccace6b4a29eea972730527c7","observation_id":"4ae24de1-8228-4f7d-ad82-b95dbfabf1d2","resolution":{"observed_at":"2026-08-06T19:40:07.890135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:07.656656Z","title":"Improved techniques for training gans,","venue":null,"work_id":"7c865b89-5b90-488c-be1d-91dd41db514f","year":2016},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:06.183184Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:a902a73c2026a9e2899abb25a63a8677cd29fb0397cc6c503950145285f8b3c9","observation_id":"a7efb45e-843f-4d91-96e9-5a8b69baac36","resolution":{"observed_at":"2026-08-06T19:40:07.747301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:07.451102Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"dea81b7f-5664-4702-b72d-53f594e324ca","year":null},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:06.270020Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:113c8034f9d83b97e1b7121942328058af30637f49f514862d321516c9b38b73","observation_id":"ddce1c67-46ab-452f-9717-4bbfefbf307d","resolution":{"observed_at":"2026-08-06T19:40:07.534298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:07.321761Z","title":"Available: https://arxiv.org/abs/2211","venue":null,"work_id":"c50ca14c-863b-45f4-b5d3-910b9c4a9875","year":null},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:06.341162Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:e265e29799ab77c3c95864a1d4727e7f26afcdd9b40b43fb0897ec63bcb361ea","observation_id":"f793ccb1-7e6e-4408-82c8-6d38868b0d67","resolution":{"observed_at":"2026-08-06T19:40:07.382378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:05.719311Z","title":"Available: http://dx.doi.org/10.1016/j","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.719311Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:6d0a87dd838740f94b8c4fe20a5809afe273da61e83384ed15fa23fcac7b421b","observation_id":"7a790e88-2b6f-4552-95e8-4e401d7c3a91","resolution":{"observed_at":"2026-08-06T19:40:05.719311Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":39},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2507.04955."}