{"as_of":"2026-08-06T19:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0ae687823c43b47dee38f2938b8064d2d7c4095b792132fa42e2ce2c187239e5","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T07:35:14.257562Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T19:11:43.172296Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-10T23:20:54.250212Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"cited_work":{"arxiv_id":"2603.19857","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.19857","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","venue":"cs.SD","work_id":"0c7b2ddd-9afe-4820-8b8c-4fba54caa5e0","year":2026},"citing_paper":{"arxiv_id":"2604.06870","last_updated":"2026-04-08T09:32:15Z","snapshot_observed_at":"2026-07-06T22:55:15.791334Z","submitted_at":"2026-04-08T09:32:15Z","title":"RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T19:11:43.172296Z"},"links":{"cited_paper":"/paper/2603.19857","citing_paper":"/paper/2604.06870"},"observation_digest":"sha256:5fb874666117d963e1d356c70fdbae27feaf8787fe6ace90e40bb7aeba71a244","observation_id":"14285130-a947-437c-b8d6-d0e0c0629475","resolution":{"observed_at":"2026-05-10T23:20:54.259356Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.19857/citation-record","integrity":"/paper/2603.19857/integrity","json":"/paper/2603.19857/citation-record.json","paper":"/paper/2603.19857"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Black forest labs; frontier ai lab","venue":null,"work_id":"9f0cc712-7222-4740-94c3-3ebf5c8d83eb","year":2024},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:eaae64e66ca1bbe78a98a533185d8355779a817a069dcf5e10f509a2d114f60a","observation_id":"bf2fa41c-3316-497d-8346-57860a849652","resolution":{"observed_at":"2026-05-15T07:40:13.572047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"cbdfb2fa-2296-40b7-a3da-f392f817224b","year":2020},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:ee96d160e89c851b286f652d3aa8e6a96f3b6a1a7383b9e533f105e645d0d038","observation_id":"e2ef8972-038b-4a97-8f9a-1dd14857ca62","resolution":{"observed_at":"2026-05-15T07:40:13.541844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-guided foley sound generation with multimodal con- trols","venue":null,"work_id":"2fbead62-96ff-4f9c-8109-8cd80e442c23","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:5d11a3d8d7ea53b4f1ce90e164954b22821a45a44edd9414a868b0a9bbec626e","observation_id":"3f815c42-d86f-4098-93a9-117b6b171e0d","resolution":{"observed_at":"2026-05-15T07:40:13.534196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MMAu- dio: Taming multimodal joint training for high-quality video-to-audio synthesis","venue":null,"work_id":"5face469-d898-4b96-a1b6-a98a38939c0d","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:e68d158c2de4ea87b5410a86c6c178ad8afd14dc9b0b7a8641379eb54d26281c","observation_id":"5ea8d461-33a6-4d6f-a914-25eee82e763d","resolution":{"observed_at":"2026-05-15T07:40:13.425198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simple and controllable music generation","venue":null,"work_id":"cea3817d-8694-4d69-b260-1c3179b14f11","year":2023},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:4afe4f0334c0a2d8b3db45d1ba42e4b4d3809e4e1ad2f6fba113a4289c135f36","observation_id":"1b7adcd7-7798-4692-b383-766a874321c2","resolution":{"observed_at":"2026-05-15T07:40:13.468694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":"2407.05407","doi":"10.48550/arxiv.2407.05407","metadata_source":"pith","pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","venue":"cs.SD","work_id":"e5ad925a-4045-49b5-b301-208bcbf3eca8","year":2024},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:76e3d9fb061f0f68d4716638972ca0b593876e6e79776de0fc9449c187fc19b9","observation_id":"68f29590-7766-484f-937f-9f915678d1d5","resolution":{"observed_at":"2026-05-15T17:01:21.074684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-07-06T20:06:30.732685Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":"2412.10117","doi":"10.48550/arxiv.2412.10117","metadata_source":"pith","pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","venue":"cs.SD","work_id":"3af84775-3b81-4078-b553-52739aae03ba","year":2024},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:ce0cea47ad18ead1eab98f525630cafd40958067ebf5f5240d96366cc79e8379","observation_id":"a5284398-a38e-4d22-a5e1-9b7318301cc6","resolution":{"observed_at":"2026-05-15T07:39:50.507500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-07-06T21:29:06.781083Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":"2505.17589","doi":"10.48550/arxiv.2505.17589","metadata_source":"pith","pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","venue":"cs.SD","work_id":"ce66e767-526a-419d-bb95-ac019edf4050","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:bf780313e92ce9bd2c0e50174353b4af3d74720370b069f68ed7c135119c1182","observation_id":"1233b08b-7529-4716-ac5c-2f268e99b882","resolution":{"observed_at":"2026-05-16T05:27:25.722747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-07-06T15:20:25.388057Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":"2304.13731","doi":"10.48550/arxiv.2304.13731","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text-to-audio generation using instruction- tuned LLM and latent diffusion model","venue":"arXiv (Cornell University)","work_id":"492d96c3-fca9-41b7-a64d-3e3313ff9da1","year":2023},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:ad13be19bf89a4a0dac96b98760c9ff137b5e1dc01b4601e68c07657674765c0","observation_id":"cc2f9143-e0da-45f8-90c0-5b8af801aee5","resolution":{"observed_at":"2026-05-15T07:39:50.497266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"0b1ecbfc-3522-480b-ae00-ce118ebc4da9","year":2023},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:4252a23235ff1d5b642ba57a600fd903e365839df1acdfbe574292134345abca","observation_id":"2d43860a-3b14-43e1-b7dc-c0ae64728f83","resolution":{"observed_at":"2026-05-15T07:40:13.507977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5ede1edc-7b6a-41cb-80a0-df08de063122","year":2017},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:2a5276a0df0c24fffd743043337ea97028d18891552acb19110a5a1c597b9131","observation_id":"bbccbe17-8fe8-477c-824a-ab8db7d2321d","resolution":{"observed_at":"2026-05-15T07:40:13.464534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14709","last_updated":"2024-09-23T05:05:47Z","snapshot_observed_at":"2026-07-06T19:19:37.350445Z","submitted_at":"2024-09-23T05:05:47Z","title":"Video-to-Audio Generation with Fine-grained Temporal Semantics","version":1},"cited_work":{"arxiv_id":"2409.14709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14709","snapshot_observed_at":"2026-06-29T08:03:14.755687Z","title":"Video-to-audio generation with fine-grained temporal semantics","venue":null,"work_id":"7e18ddab-6f76-417d-b6af-6077dae8f0f8","year":2024},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"cited_paper":"/paper/2409.14709","citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:3bb0bbf7af1ecbe6e54a579b66f52500790ef0b60c00788d2fc44c9cb426fa2c","observation_id":"abb910f8-0020-47b9-8c46-da7aa1a50d51","resolution":{"observed_at":"2026-05-15T07:39:50.493731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spotlighting partially visible cinematic language for video-to-audio gen- eration via self-distillation","venue":null,"work_id":"f803b4bc-e441-44b4-98bb-afbc36cdf62b","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:153f77c293a0b42f849aa30775464108368d4e107ee3655a12b81b8537648d26","observation_id":"457c038e-c392-422f-9f65-d8a465ba0383","resolution":{"observed_at":"2026-05-15T07:40:13.452566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12661","last_updated":"2023-01-30T04:44:34Z","snapshot_observed_at":"2026-07-06T14:45:55.345502Z","submitted_at":"2023-01-30T04:44:34Z","title":"Make-An-Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion Models","version":1},"cited_work":{"arxiv_id":"2301.12661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12661","snapshot_observed_at":"2026-06-28T20:42:37.763677Z","title":"Make-An-Audio: Text-to-audio generation with prompt-enhanced diffusion models","venue":null,"work_id":"a9bc5106-f11c-415f-9d34-fb7a465c5185","year":2023},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"cited_paper":"/paper/2301.12661","citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:b1be33a24a20c1088d675707e1e639be5fb517153dcaff64883e76c4c83369da","observation_id":"f7217cf6-c0cf-4606-8373-7a3cb4d4e8ad","resolution":{"observed_at":"2026-05-15T07:39:50.518487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":null,"work_id":"9093b90b-ffae-4453-85b7-4ebbbb6b0b1f","year":2024},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:d386e386ac3ef45beed04980206b636898e63637aa9e574357fd2297bca8c34a","observation_id":"97d8d566-39f0-4746-9368-5bd523152868","resolution":{"observed_at":"2026-05-15T07:40:13.484427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zisserman","venue":null,"work_id":"ddce8848-e920-42af-8cea-39cc8d6f122c","year":2024},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:56c63e862c8a1649305989fdacad6c93838d13ab39e1ff3f51cfe70843777b9e","observation_id":"ffd7fa4d-89fe-492e-86fd-be23e579153e","resolution":{"observed_at":"2026-05-15T07:40:13.472192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audiocaps: Generating captions for audios in the wild","venue":null,"work_id":"55af2fc8-fc30-4118-8761-06b5171c7c18","year":2019},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:dae5a09150126e3c6d71f055247a114582cb9e6b541bd47f926d9a4eec15f2e6","observation_id":"35ca8a3f-bd26-44f0-bba6-ff82304f9904","resolution":{"observed_at":"2026-05-15T07:40:13.503752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Plumbley","venue":null,"work_id":"1650ec77-9901-4e80-8b8f-70c485265256","year":2020},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:0fa8af7ae8980d6642ba91f83f0389ed48393204ccc9072f58090e8dbecb77e9","observation_id":"b71e4b0b-1717-401d-8050-8c79d3717216","resolution":{"observed_at":"2026-05-15T07:40:13.552825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:172098327fc1cfd8dcad945957be55373ac36a6e078b225102547b972b049a4f","observation_id":"5bd501e2-6f78-458e-9dd2-8c802731a476","resolution":{"observed_at":"2026-05-15T07:39:50.514212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient training of audio transformers with patchout","venue":null,"work_id":"4685f150-2404-4022-a947-f14de673ab1a","year":2022},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:279ebe2c821dcf97759594311df4ca58f89043d14338cb471f9a9165959a44c7","observation_id":"bfad09d1-ddc4-438d-8640-35e45deb9fba","resolution":{"observed_at":"2026-05-15T07:40:13.564810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-03T05:48:47.605109Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:057b84e60e6818c40cac40f8546f487080a93a49c36d4bf9c45bb1d728720b97","observation_id":"061b5dad-dfc2-42d9-bc6e-291fe3375a92","resolution":{"observed_at":"2026-05-15T07:39:50.489770Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-foley: Two-stage video-to-sound generation via tem- poral event condition for foley sound.IEEE Transactions on Audio, Speech and Language Processing","venue":null,"work_id":"d0b69622-6c06-402c-979c-4a90cc009443","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:2a160fdaf2c0548c82ac01e002e5f931c532cb0084d6342be0779cdf1276215e","observation_id":"a159c0f6-1e21-4cc5-acc2-85e9791d5f20","resolution":{"observed_at":"2026-05-15T07:40:13.480302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreamfoley: Scalable vlms for high-fidelity video-to- audio generation","venue":null,"work_id":"f9fb88cf-4909-4833-849f-f467ba33023b","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:3ce54eda0053ab3117f79330164cfa9676313b5d8233c707ebfc194905cce18c","observation_id":"6217bfbf-1d4d-428b-9467-5285616db589","resolution":{"observed_at":"2026-05-15T07:40:13.518866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-07-06T19:56:48.086175Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":"2411.16749","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.16749","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anysynth: Harnessing the power of image synthetic data generation for generalized vision-language tasks","venue":null,"work_id":"4c822625-8c9c-4021-b642-441e0964503b","year":2024},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"cited_paper":"/paper/2411.16749","citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:9960f1bb15811c60f59b79da56ec7c04139ae5f64b1f02bfebb4c532c5770858","observation_id":"52e3cd3d-fc9b-450e-9da5-55576307077c","resolution":{"observed_at":"2026-05-15T07:39:50.480308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagine and seek: Improv- ing composed image retrieval with an imagined proxy","venue":null,"work_id":"5d56891a-b45d-4b3d-8683-1b44c3f4d7cb","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:44861046ce223f7ff74852e881e1a6dfe5470c8e88277f4b22060fc1680fbd7e","observation_id":"7cd9ed13-ecd7-4dda-b22c-b884fb57acc6","resolution":{"observed_at":"2026-05-15T07:40:13.545160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audi- oLDM: Text-to-audio generation with latent diffusion mod- els.Proceedings of the International Conference on Machine Learning, pages 21450–21474","venue":null,"work_id":"6256870e-cc1a-4a70-9a6b-2b14054db262","year":2023},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:b6f585db75f0aa745df156436820b0a26edbb5650dd3ac7f709d49985fa16a13","observation_id":"f3669e5b-77a1-4e2d-8d16-247117093d96","resolution":{"observed_at":"2026-05-15T07:40:13.560910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Plumbley","venue":null,"work_id":"82afb097-27de-4a06-9c84-c9b42947ad49","year":2024},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:fe30d65ae79ca62d80dcd2a0a3351a5cb2b128d7726ab7c51e8fc1d3a13ea9f7","observation_id":"1262e0b1-5b49-429a-ad0d-01d01dc80a3b","resolution":{"observed_at":"2026-05-15T07:40:13.511192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashaudio: Rectified flows for fast and high-fidelity text-to-audio generation","venue":null,"work_id":"180062cd-c80c-4e4c-92b6-03ae052822d9","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:d1445f148be39cbd71d5d81fff880142982e3c53adfeb9122111b90d3cf709e6","observation_id":"db8b65f2-ce98-4903-b1ca-a53b327de6e6","resolution":{"observed_at":"2026-05-15T07:40:13.460614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thinksound: Chain-of- thought reasoning in multimodal large language models for audio generation and editing","venue":null,"work_id":"6a3c2e15-6c83-494f-aea5-23927a841075","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:602586a7f03e9e594985de595453f1c121ddb44458fcc71f1db04431a80872d1","observation_id":"a2f6a240-2213-472f-b25b-71904619a732","resolution":{"observed_at":"2026-05-15T07:40:13.437306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diff-foley: Synchronized video-to-audio synthesis with la- tent diffusion models","venue":null,"work_id":"fd9de88d-fcfd-442b-aee6-22235c2cfebc","year":2023},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:250f205373c8e4a07307ac1a14a01fe1e821e8e976432542aa0087bfb7260b51","observation_id":"186059dd-547d-44dd-934f-04cb85f13f1f","resolution":{"observed_at":"2026-05-15T07:40:13.579079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vista-llama: Reducing hallucination in video language models via equal distance to visual tokens","venue":null,"work_id":"d9947dc6-63bd-4eb1-971d-87615b676fd2","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:afa7fbb7faa9ad8378ae41742469d26947ecf18c7306d20608f606e6e1220941","observation_id":"789584c7-8d71-4aab-8744-acdce79db322","resolution":{"observed_at":"2026-05-15T07:40:13.488577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever","venue":null,"work_id":"bb35069c-2ae4-4220-b168-1188d9bf293a","year":2021},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:207976177e80669ee4f560be3385824515e89aba2811cc6619835faaa83c57d8","observation_id":"37dafcf1-55e2-40b3-9020-d4fb2539e913","resolution":{"observed_at":"2026-05-15T07:40:13.448983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"535ceba1-cabb-4509-9f9e-3f07fc98ed07","year":2022},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:d322422cd68be254e79b4d0aafa393b253fc2e131e63f7d092ef0a52e4eb4f85","observation_id":"962cd879-8b12-4bd7-ae9c-07a0e6358d00","resolution":{"observed_at":"2026-05-15T07:40:13.440095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hunyuanvideo- foley: Multimodal diffusion with representation alignment for high-fidelity foley audio generation","venue":null,"work_id":"f8d33576-c439-419f-910b-f8cd7f18dec0","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:b044f6d8956d27a586fde1feb5d0f2efd614bba29722a66fe0919a52914fbcdb","observation_id":"6fd8684f-17c5-4d59-8a0b-26a26dd7b6be","resolution":{"observed_at":"2026-05-15T07:40:13.434039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20427","last_updated":"2025-12-10T16:37:54Z","snapshot_observed_at":"2026-07-06T22:30:41.141182Z","submitted_at":"2025-09-24T17:59:04Z","title":"Seedream 4.0: Toward Next-generation Multimodal Image Generation","version":3},"cited_work":{"arxiv_id":"2509.20427","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.20427","snapshot_observed_at":"2026-07-11T00:07:42.259448Z","title":"Seedream 4.0: Toward Next-generation Multimodal Image Generation","venue":"cs.CV","work_id":"15c839a0-48a3-4218-82b6-cac5b7f66e13","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"cited_paper":"/paper/2509.20427","citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:dcc1ddf99ecdd9e77d9074dcff6fd9e2653c1bd40ab55c15426555f3aeec7f3e","observation_id":"d602ab2c-a437-453f-87a2-85b28799d44d","resolution":{"observed_at":"2026-05-15T07:39:50.455277Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporally aligned audio for video with autoregression","venue":null,"work_id":"f6ed5b45-7b1c-4bc9-aa36-de1f8a684e49","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:356cb5e03a6687090c7bb7f4050dd458aae5d372404269df9b37946794bc42ae","observation_id":"25ec8201-7247-4d1c-8d7c-56fdeb8c9bc5","resolution":{"observed_at":"2026-05-15T07:40:13.475959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":"429a5c1c-4478-44ae-b576-09ad6004bea1","year":2023},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:80c54b83a3ca0b18c2c51cc335e6575040739cbce3f71bc06513267744d7a759","observation_id":"d96234ef-1141-4efd-bc5d-20b7acf2d289","resolution":{"observed_at":"2026-05-15T07:40:13.522610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:e576acab3344cf986c5269d1be0bc06cce71eb261719cc8bd42d0d629063d63f","observation_id":"dca90a6c-031a-45e1-8c6e-e1d6efd4e026","resolution":{"observed_at":"2026-05-15T07:39:50.451319Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kling-foley: Multimodal diffusion trans- former for high-quality video-to-audio generation","venue":null,"work_id":"f3043076-dbba-4476-9ee6-072fcf369692","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:93782805ee2e428aafa8407e0d1998253edb311059f8d1b9badd79781f06ed9f","observation_id":"b5574116-6960-495e-b3d9-0056cea8d7d1","resolution":{"observed_at":"2026-05-15T07:40:13.445490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frieren: Efficient video-to-audio generation network with rectified flow matching.Advances in Neural Information Processing Systems, 37:128118–128138","venue":null,"work_id":"581ef6df-1bd3-44a2-8f3c-58d25ed288c9","year":2024},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:e4449a032d65ed3971317e1193a2d4d41304590127c7397843828a38c1a20667","observation_id":"cc4140ad-b044-46e7-96d7-46e44db93cec","resolution":{"observed_at":"2026-05-15T07:40:13.568458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:7a82c8776686ce153267861dcedcfbe8caf5622bed9b677508e6c5be5cff82f9","observation_id":"f2debca2-c864-42a6-b137-d91ef1b07d80","resolution":{"observed_at":"2026-05-15T07:39:50.485071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:09675af5293f52c13a96c5958c7cdf508372309c8b6c64efebfdee6a13c7a94e","observation_id":"2971fe07-3228-4cfe-b5bb-920697271c66","resolution":{"observed_at":"2026-05-15T07:39:50.484652Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-to-audio generation with hidden alignment","venue":null,"work_id":"0048e2c4-88ee-4ef7-8a0c-38c13c3f5b6c","year":2024},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:6e40f55fdb13b7592d5cc636adf3207c305c3b0e1d9f31739692860a6ef22d58","observation_id":"c37a2910-650a-4ecd-a11c-4524546b64d1","resolution":{"observed_at":"2026-05-15T07:40:13.496034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11000","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:39:50.235274Z","title":"Con- textgen: Contextual layout anchoring for identity-consistent multi-instance generation.arXiv preprint arXiv:2510.11000","venue":null,"work_id":"8e1d0006-840f-4934-b578-de20102a0572","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:b090fc58d94c16d44d580b5ad7e7cc34b836c64e8fb90a26806992c971f421d9","observation_id":"774d5e36-1922-40ba-b902-8ebb08dd0ce5","resolution":{"observed_at":"2026-05-15T07:39:50.511077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02584","last_updated":"2024-07-17T06:11:43Z","snapshot_observed_at":"2026-08-04T10:05:29.359571Z","submitted_at":"2024-01-05T00:27:32Z","title":"Towards Weakly Supervised Text-to-Audio Grounding","version":2},"cited_work":{"arxiv_id":"2401.02584","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02584","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards weakly supervised text-to-audio grounding","venue":null,"work_id":"af8ea266-ea3e-48b8-87b8-caa2b55f0f13","year":2024},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"cited_paper":"/paper/2401.02584","citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:e22d2e7fd7a2bd4eac748d255fab076bee4aeb35bb06a5ecac68015332560e97","observation_id":"d246dbf2-cd28-4dbc-91ce-caf561cb1524","resolution":{"observed_at":"2026-05-15T07:39:50.464018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffsound: Discrete diffusion model for text-to-sound generation.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 31:1720–1733","venue":null,"work_id":"1106df60-b897-4c2d-8d26-79afafc27f4c","year":2023},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:04eed7eae93e5d6e107b4034a297ec1449cd3c160df6eac66f8e3eba0c484915","observation_id":"aef1d58f-46b2-44d7-8072-76d77c14f918","resolution":{"observed_at":"2026-05-15T07:40:13.515099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:b8535a555226ce2d02a51fc4a2491038f4645d1a20470048897efc766f705031","observation_id":"ae11fb55-b5b7-4b1c-a873-e175d3004ed4","resolution":{"observed_at":"2026-05-15T07:39:50.468836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Foley- crafter: Bring silent videos to life with lifelike and synchro- nized sounds","venue":null,"work_id":"fca675f8-c7a5-4ecd-a02f-bdfa897da721","year":2024},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:a355ea4a0b0902b53ea4b264674c991184ba4f15b35135d94d928d40510565c6","observation_id":"8e6a628d-a948-48e8-a2da-d39b984a7bb1","resolution":{"observed_at":"2026-05-15T07:40:13.526854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Migc++: Advanced multi-instance generation controller for image synthesis.IEEE Transactions on Pattern Analysis and Machine Intelligence","venue":null,"work_id":"bdd08da5-7777-4331-97ce-a7b70dcc855e","year":2024},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:1839c68c915f804ac504791c2856b33d2f5d51ade21261fbb63b249ed774571d","observation_id":"23e0861c-4e7f-4ffb-9b64-9158d0bfeac1","resolution":{"observed_at":"2026-05-15T07:40:13.548824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Migc: Multi-instance generation controller for text-to-image synthesis","venue":null,"work_id":"f21e3810-1efb-4f7b-b7c9-cf24ad523a95","year":2024},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:dd0d41c6cd652f3109a2ed17cf0fb0e9cf87dc86b33d2d8e6a23e71bd93bed30","observation_id":"3bbd6672-5cd1-4839-a0e9-53194717df96","resolution":{"observed_at":"2026-05-15T07:40:13.538370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.12669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:38:39.661947Z","title":"3dis: Depth-driven decoupled instance synthesis for text-to-image generation","venue":null,"work_id":"962a1fc4-b045-4fab-a202-0f1bdb67fb6c","year":2024},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:7f4f2cf3fb0c854f1d0094bf8b0781f0936ba4556874466899d9187fab625ba4","observation_id":"be354d4c-014f-4cd5-b12b-2fef546f42df","resolution":{"observed_at":"2026-05-15T07:39:50.522770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.19268","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:38:39.623980Z","title":"Bidedpo: Conditional image generation with simultaneous text and condition alignment","venue":null,"work_id":"68d9a1ed-7183-4f3f-9ec7-8079ef0509b7","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:4ac6a15fd9be3c17e224511f44837d674f160a8096c75b76b2936331c56167ac","observation_id":"751d62f7-6b40-4bb3-8e95-522f0b2a79f8","resolution":{"observed_at":"2026-05-15T07:39:50.445057Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreamrenderer: Taming multi-instance attribute control in large-scale text-to-image models","venue":null,"work_id":"3b3af76f-dd6a-4c4f-b00c-147f4137b891","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:09516bf9be6cd6b0696297cf0d22ef2f041b59cb766a42bc8ecc3326ee62a787","observation_id":"d4f23135-9a7b-44b6-ad3d-e167deff07f3","resolution":{"observed_at":"2026-05-15T07:40:13.442908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05131","last_updated":"2025-01-09T10:34:00Z","snapshot_observed_at":"2026-08-06T02:14:02.110378Z","submitted_at":"2025-01-09T10:34:00Z","title":"3DIS-FLUX: simple and efficient multi-instance generation with DiT rendering","version":1},"cited_work":{"arxiv_id":"2501.05131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05131","snapshot_observed_at":"2026-07-02T08:26:47.761188Z","title":"3dis-flux: simple and efficient multi-instance generation with dit ren- dering","venue":null,"work_id":"5423f6c3-110f-4934-908a-90c5c9b85af7","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"cited_paper":"/paper/2501.05131","citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:8141be44cfee23cd03e5521994cae6332f98cb1232f08f15a4d6abd812754771","observation_id":"1df1957c-1839-496f-a69a-5e429aa669f1","resolution":{"observed_at":"2026-05-15T07:39:50.500931Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked audio generation using a single non- autoregressive transformer","venue":null,"work_id":"e954394b-a066-4b99-b1db-51b91769db39","year":2024},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:dde3730306de017e317f0c07e8f9b497c5c0de8670fbe058f7689fa343bc5aac","observation_id":"f9549235-6119-4bb1-9eae-3a7b6d610caa","resolution":{"observed_at":"2026-05-15T07:40:13.456310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"30722218-22a6-4e0b-a9f4-48f157623e4d","year":null},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:cd62af40f46cfe24dc46f761ef362343b44beb0c811780250b0be83f55fc0169","observation_id":"27f04722-67b9-453f-9995-336e20b12d4b","resolution":{"observed_at":"2026-05-15T07:40:13.575457Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e48bf57c-ee91-4d23-82fe-7b7955a95b61","year":null},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:79bd0e30ef056020db13a55187cf788398935676623e9b112a642e3012c6b03d","observation_id":"3616e69c-1865-4430-ba7b-925378572b7d","resolution":{"observed_at":"2026-05-15T07:40:13.530268Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e9890b63-e4be-40d5-828e-de4a1ea888e9","year":null},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:68a240a455eaf94318143a77bc68b6080c9cd7153d0b21ea6396b3e10c206efc","observation_id":"d7660209-014b-458c-974e-3ee463c969c5","resolution":{"observed_at":"2026-05-15T07:40:13.499432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(b) Segment-level Classification You are an audio-visual analysis expert","venue":null,"work_id":"7c97f01a-0007-4833-b26e-f4499fd76648","year":null},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:4ecfc7ac818da14233ba97794c407743f6b092937e1984f08e6427e2dcfc0d8e","observation_id":"84a277d4-a083-4cd7-902c-1d46bbae8096","resolution":{"observed_at":"2026-05-15T07:40:13.556738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yes\") or absent (","venue":null,"work_id":"5e0dc8d6-a7e7-4bbc-a2f4-64bc322b53d2","year":null},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:2c975d7ada358bddc04e5973f32cbee11d9e484b7130b4b286c33a32ac211786","observation_id":"8c1aac7c-efc7-4fb6-8e05-a6a96844735b","resolution":{"observed_at":"2026-05-15T07:40:13.427714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"soft\", \"medium","venue":null,"work_id":"b2d42dfc-37fb-47a6-9c04-7e9bda016086","year":null},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:b0390b1f16d2cba19ca347c6d0d58dd2f934f125999b199b221ab601a641b638","observation_id":"52bd301c-bd8f-4fe0-849c-ca34994288a4","resolution":{"observed_at":"2026-05-15T07:40:13.492118Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"During training, we randomly drop TSR features with a probability of 0.1 We set an initial learning rate of2.0×10 −5","venue":null,"work_id":"85431987-1d56-4e6c-b1af-32ac9abe34c0","year":null},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:77d68a6191a389d823812ffb8a9b9be550fe66bab2ea94bdbc2035e28f0e307f","observation_id":"3fd4c9ce-1fa9-443e-88a1-6d2b784a805c","resolution":{"observed_at":"2026-05-15T07:40:13.430949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":4,"verified_exact":18,"verified_fuzzy":38},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2603.19857."}