{"as_of":"2026-08-08T11:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:db074720022782b9f4e844bc2349869f50faa5d477e65d3da8c5df4c91b18b23","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:09:58.262045Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T08:20:02.986562Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T08:21:06.814521Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"cited_work":{"arxiv_id":"2505.16195","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16195","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Specmaskfoley: Steering pretrained spectral masked generative transformer toward synchronized video- to-audio synthesis via controlnet","venue":null,"work_id":"ad004825-ef4b-4be2-8c76-2cb8780f5260","year":2025},"citing_paper":{"arxiv_id":"2510.09065","last_updated":"2026-04-17T15:00:46Z","snapshot_observed_at":"2026-07-06T22:32:17.816175Z","submitted_at":"2025-10-10T07:13:06Z","title":"MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T08:20:02.986562Z"},"links":{"cited_paper":"/paper/2505.16195","citing_paper":"/paper/2510.09065"},"observation_digest":"sha256:fa3cb88c292d0aef6dbb74049eabb9c1d5e5bce91669f80b65a4a348892f854b","observation_id":"2678bf73-aeaa-4275-b270-963fb3ea0938","resolution":{"observed_at":"2026-05-18T08:21:06.817478Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16195/citation-record","integrity":"/paper/2505.16195/integrity","json":"/paper/2505.16195/citation-record.json","paper":"/paper/2505.16195"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-07T16:54:38.689558Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-07T15:09:54.545341Z","title":"Audiogen: Textually guided audio generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.545341Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:6579114b5a8b631b9596b776c8e9b1748a5e48a4f4ae6cb014377974008ee726","observation_id":"abc09efc-c13d-4be5-8260-8f0b94acdb03","resolution":{"observed_at":"2026-08-07T15:09:54.545341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-08-08T06:05:53.280034Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-08-07T15:09:54.619538Z","title":"Make-an-audio 2: Temporal-enhanced text-to-audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.619538Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:d2c7dd686bf35325bab9aced9f584b46392b5536a4a0c4f96fee7fb3f9032813","observation_id":"7953642e-47fc-455d-a2b1-c9fc8739fcc3","resolution":{"observed_at":"2026-08-07T15:09:54.619538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17672","last_updated":"2024-06-26T08:15:24Z","snapshot_observed_at":"2026-08-08T01:46:00.207911Z","submitted_at":"2024-06-25T16:02:59Z","title":"SpecMaskGIT: Masked Generative Modeling of Audio Spectrograms for Efficient Audio Synthesis and Beyond","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17672","snapshot_observed_at":"2026-08-07T15:09:54.712485Z","title":"Specmaskgit: Masked generative modeling of audio spectrograms for efficient audio synthesis and beyond,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.712485Z"},"links":{"cited_paper":"/paper/2406.17672","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:51c090996702913971649996a5e986d13583cb7bbd2bd575118373ca0547ef51","observation_id":"10e5f49b-3c03-4f1f-b5df-9f047e5e0bfd","resolution":{"observed_at":"2026-08-07T15:09:54.712485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18503","last_updated":"2025-03-10T15:51:47Z","snapshot_observed_at":"2026-07-06T18:21:35.476139Z","submitted_at":"2024-05-28T18:14:52Z","title":"SoundCTM: Unifying Score-based and Consistency Models for Full-band Text-to-Sound Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18503","snapshot_observed_at":"2026-08-07T15:09:54.810995Z","title":"Soundctm: Uniting score-based and consistency models for text-to-sound generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.810995Z"},"links":{"cited_paper":"/paper/2405.18503","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:228d8896891aec0198b4c996d6e24d7c4e876602a7f971ec32b6f5deb9bc77b8","observation_id":"66c067d3-bdd2-4644-98ba-2b6fbf9c6141","resolution":{"observed_at":"2026-08-07T15:09:54.810995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:02.736030Z","title":"Stable audio open,","venue":null,"work_id":"f069c9f5-6d1a-4108-b3d0-bf129248a68c","year":2025},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.911275Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:01bbe409f7e46931a6cc69be065e7f080c3c707b8e612768c276ed7b63b56ca2","observation_id":"fe976c38-6e02-4d78-a072-a320e56aaf45","resolution":{"observed_at":"2026-08-07T15:10:02.801403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15322","last_updated":"2025-04-07T18:00:00Z","snapshot_observed_at":"2026-08-03T17:32:04.376468Z","submitted_at":"2024-12-19T18:59:55Z","title":"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15322","snapshot_observed_at":"2026-08-07T15:09:54.999597Z","title":"Taming multimodal joint training for high-quality video- to-audio synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.999597Z"},"links":{"cited_paper":"/paper/2412.15322","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:2b098e8aa6158d02f7a8ad165d5ee2cda0f0705206457e4f54ee93b5272f1aeb","observation_id":"4ba353cf-9ed8-4907-825a-6f6705aa76b4","resolution":{"observed_at":"2026-08-07T15:09:54.999597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:02.580812Z","title":"Mm-diffusion: Learning multi-modal diffusion models for joint audio and video generation,","venue":null,"work_id":"b88a1f24-4f77-42cd-9bef-c04307d1dc2a","year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.139356Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:c648ec1a4178655b1c1254dc788130255d7938514fb707d404e2b4d3b93cd3db","observation_id":"9b22797a-76b4-46ae-886b-f4261d8e063c","resolution":{"observed_at":"2026-08-07T15:10:02.647919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14598","last_updated":"2024-05-24T15:21:13Z","snapshot_observed_at":"2026-08-08T01:41:09.202426Z","submitted_at":"2024-05-23T14:13:16Z","title":"Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14598","snapshot_observed_at":"2026-08-07T15:09:55.278233Z","title":"Visual echoes: A simple unified transformer for audio- visual generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.278233Z"},"links":{"cited_paper":"/paper/2405.14598","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:f61643d4d605308c242e2389fec10807697fe0843f37e781b617472ae684c146","observation_id":"23d57b05-ab77-49f4-88f7-9f99a863cba2","resolution":{"observed_at":"2026-08-07T15:09:55.278233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:02.430540Z","title":"V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foundation models,","venue":null,"work_id":"f16a934d-89b7-44e6-9436-c2a0a79410af","year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.387681Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:190e1166c900d51b9f517e7324730a1665a781231df2f09b3848578c9569cf44","observation_id":"e8818c41-138b-4f53-ab6e-af61e8b28b03","resolution":{"observed_at":"2026-08-07T15:10:02.496790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:02.282473Z","title":"Seeing and hearing: Open-domain visual-audio generation with diffusion latent aligners,","venue":null,"work_id":"afef7ee5-4cec-447f-b388-f56f7d1256d9","year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.487341Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:51ed391c8c35188bdff14a7a66c2992c188b24b1db998845fa98ecceea3236d8","observation_id":"cfd683ff-f0a3-4a25-baab-cead609353e7","resolution":{"observed_at":"2026-08-07T15:10:02.352055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-07-30T17:52:19.430476Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-07T15:09:55.547205Z","title":"Fr \\’echet audio distance: A metric for evaluating music enhancement algorithms,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.547205Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:c705322dac4cfd154699cc9a246ae867fdf48b43edbb4ddea708244d16d6767d","observation_id":"9fef9217-ca06-447b-8cd2-15c042f266c9","resolution":{"observed_at":"2026-08-07T15:09:55.547205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:02.132173Z","title":"Synchformer: Efficient synchronization from sparse cues,","venue":null,"work_id":"99e5c247-512d-42d7-93ac-ae9ce9ec2c3f","year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.606504Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:c547a6c5e1c0823aa7ee5fe4677cbfa7f34cf7f12fb816326eff0d3824028f52","observation_id":"0ddf2160-429f-49b1-b0ad-bcdd0b423e1f","resolution":{"observed_at":"2026-08-07T15:10:02.207841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:01.945731Z","title":"Adding conditional control to text- to-image diffusion models,","venue":null,"work_id":"9b775a95-abe7-4a71-ba9e-8ea9649d5b18","year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.683396Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:27beba668805c7558d081d46a89c75ae50248ea4e2bd8aba269d9a227e0a6df6","observation_id":"8994e6ca-0abb-4e83-b1c4-652cdca8e598","resolution":{"observed_at":"2026-08-07T15:10:02.020964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:01.772989Z","title":"Uni-controlnet: All-in-one control to text-to-image diffusion models,","venue":null,"work_id":"f38cc7e3-d72f-48c9-a20f-ece9fa261035","year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.753711Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:762a853c4caacad08a1c0ed45d096469a1d91d806a601f7a7a4a780a88486e46","observation_id":"3cc6f8c6-e56a-4b03-b059-a741ae33fc09","resolution":{"observed_at":"2026-08-07T15:10:01.857838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05551","last_updated":"2024-12-26T15:23:36Z","snapshot_observed_at":"2026-07-31T15:22:41.072708Z","submitted_at":"2024-07-08T01:59:17Z","title":"Read, Watch and Scream! Sound Generation from Text and Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05551","snapshot_observed_at":"2026-08-07T15:09:55.831770Z","title":"Read, watch and scream! sound generation from text and video,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.831770Z"},"links":{"cited_paper":"/paper/2407.05551","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:dab28ba7f6e0d6c92377fb97b594feb68beadadc2ed285db545ab5af1110cf9e","observation_id":"110c6b42-6d76-4411-a425-12ee6748e1f7","resolution":{"observed_at":"2026-08-07T15:09:55.831770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-07T10:46:50.742580Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-07T15:09:55.910310Z","title":"Foleycrafter: Bring silent videos to life with lifelike and synchronized sounds,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.910310Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:5b7c42f8c6ea1eaf1b83ebf62a9a18bec1b44854435188341ee6d6a819a6a172","observation_id":"72a83755-a8c4-4920-b509-daf337c91156","resolution":{"observed_at":"2026-08-07T15:09:55.910310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05679","last_updated":"2025-04-04T21:50:29Z","snapshot_observed_at":"2026-07-06T19:47:30.083298Z","submitted_at":"2024-11-08T16:29:07Z","title":"Tell What You Hear From What You See -- Video to Audio Generation Through Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05679","snapshot_observed_at":"2026-08-07T15:09:55.988743Z","title":"Tell what you hear from what you see– video to audio generation through text,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.988743Z"},"links":{"cited_paper":"/paper/2411.05679","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:9ac3c699b25dfe02e097a48d06039494e8111fb899c2acfb450d0d6599ac5e8b","observation_id":"0dd4b443-d5f0-4fa6-a51c-394681685a84","resolution":{"observed_at":"2026-08-07T15:09:55.988743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:01.513171Z","title":"Temporally aligned audio for video with autoregression,","venue":null,"work_id":"a167ff6e-f273-45af-a411-bd68b7aff3c8","year":2025},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.045325Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:03f97f6638e15ff0833b980f9729e472caac30f19f5f4e10409c1bbcfbc7c353","observation_id":"6278bfb9-8f1b-4e1a-8085-cc24982c664e","resolution":{"observed_at":"2026-08-07T15:10:01.708710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:01.352394Z","title":"Frieren: Efficient video-to-audio generation network with rectified flow matching,","venue":null,"work_id":"d306ac87-2aa8-40e7-9229-3b5638c5ef20","year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.119327Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:701c8251f110d1662b802d9f1bcc016aea326497d2d87727fb289dc7f2b22098","observation_id":"f2a7234f-eedb-4911-a3eb-28b36912076e","resolution":{"observed_at":"2026-08-07T15:10:01.422859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:01.185840Z","title":"Mavil: Masked audio-video learners,","venue":null,"work_id":"3d8eb3d8-6ddc-4da2-a004-10ee30764dde","year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.195962Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:b1cdbce1666bd169911b90a317d0b1fe3e78400dcedae0366d122a6948f371c2","observation_id":"e6501fb0-d017-4ff1-9d9d-438c83298075","resolution":{"observed_at":"2026-08-07T15:10:01.261287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:01.020209Z","title":"Diff-foley: Synchronized video- to-audio synthesis with latent diffusion models,","venue":null,"work_id":"73ae40f1-27da-45b3-a28f-86eeee3a5f7d","year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.264683Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:520df06af652e8ca1c917456a5081b2590a4c3e9030bf1cc47d063d29936dd06","observation_id":"3cc382ef-08bf-40c2-a2e7-7cbbe25e8cc4","resolution":{"observed_at":"2026-08-07T15:10:01.089076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15023","last_updated":"2025-05-05T16:55:53Z","snapshot_observed_at":"2026-08-07T02:24:23.582220Z","submitted_at":"2024-12-19T16:37:19Z","title":"FolAI: Synchronized Foley Sound Generation with Semantic and Temporal Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15023","snapshot_observed_at":"2026-08-07T15:09:56.308460Z","title":"Stable-v2a: Synthesis of synchronized sound effects with temporal and semantic controls,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.308460Z"},"links":{"cited_paper":"/paper/2412.15023","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:25ceebee088361ccaf22451d719bbcecce331b20ddaa3d8f6f7b3a67941b6cab","observation_id":"6cb4d445-1e69-4e49-ba26-f9ebff2361a3","resolution":{"observed_at":"2026-08-07T15:09:56.308460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:00.854659Z","title":"Smooth-foley: Creating continuous sound for video-to-audio generation under semantic guidance,","venue":null,"work_id":"84fce43d-7573-489c-8537-a450cffe3da6","year":null},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.376868Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:e4a0a28e1ff7981656d82868904ef982823ba3a057529ffb3fc0e363bdc842b9","observation_id":"1153f749-b0bd-4fd4-b5e1-da4c0392e7da","resolution":{"observed_at":"2026-08-07T15:10:00.923321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:00.681939Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"39bf8341-e070-4a5e-bf30-b820af29d4ee","year":2021},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.424504Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:3868b2a14e18f4b966c83156d0df79431565610ca7852cba8b457b2a4383e735","observation_id":"18b0951f-4fe7-4acb-a6e8-fc7fc4972a5f","resolution":{"observed_at":"2026-08-07T15:10:00.765043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:00.537391Z","title":"Maskgit: Masked generative image transformer,","venue":null,"work_id":"52136409-5d58-44a2-a92c-b48037f5c284","year":2022},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.497923Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:7f5cc8b3f38c655b87626d37bdcff5abffaa0f6b834dff7c411cc556d93f2304","observation_id":"34ad2f69-31e0-421e-aa52-a94edb43a1cc","resolution":{"observed_at":"2026-08-07T15:10:00.596551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-07T15:09:56.595415Z","title":"Eva-clip: Improved training techniques for clip at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.595415Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:857dae3f2874406f889749c8cfc4a48ab9460b7b279b56a3c5c0f874ae9a902e","observation_id":"389e82fd-b576-42d8-b9dc-c7eb68d08266","resolution":{"observed_at":"2026-08-07T15:09:56.595415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01135","last_updated":"2025-05-27T08:58:45Z","snapshot_observed_at":"2026-07-06T19:43:59.326124Z","submitted_at":"2024-11-02T04:44:27Z","title":"Music Foundation Model as Generic Booster for Music Downstream Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01135","snapshot_observed_at":"2026-08-07T15:09:56.680530Z","title":"Music foundation model as generic booster for music downstream tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.680530Z"},"links":{"cited_paper":"/paper/2411.01135","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:dc5e660896dfd24f77d1863f1aa13c7d1d22d5d5bdda992d5bfa4f7a6bc3f010","observation_id":"1648a738-ef21-43fe-8484-e30a2be13b05","resolution":{"observed_at":"2026-08-07T15:09:56.680530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T15:09:56.761212Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.761212Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:118a4f8db7b99950dfc92d5a9e41c92dc368f168816999ac4d4a697c9825b3ec","observation_id":"4ba595d1-8f83-41b5-b393-85b15143268d","resolution":{"observed_at":"2026-08-07T15:09:56.761212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:00.417041Z","title":"High- fidelity audio compression with improved rvqgan,","venue":null,"work_id":"cdc270c5-4915-4175-b0e7-c8dd60316ffd","year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.840072Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:d3dc40ac3bce7a73729abdc26ef6b8190b175ee2916c0a66ed979ed24fbcd5e8","observation_id":"bc0b6b04-276c-4456-8638-737ada8b65fd","resolution":{"observed_at":"2026-08-07T15:10:00.473120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08791","last_updated":"2021-10-17T11:14:00Z","snapshot_observed_at":"2026-07-06T11:58:46.444354Z","submitted_at":"2021-10-17T11:14:00Z","title":"Taming Visually Guided Sound Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08791","snapshot_observed_at":"2026-08-07T15:09:56.889056Z","title":"Taming visually guided sound generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.889056Z"},"links":{"cited_paper":"/paper/2110.08791","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:6e9e786df3c630223dc7eee2d3b32ccfaa84a6dc892f82f9c9381b3ab5de0d3c","observation_id":"52abba22-8b04-45dd-aacc-3e6d083918f9","resolution":{"observed_at":"2026-08-07T15:09:56.889056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:00.312361Z","title":"Masked autoencoders are scalable vision learners,","venue":null,"work_id":"9ee91eec-82db-4469-ac38-ec053ab978fd","year":2022},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.939962Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:5e5bfecf6a8a89bbb46e416bcea357f3aec8d4b9f9551cfe17f9cb1e9bf185e5","observation_id":"ea1a425d-b872-4299-bf93-254e01388d49","resolution":{"observed_at":"2026-08-07T15:10:00.382535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:00.143283Z","title":"Extending audio masked autoencoders toward audio restoration,","venue":null,"work_id":"af13a740-e93c-4bf6-8290-335ae2984d70","year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.006139Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:b94c2ecfe2e952c317559874feeaabf4c8d157b6e517df7d016ba706c2762bdd","observation_id":"3e56c4ab-42ed-407a-8092-60bd86077502","resolution":{"observed_at":"2026-08-07T15:10:00.237928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:59.912805Z","title":"Mage: Masked generative encoder to unify representation learning and image synthesis,","venue":null,"work_id":"6cd7bf08-fe61-48da-9385-f95a8ac65094","year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.058562Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:56d72433441cdeb667d276446e818d34b1bb60c884beeab2b9e9e923b07b089d","observation_id":"87d13178-79e3-43d7-b824-dede84d37966","resolution":{"observed_at":"2026-08-07T15:10:00.021600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-07T15:09:57.138047Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.138047Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:c25ddf8f114fae8b16ba5b7ed6857a3f914d1fb3f62c0f34071570269546eb67","observation_id":"ead1e612-6841-4a2b-817b-ab9faebc6d7d","resolution":{"observed_at":"2026-08-07T15:09:57.138047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05252","last_updated":"2024-01-10T16:27:38Z","snapshot_observed_at":"2026-08-07T04:04:46.527670Z","submitted_at":"2024-01-10T16:27:38Z","title":"PIXART-{\\delta}: Fast and Controllable Image Generation with Latent Consistency Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05252","snapshot_observed_at":"2026-08-07T15:09:57.179030Z","title":"Pixart- {\\delta}: Fast and controllable image generation with latent consistency models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.179030Z"},"links":{"cited_paper":"/paper/2401.05252","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:7ca82fa09122c3f85f7dbfcdd21820e6f0e8b264a9b0885f07d2574d30b69e5b","observation_id":"158aff55-058b-43f9-a4a9-4fc26dd9b46b","resolution":{"observed_at":"2026-08-07T15:09:57.179030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16969","last_updated":"2025-01-09T11:42:21Z","snapshot_observed_at":"2026-07-06T18:05:46.922400Z","submitted_at":"2024-04-25T18:42:25Z","title":"COCOLA: Coherence-Oriented Contrastive Learning of Musical Audio Representations","version":4},"cited_work":{"arxiv_id":"2404.16969","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.16969","snapshot_observed_at":"2026-08-07T15:09:58.377545Z","title":"COCOLA: Coherence-Oriented Contrastive Learning of Musical Audio Representations","venue":"cs.SD","work_id":"625d8fa9-1e97-427a-b048-aa15f228f409","year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.248961Z"},"links":{"cited_paper":"/paper/2404.16969","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:8bde5c88cf9608d528a924e1a5e634c573e2efe2a57d2e2dac998dcae3456c00","observation_id":"c4db9e3c-35ea-45c6-aa2f-f3f918488ffb","resolution":{"observed_at":"2026-08-07T15:09:58.450395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:59.702460Z","title":"Editing music with melody and text: Using controlnet for diffusion transformer,","venue":null,"work_id":"e9d9114a-9f13-4955-b131-92165641f34e","year":2025},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.354123Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:e20aedf9b05aa67d3408f8b20d19a2c13ba599bdccf88068dbbe01c804f8ed9b","observation_id":"d64c8f29-6bdc-49fe-a011-3afb21821ef2","resolution":{"observed_at":"2026-08-07T15:09:59.778127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T15:09:57.420079Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.420079Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:6049bf255d10ea997ae8349d5d1f88f45ca43f179ac669f61bd93fce72656955","observation_id":"5e669fe6-ece2-4d8e-88cf-6ced1feec5be","resolution":{"observed_at":"2026-08-07T15:09:57.420079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T15:09:57.486525Z","title":"Muse: Text-to- image generation via masked generative transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.486525Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:4fa5f01915e56c35baa8c92601d0a4677fdc73a449f2c4d66af0287b9d10c551","observation_id":"e77c68c5-45da-461b-aeba-416f1234010b","resolution":{"observed_at":"2026-08-07T15:09:57.486525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:59.533827Z","title":"Stemgen: A music generation model that listens,","venue":null,"work_id":"b67cf1c2-22d8-4582-bc5a-35219ee683ea","year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.567373Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:21c6ce2b4a430846414eae88065d263a483e4838293c1dfae21dbf2b98d78bcd","observation_id":"b1ce6187-a2e0-41d4-842d-2858f15c4994","resolution":{"observed_at":"2026-08-07T15:09:59.611073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:59.372356Z","title":"Imagebind: One embedding space to bind them all,","venue":null,"work_id":"ab30474f-7aef-4fb4-97b0-7a347c8b87df","year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.668416Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:254ecdf353809cec7772aaa9b5dfe70e2426e20a6f8aba1e62580d8eebad37f4","observation_id":"1c375ab3-c629-4e01-8ec7-e5d4b76227e4","resolution":{"observed_at":"2026-08-07T15:09:59.447837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:59.239922Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"f91a8b6a-c179-4db1-a047-8b01f5f2204c","year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.772268Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:1f68376174620448758384ec192950750b2bb0e6b94ab252da73f494d033c9aa","observation_id":"899ae236-eb3b-43c4-83cd-44ea45f0aa47","resolution":{"observed_at":"2026-08-07T15:09:59.318967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:59.203592Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":"db04a248-55d2-4948-989b-437326d96781","year":2017},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.862288Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:122a7c96c9aedb4d5acbc38eefc766b81c0b6848f70d030cf4a8f972227b4642","observation_id":"f6054d9e-adc8-4eb1-aca5-4fb921a2b459","resolution":{"observed_at":"2026-08-07T15:09:59.207305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-07T15:09:57.929534Z","title":"Effi- cient training of audio transformers with patchout,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.929534Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:f53a4902538b84b0cb619ed366d0a8589943fa7bb32bd86289a7a70ec65fcbab","observation_id":"a066d024-477c-4e68-9145-818d1990d3b7","resolution":{"observed_at":"2026-08-07T15:09:57.929534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:59.084511Z","title":"Vggsound: A large- scale audio-visual dataset,","venue":null,"work_id":"f3046432-c8ae-4c07-9666-ed0614178cbe","year":2020},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:58.028545Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:f8733cfa91297493887507ce574f8b45e7ac32a003243a466ed06037f3e895ad","observation_id":"9d1e8033-5093-4836-8fc2-544e8816659a","resolution":{"observed_at":"2026-08-07T15:09:59.139077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:58.946013Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"a70eb40e-7565-4808-8d2b-b6eb7e6f6bce","year":2020},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:58.119664Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:efdbdf9a5d1fc1dde4da7b1b24ed2d1c296a44a78aad9549aea913480b4fc2d8","observation_id":"330a7253-e81a-4013-98aa-49fd7a4ff704","resolution":{"observed_at":"2026-08-07T15:09:59.019857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:58.802861Z","title":"Cnn architectures for large-scale audio classification,","venue":null,"work_id":"e509e1ca-2cf2-4142-9306-6e46a194a696","year":2017},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:58.194238Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:ceb79774fb8bf7636d6f9dc2e8f38e945a3d7461f97515880ea1feda74801510","observation_id":"ecda695c-59e4-4d15-b432-4efb0dcb829f","resolution":{"observed_at":"2026-08-07T15:09:58.866089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:58.708625Z","title":"Panns: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":"6cea203c-3757-41f4-9b36-40f73fc94f96","year":2020},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:58.262045Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:5839c1b9fef8e9f0bcdf2c005359fd125c41339a4697a3647ab5e04fe4a6bc96","observation_id":"9efe0af6-4ce8-454b-8bf9-b24274ca4411","resolution":{"observed_at":"2026-08-07T15:09:58.751950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":27},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 1 inbound Pith citation observation for arXiv:2505.16195."}