{"as_of":"2026-08-09T17:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fce841550e2a692b4eca718586dce0dd021640418508284ca9115f6196679457","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:45:08.841789Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.20995/citation-record","integrity":"/paper/2506.20995/integrity","json":"/paper/2506.20995/citation-record.json","paper":"/paper/2506.20995"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.347666Z","title":"The Foley Grail: The Art of Performing Sound for Film, Games, and Animation","venue":null,"work_id":"d4202949-3d77-4f25-82a9-8d18411826db","year":2021},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:04.880574Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:b6c70ca049ab123295300c8d8becb5e75525eb14f828b32443877debf684d566","observation_id":"b2efef86-b747-425b-86c4-8cc021f95666","resolution":{"observed_at":"2026-08-06T22:45:12.351577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T22:45:04.943204Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:04.943204Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:10ca119cb032ab708cb123df6a3fd8b4cca44af44d5375565f75bfe9a0d609e2","observation_id":"bf501168-58c8-491e-88bf-c0087732d0c7","resolution":{"observed_at":"2026-08-06T22:45:04.943204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.335425Z","title":"Erasedraw: Learning to insert objects by erasing them from images","venue":null,"work_id":"be301b5b-13a7-4f7e-8cf9-f78cf32981b2","year":2024},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:05.024306Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:fdadb4908e455e8f809c863cab1633acfe93839edb547d326e06caff0651b720","observation_id":"138ac0b1-663d-4891-ae36-377b6e6f1b38","resolution":{"observed_at":"2026-08-06T22:45:12.340230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.323966Z","title":"Action2sound: Ambient-aware generation of action sounds from egocentric videos","venue":null,"work_id":"f2e15aeb-3b2f-485f-bdfe-76321d5c9b65","year":2024},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:05.113307Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:02f0ac758de8d8d2ff0e75a79abfb2c5f9663a0709e155f4e36e2dff8475363a","observation_id":"9cc5593b-09cc-4f8e-9f1e-3ef031053a27","resolution":{"observed_at":"2026-08-06T22:45:12.327905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.313011Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"f508fffe-dc18-4fe3-91f9-4c1a7e0d6204","year":2020},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:05.234622Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:0990dc0375d6e83f9764bae0eca1bac2b4c9e339ef92d3a006e84c06b2d3c20c","observation_id":"f19cb447-815d-43e3-b6e9-057ba58a388e","resolution":{"observed_at":"2026-08-06T22:45:12.316890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.301486Z","title":"Generating visually aligned sound from videos","venue":null,"work_id":"08c249a7-705a-4167-9f94-c716ef18a62c","year":2020},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:05.353789Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:04f988f60664b94544562be88c2c3ded3c169e83e9d6aa052d275918b86a9f04","observation_id":"50d1729f-30ce-4e2c-9a55-874ca54bf8db","resolution":{"observed_at":"2026-08-06T22:45:12.305399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17698","last_updated":"2025-03-17T17:44:37Z","snapshot_observed_at":"2026-07-31T09:11:09.636803Z","submitted_at":"2024-11-26T18:59:58Z","title":"Video-Guided Foley Sound Generation with Multimodal Controls","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17698","snapshot_observed_at":"2026-08-06T22:45:05.422297Z","title":"Video-guided foley sound generation with multimodal controls","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:05.422297Z"},"links":{"cited_paper":"/paper/2411.17698","citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:8f3f0ee42b29d1a657db6d1da6d33d933b2a14705b6cacd80b86dae32c63e363","observation_id":"83671cc3-1f8c-46ab-adbb-f180111af7f3","resolution":{"observed_at":"2026-08-06T22:45:05.422297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.288655Z","title":"Mmaudio: Taming multimodal joint training for high-quality video-to-audio synthesis","venue":null,"work_id":"b58e1028-2db8-46e4-a219-9e92c081ece2","year":2025},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:05.510328Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:2d86136fae4e605e7f63a16757c74bc461a52d25a10efdb5f39a262ac42f3b50","observation_id":"465ce467-2a71-45bb-94bb-5bd783ab6dd0","resolution":{"observed_at":"2026-08-06T22:45:12.293192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.277235Z","title":"Clotho: An audio captioning dataset","venue":null,"work_id":"64be47b1-4139-4998-a626-5a976e6d34b5","year":2020},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:05.606265Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:050586e2d9ebe57a9b3f737ef1de1848d33d10d0af4918297368f3d8b8f00c35","observation_id":"f6f79a6e-9c2b-497d-9ccb-aa341c3f8f5e","resolution":{"observed_at":"2026-08-06T22:45:12.281452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.265918Z","title":"Compositional visual generation with energy based models","venue":null,"work_id":"0f4160fe-94d1-43f4-bb5f-b7ed1f6f3cae","year":2020},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:05.722732Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:294ffdcda6224414c6b40b2860219ccc9a8252e11a5ef0c58d2425df19dc308c","observation_id":"c48835b7-ca7e-4973-9b99-a865742c2709","resolution":{"observed_at":"2026-08-06T22:45:12.269734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.253317Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"a05d042e-4673-4203-bcf1-1f6933a6fabe","year":2024},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:05.808806Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:9157da647e3316cbc3014793749da94a592081a659cc8050e14ecc6cd2b33a34","observation_id":"8fcf95f3-9723-4d9e-8778-5fdb8415bf20","resolution":{"observed_at":"2026-08-06T22:45:12.258064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.241752Z","title":"Sketch2sound: Controllable audio generation via time-varying signals and sonic imitations","venue":null,"work_id":"3c8fc925-f117-4af1-a92c-dde3fffa7354","year":2025},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:05.904797Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:f708d705410803aa9629e9cfc0dc91d5d7314dc2bea3c01bbb64c4a620b2b150","observation_id":"5a745c0a-b954-408e-bd54-993eacde0289","resolution":{"observed_at":"2026-08-06T22:45:12.245835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.229656Z","title":"Audio set: An ontology and human-labeled dataset for audio events","venue":null,"work_id":"cd74a901-d9ef-4d0c-9511-83c4d3170d84","year":2017},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:05.968972Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:76daf5f4acb243a53628253841566d42b9bd22d5273970faf10403c4e3714465","observation_id":"e2701f7c-992a-43d0-bba1-362698e35d76","resolution":{"observed_at":"2026-08-06T22:45:12.233666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.217225Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"0108e9c9-4e0e-41ef-b9ca-33211c70e625","year":2023},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:06.021697Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:a33e163437d10fa36102980aa09528c8a0cfa2b7b6852575c5b42b82e3e48143","observation_id":"8ab04e99-e18d-484c-9a57-60fc2b2b7602","resolution":{"observed_at":"2026-08-06T22:45:12.222069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.205507Z","title":"Instructme: An instruction guided music edit and remix framework with latent diffusion models","venue":null,"work_id":"eab0d5cf-86e4-4b49-94ba-4055352c0917","year":2024},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:06.075730Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:35e44f9314c3e079f2a6b91680906c25da73e5c38ccb61190d72f7a89adb7291","observation_id":"d2359448-9249-44de-8680-c523e1dad7d8","resolution":{"observed_at":"2026-08-06T22:45:12.209188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.194055Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":"2f0ccde9-bea5-49cc-8390-4ff5d4ba77a2","year":2021},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:06.151487Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:f1b7de103f72157e63b43d4fddc34f57d1f40ef0a75ced719df2fdd11cea9359","observation_id":"784a3cab-fd12-4243-b191-259de7ea9baf","resolution":{"observed_at":"2026-08-06T22:45:12.198403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.182174Z","title":"Taming visually guided sound generation","venue":null,"work_id":"8df97fd9-fcd3-4d6c-a1d1-f623b3d39c2a","year":2021},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:06.203790Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:7560559e17c11f7cdb91935e5d420313a3de790c8f987105557fe51e014dc5d5","observation_id":"791d89c6-44a6-45a4-9721-f24578894e16","resolution":{"observed_at":"2026-08-06T22:45:12.186932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.170805Z","title":"Synchformer: Efficient synchronization from sparse cues","venue":null,"work_id":"68b6d4bd-ff50-49ef-a903-b32b22da57a8","year":2024},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:06.275002Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:3d7dad5fb785600ff9e866a7454607a65d041131ecaa579e3b1d1602afc06981","observation_id":"3f00ebf4-1299-48dc-809f-7d36449e9505","resolution":{"observed_at":"2026-08-06T22:45:12.174622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.159658Z","title":"Audioeditor: A training-free diffusion-based audio editing framework","venue":null,"work_id":"f9ac39b0-8f73-488a-a174-e6172ac27cce","year":2025},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:06.323102Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:31733f026ae1b5aed71ea6af6e1cfc3b048b1f7a17e8c75f8a0865f8e2e4d533","observation_id":"76d83d63-5816-4a20-bcb7-456bbf0e3d3b","resolution":{"observed_at":"2026-08-06T22:45:12.163649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.147623Z","title":"Simultaneous music separation and generation using multi-track latent diffusion models","venue":null,"work_id":"03780d00-d5c1-46b1-9999-ab9d4c48694b","year":2025},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:06.376824Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:d71f172c75b217c8c26c1aa63f6008d648f8b4977f96ebd5fb90ac6d2f3dbcd5","observation_id":"a6d67126-3422-4ee6-b220-50bc93246462","resolution":{"observed_at":"2026-08-06T22:45:12.151760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.136026Z","title":"Analyzing and improving the training dynamics of diffusion models","venue":null,"work_id":"ec3a3d31-e58f-47eb-84a9-a501523b0de3","year":2024},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:06.432024Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:8aabef550b9f944cc2bfc0f272cbff9cf1a97a873d0b7f870af79590341948f9","observation_id":"543f135c-bde9-4a08-907e-32953996f07c","resolution":{"observed_at":"2026-08-06T22:45:12.140505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.124330Z","title":"Audiocaps: Generating captions for audios in the wild","venue":null,"work_id":"82c922a5-ea19-4db4-936f-5961b55d13db","year":2019},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:06.488469Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:e413a9823514a645252acc42a232b10b998e8d4835ea6076eb9db1bb30bd9cdc","observation_id":"f0c3b862-20cb-440b-8185-4c5cc2213f44","resolution":{"observed_at":"2026-08-06T22:45:12.128711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.112338Z","title":"Panns: Large-scale pretrained audio neural networks for audio pattern recognition","venue":null,"work_id":"1f8fd543-85b9-40fc-b00e-84d6f8420e4a","year":2020},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:06.539100Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:07bb46a98b34e2ba539f19197c63a7169e349d7cc4cd76c1abe1512ea6944459","observation_id":"ee2e0e48-327f-416e-93d1-9878a97a85f3","resolution":{"observed_at":"2026-08-06T22:45:12.116398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.100206Z","title":"Vintage: Joint video and text conditioning for holistic audio generation","venue":null,"work_id":"11a4c0d2-198e-422d-b6ff-9492f39d9c07","year":2025},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:06.608604Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:a6062d22e6dd443e7499d5be750c975220e0ec194d74c261da9b6a1a3b4568a2","observation_id":"2285d8a5-0e8d-4396-94bf-2d20c51f43b8","resolution":{"observed_at":"2026-08-06T22:45:12.104521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.087942Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"359b0f14-401d-4394-9a39-656f6f2234fd","year":2023},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:06.675323Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:8e636a9133c3df7007631967c74e09da0de1e1d0e77426572a0636a4bf625f10","observation_id":"3b64cfc8-9b49-4187-b718-f8eddc76d437","resolution":{"observed_at":"2026-08-06T22:45:12.091741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.076932Z","title":"Flow matching for generative modeling","venue":null,"work_id":"049654a7-f2c8-466b-8231-50c29e701fdc","year":2023},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:06.722269Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:4ee2bb123218b18a3e8fd3896628dbe87033fa11baf2a5a41f4645ab518fb1f9","observation_id":"8d5aed84-561b-4ff3-b3da-80fc48acb6f0","resolution":{"observed_at":"2026-08-06T22:45:12.080943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.065962Z","title":"Compositional visual generation with composable diffusion models","venue":null,"work_id":"baa0bbce-dace-4297-824e-beb6263eb707","year":2022},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:06.789909Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:839e0c928aa2cc82dc60cd83e425d8bdaa304e091afd89a12488069df62de90f","observation_id":"72f18168-e4f9-43bd-bd23-35e8754133ee","resolution":{"observed_at":"2026-08-06T22:45:12.069743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.054637Z","title":"Tell what you hear from what you see-video to audio generation through text","venue":null,"work_id":"2e117743-4e97-426e-83cd-a5d59a7e1734","year":2024},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:06.849457Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:424181e9ce52094f0fc32b141ad3315dc4ab8559739f1baf0e525892cff937ab","observation_id":"fbac445a-9263-4075-8796-713d4175d007","resolution":{"observed_at":"2026-08-06T22:45:12.058915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.043930Z","title":"Diff-foley: Synchronized video-to-audio synthesis with latent diffusion models","venue":null,"work_id":"99b1893a-5ee9-423c-8631-4608ef331269","year":2023},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:06.916636Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:125dfeb7555e3adf34b9bef5406eabd74ec340698b297544ad38cf7dce884ee7","observation_id":"5c27eb4f-97b7-4233-b673-0f8f00d8fd96","resolution":{"observed_at":"2026-08-06T22:45:12.047856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.032744Z","title":"Multi-source diffusion models for simultaneous music generation and separation","venue":null,"work_id":"487ebd11-4338-4621-929b-08e7854563d1","year":2024},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:06.972516Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:0a5104d4449fb61c74a67b5b025826113696e6619c74303a6b17d67a432fdba0","observation_id":"79b5cffe-d872-4a6b-a594-afe71466b990","resolution":{"observed_at":"2026-08-06T22:45:12.037038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.020046Z","title":"Wavcaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal research","venue":null,"work_id":"e6dacd74-8a39-4d3c-a6cd-8f17b43e30fa","year":2024},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:07.046130Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:44d092afe30b22eaed492b32588160a84649f0893dd8b451075736b0815b6e44","observation_id":"1c51d7c4-9601-4119-a8e5-7b6e238e7efa","resolution":{"observed_at":"2026-08-06T22:45:12.024863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:12.008995Z","title":"Audio-visual scene analysis with self-supervised multisensory features","venue":null,"work_id":"d7146fe6-0340-416a-9c47-b6398fee5e48","year":2018},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:07.096950Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:6ae9f1d0ff5154ab572959e461e549b4e8135054acf09c78acfbc95aeb7c59b8","observation_id":"20fca138-03ed-415c-958c-0173fb57af3a","resolution":{"observed_at":"2026-08-06T22:45:12.012958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:11.997494Z","title":"Stemgen: A music generation model that listens","venue":null,"work_id":"5c0271f3-157f-4f58-8aca-25a274566518","year":2024},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:07.138164Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:6ffc532babac9cbaa48178c47bfadba7fc5dcb75846bd588316b319ccb94f01b","observation_id":"0f77170d-dce8-464e-84cd-b1b0bb67c57f","resolution":{"observed_at":"2026-08-06T22:45:12.001536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T22:45:07.206934Z","title":"Sampson, Shikai Li, Simone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petrovic, and Yuming Du","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:07.206934Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:709722e7432bec90caf29a64532f2725ea7e4a091f64ee7aeb7b1ff1dcfc2b1e","observation_id":"186907ed-1502-45d5-82a0-79d9c0153b15","resolution":{"observed_at":"2026-08-06T22:45:07.206934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:11.986406Z","title":"Generalized multi-source inference for text conditioned music diffusion models","venue":null,"work_id":"307003a5-ae72-4fcf-b529-7e38feba95f1","year":2024},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:07.274186Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:77f5723ba696e1bf15791374cc11ccad01425769c1a42f55ce3fefbc09510732","observation_id":"463dd510-0502-4450-9692-436cc26a425b","resolution":{"observed_at":"2026-08-06T22:45:11.990280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:11.974359Z","title":"Improved techniques for training gans","venue":null,"work_id":"136118cc-bb03-488f-8425-fd0591e33269","year":2016},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:07.347645Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:702b8e3ab1187d4e4bd67ffbc307084eb22484398435b09fd00ddb2eb6176f36","observation_id":"b96150f7-b8f9-4748-a4de-37565fc32655","resolution":{"observed_at":"2026-08-06T22:45:11.978310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:11.946373Z","title":"Smartmask: context aware high-fidelity mask generation for fine-grained object insertion and layout control","venue":null,"work_id":"0b905ee4-abeb-4c93-b892-9f497014e6b9","year":2024},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:07.473056Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:274de457b5a749e58394566a4a3092c5918befb1ca5409a8bc35d2d292f1202c","observation_id":"e65fd7f1-2874-4163-a217-7e3bb9e57f15","resolution":{"observed_at":"2026-08-06T22:45:11.960730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:11.681138Z","title":"Visually guided sound source separation with audio-visual predictive coding","venue":null,"work_id":"36b108f8-5fc5-4a12-a083-ffa50bdccb19","year":2023},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:07.585707Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:b290b53d12d23d027d79036527b375db00e32fda2dbc7a51b4f7d33088402994","observation_id":"a4f55f75-e5ed-4ed4-bb7c-d95b5b065c55","resolution":{"observed_at":"2026-08-06T22:45:11.832404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:11.394753Z","title":"sd3.5, 2024","venue":null,"work_id":"36caba44-935a-4d23-80e2-1eadf3574d01","year":2024},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:07.682202Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:45e8eaaccea9487f8d0cb607ca566dc215f4be9eb8e887d99cf3c08b0ea83994","observation_id":"4e31c034-6b9a-4f01-93ab-ae7ff2779e8c","resolution":{"observed_at":"2026-08-06T22:45:11.502321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:11.207711Z","title":"Steinmetz and Joshua D","venue":null,"work_id":"b9eb8c9c-12ca-43f8-bd9a-80caff75ac1d","year":2021},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:07.779691Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:7c7ad563596f0abf649b9ac8cef4902994bed4e7432adf46f4d24798dbe19422","observation_id":"37145041-e787-421d-b6f3-a1e17e010e53","resolution":{"observed_at":"2026-08-06T22:45:11.318638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:10.981193Z","title":"Add-it: Training-free object insertion in images with pretrained diffusion models","venue":null,"work_id":"f0e982bd-e8cc-4f57-95cf-40ef326ceb36","year":2025},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:07.883778Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:0aaca6ab354b1d4ba4937e60fd5d64c3b9bc56c18ca53bdf354efe51730d062a","observation_id":"03c38e60-10be-4a19-ae61-8e74395b6276","resolution":{"observed_at":"2026-08-06T22:45:11.045041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:10.851816Z","title":"Liu, Kevin J","venue":null,"work_id":"7791f20b-f41d-43f9-aae5-325b6ffe9195","year":2025},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:08.011468Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:5a196210838cc5e6ac8771a4800b041f525e021ea52be41e57e0d44500318da5","observation_id":"0bc16ca5-f94f-4c75-ba2a-1b4004b179b2","resolution":{"observed_at":"2026-08-06T22:45:10.900034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:10.648987Z","title":"Temporally aligned audio for video with autoregression","venue":null,"work_id":"ed556c38-7026-4ee6-a947-f6d0718a8af5","year":2025},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:08.098102Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:2bb49e95aca0c31c1eb7626a513e213b451c75d26c472086855f2d89f748629d","observation_id":"9777209a-2c83-403a-82c9-35f0b3cdcafe","resolution":{"observed_at":"2026-08-06T22:45:10.758908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:10.461307Z","title":"V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foundation models","venue":null,"work_id":"9f6d1b56-5223-471b-9dc6-79a5a73875a7","year":2024},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:08.178693Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:00842fe2c268710c8c049de2a0048603a938add1a3b26b237b567e976df5a9ea","observation_id":"f6e8b40c-660b-4d33-9552-06e095b8af5c","resolution":{"observed_at":"2026-08-06T22:45:10.554435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:10.318860Z","title":"Frieren: Efficient video-to-audio generation network with rectified flow matching","venue":null,"work_id":"de5749ac-1cbd-446d-a540-42b340906f1d","year":2024},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:08.285868Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:acc7431aaa2985234723736718b811c2b8eef951ce382d172d3e8ab224fd8d7c","observation_id":"5ba41fe0-c0b5-41dc-88ec-625b962f1694","resolution":{"observed_at":"2026-08-06T22:45:10.395064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:10.091661Z","title":"Audit: Audio editing by following instructions with latent diffusion models","venue":null,"work_id":"8e290e3d-1057-40a3-a513-24cdfff420a2","year":2023},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:08.365573Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:c99ff8face7beded99ae3e44702f40e13e242d19b8e14b0ad2ec7e9d107fa58e","observation_id":"e0dde940-a687-4083-9f75-0920aa92541e","resolution":{"observed_at":"2026-08-06T22:45:10.226759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:09.859575Z","title":"Stable diffusion 2.0 and the importance of negative prompts for good results, 2022","venue":null,"work_id":"d9c56da3-8e61-453e-8c2b-1070d37090de","year":2022},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:08.474046Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:d2eb157a0189d2e7aa800c5b0390eeb976fdd383c49c5488473762eca2d2cd82","observation_id":"d4d331b0-7589-46d7-a134-6f921ba9eae9","resolution":{"observed_at":"2026-08-06T22:45:09.978231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:09.620183Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":"de80da30-d965-4dd4-b58c-7ab117d7f495","year":2023},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:08.535917Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:c35fc31e1e387a92df444f80803e40c19c0c920154a904c48635f4562acc11be","observation_id":"fbf2a7b1-9d47-4e00-a5ab-eed923cef885","resolution":{"observed_at":"2026-08-06T22:45:09.732295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:09.411353Z","title":"Seeing and hearing: Open-domain visual-audio generation with diffusion latent aligners","venue":null,"work_id":"368f9948-905f-42f6-a945-6542f15273bf","year":2024},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:08.546056Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:84e1fe7401a0fc9f2efd6e876833a5ecd8aa3ff1c73082be6d732e93702a8205","observation_id":"0102a54a-4938-4296-8fd9-88cd98f822af","resolution":{"observed_at":"2026-08-06T22:45:09.528185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:09.198804Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"2688546e-2149-4c15-8be3-5fb625fdc9b3","year":2023},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:08.621106Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:dc0ffe2840be81850d3ce27359c628f1064698565c13a93d9aad05191f4bdd3a","observation_id":"6d026ab3-f7b1-4d29-9af6-1d3023bc86fd","resolution":{"observed_at":"2026-08-06T22:45:09.304523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-07T10:46:50.742580Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-06T22:45:08.730625Z","title":"Foleycrafter: Bring silent videos to life with lifelike and synchronized sounds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:08.730625Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:49c054135900be3329a6d29e372ea66624d96fc398179461ae43b56208bd5acb","observation_id":"f86c4cf0-2d82-4547-8a55-783902287549","resolution":{"observed_at":"2026-08-06T22:45:08.730625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:09.004158Z","title":"Visually guided sound source separation using cascaded opponent filter network","venue":null,"work_id":"2d45de70-0f43-4079-95cd-cc0842279569","year":2020},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:08.841789Z"},"links":{"citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:5aa4d423731648fecc651215fe93f38a6642f97c93980705f9fcd6cc4cd8a536","observation_id":"b754503b-876d-4787-b826-07e6136fc464","resolution":{"observed_at":"2026-08-06T22:45:09.086947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T10:47:31.323670Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":48},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2506.20995."}