{"as_of":"2026-08-09T12:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d6281caee87d1b224910fcf5b53515635380078122f809003154425801d1d0a","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:10:31.849774Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.20379/citation-record","integrity":"/paper/2508.20379/integrity","json":"/paper/2508.20379/citation-record.json","paper":"/paper/2508.20379"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T15:10:31.658133Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.658133Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:a182b0f062cfe7d34c55b93af701012d59e603d295a29df74285270c8ed0b7c8","observation_id":"3920ab5b-1b92-456c-babc-9857e328da00","resolution":{"observed_at":"2026-08-05T15:10:31.658133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.465899Z","title":"Text2live: Text-driven layered image and video editing","venue":null,"work_id":"6c4cbd56-387d-424d-97a8-0d5ffbfb49c6","year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.662463Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:46bc01a0ae55215e3b58384829c6f5eeb643e0f96fe4c519015b25ff7b60bc86","observation_id":"adc71368-bcf9-480b-aff4-9589c8e14b6e","resolution":{"observed_at":"2026-08-05T15:10:32.469198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00878","last_updated":"2024-05-01T21:43:57Z","snapshot_observed_at":"2026-08-06T15:18:41.938107Z","submitted_at":"2024-05-01T21:43:57Z","title":"SonicDiffusion: Audio-Driven Image Generation and Editing with Pretrained Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.00878","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.00878","snapshot_observed_at":"2026-08-05T15:10:32.198155Z","title":"SonicDiffusion: Audio-Driven Image Generation and Editing with Pretrained Diffusion Models","venue":"cs.CV","work_id":"2008f01f-c86e-4f2a-b754-a05cd65dff84","year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.667945Z"},"links":{"cited_paper":"/paper/2405.00878","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:97cb0e79736833edb340a6457792d5cd58e814730dd173cbc8ccf22b73b37292","observation_id":"c1b863f0-6252-49cf-8419-27a579b8d80f","resolution":{"observed_at":"2026-08-05T15:10:32.202014Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:31.671833Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.671833Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:87407f32439df685fb041fa5bc345414fce27efaa4a31ed79bcf1a9b39422071","observation_id":"47e2c4cb-2364-43fa-8d26-fad3ea7f3196","resolution":{"observed_at":"2026-08-05T15:10:31.671833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.451138Z","title":"Ledits++: Limitless image editing using text-to-image models","venue":null,"work_id":"5c2f8cf3-5a37-4595-a4ae-145d2f166d15","year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.674911Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:9e7bbf38fe58c249d7b22240636e7b0521cc8cb988975ca6f1022474cbd4162b","observation_id":"cb1a46e1-9ea0-42b4-9a49-88786c7f2087","resolution":{"observed_at":"2026-08-05T15:10:32.454984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.441414Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"029b7e0d-6709-42a3-8f22-e1ff761e2f5d","year":2020},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.678420Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:e63cab60a8687c6b1358b18ce3c7affcd303b54dba0b1e66f02be9f1af766808","observation_id":"8038bc95-56ab-4c82-a49a-426e5953eb8f","resolution":{"observed_at":"2026-08-05T15:10:32.444636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11427","last_updated":"2022-10-20T17:16:37Z","snapshot_observed_at":"2026-08-01T15:07:11.635426Z","submitted_at":"2022-10-20T17:16:37Z","title":"DiffEdit: Diffusion-based semantic image editing with mask guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11427","snapshot_observed_at":"2026-08-05T15:10:31.682377Z","title":"Diffedit: Diffusion-based semantic image editing with mask guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.682377Z"},"links":{"cited_paper":"/paper/2210.11427","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:60316fe2a06e4975e5f06a2d259c64a0e359bb5ecf65e3cb0dbdfca64809c2d0","observation_id":"15255ef9-bc95-4305-ae2d-92fa964d1eab","resolution":{"observed_at":"2026-08-05T15:10:31.682377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.431752Z","title":"Con- ditional generation of audio from video via foley analogies","venue":null,"work_id":"78f0c030-ebeb-4f25-859a-a62267922308","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.685950Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:a797a2b30c503088c8472d895f2d9775d5bf867f57e2dffc877c69154e777d49","observation_id":"3a9ba256-3b8c-407b-9a4f-47b4036a63ea","resolution":{"observed_at":"2026-08-05T15:10:32.434962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.422530Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":"137ba2a9-182c-451f-847e-77509d606339","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.689192Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:1446208090028afaf3c1facb131474b7821fb3ff154036c0cb3686871aa766d4","observation_id":"70e339d7-4417-4a3b-8b9f-20a65d53e31f","resolution":{"observed_at":"2026-08-05T15:10:32.425812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-06T08:12:35.134201Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-08-05T15:10:31.692936Z","title":"Tokenflow: Consistent diffusion features for consistent video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.692936Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:66b49f60e6059a71922f5c981f6fd3607c85ffe34c82ae40dd3ca0e3e8acb439","observation_id":"c1a0ee9a-b796-402c-a5d3-19025e5b4ed8","resolution":{"observed_at":"2026-08-05T15:10:31.692936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.413322Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"d18c7b6e-3194-4f31-8e7c-10ed300a7978","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.696749Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:907ffd206098b4872b1666a1b91d87450ab3afbfe550e297debe6c5f367ce947","observation_id":"017fc962-2b1e-4a23-b0a5-9fed696c05ea","resolution":{"observed_at":"2026-08-05T15:10:32.416553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01800","last_updated":"2024-03-05T08:19:51Z","snapshot_observed_at":"2026-08-07T13:32:19.731078Z","submitted_at":"2024-03-04T07:41:50Z","title":"AtomoVideo: High Fidelity Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01800","snapshot_observed_at":"2026-08-05T15:10:31.700664Z","title":"Atomovideo: High fidelity image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.700664Z"},"links":{"cited_paper":"/paper/2403.01800","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:b69a96a8988909b7a6293af776ce56fa8a96a40786985b2ed707a27def567bf5","observation_id":"a38220d8-905a-45b9-a58f-de8655d3d5f0","resolution":{"observed_at":"2026-08-05T15:10:31.700664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08933","last_updated":"2023-02-14T06:45:49Z","snapshot_observed_at":"2026-07-06T14:06:34.310083Z","submitted_at":"2022-10-17T10:49:08Z","title":"DiffuSeq: Sequence to Sequence Text Generation with Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08933","snapshot_observed_at":"2026-08-05T15:10:31.704083Z","title":"Dif- fuseq: Sequence to sequence text generation with diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.704083Z"},"links":{"cited_paper":"/paper/2210.08933","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:79c2f44f66f00500a07cc00c4a2ae7c01543a6192d33c192e7b7d7c297c2ef60","observation_id":"b3099f05-64d3-4e41-bf32-662f496e67f9","resolution":{"observed_at":"2026-08-05T15:10:31.704083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04834","last_updated":"2024-05-22T02:45:13Z","snapshot_observed_at":"2026-07-06T18:11:21.771258Z","submitted_at":"2024-05-08T06:09:11Z","title":"FlexEControl: Flexible and Efficient Multimodal Control for Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2405.04834","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.04834","snapshot_observed_at":"2026-08-05T15:10:32.150739Z","title":"FlexEControl: Flexible and Efficient Multimodal Control for Text-to-Image Generation","venue":"cs.CV","work_id":"9fb07249-741e-467a-ba66-3de6c3e3dd4e","year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.708990Z"},"links":{"cited_paper":"/paper/2405.04834","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:d8e428f5e97edc3f47a3126539cf8b8d981cef6e1e66a2858c79826ab610d198","observation_id":"c1de15e2-4ec3-43b2-9a43-f8d8bd6fb07e","resolution":{"observed_at":"2026-08-05T15:10:32.154458Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-05T15:10:31.713176Z","title":"Prompt-to-prompt image editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.713176Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:e705604eb2d76a174fb2cb35a0947c6c94cf54cfd2db0d66b6ccb8e44d3ae864","observation_id":"6c938676-cf99-4b22-b3d5-29caf78618bd","resolution":{"observed_at":"2026-08-05T15:10:31.713176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-05T15:10:31.716262Z","title":"Clip- score: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.716262Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:3ebf022f07220beb1d686f73d8a34f61ff67bba776d4ea94c357e20b311456b3","observation_id":"d9c1f186-073e-48e5-a586-4874717b2784","resolution":{"observed_at":"2026-08-05T15:10:31.716262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01506","last_updated":"2023-10-19T13:02:21Z","snapshot_observed_at":"2026-08-05T14:13:30.114970Z","submitted_at":"2023-10-02T18:01:55Z","title":"Direct Inversion: Boosting Diffusion-based Editing with 3 Lines of Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01506","snapshot_observed_at":"2026-08-05T15:10:31.719815Z","title":"Direct inversion: Boosting diffusion-based editing with 3 lines of code","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.719815Z"},"links":{"cited_paper":"/paper/2310.01506","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:78fb98a03a9f40c28483c47c27c25afdb7c644b3c97f461cd82798d018fab6d3","observation_id":"c4435c43-05ee-4b21-9678-726f78a5d31f","resolution":{"observed_at":"2026-08-05T15:10:31.719815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.404299Z","title":"Text2video-zero: Text-to- image diffusion models are zero-shot video generators","venue":null,"work_id":"0dc6ac56-e038-4ac0-b07a-d767a8b65f46","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.722751Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:6462bedaa3ce7bfa4ddc5d19a516cb180e77141276761336ab41000cec20546a","observation_id":"38c81fa2-f69a-4611-8626-a787974b7d05","resolution":{"observed_at":"2026-08-05T15:10:32.407619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:31.725752Z","title":"Enclap: Combining neural audio codec and audio-text joint embedding for automated audio captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.725752Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:38cdc180f53d781a37f12ebea502b75287daa0b9ffbf2b81cc92baae717d9c70","observation_id":"d69db800-7323-4db2-a592-e0ed9afcac39","resolution":{"observed_at":"2026-08-05T15:10:31.725752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:31.728658Z","title":"Multi-concept customization of text-to-image diffusion","venue":null,"work_id":null,"year":1931},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.728658Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:ca1de99331199e70e5c966d3ff9b5cb824dd3846b385606bd44cff156410aab6","observation_id":"6ebd06e6-9de3-4d2c-8045-5942e4032e18","resolution":{"observed_at":"2026-08-05T15:10:31.728658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.389784Z","title":"Sound-guided semantic image manipulation","venue":null,"work_id":"170e9fd8-6d6d-4562-8a2e-55bb10cc0628","year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.731687Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:8371f6a47e6a6e7128588e0dba9e9ccc530c47cda3613cc870056ddc76155388","observation_id":"e6b2b2f6-8177-49e4-9f46-f74b2ee39ef4","resolution":{"observed_at":"2026-08-05T15:10:32.392936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06818","last_updated":"2023-04-13T20:56:53Z","snapshot_observed_at":"2026-08-01T16:07:10.401914Z","submitted_at":"2023-04-13T20:56:53Z","title":"Soundini: Sound-Guided Diffusion for Natural Video Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06818","snapshot_observed_at":"2026-08-05T15:10:31.734970Z","title":"Soundini: Sound-guided diffusion for natural video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.734970Z"},"links":{"cited_paper":"/paper/2304.06818","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:253380bbcfdec0750e7a60b40f427df144be86611cc6bb021a4a1c967f0c243f","observation_id":"44e2fce0-b5e8-460a-89a0-53bb27120f97","resolution":{"observed_at":"2026-08-05T15:10:31.734970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.380486Z","title":"Generating real- istic images from in-the-wild sounds","venue":null,"work_id":"7ef10abb-e5ef-44c3-8ab5-ec4a135a343e","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.737985Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:14426e0617fd4ee3ab1f96ca1df5f74ae6825573b24867cb0154bfbb26dc86b0","observation_id":"2b58a244-9615-45e9-87b1-0f98f98c73d5","resolution":{"observed_at":"2026-08-05T15:10:32.383588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.370853Z","title":"Learning visual styles from audio-visual associations","venue":null,"work_id":"fc760919-96be-46d3-8d47-a980faf53db0","year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.741316Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:85e1c2f959bac401217c5efd7bbf8eefc24a5bff965629eae6fb6173665283d8","observation_id":"dbb0e571-384b-4b43-9fc2-58e48bf14f32","resolution":{"observed_at":"2026-08-05T15:10:32.374499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.361712Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning","venue":null,"work_id":"9b1b140e-9dbc-4459-bbdc-5b51fc1a2fa9","year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.744280Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:a15eeb0d6aaaabaa98e25b1e3ddbf265fac2b4934f301f9432dff1244fccf203","observation_id":"d0ef518f-84ba-4c12-bfae-ff480a868876","resolution":{"observed_at":"2026-08-05T15:10:32.365099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09967","last_updated":"2024-05-24T16:29:38Z","snapshot_observed_at":"2026-08-03T19:03:47.269374Z","submitted_at":"2024-04-15T17:45:36Z","title":"Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09967","snapshot_observed_at":"2026-08-05T15:10:31.747156Z","title":"Ctrl-adapter: An efficient and versatile framework for adapting diverse controls to any diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.747156Z"},"links":{"cited_paper":"/paper/2404.09967","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:7bfc9224ef1167b1a2314847adc431f10156b249f5e825d4a1cf7efc6da3365b","observation_id":"ff760cde-a948-48cb-b605-60bd5298135c","resolution":{"observed_at":"2026-08-05T15:10:31.747156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20782","last_updated":"2025-03-26T17:59:04Z","snapshot_observed_at":"2026-08-07T16:34:49.543031Z","submitted_at":"2025-03-26T17:59:04Z","title":"Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20782","snapshot_observed_at":"2026-08-05T15:10:31.750629Z","title":"Zero-shot audio-visual editing via cross-modal delta denoising","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.750629Z"},"links":{"cited_paper":"/paper/2503.20782","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:28d4d2d932384b7b530458824e69a26abd7a703b92b911e6dcd5fb48dfffe828","observation_id":"d6bfd0e8-3685-41e7-ab70-c02f60c6012f","resolution":{"observed_at":"2026-08-05T15:10:31.750629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-05T15:10:31.753877Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.753877Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:2b273ca11d0813ce217817fd58101b2a24f17fd2f9fd179bdc2ff58808cbf848","observation_id":"b0ef9092-7b6a-45a5-a957-900a8070585c","resolution":{"observed_at":"2026-08-05T15:10:31.753877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.351680Z","title":"Diff-foley: Synchronized video-to-audio synthesis with latent diffusion models","venue":null,"work_id":"d643ea3f-bd67-4838-8642-c72d1ef7c5eb","year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.757006Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:67f30eea7c375ed9614b71d6831f61e026839617221640b0f199a2c89c9e621f","observation_id":"2af4216c-7cf4-4b16-8b8f-ab8664569220","resolution":{"observed_at":"2026-08-05T15:10:32.355091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.342518Z","title":"Videofusion: Decomposed diffusion models for high-quality video generation","venue":null,"work_id":"5f035097-8c59-4693-b05c-dbb466a4df22","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.760023Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:e2bbc08caf2c7f68b4b1abfa7ad113a34e30de4956b9f7940ac3f0a4d3c944e6","observation_id":"79bccee3-4715-4b5f-baf5-07bff6f8656c","resolution":{"observed_at":"2026-08-05T15:10:32.345669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10009","last_updated":"2024-05-29T11:27:24Z","snapshot_observed_at":"2026-07-06T17:30:39.245059Z","submitted_at":"2024-02-15T15:17:26Z","title":"Zero-Shot Unsupervised and Text-Based Audio Editing Using DDPM Inversion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10009","snapshot_observed_at":"2026-08-05T15:10:31.763240Z","title":"Zero-shot unsupervised and text-based audio editing using ddpm inversion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.763240Z"},"links":{"cited_paper":"/paper/2402.10009","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:dfb34b5b60543584590e99420a2b5917224a3e3237a4f8e2da5ecbc366385831","observation_id":"75333614-6bef-46d9-9f16-2e05dbf39fcb","resolution":{"observed_at":"2026-08-05T15:10:31.763240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-08-08T06:35:17.078531Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-05T15:10:31.766335Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.766335Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:c5cc62be0bab35cfc112d4e1ed1fbc51fb22aaf5c6e4f15bbfa6632733a51959","observation_id":"81065768-7ebe-4cfd-8d4a-63f846f602dc","resolution":{"observed_at":"2026-08-05T15:10:31.766335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.333557Z","title":"Freecontrol: Training-free spatial control of any text-to-image diffusion model with any condition","venue":null,"work_id":"91bb0eaf-a7d9-4d30-bd70-38826ad81e81","year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.769728Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:5ef194f4091356191440391bf8014a13886c64032984d9ddc8f87d32c7052fc1","observation_id":"b15750d2-18e5-4fd5-9900-ea7ac919ef72","resolution":{"observed_at":"2026-08-05T15:10:32.336618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.323910Z","title":"Null-text inversion for editing real images using guided diffusion models","venue":null,"work_id":"ebe7599b-6711-4f2a-a065-662d52c002ff","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.773612Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:bf3fdd65a88a0eec9436f11ab7572f9725e43a830184f1e5cb399529815bf861","observation_id":"f717f9cb-22d1-47f5-97fb-41227fd3e1b8","resolution":{"observed_at":"2026-08-05T15:10:32.327476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.314033Z","title":"Conditional image-to-video generation with latent flow diffusion models","venue":null,"work_id":"1b91c45c-d923-4940-bce8-465eda34ac50","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.776779Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:780d11e89250b83fc9c450e02c72e84760f815da38aa2b4c20d5e1be76e80d30","observation_id":"705322b1-435b-438a-83ee-9b6922827448","resolution":{"observed_at":"2026-08-05T15:10:32.318131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-05T15:10:31.780021Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.780021Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:bc288b33b1af4b287ba1f2b54d5854aeb26f8d91be526d0da40b0ea13f7a15db","observation_id":"0d3e2c24-9ba4-496b-8b26-cda1590b0b48","resolution":{"observed_at":"2026-08-05T15:10:31.780021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-05T15:10:31.784026Z","title":"The 2017 davis challenge on video object segmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.784026Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:b3a3bd5a11402fc037ed1b72afef1d412b32720ee9cf4180293592605a651f1f","observation_id":"c37a2fe5-dc43-484b-a07a-55102189a072","resolution":{"observed_at":"2026-08-05T15:10:31.784026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:31.788198Z","title":"Grad-tts: A diffusion probabilistic model for text-to-speech","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.788198Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:f71217a5b99451d3fa1f4deed02d00c8938c7d486f5888f7d72ff3528b9c2bc8","observation_id":"ed40fd61-e4ed-44a3-9e05-3eaaa2dddf45","resolution":{"observed_at":"2026-08-05T15:10:31.788198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.298358Z","title":"Fatezero: Fusing attentions for zero-shot text-based video editing","venue":null,"work_id":"801bb11e-7f6b-4a1b-b8b0-7d208cbcaa6d","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.791205Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:ee1495dfc16e23a6e3615e9f98d48ad7495108b4a2a43b6454bf717db68b07aa","observation_id":"8d8de396-afe3-4b6b-93c1-4d7b4d040fc0","resolution":{"observed_at":"2026-08-05T15:10:32.301659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T15:10:31.794473Z","title":"Hierarchi- cal text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.794473Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:795ccefd674751b22607360b1803628d3c458e5d610826a030f12ee8bcf54ae9","observation_id":"a225ef8d-4329-4cee-8f46-ac398c6ce10a","resolution":{"observed_at":"2026-08-05T15:10:31.794473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.288956Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"9026691e-ec45-44e9-adfc-681438846b9d","year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.797335Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:a91d8bd30628c60e001ff6110c89f2c215d22d03c2fcc137fee5c1cc3e1c8a39","observation_id":"d343c0ec-5f2a-4eb8-9491-4e2c3ba36eb8","resolution":{"observed_at":"2026-08-05T15:10:32.292428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.279456Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"89b32aef-9ffc-437b-b465-41dcaf3fa701","year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.801313Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:4f4fa27485b290196a329a58099f834d3eaa3795f28088125cc356388e5d75ea","observation_id":"cc1637b2-aefb-40aa-a17b-b07656bcda18","resolution":{"observed_at":"2026-08-05T15:10:32.283106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09116","last_updated":"2023-05-30T16:09:10Z","snapshot_observed_at":"2026-08-08T00:30:28.663818Z","submitted_at":"2023-04-18T16:31:59Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09116","snapshot_observed_at":"2026-08-05T15:10:31.804516Z","title":"Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.804516Z"},"links":{"cited_paper":"/paper/2304.09116","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:e9ed09f979954ff9a0d6e743532a58e36968f564417e095a02a4b342479f9f4e","observation_id":"6562b558-0a3e-403b-9f40-55481a3dceab","resolution":{"observed_at":"2026-08-05T15:10:31.804516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T15:10:31.807657Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.807657Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:7f1bc0faa1ddb312dbebabcd612d5f689c5d77f0fdc969cbb30d56878ffcd0c7","observation_id":"0277b3f2-5a4f-4538-8813-931e2d73d77c","resolution":{"observed_at":"2026-08-05T15:10:31.807657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18775","last_updated":"2023-11-30T18:21:25Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:21:25Z","title":"CoDi-2: In-Context, Interleaved, and Interactive Any-to-Any Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18775","snapshot_observed_at":"2026-08-05T15:10:31.811712Z","title":"Codi-2: In-context, interleaved, and interactive any-to-any generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.811712Z"},"links":{"cited_paper":"/paper/2311.18775","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:1643f331ffa5bc42b041ee0616c293d42747a96aee2ccc29cbf692f1b26bbafa","observation_id":"68203758-5db6-4225-9d4d-4f63e58a8ec0","resolution":{"observed_at":"2026-08-05T15:10:31.811712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11846","last_updated":"2023-05-19T17:38:32Z","snapshot_observed_at":"2026-08-01T22:27:04.899117Z","submitted_at":"2023-05-19T17:38:32Z","title":"Any-to-Any Generation via Composable Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11846","snapshot_observed_at":"2026-08-05T15:10:31.814837Z","title":"Any-to-any generation via composable diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.814837Z"},"links":{"cited_paper":"/paper/2305.11846","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:95869f47a5a97bf7f8b3638fbf8d7e8052dde2c9f683fb16a43a6b7123bd7e26","observation_id":"8002fae2-0e9c-43c9-b91c-38834b9edba0","resolution":{"observed_at":"2026-08-05T15:10:31.814837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.270018Z","title":"Splicing vit features for semantic appearance transfer","venue":null,"work_id":"919e2e04-809a-4918-928d-0632c039b75c","year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.818212Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:29fa350ca6f39eee3f26475224e8584cfc4d89cb29a00b05a2c3bd6e2a274f63","observation_id":"8390fd36-fdb4-4726-9136-619a2a8f4708","resolution":{"observed_at":"2026-08-05T15:10:32.273359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:31.821082Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":null,"year":1921},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.821082Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:517ef7f4aeaaa0c9164f65367d9a3411f74fb554b3a66b13fef231d7ce2946a7","observation_id":"99c62098-9257-42b2-8a37-27ae0cebcfaa","resolution":{"observed_at":"2026-08-05T15:10:31.821082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.254717Z","title":"Audit: Audio editing by following instructions with latent diffusion models","venue":null,"work_id":"43311f38-4a4d-4374-a205-8ff013194994","year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.824068Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:96b7c5c1cfd1f75012ab5204f3025b0bde42ecb9e41d6c58c3231f86b98bb517","observation_id":"fa7fff4f-95cf-4e2e-8053-f3d43caeab9a","resolution":{"observed_at":"2026-08-05T15:10:32.258243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.245137Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":"32b44a67-a5eb-4989-80c8-fe447b36ece2","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.827209Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:33fa851ad4e91a13d83006fd0622bf74f3c706442edd029460cc6c1884144c58","observation_id":"509d7ec8-fc05-4c4a-a237-72817d40639c","resolution":{"observed_at":"2026-08-05T15:10:32.248945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16003","last_updated":"2023-10-24T16:56:58Z","snapshot_observed_at":"2026-08-01T15:51:11.290263Z","submitted_at":"2023-10-24T16:56:58Z","title":"CVPR 2023 Text Guided Video Editing Competition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16003","snapshot_observed_at":"2026-08-05T15:10:31.830361Z","title":"Cvpr 2023 text guided video editing competition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.830361Z"},"links":{"cited_paper":"/paper/2310.16003","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:3ccbcdb17ffde90dcfebf7c67f19559217048905a4c6d4e109e80e3bcd057db7","observation_id":"12fef8f2-af64-4a1a-b178-bf8f1f08b6cc","resolution":{"observed_at":"2026-08-05T15:10:31.830361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-04T16:34:07.714734Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-05T15:10:31.833708Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.833708Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:3c2243601d790c0d6af3d5ce1d94411c1b520c9803798a557fd9f855aecb036d","observation_id":"0d76b3bd-d2d5-474b-bdc9-8f2c483b45cd","resolution":{"observed_at":"2026-08-05T15:10:31.833708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.236546Z","title":"Ar-diffusion: Auto-regressive diffusion model for text generation","venue":null,"work_id":"cd4f4d40-163b-4c9e-8b82-8b37918d391b","year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.837124Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:9973ccf50d25c8721351c4e1a0e3f49a4360b8fc4fd48b726da4599da90775b4","observation_id":"b239d8f0-2453-48f3-a5b9-0c93d6930919","resolution":{"observed_at":"2026-08-05T15:10:32.239486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17723","last_updated":"2024-02-27T17:57:04Z","snapshot_observed_at":"2026-07-06T17:36:23.851926Z","submitted_at":"2024-02-27T17:57:04Z","title":"Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners","version":1},"cited_work":{"arxiv_id":"2402.17723","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.17723","snapshot_observed_at":"2026-08-05T15:10:31.897560Z","title":"Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners","venue":"cs.CV","work_id":"d5cc84f2-89a1-47da-9b5f-4285dccff89c","year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.840253Z"},"links":{"cited_paper":"/paper/2402.17723","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:c93c6d9b2793c5b4d1d04b3d193919619aee74b72ab16cda2f08afb1410534f1","observation_id":"6617b490-5b00-4988-a50e-b1cc63fb1f43","resolution":{"observed_at":"2026-08-05T15:10:31.902187Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11504","last_updated":"2023-06-20T12:50:49Z","snapshot_observed_at":"2026-07-06T15:44:35.147343Z","submitted_at":"2023-06-20T12:50:49Z","title":"Align, Adapt and Inject: Sound-guided Unified Image Generation","version":1},"cited_work":{"arxiv_id":"2306.11504","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.11504","snapshot_observed_at":"2026-08-05T15:10:31.880832Z","title":"Align, Adapt and Inject: Sound-guided Unified Image Generation","venue":"cs.GR","work_id":"031c1ac5-e3a1-48a0-b403-11d6cba98908","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.843363Z"},"links":{"cited_paper":"/paper/2306.11504","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:4ded2e061028a3da4336e97af055409394d03ce7880db6a0d27b9ed7b0e05f6e","observation_id":"3de73937-bc91-4434-b7a8-97c435a9ecdc","resolution":{"observed_at":"2026-08-05T15:10:31.886034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.227312Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"620734ae-a517-4b11-ac35-61b12d4d8ae1","year":2018},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.846869Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:2af29ca0f5272a3e8a393c778ac1b56833b2dc778f0a6c847663f4402ff0e4b5","observation_id":"91f0718d-73b0-4c14-a3c9-8a09db9e19bf","resolution":{"observed_at":"2026-08-05T15:10:32.230376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.218330Z","title":"Uni-controlnet: All-in-one control to text-to-image diffusion models","venue":null,"work_id":"10c82f53-4a3e-4666-99b3-9446f8f47d91","year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.849774Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:21c662c1f06784cc73b80705596782b528b08df7f96d0efd700324410c49d31d","observation_id":"40491051-3946-400f-9b6c-7283985938a4","resolution":{"observed_at":"2026-08-05T15:10:32.221511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":4,"verified_fuzzy":25},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2508.20379."}