{"as_of":"2026-08-08T05:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a3ef97734d623b16be289348b9a6e9a192ff281da6d3862357ec2c46b0cb0d7f","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:53:18.476414Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.04214/citation-record","integrity":"/paper/2506.04214/integrity","json":"/paper/2506.04214/citation-record.json","paper":"/paper/2506.04214"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:22.844932Z","title":"S., and Zisserman, A","venue":null,"work_id":"9680aa78-24a5-444e-9a46-05247f967978","year":2020},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:14.166587Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:bda26134e711db2a26660280f867f53f003a11288a94d0bad9abe944da7a3fea","observation_id":"e79acf52-0658-4e85-9d0d-4c7491b25a18","resolution":{"observed_at":"2026-08-07T10:53:22.979644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:19.382938Z","title":"Effect of positional encoding.We assess the impact of positional encoding (PE) on our model’s performance","venue":null,"work_id":"70f629df-e6d1-4d97-83a8-d0361b28bf4b","year":2024},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:18.261352Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:1cb80e3c6da8a06d6904a37fc5ed20358b6c82141f132988a3397c29b952411e","observation_id":"690029ba-d601-4347-8455-815102b30820","resolution":{"observed_at":"2026-08-07T10:53:19.495273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:15.135183Z","title":"L., Wu, H.-H., Salamon, J., and Bello, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:15.135183Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:46af5ffb149d2a3a2bbda4772f509b18a60df46bdedd1580741912d22db941d4","observation_id":"f34a7d41-b1ed-4f67-8430-9330dc8265c9","resolution":{"observed_at":"2026-08-07T10:53:15.135183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T10:53:15.258122Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding.arXiv preprint arXiv:1810.04805,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:15.258122Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:ff7d0af2086adaf09c842e3139130edacd377719dd95e89d830f7a6942520b82","observation_id":"24645505-7d44-4ab5-ab66-924f51f1f9f0","resolution":{"observed_at":"2026-08-07T10:53:15.258122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07065","last_updated":"2023-03-03T08:37:38Z","snapshot_observed_at":"2026-07-06T14:30:29.323059Z","submitted_at":"2022-12-14T07:21:45Z","title":"CLIPSep: Learning Text-queried Sound Separation with Noisy Unlabeled Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07065","snapshot_observed_at":"2026-08-07T10:53:15.412519Z","title":"Clipsep: Learning text-queried sound separation with noisy unlabeled videos.arXiv preprint arXiv:2212.07065,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:15.412519Z"},"links":{"cited_paper":"/paper/2212.07065","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:570436f07d70dfd7b5611b6a3162b6c37153fcd77ce639e2b36420996ab456d6","observation_id":"2ab79958-5864-400b-b386-d8ed413de65b","resolution":{"observed_at":"2026-08-07T10:53:15.412519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:19.581907Z","title":"We randomly selected 100 samples for evaluation, each rated by 50 unique participants to ensure reliability","venue":null,"work_id":"73496e73-fc5e-4305-bb71-7bd27c7c77a2","year":2012},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:18.190175Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:e34cec2791dc52d1aa48a25c2c2044733bbd7040686ffd57551899ee9af5ff58","observation_id":"b84b5353-d282-4f1d-b3e2-4fb45c42dbfe","resolution":{"observed_at":"2026-08-07T10:53:19.678359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:21.927551Z","title":"B., and Tor- ralba, A","venue":null,"work_id":"1bf08e27-e668-4bcb-8e0a-55e7731e41ca","year":2020},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:15.903051Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:765f94b564840ed8a5b95bf984d640bc9edbc57b82d11f4f6dbc411fea5cdaf7","observation_id":"306f4733-c98d-4a9a-a73c-6f422635d477","resolution":{"observed_at":"2026-08-07T10:53:22.041748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15447","last_updated":"2025-08-12T04:20:41Z","snapshot_observed_at":"2026-07-06T19:55:51.415524Z","submitted_at":"2024-11-23T04:27:19Z","title":"Gotta Hear Them All: Towards Sound Source Aware Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15447","snapshot_observed_at":"2026-08-07T10:53:16.014440Z","title":"Gotta hear them all: Sound source aware vision to audio generation.arXiv preprint arXiv:2411.15447,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.014440Z"},"links":{"cited_paper":"/paper/2411.15447","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:2b4017aa88458f844da58998eff84cd31afd1874e0a0d53410bd58fcd66585d9","observation_id":"03ba7b75-97c6-4683-9c90-352d36f6924d","resolution":{"observed_at":"2026-08-07T10:53:16.014440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T10:53:16.085528Z","title":"and Salimans, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.085528Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:a2e841d94079d0f5d217c0bfe34d5521ade5a3a3d2675f8164a285c04cc2a949","observation_id":"15194fdf-c0ab-4eaf-b1f4-3b133068b7b8","resolution":{"observed_at":"2026-08-07T10:53:16.085528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:16.285900Z","title":"D., Kim, B., Lee, H., and Kim, G","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.285900Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:b8351fb3d4049d9d793e45553a16b3f2944f302c3336bf3d97878d54a3aaeebb","observation_id":"352ceb62-d23f-43df-85a7-88a5ea815f5b","resolution":{"observed_at":"2026-08-07T10:53:16.285900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:21.306801Z","title":"Hifi-gan: Generative ad- versarial networks for efficient and high fidelity speech synthesis.Advances in Neural Information Processing Systems, 33:17022–17033, 2020a","venue":null,"work_id":"524766da-09ca-4662-8ec4-d4a1e7541e3a","year":2019},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.567043Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:c6e41bd400d63cf8fe096da7cea46f3dca674db1310559a5beff2de48ac8fbea","observation_id":"96613bab-25e7-4572-a390-b5f75b4c23af","resolution":{"observed_at":"2026-08-07T10:53:21.367734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06818","last_updated":"2023-04-13T20:56:53Z","snapshot_observed_at":"2026-08-01T16:07:10.401914Z","submitted_at":"2023-04-13T20:56:53Z","title":"Soundini: Sound-Guided Diffusion for Natural Video Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06818","snapshot_observed_at":"2026-08-07T10:53:16.636613Z","title":"H., Kim, S., Yoo, I., Yang, F., Cho, D., Kim, Y ., Chang, H., Kim, J., and Kim, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.636613Z"},"links":{"cited_paper":"/paper/2304.06818","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:8fe411347368405e976915c31053f326b07e2b5ccef50221d128bfca26a38a42","observation_id":"1ae440de-da3b-4066-a714-4e99af60fb63","resolution":{"observed_at":"2026-08-07T10:53:16.636613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T10:53:16.702062Z","title":"and Hutter, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.702062Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:3b807b930464acdd4d846545e0ef1c60488e1b2f6abf8b3f6d22a93f0b412963","observation_id":"a6df55b8-a4a8-4bb8-9fb1-8b679d97c704","resolution":{"observed_at":"2026-08-07T10:53:16.702062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T10:53:16.890076Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.890076Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:4d0e0ca79afba516315ec41a7db8f7c6152dd54d83e6b6f5bf9d215c8d1c540c","observation_id":"e044c547-1dba-4001-add8-0f90575d7d5b","resolution":{"observed_at":"2026-08-07T10:53:16.890076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:21.113443Z","title":"A., Zhang, R., and Zhu, J.-Y","venue":null,"work_id":"6785d12d-9365-4838-afef-48a3775d6f94","year":2020},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.029469Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:5f6559abbe2439088d88c2c2003ef352e18393ace593d5cb32d84cd515df48a2","observation_id":"fab05a56-1416-46ff-9cb6-7079b351df7b","resolution":{"observed_at":"2026-08-07T10:53:21.187264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T10:53:17.123505Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.123505Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:4612eb888e5f3d1861d08293193cac6d82b423e81d0b3b15c16114526ea701cb","observation_id":"d66c4616-7dd0-47b8-ab14-93dde8116703","resolution":{"observed_at":"2026-08-07T10:53:17.123505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:20.901990Z","title":"Self-supervised audio-visual co- segmentation","venue":null,"work_id":"626777af-ad69-431b-8029-c29d975519ac","year":2019},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.231123Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:82e91976e929bfe9b18fe02419e563fe93bc24fbda7b99d23698c51eee1336b0","observation_id":"d1fc9ea9-2aa6-43f3-a4b8-fe17c98098bb","resolution":{"observed_at":"2026-08-07T10:53:20.993648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:20.694870Z","title":"and Adi, Y","venue":null,"work_id":"1f7a6a6d-6896-4f4c-9dbe-a5a938d8da91","year":2023},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.324515Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:9611ee9f087f9037fabf62b1c4ba3d54bbf1e95564e622e5ce9375c1287fba27","observation_id":"88f551ae-306b-4a73-9f74-e5bdc202b4ad","resolution":{"observed_at":"2026-08-07T10:53:20.773082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T10:53:17.375318Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.375318Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:80bf4640a03db152b6fb997dde8c2f99c6c817a7777ec87ea58511f0fe5954cf","observation_id":"f18cc79b-1cf5-483d-8215-d94d3a14a6e3","resolution":{"observed_at":"2026-08-07T10:53:17.375318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T10:53:17.445595Z","title":"Llama 2: Open foundation and fine- tuned chat models.arXiv preprint arXiv:2307.09288,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.445595Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:4faea1a9d2be1ace0bde7c93b98362213d00e395e9196c26b10c01541a4c3245","observation_id":"924826e6-0172-4273-b1ae-d6e2d83287d7","resolution":{"observed_at":"2026-08-07T10:53:17.445595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.09418","last_updated":"2019-06-07T14:00:58Z","snapshot_observed_at":"2026-08-01T19:51:24.042109Z","submitted_at":"2019-05-23T01:13:24Z","title":"Analyzing Multi-Head Self-Attention: Specialized Heads Do the Heavy Lifting, the Rest Can Be Pruned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.09418","snapshot_observed_at":"2026-08-07T10:53:17.538154Z","title":"Analyzing multi-head self-attention: Specialized heads do the heavy lifting, the rest can be pruned.arXiv preprint arXiv:1905.09418,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.538154Z"},"links":{"cited_paper":"/paper/1905.09418","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:fd310081f32c54b1c466d95bc7df181635c921bf84d4716d36de4b381c92bc78","observation_id":"59579319-00f7-4000-b8af-ca7706245cb1","resolution":{"observed_at":"2026-08-07T10:53:17.538154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:20.482454Z","title":"P., and Salamon, J","venue":null,"work_id":"b996bc87-082b-4356-bf6a-30c315803750","year":2023},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.603114Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:41073d35ca851761d7b5d07eb72594b3a29c0bf1dd1502f4a6c0ac4b8d52b6c9","observation_id":"eb6f9f6b-836a-4797-b06a-4a3e7a96640c","resolution":{"observed_at":"2026-08-07T10:53:20.586856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01044","last_updated":"2024-01-02T05:42:14Z","snapshot_observed_at":"2026-08-05T01:13:48.815001Z","submitted_at":"2024-01-02T05:42:14Z","title":"Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01044","snapshot_observed_at":"2026-08-07T10:53:17.684335Z","title":"Auffusion: Leveraging the power of diffusion and large language models for text- to-audio generation.arXiv preprint arXiv:2401.01044,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.684335Z"},"links":{"cited_paper":"/paper/2401.01044","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:f77ccebddad810cc0b3f55ba1d135c99c914f0f3a61a5b1f2cb7a2def5ef8ced","observation_id":"428750bf-740f-4dbf-b041-10c95fbbbbac","resolution":{"observed_at":"2026-08-07T10:53:17.684335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04416","last_updated":"2025-01-01T13:46:37Z","snapshot_observed_at":"2026-07-06T18:41:53.152987Z","submitted_at":"2024-07-05T11:07:13Z","title":"Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04416","snapshot_observed_at":"2026-08-07T10:53:17.755251Z","title":"D., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.755251Z"},"links":{"cited_paper":"/paper/2407.04416","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:946d325cc89dae9771928476e4d9cb7544e29284617bfac06f85cfd7b3827f74","observation_id":"f491f5a3-11f0-4614-94de-1a71b8fca4f4","resolution":{"observed_at":"2026-08-07T10:53:17.755251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-07T10:46:50.742580Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-07T10:53:17.851996Z","title":"Foleycrafter: Bring silent videos to life with lifelike and synchronized sounds.arXiv preprint arXiv:2407.01494,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.851996Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:e78beb81af7f47563ca7696d9892fa36d355d58c4a27b4642a76f16b7830d7e1","observation_id":"d226c09d-d252-4134-a793-847f7f69ca39","resolution":{"observed_at":"2026-08-07T10:53:17.851996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:20.247196Z","title":"Results Video We provide a results video on the project webpage, which showcases our model’s ability to generate sounds based on the masked object prompts","venue":null,"work_id":"cecd0494-2050-432a-91b3-69e506ca487d","year":2017},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.911045Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:30d12c042234dd2d5331fedfc5af79bdd63d770b68790f0e87cc1f2a60761fb8","observation_id":"014a0f98-9611-4d99-9212-b584e52053f6","resolution":{"observed_at":"2026-08-07T10:53:20.349641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:19.999631Z","title":"The original dataset comprises 4,616 hours of video clips, each paired with corresponding labels and captions","venue":null,"work_id":"2ee906fe-ca83-4d04-8bdb-f023701bc829","year":2024},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.979108Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:eb4dbf37d40e15acf0bdbeb315f34012abcb008cd1fadbd82f3be2b27ac9992b","observation_id":"f2e512bb-446e-45db-9b36-ab6e5a2b0c89","resolution":{"observed_at":"2026-08-07T10:53:20.122666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:19.774240Z","title":"Speech\" and “Music","venue":null,"work_id":"06dc4d8d-f160-4e06-9808-354a6cb1cc3b","year":2017},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:18.061160Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:1ac5d49a9286d89f7186de81de7f4ca69aa9690cdc3306b20edc30ff825ca3b5","observation_id":"89c7e839-6d02-4d91-b3e5-4d8946b2b60b","resolution":{"observed_at":"2026-08-07T10:53:19.887206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:19.218537Z","title":"By extracting features from both modalities and computing cosine similarity, we show in Table 9 that our method consistently outperforms baselines on this metric","venue":null,"work_id":"c98aa592-0f6d-4460-b574-0626681c7fc9","year":2020},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:18.389315Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:a038e2eaf3598211f5b939af21ecf15e8246205d795e279db2dc0d0ab2951016","observation_id":"c4b27ee5-ee27-4ffb-95ef-e47c2b6e99f3","resolution":{"observed_at":"2026-08-07T10:53:19.281192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:19.021457Z","title":"video clips with better audio-visual synchronization, for test- ing","venue":null,"work_id":"796913ba-1430-4cc5-b5ca-7800a9642b46","year":2023},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:18.476414Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:164ded94a9068e39ed22f7fab4bdf31942bcfcb7e6a4afbd76aaf4d5171b85ec","observation_id":"eb734ed4-bcef-4f39-9e5b-731ed4ad6714","resolution":{"observed_at":"2026-08-07T10:53:19.118786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11390","last_updated":"2019-01-22T18:55:34Z","snapshot_observed_at":"2026-07-06T07:30:18.170401Z","submitted_at":"2019-01-22T18:55:34Z","title":"MONet: Unsupervised Scene Decomposition and Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11390","snapshot_observed_at":"2026-08-07T10:53:14.410618Z","title":"P., Matthey, L., Watters, N., Kabra, R., Higgins, I., Botvinick, M., and Lerchner, A","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":1994,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:14.410618Z"},"links":{"cited_paper":"/paper/1901.11390","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:62bfb0843b4dd6309b09ded90968fc324aba5ba507f751495c8ea97d37bab160","observation_id":"05235672-3c85-44af-928a-a5ffbf6dde8a","resolution":{"observed_at":"2026-08-07T10:53:14.410618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T10:53:16.344543Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.344543Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:a940e1061f0af597595e58fecff5af48c4d56be9debbbd72a37d830192c4e304","observation_id":"36292d4d-164e-47c1-a47d-b26706e60b98","resolution":{"observed_at":"2026-08-07T10:53:16.344543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:15.739919Z","title":"D., Carr, C., Zukowski, Z., Taylor, J., and Pons, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:15.739919Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:4b212160c4aad35c99575fc2939876dd1682575ea022a3df94327439a2796be2","observation_id":"10f7d14b-2f4b-4782-bd2e-6c614d482d2d","resolution":{"observed_at":"2026-08-07T10:53:15.739919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17203","last_updated":"2023-06-29T12:39:58Z","snapshot_observed_at":"2026-08-01T17:23:31.132306Z","submitted_at":"2023-06-29T12:39:58Z","title":"Diff-Foley: Synchronized Video-to-Audio Synthesis with Latent Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17203","snapshot_observed_at":"2026-08-07T10:53:16.772565Z","title":"Diff-foley: Syn- chronized video-to-audio synthesis with latent diffusion models.arXiv preprint arXiv:2306.17203,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.772565Z"},"links":{"cited_paper":"/paper/2306.17203","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:da504d9a85980b329ee8ae351e7a4fac99ed9b8e5a964875a62fe728733e40eb","observation_id":"a35530dd-e4d0-41b2-9fe0-2674cf50081d","resolution":{"observed_at":"2026-08-07T10:53:16.772565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-07-06T03:53:10.336430Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-07T10:53:14.283844Z","title":"Neural machine translation by jointly learning to align and translate.arXiv preprint arXiv:1409.0473,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:14.283844Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:8c72b0a2f65df50761d8944e6dc1b476233d1ffe50b4f5e0c21d31e9ca121105","observation_id":"9b5802cf-c42f-4ba2-a2ef-a519db155eee","resolution":{"observed_at":"2026-08-07T10:53:14.283844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:22.531688Z","title":"Visual acoustic matching","venue":null,"work_id":"a12ba7e6-0cb1-4ed5-b875-12f4e60a5d8e","year":2020},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:14.542529Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:900fc65636e53689a626df721e6096916dfe6256d9cbe7bb4808b5b64dfa4665","observation_id":"75e97090-91e3-411d-88d0-3d00fd96cdb5","resolution":{"observed_at":"2026-08-07T10:53:22.719167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04432","last_updated":"2021-12-08T17:50:26Z","snapshot_observed_at":"2026-07-06T12:16:41.817858Z","submitted_at":"2021-12-08T17:50:26Z","title":"Audio-Visual Synchronisation in the wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04432","snapshot_observed_at":"2026-08-07T10:53:14.750169Z","title":"Audio-visual synchronisation in the wild.arXiv preprint arXiv:2112.04432, 2021a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:14.750169Z"},"links":{"cited_paper":"/paper/2112.04432","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:6fd28371b80e8f8c7da16eedc80773cbcc7227178f4f7da0cab3ef0f9a75bd1f","observation_id":"8ac5f492-375f-4c66-a64e-f9ad9a2bc2a7","resolution":{"observed_at":"2026-08-07T10:53:14.750169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:21.697857Z","title":"Synch- former: Efficient synchronization from sparse cues","venue":null,"work_id":"2d377cda-66a9-4ac3-96f8-1e6bbc220ab7","year":2024},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.157720Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:ce27137684eb068449654c4263f0fdc278b187212bd0933a5a859a8649bf62dc","observation_id":"92982670-0cc1-4f22-9e56-f5e5bfa7c2e8","resolution":{"observed_at":"2026-08-07T10:53:21.806357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:22.176224Z","title":"On uni-modal feature learning in supervised multi-modal learning","venue":null,"work_id":"5e16025d-6bbb-4316-92e8-5cca4cfddff9","year":2023},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:15.611374Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:267877287521ffe1321d0c7ba0a71cd7bd110bd1538488b023106a8c828921c3","observation_id":"ba9961c9-9d3c-42a4-9dfd-ff2d9a87981d","resolution":{"observed_at":"2026-08-07T10:53:22.306427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:21.466827Z","title":"S., Wiles, O., Moses, Y ., and Zisserman, A","venue":null,"work_id":"9a381c3d-80d5-4f1d-a7b0-aff0a972d4b5","year":2020},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.461969Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:33efa97a2167726cdd9fde911badfc5d785fa5f7eb5afcbc34ba458c74c26f45","observation_id":"f344cc3e-447f-4383-8639-dbe578e98bd8","resolution":{"observed_at":"2026-08-07T10:53:21.536182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15322","last_updated":"2025-04-07T18:00:00Z","snapshot_observed_at":"2026-08-03T17:32:04.376468Z","submitted_at":"2024-12-19T18:59:55Z","title":"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15322","snapshot_observed_at":"2026-08-07T10:53:14.895706Z","title":"K., Ishii, M., Hayakawa, A., Shibuya, T., Schwing, A., and Mitsufuji, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:14.895706Z"},"links":{"cited_paper":"/paper/2412.15322","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:b0352aa9d01ec8f9916fd831285f7b0039cfd20bebb5ecf269d045f607a2ab25","observation_id":"14e806fc-87e0-48fa-9c31-79ec9b6b96c0","resolution":{"observed_at":"2026-08-07T10:53:14.895706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T10:43:07.384061Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2506.04214."}