{"as_of":"2026-08-11T08:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d5d184cf57c208f5a767a1c4b4479798d9ead6af4acb71dde65928f486ad2c3","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:16:26.768918Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.05413/citation-record","integrity":"/paper/2501.05413/integrity","json":"/paper/2501.05413/citation-record.json","paper":"/paper/2501.05413"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.294655Z","title":"Sonicdiffusion: Audio-driven image generation and editing with pretrained diffusion models, 2024","venue":null,"work_id":"6fee50a7-d971-4b4d-8d03-5db5fed5b67e","year":2024},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.579879Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:b551886340aecd8a04e34ff1a016cda3acb29fffe3c465fa11d95581015bdcb2","observation_id":"5e0ce949-7453-44a2-8144-0e6fc08acd99","resolution":{"observed_at":"2026-08-10T21:16:27.298515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.11096","last_updated":"2019-02-25T21:32:06Z","snapshot_observed_at":"2026-07-06T07:04:57.275371Z","submitted_at":"2018-09-28T15:38:49Z","title":"Large Scale GAN Training for High Fidelity Natural Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.11096","snapshot_observed_at":"2026-08-10T21:16:26.584206Z","title":"Large scale gan training for high fidelity natural image synthesis","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.584206Z"},"links":{"cited_paper":"/paper/1809.11096","citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:a148a61850346fca696a56c5147c69bbb1254adfc6f39e677d205a9cb2f7b7ab","observation_id":"51c6e82d-cf96-4e41-9b47-89d8818e3a38","resolution":{"observed_at":"2026-08-10T21:16:26.584206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.284115Z","title":"VGGSound: a large-scale audio-visual dataset","venue":null,"work_id":"25a9f0d7-7f37-4176-a967-b68c869cd8b6","year":2020},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.588353Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:36b08bd0dd464ae0b0fc5f6983b2f029cc2eda3ead500d48b919460ec1c4e700","observation_id":"de48d517-d021-4755-91c2-f2e8b0dc579f","resolution":{"observed_at":"2026-08-10T21:16:27.287495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.592151Z","title":"Pixart-α: Fast training of dif- fusion transformer for photorealistic text-to-image synthesis,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.592151Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:c97922635dc4fbab4848c91a9850d2e6a6cc19c0ae35001ceeffc14f17fe7a1a","observation_id":"1a91f36a-f9cf-4161-b5bc-8dbfdfbe2970","resolution":{"observed_at":"2026-08-10T21:16:26.592151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-10T21:16:26.596612Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.596612Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:e7234f9a10ef9483303e7ea272f0074045eb84fb6dfea103506ea97bb382d62c","observation_id":"c9cc4ab3-7e59-48eb-857f-d456d8816b5b","resolution":{"observed_at":"2026-08-10T21:16:26.596612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.601743Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.601743Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:e0b098dd78bf98cc7e570d6e505bab95612a6954bbe84fc1cd32c2a970cb0bd5","observation_id":"2915c9fe-2edb-41d3-a317-b3061d508179","resolution":{"observed_at":"2026-08-10T21:16:26.601743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.605417Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.605417Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:b5403e4635fbb7b63017e80f080f1fbffb8d4f089fe81339d9a444dfc00d95f3","observation_id":"8acffa26-d286-4799-a992-cc41a11010d0","resolution":{"observed_at":"2026-08-10T21:16:26.605417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.253184Z","title":"FSD50K: an open dataset of human- labeled sound events","venue":null,"work_id":"6663a96f-ed78-42a5-b7ad-3b773332f0d4","year":2022},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.610037Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:d3df4f7e1af47ccf746bfc8eb4bb1a7c8dec6b02965a47d5af6aaac9d52d5462","observation_id":"91a535d9-07c5-4ee7-b8d6-43d15d7cb075","resolution":{"observed_at":"2026-08-10T21:16:27.256510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.242919Z","title":"Gemmeke, Daniel P","venue":null,"work_id":"44ce51ea-fbbc-416f-966a-748435270382","year":2017},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.613883Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:6b9db1f28ce34ae1ae782f71cd30322d4aa4b8da0324d0f48925fc53acff8ba2","observation_id":"bfcb7571-cf0e-41be-b170-ceecbdb3ad08","resolution":{"observed_at":"2026-08-10T21:16:27.246523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.232301Z","title":"ImageBind: One embedding space to bind them all","venue":null,"work_id":"703758d7-f7d6-4d5a-be17-19f95c72dc0d","year":2023},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.618571Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:07155ab94b409a2b2c12bdb6d8cbc3c4d06269469ff834dff0ca8120aa6318c0","observation_id":"915a2ef4-f076-42fe-bb3f-acaca5ad40ea","resolution":{"observed_at":"2026-08-10T21:16:27.236239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.222348Z","title":"AST: Audio Spectrogram Transformer","venue":null,"work_id":"95844fde-b834-4485-90de-77105cdd2de6","year":2021},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.622284Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:40f851bee3c312e0738c986703d322e18ea570d9ce322ac46bcc8df19446d7d2","observation_id":"c3773c92-a913-485b-915a-94ded1620be6","resolution":{"observed_at":"2026-08-10T21:16:27.225985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.212569Z","title":"Generative adversarial nets","venue":null,"work_id":"31a44e71-23a0-401c-9d4a-6c0ec1e1b463","year":2014},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.626061Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:638512b32ff2b4a3783dfd46dd5e475bbecf753d5e7d9affa7f25b57c5c852c3","observation_id":"e83ae7af-5b91-449b-b725-2a8c9f8258da","resolution":{"observed_at":"2026-08-10T21:16:27.215721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.201569Z","title":"Grimm and M","venue":null,"work_id":"458a0477-1097-4721-aeff-e6f0354119c1","year":2010},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.629469Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:c4fe15cbc10982bac45f6b845d60e47abfac8e6f54c33a1dd448992a47e48164","observation_id":"461deba7-c29c-479d-95ec-c62415e66ff7","resolution":{"observed_at":"2026-08-10T21:16:27.204770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.184811Z","title":"AudioCLIP: Extending clip to image, text and au- dio","venue":null,"work_id":"93e64bcd-a28c-4713-a6a3-2717be92df33","year":null},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.633300Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:0180729b19a2790103e41eecbc508ac486af3625c5fd888bdee7afd1fdf30c5a","observation_id":"8bc2b167-cdc3-4560-86a5-35d896fdeca8","resolution":{"observed_at":"2026-08-10T21:16:27.194146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.173044Z","title":"CLIPScore: a reference-free evaluation met- ric for image captioning","venue":null,"work_id":"35e8a7ad-9f87-4245-9930-299ae687c78c","year":2021},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.636556Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:59688dcfd3e10629b4b14a1ec2d61d63f7624e3690dbd4c4def22677c5b0cdac","observation_id":"d42f5e3a-e96b-4aa5-98b4-791e12af9d4c","resolution":{"observed_at":"2026-08-10T21:16:27.176715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.161063Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"4897d0c3-8eed-4767-bc08-34ab412b6fc1","year":2017},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.639871Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:fe38d47a10b36f9d63725b9270bee4faffee61805dd86aa92dbaa7c5e41b62f8","observation_id":"80962813-c05f-40a3-a72b-bbf6a2ca8afd","resolution":{"observed_at":"2026-08-10T21:16:27.165470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-08-10T05:21:27.485481Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-10T21:16:26.643318Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.643318Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:4c6f64d794ba339f9dbdfe87cc7718bece36b4112cb9dea94913374b57b44026","observation_id":"eaffa1b6-079a-4d9d-b482-5dfe65cf768a","resolution":{"observed_at":"2026-08-10T21:16:26.643318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.149842Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":"cece6e19-d5d2-4e11-8739-9d657d42ae2f","year":2021},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.649514Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:257eb165ed77650d94a4567c252d06b0f67e95af9d415c15757143e90fbd3201","observation_id":"247e85c9-55b0-4a2e-a0fe-3461467556ee","resolution":{"observed_at":"2026-08-10T21:16:27.153728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.652448Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.652448Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:363a1f668ea02653ea754a0f54a9bc0ab9afa40d4435ae4fc5a7f89e4084689e","observation_id":"1ff94be0-c2b8-4387-adef-1e50f4cd0396","resolution":{"observed_at":"2026-08-10T21:16:26.652448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-10T21:16:26.655699Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.655699Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:06aad18b69f734ead622d9cbe891352b0a3c29042c4b4e62f357c2e366f860da","observation_id":"6fe3fc34-2531-4a42-8bb6-012c2581de34","resolution":{"observed_at":"2026-08-10T21:16:26.655699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.130147Z","title":"Sound-guided se- mantic video generation","venue":null,"work_id":"6357aa19-1fdf-4279-a1ad-ac173af743e0","year":2022},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.660376Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:7d21e497d1a8afef0304c234022deeb32e2d2ad2e96f9cb1ff31841b8964bd25","observation_id":"3e05c5c7-05f4-44fa-85c1-1db526b22584","resolution":{"observed_at":"2026-08-10T21:16:27.134051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.120321Z","title":"Sound-guided semantic image manipulation","venue":null,"work_id":"4db83458-e50a-48fe-b50e-f1567d9f3a50","year":2022},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.664064Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:283765e6b92e2755d331eeee6108acfb3b49ff94f922d6e823f7b946ce790040","observation_id":"ebb52430-1dd1-4f58-a47b-3b241faa0c1d","resolution":{"observed_at":"2026-08-10T21:16:27.123884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.108896Z","title":"Learning visual styles from audio-visual associations","venue":null,"work_id":"cbf88bc5-4f5a-44d7-836a-ecf14d212949","year":null},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.667587Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:bfbd0a7b907b3d709511a1369f89adecff55ad82fb796e25c9f3ee451cdb0bb8","observation_id":"f5feafd1-08b8-49ea-86db-abf5d3569b32","resolution":{"observed_at":"2026-08-10T21:16:27.113292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.088504Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"2067c4cb-1090-4496-a98c-9bada9f8a28e","year":2023},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.674856Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:bd332c899fac3018e7b85192a5ee073687c01c52d263efb06cb6759d86360650","observation_id":"bdf015c1-8c24-4cd0-ae44-77b5f3a67339","resolution":{"observed_at":"2026-08-10T21:16:27.091893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.678345Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.678345Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:b5bbdd27df1e83347bb45a63a9c1866e73cb3b6038a7218255c1d290ffa4c3f3","observation_id":"ec476676-e1f0-4e16-93e0-cf1d1fb3ceff","resolution":{"observed_at":"2026-08-10T21:16:26.678345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.682091Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.682091Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:4ecb0313be7b2ec7f448620bcfcbc6f0db9f9e8d2291d6d79dead1286d2f002c","observation_id":"fca77de4-d030-4318-94a9-aeb9f283cd2c","resolution":{"observed_at":"2026-08-10T21:16:26.682091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.063221Z","title":"Visually indicated sounds","venue":null,"work_id":"e0803175-cca5-4db9-ac5f-8130dde458a3","year":null},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.686045Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:9ac8215fdd5b72f6d1a5cb0f9198cbd9a0356d2d2f92b0fc6fac407963a2d74a","observation_id":"902eb259-a633-4b7f-b3dd-d26530a70052","resolution":{"observed_at":"2026-08-10T21:16:27.066622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.052724Z","title":"Jour- neydb: A benchmark for generative image understanding,","venue":null,"work_id":"8f93ec7b-9aa9-4d20-a241-3c87cf514217","year":null},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.689570Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:5050c7b13e47d72b65e042324ff60e0348fdc935c472dcf0e1c1168739b43861","observation_id":"c8c983b4-a2a2-4ae2-95d9-161313f51227","resolution":{"observed_at":"2026-08-10T21:16:27.056429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-10T21:16:26.693041Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.693041Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:8059268adc90848327ac0436143bd327ca02784bba3fa897cc28acc6ade5ee8e","observation_id":"0789e7e5-735c-4ddf-892c-10e692251907","resolution":{"observed_at":"2026-08-10T21:16:26.693041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.043033Z","title":"Glue- gen: Plug and play multi-modal encoders for x-to-image generation","venue":null,"work_id":"6318cd81-490b-4a3a-8f93-5e199acae19c","year":2023},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.696421Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:849bde0c0c179c96b601fac531797c156ba65b2637ced02573027daae2f9b298","observation_id":"d0462784-de8e-46a8-9b5f-8bf867faed95","resolution":{"observed_at":"2026-08-10T21:16:27.046632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.699258Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.699258Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:3b7d4021803f700a1d962e38f9a00c4b3f8ded3ec0f6c9c36e30f8f6c35f45f2","observation_id":"6a786f6a-2f84-48f6-98ef-ce5c4f9443e9","resolution":{"observed_at":"2026-08-10T21:16:26.699258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.701912Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.701912Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:2f99d0f19931b9d8d6d52a91dcc9fe6fce534b167bf89f4232a1f25623d21224","observation_id":"70fbd628-ff8d-42d7-9f89-849993071eb1","resolution":{"observed_at":"2026-08-10T21:16:26.701912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-10T21:16:26.704878Z","title":"Hierarchical text-conditional image gener- ation with CLIP latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.704878Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:55754894313b778fc35c86598ef0df0087ca2b8d625edab39c4b1908d040d406","observation_id":"37e19563-1eb6-465d-97da-377aac6caff7","resolution":{"observed_at":"2026-08-10T21:16:26.704878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.708154Z","title":"Generative ad- versarial text to image synthesis","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.708154Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:02cc0f0407422382657996a58e1eccf1a0b08d48e9fc82895e9faa5de869e1fd","observation_id":"805f24c7-3211-4cea-b0d2-456b7215765b","resolution":{"observed_at":"2026-08-10T21:16:26.708154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.011961Z","title":"High-resolution image syn- thesis with latent diffusion models, 2021","venue":null,"work_id":"9c69b39c-0ce2-4c5c-a41d-47a9e165a01c","year":2021},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.711135Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:f177786db69b2c80728e07ea8532e114808fffadef37ac94a29aaa38041704cb","observation_id":"276d7aaf-12b1-4957-8208-92e4dbe5220b","resolution":{"observed_at":"2026-08-10T21:16:27.016208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.000816Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"1be7c820-8c43-4160-a7cf-d2323ec06175","year":2022},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.713972Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:410a92004fd45742ff7c6f92c6d66e070d0be01f808e8c228c57b5a4e66b0a4e","observation_id":"e3f9f8d5-a9f7-47fe-a678-057557bc89be","resolution":{"observed_at":"2026-08-10T21:16:27.004837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.988714Z","title":"Sound to visual scene genera- tion by audio-to-visual latent alignment, 2023","venue":null,"work_id":"ec5adf2a-b5a5-4188-bd34-d128e1429aa9","year":2023},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.716787Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:912f1a8e5c344cb570662360144ec07b2812455ec73959d4268088ada49c20ea","observation_id":"f978e68f-69cd-46f1-a0e4-5f31d37a70fa","resolution":{"observed_at":"2026-08-10T21:16:26.992716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.719960Z","title":"Llama: Open and efficient foundation lan- guage models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.719960Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:4697e8784f82efc341945d4e457d77fd8c01f155dd40bb1b18a8efaab7cefedd","observation_id":"eb488697-96ad-4800-a45b-791b85430115","resolution":{"observed_at":"2026-08-10T21:16:26.719960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.970117Z","title":"Cogvlm: Visual expert for pretrained language models, 2023","venue":null,"work_id":"6255fc96-06d8-4e33-9ce7-a70a0fe0a957","year":2023},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.723245Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:ce98d62a6b8e561e6ee37232e4000dc048ecc9629544332ecbf0ebcedcdb131b","observation_id":"d9f5eef9-6e34-4d87-aca7-28147d11c386","resolution":{"observed_at":"2026-08-10T21:16:26.973331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.960507Z","title":"Wav2clip: Learning robust audio repre- sentations from clip","venue":null,"work_id":"b0f48e6c-94b0-4780-a8fd-476e967ff774","year":2022},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.726406Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:4f4d4fefe13169c872566b203efa25a4408559f4ba115f56c367bdb82df76684","observation_id":"b9069101-be2a-426c-bdd8-6ff662bafb61","resolution":{"observed_at":"2026-08-10T21:16:26.963731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.949336Z","title":"Large-scale con- trastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":"a3b41584-bfa2-46ee-a6e5-dbc892ee1eec","year":2023},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.730079Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:0077a570bef1c46be322daa6d92f2da5b395970ba6050ba67f96d3053108da4b","observation_id":"bbfce54c-fc8b-49b7-917e-9dc2226e48f3","resolution":{"observed_at":"2026-08-10T21:16:26.952789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.939398Z","title":"Attngan: Fine- grained text to image generation with attentional generative adversarial networks","venue":null,"work_id":"a4a48e5e-bfaf-4237-8241-938f0ce8face","year":2018},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.733770Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:23a704c1a67adcd87f212681251c0b35167ae0eba19c4e059d145444dc6f5b93","observation_id":"4c888a2a-a2f4-4517-8a20-b6fd97faa436","resolution":{"observed_at":"2026-08-10T21:16:26.942917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13050","last_updated":"2023-05-22T14:02:44Z","snapshot_observed_at":"2026-08-10T18:16:31.886419Z","submitted_at":"2023-05-22T14:02:44Z","title":"AudioToken: Adaptation of Text-Conditioned Diffusion Models for Audio-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13050","snapshot_observed_at":"2026-08-10T21:16:26.744477Z","title":"Audiotoken: Adaptation of text-conditioned dif- fusion models for audio-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.744477Z"},"links":{"cited_paper":"/paper/2305.13050","citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:587036bf5f8db0f3b86864753890af40f684f90280005d03b330162b2bd49630","observation_id":"dcc7da23-d922-44ce-8387-f7246c722354","resolution":{"observed_at":"2026-08-10T21:16:26.744477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.928955Z","title":"A survey on segment anything model (sam): Vision foundation model meets prompt engineering, 2023","venue":null,"work_id":"bc66731e-443b-4163-8422-0e2cbbae4c7a","year":2023},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.748798Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:c06ae91f7306eb34ad65e34d6dabd88677915f32f4b48a6aeb5fc2fad1d6bf3b","observation_id":"32fafa2e-50aa-4b0f-8552-400fb4a89113","resolution":{"observed_at":"2026-08-10T21:16:26.932575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.918431Z","title":"Stack- gan: Text to photo-realistic image synthesis with stacked generative adversarial networks","venue":null,"work_id":"6c3a77b9-05db-4451-a4ff-ccfe55922460","year":2017},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.751981Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:1807c0335755c861001c92fe27eb9200be1ee1b1c391fed014db518389ce9752","observation_id":"bd876b26-52e0-4aa5-aafb-19fcd4333f1e","resolution":{"observed_at":"2026-08-10T21:16:26.921773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.904842Z","title":null,"venue":null,"work_id":"269a503a-eeae-4016-970f-166545c943ed","year":1947},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.755315Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:6d90e713fb8a225f9aaad693f2cbd5f718ad065f7089e6aa97e772c9bbbdf12e","observation_id":"813ef01c-aff7-444a-9d34-372b856a9da0","resolution":{"observed_at":"2026-08-10T21:16:26.910331Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.892756Z","title":null,"venue":null,"work_id":"c0e94496-3d95-4b28-af07-00c7c3f17231","year":2018},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.759653Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:c28e619d86ed4ff1fdb8a7e244aa76e058106943ef157da0cfa335e935e531ba","observation_id":"aa260c62-1724-44fc-98e4-cf7a5503758a","resolution":{"observed_at":"2026-08-10T21:16:26.896762Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.880918Z","title":", Building - The sound of footsteps on the pavement","venue":null,"work_id":"adf739be-4ba6-4607-a617-fc75665a439a","year":2019},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.764660Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:87f9e2ee21735114060ba0fa31a5b5d1f53f515557813eb242a25b1c5af382c2","observation_id":"dda650b2-e859-48cc-b24c-9d80f3a81fb5","resolution":{"observed_at":"2026-08-10T21:16:26.885533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:26.869012Z","title":"Pre-trained","venue":null,"work_id":"8a0dfc0d-8892-478c-b25d-df8e89807d08","year":null},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.768918Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:12fc7d4dc1964a5fe100b4d29a70e206791fef8090445028ff9375ccc6ceba1a","observation_id":"50a0f645-8c4c-4fae-88e0-8ff552216d47","resolution":{"observed_at":"2026-08-10T21:16:26.873719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:16:27.098355Z","title":null,"venue":null,"work_id":"fe6c10c2-f970-432e-ad19-2890c5155837","year":2022},"citing_paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation","version":1},"reference_index":252,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:26.671353Z"},"links":{"citing_paper":"/paper/2501.05413"},"observation_digest":"sha256:7e536087167604e6d33dde34c6f895f6604220e1aad3ad17d7c31d89ba5368b6","observation_id":"dfa80e39-a3e8-4550-b529-2d59254383e0","resolution":{"observed_at":"2026-08-10T21:16:27.101607Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.05413","last_updated":"2025-01-09T18:13:57Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T22:17:58.825229Z","submitted_at":"2025-01-09T18:13:57Z","title":"Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":19,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2501.05413."}