{"as_of":"2026-08-16T09:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:785173b343904658d4c5d169be4db3cbf92ff00245c17c7f4b576d1c39c5e437","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:13:42.336168Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.18750/citation-record","integrity":"/paper/2507.18750/integrity","json":"/paper/2507.18750/citation-record.json","paper":"/paper/2507.18750"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.15668","last_updated":"2025-06-25T20:57:49Z","snapshot_observed_at":"2026-08-12T23:58:39.269106Z","submitted_at":"2024-05-24T16:05:15Z","title":"What Do You See? Enhancing Zero-Shot Image Classification with Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15668","snapshot_observed_at":"2026-08-15T18:13:42.054330Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.054330Z"},"links":{"cited_paper":"/paper/2405.15668","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:e3a1869cd3de33dee49276153c736911d4a5d6ff8df02c90b2056d69d03f74dc","observation_id":"ccc13960-892e-4e40-ab59-5ad58144472f","resolution":{"observed_at":"2026-08-15T18:13:42.054330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T18:13:42.059928Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.059928Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:020e2081943b52e3cd9aa7d442d6414a6e9734716cb58de99c5b2e365cbdf78c","observation_id":"a758c430-ceea-4e4e-8a85-2e8f3c72db6e","resolution":{"observed_at":"2026-08-15T18:13:42.059928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00878","last_updated":"2024-05-01T21:43:57Z","snapshot_observed_at":"2026-08-15T18:47:08.887813Z","submitted_at":"2024-05-01T21:43:57Z","title":"SonicDiffusion: Audio-Driven Image Generation and Editing with Pretrained Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00878","snapshot_observed_at":"2026-08-15T18:13:42.065118Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.065118Z"},"links":{"cited_paper":"/paper/2405.00878","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:23a77931b9bc25cb9e8279667f09b9a502c116c04a67396daec5131877cfeab9","observation_id":"d3d021f6-9f6a-4498-a883-9392eda63844","resolution":{"observed_at":"2026-08-15T18:13:42.065118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.069444Z","title":"Sutherland, Michael Arbel, and Arthur Gretton","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.069444Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:94960f1acae710400d856a0cf3693a25fe998b5939972a735b8be7add162a18b","observation_id":"1ce79bbe-a78a-4956-9c0e-d7e4c04723fa","resolution":{"observed_at":"2026-08-15T18:13:42.069444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.077678Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.077678Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:8f34feef94d1d0702aafd6dbaaa2362968e0a0ad5b5ce1ad302ea23ddb1bd577","observation_id":"393c4dea-b931-45e2-8729-cdb0499ca2a8","resolution":{"observed_at":"2026-08-15T18:13:42.077678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.081891Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.081891Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:72456a4f22090534e0720480036f35815d8a2a00380fcd1c268a5d7528d2a75e","observation_id":"b89a6921-58f8-469c-aa55-fa4db9409259","resolution":{"observed_at":"2026-08-15T18:13:42.081891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:43.176920Z","title":null,"venue":null,"work_id":"932031e8-0cd3-4947-98c4-f439b1432b6c","year":null},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.086994Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:9522b3a6e42abf9356abf783c755702f136218ea0fc87dcfbc18c195b39a9fe0","observation_id":"a5298197-2a44-485b-9a65-dad68cb0eed4","resolution":{"observed_at":"2026-08-15T18:13:43.180676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.096798Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.096798Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:a23203a0274d7c6ed06cbeb2fc4bdfde3a7b292b31786a5e360eda5ff66b9e59","observation_id":"a7d1c716-7b90-4506-9aee-87eb394be3bc","resolution":{"observed_at":"2026-08-15T18:13:42.096798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:43.153260Z","title":null,"venue":null,"work_id":"89f25009-27ff-4342-aa14-0256bac58be0","year":2025},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.102201Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:c19fcf24246fe404784cf8395aa61b664031fef81ef2422ef0cc303f1a71365f","observation_id":"c1933e3c-c50e-46d2-af4b-93f82f1eeceb","resolution":{"observed_at":"2026-08-15T18:13:43.157828Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:43.138182Z","title":null,"venue":null,"work_id":"f1c9efa3-434e-48d0-8909-90f95e772020","year":2024},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.107636Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:5baa26e05d3124fc2caf9b4ae9721bee8c89f4f84b146b1b68206dc2867637ce","observation_id":"c06281be-2262-46a6-abe8-1df33b8c8049","resolution":{"observed_at":"2026-08-15T18:13:43.143270Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.113084Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.113084Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:12ea7e6f474816c85296f7e3d81c07b3ecaeda1b55ea17030ad9839282cdc6d1","observation_id":"d882abd4-190a-435f-8bbd-1a312b51d455","resolution":{"observed_at":"2026-08-15T18:13:42.113084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.122203Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.122203Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:b6589a18dd487c60c73f2a62600eb56d4963c40b9360c6d25ac53eb209462fef","observation_id":"f4ff0221-b699-4ed1-ac87-8ec2f6185b64","resolution":{"observed_at":"2026-08-15T18:13:42.122203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.126570Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.126570Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:1fe4688a862b5c7d6ed4f1fda76f41ca80d2b003cc077e1b3b347e987535c43a","observation_id":"5cfa3b4e-e282-4b7b-854e-c21ccf38d64c","resolution":{"observed_at":"2026-08-15T18:13:42.126570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.130998Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.130998Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:c2b5d1078bf9e5d8dfbe69358952aec44afae80d1250f7f8748bfb21114162ce","observation_id":"3af42b30-2822-46cd-b569-981545d5bc1a","resolution":{"observed_at":"2026-08-15T18:13:42.130998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08500","last_updated":"2018-01-12T14:05:44Z","snapshot_observed_at":"2026-08-14T20:51:33.836666Z","submitted_at":"2017-06-26T17:45:23Z","title":"GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08500","snapshot_observed_at":"2026-08-15T18:13:42.135414Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.135414Z"},"links":{"cited_paper":"/paper/1706.08500","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:f4e50816119c7f5f9614635d94858313aeb47cf7727714065d5cd0cf613a8db1","observation_id":"01df060e-758c-47bc-89f7-bd95219bc461","resolution":{"observed_at":"2026-08-15T18:13:42.135414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:43.073082Z","title":null,"venue":null,"work_id":"46644c84-e97e-4eeb-8ddc-7bde06e5c923","year":null},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.140771Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:326bfdc5ff19b537d6eddeee88d9411c6608f6e79e15f6d7f2fc5b4c91936a20","observation_id":"10128b6c-324c-4ef3-a921-0c94d09c3df8","resolution":{"observed_at":"2026-08-15T18:13:43.077895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:43.056638Z","title":null,"venue":null,"work_id":"1ece9539-749f-4303-b25f-01b71335265d","year":2024},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.150594Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:5b64316bad6eab36c7532b1f983028a0b7742370f9bb120dea4725a6d4074a35","observation_id":"63713efa-7a81-4bbc-a9e7-c560ec43c68a","resolution":{"observed_at":"2026-08-15T18:13:43.061492Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:43.042578Z","title":null,"venue":null,"work_id":"e60b0b90-a0c6-40c4-91f7-8264e3a0f3d0","year":2025},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.154979Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:a7e49ba10fa6f9ec25f6a18942fd429869700f8402aa93a954505d918ab2a99f","observation_id":"5e8bb902-79c8-466c-a311-17fe1dda67a0","resolution":{"observed_at":"2026-08-15T18:13:43.046587Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:43.027551Z","title":null,"venue":null,"work_id":"83afa82a-9b2b-4ab6-9a59-0c60241df4e1","year":2025},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.159219Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:13c6298dde8aa981f66274880a46dfd439913fa1c4aa189fe831a99e26fadb07","observation_id":"d4cefa96-1303-4954-814f-c7e040a503c1","resolution":{"observed_at":"2026-08-15T18:13:43.032666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04001","last_updated":"2023-05-23T06:59:30Z","snapshot_observed_at":"2026-08-13T11:48:05.197922Z","submitted_at":"2023-05-06T10:26:56Z","title":"AADiff: Audio-Aligned Video Synthesis with Text-to-Image Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04001","snapshot_observed_at":"2026-08-15T18:13:42.163499Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.163499Z"},"links":{"cited_paper":"/paper/2305.04001","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:df9bc85465a92b52a34e20fc7b71afca33a26ccb845b6aacbd0e395b74fc3fdc","observation_id":"23ceac24-8882-4ac7-b704-c5f89ab7bc36","resolution":{"observed_at":"2026-08-15T18:13:42.163499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:43.013267Z","title":null,"venue":null,"work_id":"b883b11e-5899-4b5e-8f15-ea714097bc98","year":2022},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.168053Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:557ea0f599bc8399dbc032163a7eadbea43970ec4249e519615601321f7b00e6","observation_id":"f3360c56-5e90-4e1a-98d4-07cafd0efee4","resolution":{"observed_at":"2026-08-15T18:13:43.017752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02405","last_updated":"2023-09-05T17:36:40Z","snapshot_observed_at":"2026-08-13T10:19:54.219064Z","submitted_at":"2023-09-05T17:36:40Z","title":"Generating Realistic Images from In-the-wild Sounds","version":1},"cited_work":{"arxiv_id":"2309.02405","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.02405","snapshot_observed_at":"2026-08-15T18:13:42.607655Z","title":"Generating Realistic Images from In-the-wild Sounds","venue":"cs.CV","work_id":"9f8fd765-5b12-4384-844d-2ae6a8b8d6da","year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.173203Z"},"links":{"cited_paper":"/paper/2309.02405","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:8c5ff9a636c1db9819088303c4edd7441de56342a2763a181ad3e14bae65de84","observation_id":"3935455c-aea9-4795-be28-9a9899b51d5a","resolution":{"observed_at":"2026-08-15T18:13:42.611915Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.998562Z","title":null,"venue":null,"work_id":"b4dbc44a-ab2f-46a9-a825-1bdad927ae5b","year":2024},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.179176Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:c7db2fa8fb94f2bbc9aaa70046efde636d95f7aec1e6e929b9de1261237bbfd1","observation_id":"7c4dbade-1d96-4972-b3af-2ac71cbb8595","resolution":{"observed_at":"2026-08-15T18:13:43.003224Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.183398Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.183398Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:55ec079f102a25e2742a88f5bb4b42fd40c4fa8bb984466c2ca7c58ad5198c8f","observation_id":"9c8ab432-d106-49a7-a787-42119eda21b3","resolution":{"observed_at":"2026-08-15T18:13:42.183398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.188591Z","title":null,"venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.188591Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:448b3fb30400617b67db0547646ba06d51ec8736f7748083f1025f03dbdd92b6","observation_id":"913470ea-4893-481d-bda1-b66606b6250e","resolution":{"observed_at":"2026-08-15T18:13:42.188591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.964726Z","title":null,"venue":null,"work_id":"050b273a-4c0d-4183-97ce-321dfbd0ee93","year":2024},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.194021Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:c07c4b2ee9a4ef5d2fac073d6180ecfcebede05aec52fd6b52fa74da028b88f5","observation_id":"7f05b8e1-ebc9-4216-8175-25a70461884c","resolution":{"observed_at":"2026-08-15T18:13:42.969071Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07183","last_updated":"2022-12-01T17:38:37Z","snapshot_observed_at":"2026-08-13T14:05:48.329373Z","submitted_at":"2022-10-13T17:03:46Z","title":"Visual Classification via Description from Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07183","snapshot_observed_at":"2026-08-15T18:13:42.198876Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.198876Z"},"links":{"cited_paper":"/paper/2210.07183","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:7112520fef34b8cd378fd3eece8b8449018e54993e73d23297a6cf03efc4e39a","observation_id":"1002a0ea-1397-4d72-809d-8b9e051199df","resolution":{"observed_at":"2026-08-15T18:13:42.198876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.950183Z","title":null,"venue":null,"work_id":"27f7f609-fba3-43e4-bda2-4256bd604ce8","year":2024},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.204323Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:319652cc8b8d36d5758749a8338dd67769f4521b70c09400652cf4e7cbb830eb","observation_id":"206e9341-b909-4893-a6c3-7f7671b9794a","resolution":{"observed_at":"2026-08-15T18:13:42.954916Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06708","last_updated":"2023-04-13T17:57:01Z","snapshot_observed_at":"2026-08-13T12:03:22.196001Z","submitted_at":"2023-04-13T17:57:01Z","title":"Verbs in Action: Improving verb understanding in video-language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06708","snapshot_observed_at":"2026-08-15T18:13:42.208738Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.208738Z"},"links":{"cited_paper":"/paper/2304.06708","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:4200d4ac0672a06ecb677e420ea0bcec9a533f87d8d658f0496ec07c927e6277","observation_id":"47adc57a-a63e-4b88-8ab3-d99fe3fa6aca","resolution":{"observed_at":"2026-08-15T18:13:42.208738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-15T18:13:42.213418Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.213418Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:3eaff077e51403afd6a707cb21c325177291df0e460954b7a639f433201e3bb1","observation_id":"4c5cf2fb-5584-4d3f-97ba-05b6338305b8","resolution":{"observed_at":"2026-08-15T18:13:42.213418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.218310Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.218310Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:bcfa12cad1c0ecd344ffd1b2608f4bde0bd541506167be0d526377353eb0731e","observation_id":"4b5ecbb3-7546-456e-a93e-e1e337c8dbb1","resolution":{"observed_at":"2026-08-15T18:13:42.218310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-15T18:13:42.223364Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.223364Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:9e340aec36360e314937b7d804574ca2d2a4c753a5317ae40999bd2598167ede","observation_id":"2752b778-46f2-42db-813b-1f217636be87","resolution":{"observed_at":"2026-08-15T18:13:42.223364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.936391Z","title":null,"venue":null,"work_id":"96115966-0613-4d97-85f3-4dd86ba15f9f","year":2015},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.228851Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:7ca214c0e4bbe4b9b801925c96d8522d62fedf62ea7d042e39c090fde353fcd7","observation_id":"7f596643-4f95-432c-9950-61c5f62249ae","resolution":{"observed_at":"2026-08-15T18:13:42.940708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.921661Z","title":null,"venue":null,"work_id":"0493a5b1-9653-4c2c-b505-26859ded26b4","year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.233207Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:d12d3114f81fb89c9e3cec8e0339e674e2d72febe0858256bb4c9ce304bd93f4","observation_id":"1f40cd43-3563-4343-aeed-92802e0a8e8f","resolution":{"observed_at":"2026-08-15T18:13:42.926311Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.907245Z","title":null,"venue":null,"work_id":"35864281-6142-4a48-9b3f-309beef4a24e","year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.237721Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:91ca2979306af30bb0229326bd7f3c2a30256d6007e2662f220b3e760b85e365","observation_id":"a54b5364-cdd9-4603-ab1e-01ad1ae2db14","resolution":{"observed_at":"2026-08-15T18:13:42.911101Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.242116Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.242116Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:f7759831c933167e07cb085ba3ed85a4bcf3f10f0b875863807046a27f699d4e","observation_id":"97824ef0-5093-4afc-b369-35a5708c41d9","resolution":{"observed_at":"2026-08-15T18:13:42.242116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.247370Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.247370Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:7bed85ed336998c20c6a2ff53055e92c133b1ac5a83d49c914ad87c0a2f84f75","observation_id":"378208aa-b929-485f-ac4a-0523c7b17c0e","resolution":{"observed_at":"2026-08-15T18:13:42.247370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.252095Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.252095Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:cb51489bf5c98647cff477fe028d0471542344dd8ffac615cc9d036b518874d6","observation_id":"01d98179-04fe-4754-a7f9-a2b427971545","resolution":{"observed_at":"2026-08-15T18:13:42.252095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.256550Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.256550Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:c8f6f22958143f0798b22060031e2a42390270f90dc841bde42f334a335a51b2","observation_id":"25a6320d-1a8d-40e0-aad6-5628bd644641","resolution":{"observed_at":"2026-08-15T18:13:42.256550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.857773Z","title":null,"venue":null,"work_id":"534e6927-f407-4d03-96e2-f4c8bf2d1706","year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.264979Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:b5e2c647362cf107ac062bbbc306b405674206b507295939ee49cf5468495382","observation_id":"bcb65fc8-f573-40d2-9ea0-c79b9dcf1da3","resolution":{"observed_at":"2026-08-15T18:13:42.862198Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.268788Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.268788Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:7a17afaadab5fdbf2caf98a91d67047adaa031a03461f079a5a0d574a9c27c09","observation_id":"1a33667d-af6a-45f0-a455-1216868f7d61","resolution":{"observed_at":"2026-08-15T18:13:42.268788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17718","last_updated":"2023-11-15T14:57:32Z","snapshot_observed_at":"2026-08-13T11:30:51.626332Z","submitted_at":"2023-05-28T13:16:03Z","title":"FuseCap: Leveraging Large Language Models for Enriched Fused Image Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17718","snapshot_observed_at":"2026-08-15T18:13:42.273111Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.273111Z"},"links":{"cited_paper":"/paper/2305.17718","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:c8681a2eb9bbd3dfb4b82f4d49936b7b401ad00df3aba530dd66a4d8059f9340","observation_id":"1a82cd5f-0bed-4b83-80e7-a9577800ad85","resolution":{"observed_at":"2026-08-15T18:13:42.273111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.834541Z","title":null,"venue":null,"work_id":"2265dba6-33f1-4096-8011-6aa109feb584","year":2022},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.277827Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:e5dfa71020dcf3789c5830cc04f851c96c79c8422572330150a00700af2cd2be","observation_id":"74178116-f38b-4157-a939-a836a8aa083e","resolution":{"observed_at":"2026-08-15T18:13:42.839054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-15T18:13:42.260731Z","title":"arXiv preprint arXiv:2204.06125 1, 2 (2022), 3","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.260731Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:41a296b8691591ca35ce3ee4e11ff4d010cd68943f503a57d06c5c342dcbcb1c","observation_id":"1111d075-90a0-4e14-bea7-26c7f339556c","resolution":{"observed_at":"2026-08-15T18:13:42.260731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00645","last_updated":"2024-12-31T20:53:45Z","snapshot_observed_at":"2026-08-15T05:40:13.549436Z","submitted_at":"2024-12-31T20:53:45Z","title":"SoundBrush: Sound as a Brush for Visual Scene Editing","version":1},"cited_work":{"arxiv_id":"2501.00645","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00645","snapshot_observed_at":"2026-08-15T18:13:42.420424Z","title":"SoundBrush: Sound as a Brush for Visual Scene Editing","venue":"cs.CV","work_id":"ae5f0ef0-4ca1-4755-8fe3-25a1539d199d","year":2024},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.287255Z"},"links":{"cited_paper":"/paper/2501.00645","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:75c7ebcade96cc0fe28efd6c7fe98da02a73351622e959867267134a6f2f267a","observation_id":"fc29233e-5e3b-4210-8b0c-81ac245f7d64","resolution":{"observed_at":"2026-08-15T18:13:42.427187Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.292419Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.292419Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:a2d7a4eaa8032f8f8fa9e83727ae31360e09e764f0e84b40eeef0ffd9841fdee","observation_id":"244e5cb2-34ff-4444-9c22-dc2742564d90","resolution":{"observed_at":"2026-08-15T18:13:42.292419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.301691Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.301691Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:fc7f34fd2d9e0cc6b4170f0114d779d8eafca47043b5834a5a50fd69cac8a7cd","observation_id":"0ed6f90d-7869-474f-aa02-24b2c7cd021a","resolution":{"observed_at":"2026-08-15T18:13:42.301691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-15T18:13:42.306094Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.306094Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:9cba2e219ef8c4363b1d79b336f5413620cf80a8a28899ccde5357fa9fad0793","observation_id":"45e5f480-ed2a-4b7a-a791-83cb7313b86e","resolution":{"observed_at":"2026-08-15T18:13:42.306094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.820161Z","title":null,"venue":null,"work_id":"8a6267df-106f-4b46-af62-8bbfd235c25c","year":2014},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.282434Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:d8c6684050f06f0d40e97157dc2e6c83aa03fe92abb0a67038cd1dbfb7bb7aff","observation_id":"fb8a7905-ac08-4385-9eaa-6abceab2cc0f","resolution":{"observed_at":"2026-08-15T18:13:42.824664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.316736Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.316736Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:50cb1626eb973f484f05f2526843bc40667c947c41ac3b3a4396fd66a07d3a94","observation_id":"c5a3ccac-dd21-4028-8884-13a1492c85ee","resolution":{"observed_at":"2026-08-15T18:13:42.316736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13050","last_updated":"2023-05-22T14:02:44Z","snapshot_observed_at":"2026-08-15T21:40:51.918000Z","submitted_at":"2023-05-22T14:02:44Z","title":"AudioToken: Adaptation of Text-Conditioned Diffusion Models for Audio-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13050","snapshot_observed_at":"2026-08-15T18:13:42.321168Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.321168Z"},"links":{"cited_paper":"/paper/2305.13050","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:43e0652a743ee96628387d97a98d32ebed3a8794e4c2b93939e0080bb6bf3b34","observation_id":"4ec3b67f-2025-4498-9bf0-861c79ff1164","resolution":{"observed_at":"2026-08-15T18:13:42.321168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.297121Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.297121Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:0626538befa62c75e119a68b021661f5ff187f409b1945e378910a7c7110c6de","observation_id":"755140ad-6731-475b-b5fb-8e7ed3892aed","resolution":{"observed_at":"2026-08-15T18:13:42.297121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.332089Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.332089Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:14272887773c1b4f6837595586f13b1e496039384f1e39b2c242263a3eb8337b","observation_id":"2ec3c1bc-07e1-4e1d-a7b1-f3aa4bd056f8","resolution":{"observed_at":"2026-08-15T18:13:42.332089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.746605Z","title":"dog” and “engine idling","venue":null,"work_id":"43584a06-940b-4b0c-b7f0-3d9e474f51cf","year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.336168Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:04988bb1513a7840adcff879dc3ae013e36129133cf76826c2edcb3f879cda59","observation_id":"f0478445-4a2e-498a-b0f2-30bd03a9eadb","resolution":{"observed_at":"2026-08-15T18:13:42.750979Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.778790Z","title":null,"venue":null,"work_id":"021d02c9-ed67-4aac-9a56-02950485abb2","year":2022},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.311659Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:b95f40a24151e5106f3407ffdbdb533fbfb3474a2dd21df2d867fdaa66dfb8d4","observation_id":"29279c59-0211-4e88-a2d5-e12f4f40b377","resolution":{"observed_at":"2026-08-15T18:13:42.783525Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05191","last_updated":"2024-11-14T21:26:33Z","snapshot_observed_at":"2026-08-12T23:47:39.048927Z","submitted_at":"2024-06-07T18:17:17Z","title":"DiffusionPID: Interpreting Diffusion via Partial Information Decomposition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05191","snapshot_observed_at":"2026-08-15T18:13:42.326931Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.326931Z"},"links":{"cited_paper":"/paper/2406.05191","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:69abe849883baa8e1e88091b54276cbea98c3e3315c1ae1454fde84a4b42216b","observation_id":"90d249d7-5694-41e2-9d27-f020e0ae7c58","resolution":{"observed_at":"2026-08-15T18:13:42.326931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01401","last_updated":"2021-01-14T05:36:59Z","snapshot_observed_at":"2026-08-13T06:40:48.610500Z","submitted_at":"2018-01-04T15:25:26Z","title":"Demystifying MMD GANs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01401","snapshot_observed_at":"2026-08-15T18:13:42.073419Z","title":"arXiv:1801.01401 [stat.ML] https://arxiv.org/ abs/1801.01401","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.073419Z"},"links":{"cited_paper":"/paper/1801.01401","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:28c68466bcdf51289565c5aaea0397feb0596afa7507e81e0c7b00649d20d399","observation_id":"86d882b3-9bdb-42f8-85d7-84ca607dc62e","resolution":{"observed_at":"2026-08-15T18:13:42.073419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09699","last_updated":"2023-08-17T21:43:24Z","snapshot_observed_at":"2026-08-13T17:05:26.904327Z","submitted_at":"2022-11-15T19:07:53Z","title":"PromptCap: Prompt-Guided Task-Aware Image Captioning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09699","snapshot_observed_at":"2026-08-15T18:13:42.145867Z","title":"arXiv preprint arXiv:2211.09699 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.145867Z"},"links":{"cited_paper":"/paper/2211.09699","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:998faa0c6e6e70fc67f4a23da45df183fb3004b8fa6c0ae68e4a765ff00795f1","observation_id":"1d5b2766-4c0d-461a-8934-0cef90e401ec","resolution":{"observed_at":"2026-08-15T18:13:42.145867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:13:42.117607Z","title":"InICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.117607Z"},"links":{"citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:43913549eddf945cd74724c70b5e0b565aaecd15077fa25803945afbde6736be","observation_id":"f77766c9-38e1-40fc-9e41-3f38b37a29bd","resolution":{"observed_at":"2026-08-15T18:13:42.117607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16406","last_updated":"2025-03-20T17:56:20Z","snapshot_observed_at":"2026-08-14T11:22:06.436292Z","submitted_at":"2025-03-20T17:56:20Z","title":"VerbDiff: Text-Only Diffusion Models with Enhanced Interaction Awareness","version":1},"cited_work":{"arxiv_id":"2503.16406","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.16406","snapshot_observed_at":"2026-08-15T18:13:42.672001Z","title":"VerbDiff: Text-Only Diffusion Models with Enhanced Interaction Awareness","venue":"cs.GR","work_id":"ffddf656-b711-404a-a0ca-d68dc8adadb1","year":2025},"citing_paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T18:13:42.091627Z"},"links":{"cited_paper":"/paper/2503.16406","citing_paper":"/paper/2507.18750"},"observation_digest":"sha256:fd08f36fb712edf582eb3317f48361cb52dbed9fc017cc1b62eee72679cfa218","observation_id":"732aa0ef-de5a-405d-8faf-cc94ada07170","resolution":{"observed_at":"2026-08-15T18:13:42.676848Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.18750","last_updated":"2025-07-24T19:01:05Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-15T18:47:44.892298Z","submitted_at":"2025-07-24T19:01:05Z","title":"CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":56,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2507.18750."}