{"as_of":"2026-08-12T13:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:70119dec2fb454898959d5e5d518ae943cc2c16024dca0e24dab26a411f25377","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:41:34.381968Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09529/citation-record","integrity":"/paper/2608.09529/integrity","json":"/paper/2608.09529/citation-record.json","paper":"/paper/2608.09529"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.106949Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.106949Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:51ada1402f12db9a390f92fd1b31fc4d04602e35c5be128bb1b4f35441ad4a27","observation_id":"5499e55c-4442-485c-a0ce-bd274fcb657b","resolution":{"observed_at":"2026-08-11T15:41:34.106949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.117045Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.117045Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:ae4cee0f8382e5ebbe32951be5382e3a78499ad4135869ff245db9f01efa1b68","observation_id":"7e1016fa-d14f-4487-a833-e02b546b800a","resolution":{"observed_at":"2026-08-11T15:41:34.117045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-11T15:41:34.121620Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.121620Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:24ee463447d50d5eaa01ef92310c8ff2089475a8ee31d76be178e90a366d06ec","observation_id":"54d3592b-0ec5-49dc-8047-bca52ce43250","resolution":{"observed_at":"2026-08-11T15:41:34.121620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00878","last_updated":"2024-05-01T21:43:57Z","snapshot_observed_at":"2026-08-06T15:18:41.938107Z","submitted_at":"2024-05-01T21:43:57Z","title":"SonicDiffusion: Audio-Driven Image Generation and Editing with Pretrained Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00878","snapshot_observed_at":"2026-08-11T15:41:34.126404Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.126404Z"},"links":{"cited_paper":"/paper/2405.00878","citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:cfe276325708d159178ad42bdac35a3550bf90b2559a2a2deede5bea53b4ed73","observation_id":"77c8da77-0574-4eaa-bfe3-c6507eb04917","resolution":{"observed_at":"2026-08-11T15:41:34.126404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:35.399593Z","title":null,"venue":null,"work_id":"d9abb608-6f37-41c5-bd9a-4f5a96377b08","year":2021},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.131345Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:5aa480500ac4cedb9ab8388173511c26cc08b78932749d9286dfe7498c28445d","observation_id":"1f347c07-c602-4f2c-9057-c1e130551bbe","resolution":{"observed_at":"2026-08-11T15:41:35.403358Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:35.387412Z","title":null,"venue":null,"work_id":"0a2f19c5-bfc7-4d0a-b2ef-8484bb9e8506","year":2020},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.136526Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:111941458196fa212f29002a719a2d47f6cf7fd2e9b54838be46c7457decb796","observation_id":"c7f64e7b-04f9-4c96-b155-f6ad8df9f481","resolution":{"observed_at":"2026-08-11T15:41:35.391346Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.141840Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.141840Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:5650695f2ff5fdc196de2bac35716bd59426ca7651562d9310371e9f7e720182","observation_id":"7d258208-eb36-4d96-9d87-f42ae61d879b","resolution":{"observed_at":"2026-08-11T15:41:34.141840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-11T15:41:34.147229Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.147229Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:9b9511339f676143b577ba95970a292b387659f1caa51d7713276d4f23a563b0","observation_id":"9b954811-bcdf-4f68-98ca-badcb11de8cf","resolution":{"observed_at":"2026-08-11T15:41:34.147229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-07T11:48:17.343481Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01111","snapshot_observed_at":"2026-08-11T15:41:34.152062Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.152062Z"},"links":{"cited_paper":"/paper/2506.01111","citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:a6758a02c87264af07a671da404afb6e29bb2333604f053a616771bcaa2da755","observation_id":"81f7bfc2-eef1-4023-80a4-976ee2762f86","resolution":{"observed_at":"2026-08-11T15:41:34.152062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08729","last_updated":"2026-06-29T11:45:55Z","snapshot_observed_at":"2026-08-11T14:25:55.811264Z","submitted_at":"2026-05-09T06:32:54Z","title":"Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.08729","snapshot_observed_at":"2026-08-11T15:41:34.156810Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.156810Z"},"links":{"cited_paper":"/paper/2605.08729","citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:fb1e13752b277ed7f90616f001cac60e1e2ce9ccf5250d74edb45891220c7fe7","observation_id":"81131255-de76-44bc-adcd-a2201c8416e7","resolution":{"observed_at":"2026-08-11T15:41:34.156810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-11T15:41:34.161186Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.161186Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:36738494ab7ab4bb2a0f960b68c9541e0bba55e07986638088f3aa33ae18831c","observation_id":"407959c6-c6ae-48f5-8ce6-4c796e047570","resolution":{"observed_at":"2026-08-11T15:41:34.161186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15807","last_updated":"2023-09-27T17:30:19Z","snapshot_observed_at":"2026-08-02T11:54:13.342379Z","submitted_at":"2023-09-27T17:30:19Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15807","snapshot_observed_at":"2026-08-11T15:41:34.165702Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.165702Z"},"links":{"cited_paper":"/paper/2309.15807","citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:c4fddc81237c86d4be35c8dbff89c448e5b1cefa5cbeda4031c945d578ad775b","observation_id":"445908df-85c5-4b6e-8f1c-177512540198","resolution":{"observed_at":"2026-08-11T15:41:34.165702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:35.367349Z","title":null,"venue":null,"work_id":"3b481199-d910-4fd4-b5a9-10b1063837ff","year":2003},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.169825Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:dbb03341f96f9dbe9f1d41101f880c4554b008148a76045cf37145499da38b07","observation_id":"44a65de6-7316-4f2d-bf81-582b7ea5dc66","resolution":{"observed_at":"2026-08-11T15:41:35.371299Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.174885Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.174885Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:434dab3b97d4b74940e4ffd377088e2081a6816b946f0c6f41d58b4a9812164b","observation_id":"170ce7ee-8829-44a9-b2ec-0311c63bab55","resolution":{"observed_at":"2026-08-11T15:41:34.174885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.178845Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.178845Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:dcff70be2023f2798cf00dc5ed5577d3796079b037b3ac21fb189609c072d826","observation_id":"7ab50835-eb3a-444c-92f0-63f2e4bfdd6c","resolution":{"observed_at":"2026-08-11T15:41:34.178845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:35.335546Z","title":null,"venue":null,"work_id":"e9b719da-596d-4ab1-829c-0f27d0cecdfe","year":2025},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.182233Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:a6f8cc6dbb080b0bea49392e87ad2a9b0c5854a623bf0f79414b8de6b0e8daec","observation_id":"fdfeec41-52cb-4c17-ab5e-f51637f8aae6","resolution":{"observed_at":"2026-08-11T15:41:35.340192Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.185572Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.185572Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:7e70d682c0b12995c154d84cef9e111ec62225afc4bd77ba58ed7ed6b785e83c","observation_id":"085e0dd4-a64a-4cbc-9805-7e14955564b2","resolution":{"observed_at":"2026-08-11T15:41:34.185572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.191958Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.191958Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:2a3cef04c53f245a715c46c6c95637e52f6dae6b3609c1fb59e0fc1c5b90cd96","observation_id":"b158ec18-97bb-4b2a-bbd7-8c095c677568","resolution":{"observed_at":"2026-08-11T15:41:34.191958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-08-11T15:41:34.195746Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.195746Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:1f8b6eb243a653fdaa63198cfcba116921738d44ec9b4d0544175bce110debe1","observation_id":"51445caf-5a85-41d0-afb7-0efef22bf28f","resolution":{"observed_at":"2026-08-11T15:41:34.195746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:35.304980Z","title":null,"venue":null,"work_id":"3356bc72-74ec-4198-b9a6-bc71b87a66b6","year":2026},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.202252Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:20e55b0ee441202b2dfa80fefd1b202a27fc0588cd8fd1d163c48229686fae31","observation_id":"05a2c0ef-b839-4460-b0bb-414505746313","resolution":{"observed_at":"2026-08-11T15:41:35.310410Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:35.291697Z","title":null,"venue":null,"work_id":"c2227b75-11ff-431f-8485-edc8aa4b930a","year":2025},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.223442Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:1e2181cc93c0ac0d1cc0d8c645860acbedafb79e18125bacf5a2258d6289d5f4","observation_id":"c0e26a85-064d-4ffb-bf78-a034169f0d44","resolution":{"observed_at":"2026-08-11T15:41:35.296132Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:35.279328Z","title":null,"venue":null,"work_id":"56f10391-4843-421c-80f0-e341ae5b0760","year":2022},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.227907Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:e6fcdb710d9a671273505fcf413741f5dc7d358b4631d176fb88923c4de3da4e","observation_id":"47d65d10-c76a-4f9e-8db1-8db6158f11fc","resolution":{"observed_at":"2026-08-11T15:41:35.283319Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.233176Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.233176Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:77607bf46a1069d37bc8d48ce8b63c5d4faaae2c95b9e223c0b3596a99866390","observation_id":"0a176863-2ca2-4c67-8b38-1b3a937649ec","resolution":{"observed_at":"2026-08-11T15:41:34.233176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:35.257995Z","title":null,"venue":null,"work_id":"4cbf1692-121f-4a2c-8bb6-f25db0177894","year":2022},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.237280Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:0276913ea833f9dc804bee7879bf18a2daa166369a1f3f11a7df5ea298b30015","observation_id":"ed524262-779f-452a-aa52-7855b4c1be89","resolution":{"observed_at":"2026-08-11T15:41:35.261879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2025-737","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.416338Z","title":null,"venue":null,"work_id":"071448e4-5331-45e7-ae33-b3d49515bf30","year":2025},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.241666Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:ad25c1013468627479a55703c8857ee9f80a458a707ae2523c9f735a9de232c3","observation_id":"48d333c0-3f15-4fb8-93cb-f3b4b4fe15c9","resolution":{"observed_at":"2026-08-11T15:41:34.422290Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:35.244247Z","title":null,"venue":null,"work_id":"160d5015-4b1c-4f36-89f0-22ad0123e8ad","year":2024},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.246374Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:78e7b6181c853f8475173082caeff068b2b41316d5f58a66d2ed80dc0242bad3","observation_id":"529399a4-06e1-420c-977a-77791d751c37","resolution":{"observed_at":"2026-08-11T15:41:35.248327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-11T15:41:34.251401Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.251401Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:97b606b01accb6122f42399bbe010a2f02546ffddc67ae03b65510b6efddf569","observation_id":"5881b4de-0b83-4946-9684-cdc6ca2e0973","resolution":{"observed_at":"2026-08-11T15:41:34.251401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.256085Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.256085Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:f9cd71442a9c9eb98100039f6cd6ebc18e17fac1ab980f022a48a377001e4f7c","observation_id":"0580e7e2-d925-4381-b93b-d9ef06abf2a6","resolution":{"observed_at":"2026-08-11T15:41:34.256085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:35.221805Z","title":null,"venue":null,"work_id":"5b539693-57fc-449c-a8a1-060f2ce2c496","year":2016},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.260375Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:d4b67afca7e398293b5939b1bb7e91a37340cb29348cd46baf111674139854ae","observation_id":"3114ed37-9df1-4fda-b656-cc91ef055d32","resolution":{"observed_at":"2026-08-11T15:41:35.227361Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.264355Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.264355Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:784b293cf7a7ba67e07a3926bad3c34215020446763fe64163722518a437a585","observation_id":"c02742d9-3e0c-45fc-b9a8-24c9ffe28e52","resolution":{"observed_at":"2026-08-11T15:41:34.264355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:35.198495Z","title":null,"venue":null,"work_id":"891f6e4b-cbe3-4c21-81bc-1e36a27f5537","year":2023},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.268402Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:6e0856b071fc7174e012a5a833460605cb0329175736deb065ac2a225dc46dd6","observation_id":"996eb128-6663-429c-a08d-09ed058974a5","resolution":{"observed_at":"2026-08-11T15:41:35.203076Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.272510Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.272510Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:9c28c345cfe2a45fd002ca7860ffba86a4492db146bb0dad1ae8d3de041d13fb","observation_id":"285cf977-bf1b-4acb-b96e-aabff348d07e","resolution":{"observed_at":"2026-08-11T15:41:34.272510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.276452Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.276452Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:17e37989e086fc18d6b10dfb0326688ffad6258c22f1767b400c258c444773c9","observation_id":"c544954d-47fa-487f-901c-17aba8c82d8d","resolution":{"observed_at":"2026-08-11T15:41:34.276452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.280600Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.280600Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:fd16fd841fa85f9e3e28a10aba397e0e521fe5a8eed0309b1beb5aa5e7fc325b","observation_id":"b5435a5d-54f9-42ea-a39f-2c32235422e8","resolution":{"observed_at":"2026-08-11T15:41:34.280600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:35.169204Z","title":null,"venue":null,"work_id":"2bb64c31-ead6-4537-a3b9-379634ba20f5","year":2023},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.284566Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:1bfe70ed5ba34781d1e4acc3f8131c13f638101c363bcf71edea9d46316a7850","observation_id":"8b61f7b0-894b-45bb-817c-5084ad65406b","resolution":{"observed_at":"2026-08-11T15:41:35.174848Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.288493Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.288493Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:44b0e8fc19f3109dc0c6c191142c7b59d55166102426d400079b9af5be95d1d9","observation_id":"b94af2fb-3928-47b3-abdf-9f2d7a1a054e","resolution":{"observed_at":"2026-08-11T15:41:34.288493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:35.148560Z","title":null,"venue":null,"work_id":"1637966c-6dc1-4c06-a07f-1a01856ab8d8","year":2025},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.292361Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:ce92963fb6191963448ac6f2a5010ee543ef1da509e2274a1bc5b3b996abbb0c","observation_id":"8eaed4ba-c82c-49fc-9570-f147d7200303","resolution":{"observed_at":"2026-08-11T15:41:35.152737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.297516Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.297516Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:3e31d7cac24a9ddd59c4392de0c0cc0ffc4d8260a25f0fab7753fe4f521c3383","observation_id":"be5bf654-8cbe-4ad3-9153-98eccb2f164f","resolution":{"observed_at":"2026-08-11T15:41:34.297516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.22905","last_updated":"2026-06-30T08:27:33Z","snapshot_observed_at":"2026-08-05T18:57:39.905774Z","submitted_at":"2026-06-22T06:41:17Z","title":"InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.22905","snapshot_observed_at":"2026-08-11T15:41:34.302159Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.302159Z"},"links":{"cited_paper":"/paper/2606.22905","citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:686ed4379de4a86feef5c0edeb54bc7043a28021d12f49a25d21451f7247b1cd","observation_id":"49af4d98-5205-44f9-89f9-27b18638e561","resolution":{"observed_at":"2026-08-11T15:41:34.302159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.04838","last_updated":"2020-08-11T16:37:59Z","snapshot_observed_at":"2026-08-12T09:32:09.643958Z","submitted_at":"2020-08-11T16:37:59Z","title":"TransNet V2: An effective deep network architecture for fast shot transition detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.04838","snapshot_observed_at":"2026-08-11T15:41:34.307150Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.307150Z"},"links":{"cited_paper":"/paper/2008.04838","citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:90797cd0c730805d699e2d88ab68af6a2b10c1c86793093e474cb2d82535ddd5","observation_id":"72ffc7f8-406c-4ebc-8961-f11d36e33b6d","resolution":{"observed_at":"2026-08-11T15:41:34.307150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:35.132815Z","title":null,"venue":null,"work_id":"adb46825-0c4d-4fde-8567-353919c1bf74","year":null},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.311858Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:8210a383b8af324b8bc6ed6c51b36c216408fedd121040585ccec3c2b932c78c","observation_id":"b3ef91ca-ce95-4f76-b966-c5dd5866864d","resolution":{"observed_at":"2026-08-11T15:41:35.137389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:35.098409Z","title":null,"venue":null,"work_id":"4375dad2-136e-4481-9876-b1663bf9a573","year":2023},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.321229Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:3e3540cdb91f1f399f69eaf6b065a874f04211cf166f09936c0634e934677956","observation_id":"ac2da736-ac44-45da-bf7c-b87ffbb70170","resolution":{"observed_at":"2026-08-11T15:41:35.102644Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.325382Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.325382Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:1893c046ea0f1ce5466711d08de5e190bcd6a322e044f5ca090d6451d94f8544","observation_id":"06941a77-2e5c-418b-8df4-ee7edef33f36","resolution":{"observed_at":"2026-08-11T15:41:34.325382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:35.070543Z","title":null,"venue":null,"work_id":"3189137d-ba5d-4653-86b1-ad0387573a25","year":2025},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.329856Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:42ea7d7602d0f318da86536112f83e10f2071af5be136e318c76378e66734165","observation_id":"445351ab-91db-4c6e-b5e2-ffdb4e3c8056","resolution":{"observed_at":"2026-08-11T15:41:35.076228Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.334245Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.334245Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:ec1a370388f0e1ea1c88dff7ea537761976000de500add86cecbb7edec803ecf","observation_id":"a761130c-9057-4301-afa8-f83b212722c5","resolution":{"observed_at":"2026-08-11T15:41:34.334245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:35.044787Z","title":null,"venue":null,"work_id":"559e94b2-626a-4a72-b5fc-1369929b0764","year":2023},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.338582Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:a75acc079ddfa84fd2a501a58cbd8cca9f84cfe31983ce36db87e19e7912e538","observation_id":"8fe144ba-39ec-4501-b027-5122f5c9f762","resolution":{"observed_at":"2026-08-11T15:41:35.050662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-11T15:41:34.343280Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.343280Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:383a35ae56a56fc49fab427f6d25963b3e1e1c15dbc4aa4743bc0a9cbbd260e7","observation_id":"c0db9894-a99d-4c82-8c84-6694902529e0","resolution":{"observed_at":"2026-08-11T15:41:34.343280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13050","last_updated":"2023-05-22T14:02:44Z","snapshot_observed_at":"2026-08-10T18:16:31.886419Z","submitted_at":"2023-05-22T14:02:44Z","title":"AudioToken: Adaptation of Text-Conditioned Diffusion Models for Audio-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13050","snapshot_observed_at":"2026-08-11T15:41:34.347508Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.347508Z"},"links":{"cited_paper":"/paper/2305.13050","citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:e7405ef4490836ae3f00eb4fbc6d81087b46c5ea0958738140147064d5d32dfa","observation_id":"aef01029-75b3-4962-9c29-7563eb6c0a20","resolution":{"observed_at":"2026-08-11T15:41:34.347508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-11T15:41:34.352108Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.352108Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:041dd1757707754e24d749762ab8802a51ad541c8a60bd180ad02bd0cdd1e2ce","observation_id":"e1a51c55-39ff-4bbf-bb94-bdbf3ca4cc5a","resolution":{"observed_at":"2026-08-11T15:41:34.352108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-08-11T15:41:34.355920Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.355920Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:8c3e07ec1a0e2159d62bfc7e078a24dcf5df8f07ce65f60f3de575d2559ab14e","observation_id":"1e3c2a70-445c-49fa-a886-e9efa78515e5","resolution":{"observed_at":"2026-08-11T15:41:34.355920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-05T19:10:38.526074Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"cited_work":{"arxiv_id":"2508.12918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.12918","snapshot_observed_at":"2026-08-11T15:41:34.547908Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","venue":"cs.SD","work_id":"7520e9f4-1c5c-4daf-9e06-f7e3f1da1f27","year":2025},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.359873Z"},"links":{"cited_paper":"/paper/2508.12918","citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:81b9001831f6eb5466104544f75f9f811e6ac315d332670bb08b09299f7c5b6a","observation_id":"6173af98-3b2e-4a96-9062-41097d0cc30c","resolution":{"observed_at":"2026-08-11T15:41:34.554124Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:35.028860Z","title":null,"venue":null,"work_id":"ee3ed760-e63a-484d-b49e-43e0b30fc675","year":2025},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.363774Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:9de014a1285dfaa23e8d60f0ffe69668d538ddd9f0443dd6b0e40a3af6aeafc8","observation_id":"33e7086b-aa82-4375-83bf-94946de8c5eb","resolution":{"observed_at":"2026-08-11T15:41:35.033078Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.10287","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.525155Z","title":null,"venue":null,"work_id":"1883a32f-e072-4233-b8f0-515bb8991ab4","year":2025},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.367982Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:5c32c9b3d90c64a340fdd8a99ed74d9758c5907dd9089ffd45a9dfcb86b4e55e","observation_id":"8ceabb6b-f3d7-4e72-bc19-07aedac7bb3a","resolution":{"observed_at":"2026-08-11T15:41:34.532298Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14099","last_updated":"2026-06-03T04:57:11Z","snapshot_observed_at":"2026-08-09T17:09:38.671248Z","submitted_at":"2025-12-16T05:15:07Z","title":"ViewMask-1-to-3: Multi-View Consistent Image Generation via Multimodal Discrete Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.14099","snapshot_observed_at":"2026-08-11T15:41:34.372388Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.372388Z"},"links":{"cited_paper":"/paper/2512.14099","citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:9ae86d1b834da4cebf38a39b2b24bc57d329e3397796fec6b2badfee9107d955","observation_id":"8ac456d1-b78b-402b-b432-68c7559eafbe","resolution":{"observed_at":"2026-08-11T15:41:34.372388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:35.005059Z","title":"silent frames","venue":null,"work_id":"c512f38a-9a13-4bcf-b8a2-52a68ee4899f","year":2025},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.377167Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:36b821765144b9793111a2a97e3869db38c8fb7a60eb518fa0eeff9235507586","observation_id":"d44e608b-7bd0-49d1-8b02-933e5ccad5ec","resolution":{"observed_at":"2026-08-11T15:41:35.015532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.988245Z","title":"the sound of a vehicle driving","venue":null,"work_id":"2c1d4648-a0dc-472d-9dbd-26d2a64a917f","year":2026},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.381968Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:39a5768de78637164aba5b6efe65a4a065f145b08aed18143af344e0153d6c4f","observation_id":"9bd2df92-e91e-4ca8-aa53-5fa0a9f34f8e","resolution":{"observed_at":"2026-08-11T15:41:34.992918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:35.114830Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"4f820c04-29e4-4d15-b2c5-c4e4a2b0272e","year":null},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.316499Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:a3c89a96ed59bbeed17a15471b2a2fa9963b8df1b0470dbcc1c4a8b74d4dcf0e","observation_id":"f7eef15a-5a49-4d27-a3b0-31cd6b8af678","resolution":{"observed_at":"2026-08-11T15:41:35.119557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:34.112150Z","title":"In Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.112150Z"},"links":{"citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:ac56e95064847ff242041a4300d7ac6c7614e86cc3ab61939f89a459825b85cf","observation_id":"dbdff0f5-4c34-4ab9-b1ad-5ccd20273336","resolution":{"observed_at":"2026-08-11T15:41:34.112150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T13:20:29.717401Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":3,"verified_fuzzy":3},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2608.09529."}