{"as_of":"2026-08-12T10:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:79c4d944465b702cf5f3d311b7e95397670a4d46c41e4ad3a28969ecf2e4cd52","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:43:01.110656Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:38:08.339998Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T20:27:03.913459Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10768","snapshot_observed_at":"2026-08-11T11:38:08.339998Z","title":"Vintage: Joint video and text conditioning for holistic audio generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.339998Z"},"links":{"cited_paper":"/paper/2412.10768","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:cc67ec4ee6c226862eb5dcce3ae161ac6f0667a98f5811e3a71b5c73a1f0bab7","observation_id":"52d52cb8-48a5-4be9-989e-07211047f4bf","resolution":{"observed_at":"2026-08-11T11:38:08.339998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"cited_work":{"arxiv_id":"2412.10768","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10768","snapshot_observed_at":"2026-08-10T20:27:03.913459Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","venue":"cs.CV","work_id":"295e9cb8-fe32-46aa-adfe-26f0070a5720","year":2024},"citing_paper":{"arxiv_id":"2501.08587","last_updated":"2025-01-15T05:15:54Z","snapshot_observed_at":"2026-08-10T20:31:37.646062Z","submitted_at":"2025-01-15T05:15:54Z","title":"Sound Scene Synthesis at the DCASE 2024 Challenge","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:27:03.773063Z"},"links":{"cited_paper":"/paper/2412.10768","citing_paper":"/paper/2501.08587"},"observation_digest":"sha256:1107203882829bbdbf74668bbba2ae6d069370cabf776d2954baf81b3d409354","observation_id":"eaa0d4c0-e44a-4942-bc74-9a9d04cb9093","resolution":{"observed_at":"2026-08-10T20:27:03.921470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.10768/citation-record","integrity":"/paper/2412.10768/integrity","json":"/paper/2412.10768/citation-record.json","paper":"/paper/2412.10768"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:02.013351Z","title":"The Foley grail: The art of perform- ing sound for film, games, and animation","venue":null,"work_id":"c1eb00b3-9d94-4d75-be91-982581e585ef","year":2014},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.831775Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:f1178e2f644c7abd9993427a4b312e26af85802d7c869c3078fee10643841dac","observation_id":"dd153951-d89a-4a29-895b-f5070adee5ff","resolution":{"observed_at":"2026-08-11T15:43:02.018261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.998028Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"972431fb-ada0-489f-a08e-3eb4a3e27583","year":2023},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.837425Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:56629e8c510998ce989e5bbfd850508ebbaaece4be605857c3e2fa4dcb7be9cd","observation_id":"cc69f13e-4ca3-4858-a248-4a172f5a6604","resolution":{"observed_at":"2026-08-11T15:43:02.003279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:00.842354Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.842354Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:d2bfffb8e76850e9d3fba2b508549995d10f13a54b5c85222bad08144c3b4bb4","observation_id":"394a27a7-aabb-408b-ba07-37715ce35c5e","resolution":{"observed_at":"2026-08-11T15:43:00.842354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.973800Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"8b6e2c89-0f5a-430e-8a30-1366528e73ce","year":2020},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.847396Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:e96d21c446a54a1825524e54925b7fb1842d6262fe427df400c897c200f7795d","observation_id":"0963105e-5194-4970-b34c-0f821db9a0f4","resolution":{"observed_at":"2026-08-11T15:43:01.978661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.958815Z","title":"Gentron: Diffusion trans- formers for image and video generation","venue":null,"work_id":"0980d292-3af1-407a-b962-660f35cbdba6","year":2024},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.852162Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:2bffc68b01ddee2aebd8126b7cdff5f5bfde74ae967c400159b4b5b35b35367a","observation_id":"1f456e97-c8d9-4bed-a688-96db9796cdd3","resolution":{"observed_at":"2026-08-11T15:43:01.963716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.944345Z","title":"Audio-vision: sound on screen","venue":null,"work_id":"aabf273d-d68a-4472-9de2-cd9942fddd73","year":2019},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.856979Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:a2d3f2110f207f2694c25335586e8bae1247176178e578c3de1ff6024180641f","observation_id":"7504d809-a4a5-4610-a200-d4f02bb44391","resolution":{"observed_at":"2026-08-11T15:43:01.948849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.928394Z","title":"Scaling instruction- finetuned language models","venue":null,"work_id":"422c1fdb-d872-4cf0-ab6f-d6443d099c09","year":2024},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.861754Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:ce20a01dab17c91e15ea6537c91e20e5dab2937af2fa678696cfe2bb8bbcd8df","observation_id":"42357cef-9a0e-4976-b4d7-37d60620d868","resolution":{"observed_at":"2026-08-11T15:43:01.933714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T15:43:00.867260Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.867260Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:cdba7f73e34df825655fe6c187b4edc3304f74c2879015fb5d0c2c66eb97a306","observation_id":"70a28615-c939-412f-addc-4ce07851924a","resolution":{"observed_at":"2026-08-11T15:43:00.867260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-11T15:43:00.877098Z","title":"Lumina-t2x: Trans- forming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.877098Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:af532ccb37b21cfbdb4fe1eccc0f51945d8a75475c5db8adfff3bb3aa9d786ca","observation_id":"b5e1b2c8-5007-4e4c-a5a6-da577476013d","resolution":{"observed_at":"2026-08-11T15:43:00.877098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-10T11:18:06.491859Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-11T15:43:00.881954Z","title":"Text-to-audio generation using instruc- tion tuned llm and latent diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.881954Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:bde10b4a58e39f5ad783c183bd7294ae084e0a4f8273cf0456cb3859119d5d56","observation_id":"f9bd243d-5c75-4739-afa0-c72c3a3200c4","resolution":{"observed_at":"2026-08-11T15:43:00.881954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.912540Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"96f21507-6df3-4690-805f-058de8d5ec3c","year":2023},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.887089Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:6ca59ecf0faf68d4eed21135ea9ff30fb4119eb0bc39b24aad45baaaa4e34e86","observation_id":"b0a8ec89-425b-4bb6-824d-e9428d88aac6","resolution":{"observed_at":"2026-08-11T15:43:01.917393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.897846Z","title":"Determining op- tical flow","venue":null,"work_id":"6ac4918b-ccd3-499a-abb0-980436c0f69f","year":1981},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.891837Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:65f85e10a33c52002e79893540f15393e2255dc9752792899de363b0ba9a76db","observation_id":"fe58a50c-5079-4ba4-9d18-971491a11c80","resolution":{"observed_at":"2026-08-11T15:43:01.902604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.881829Z","title":"Make-an-audio: Text-to-audio gen- eration with prompt-enhanced diffusion models","venue":null,"work_id":"15cca3a2-6357-4883-968b-ddb875e87dd7","year":2023},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.896690Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:5ee720dbcce913767239caa6899393bd87ca4d0789899d014dc59f577198fc6b","observation_id":"81536570-f0b8-4950-ab39-2777285f32f3","resolution":{"observed_at":"2026-08-11T15:43:01.887430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.865982Z","title":"Captivating sound","venue":null,"work_id":"d13ec1a8-736e-4f94-8e7d-da09ecd0dc81","year":2010},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.901474Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:aa568039b239c2b85d4218140b90e22b1b4604d109fadd6ea8dbd7ff5d13000f","observation_id":"3a79237d-0f2d-4eb2-b0a3-fc343e6218b1","resolution":{"observed_at":"2026-08-11T15:43:01.871039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.850722Z","title":"Taming visually guided sound generation","venue":null,"work_id":"eaf8db20-112d-4f7a-ad1b-25a2881e6d8d","year":2021},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.906290Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:8a24d5bded9653e47d0c1603e4ffca90e2d57c8443b5112badd6d5740f1d0f90","observation_id":"43da5ea3-8cb9-4f97-b8a6-e16b0aee59ba","resolution":{"observed_at":"2026-08-11T15:43:01.855536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.835004Z","title":"Mixing audio: concepts, practices, and tools","venue":null,"work_id":"436e8012-3c63-45e2-98c2-ee0ea44fadb7","year":2017},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.911140Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:67dfd81189a9ff689832063960b0fdd2853a98b5ba363d836ad7961bdcb47d0a","observation_id":"7bbc4dc9-61b1-4ad3-812f-df8ad7362d2c","resolution":{"observed_at":"2026-08-11T15:43:01.839857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.820039Z","title":"Read, watch and scream! sound generation from text and video","venue":null,"work_id":"55d9f301-94c5-4b1b-9f7d-17c45217799c","year":2024},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.915875Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:934b309b70ca679d8950b720e6d8a29c9cea587d074f06abe42560fa99f51829","observation_id":"2432f03f-54a6-4d14-abc8-427a56b07f0c","resolution":{"observed_at":"2026-08-11T15:43:01.825042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-08T16:07:44.435146Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-11T15:43:00.920633Z","title":"Fr \\’echet audio distance: A metric for evaluating music enhancement algorithms","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.920633Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:8e38ee57afa0c4932dc316dcdc2dea04ba17db64c9ff75a35c9071765e4a7afa","observation_id":"f01f30cf-82ef-45fb-bb91-d7747fc80aba","resolution":{"observed_at":"2026-08-11T15:43:00.920633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.805071Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fi- delity speech synthesis","venue":null,"work_id":"f049a374-059d-4d11-9841-774105c21fb1","year":2020},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.925539Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:71bcea49045387bb9f0389da95a4bc8a71068d66c774136417e7bbe460b6bf19","observation_id":"3133d9e4-9647-48bd-bcd2-f71ab0d354f0","resolution":{"observed_at":"2026-08-11T15:43:01.810087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-07T16:54:38.689558Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-11T15:43:00.930103Z","title":"Audiogen: Textually guided audio gen- eration","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.930103Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:fec86e206a27c5d9669d4847bfdf21b98f3f32c2223800412fc843983d66f80d","observation_id":"75b0328f-621c-491d-a3ed-870cadf9102b","resolution":{"observed_at":"2026-08-11T15:43:00.930103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11299","last_updated":"2024-10-15T05:37:22Z","snapshot_observed_at":"2026-07-06T19:33:39.134036Z","submitted_at":"2024-10-15T05:37:22Z","title":"Diff-SAGe: End-to-End Spatial Audio Generation Using Diffusion Models","version":1},"cited_work":{"arxiv_id":"2410.11299","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11299","snapshot_observed_at":"2026-08-11T15:43:01.298056Z","title":"Diff-SAGe: End-to-End Spatial Audio Generation Using Diffusion Models","venue":"cs.SD","work_id":"02acf062-b358-4a8a-b593-49c7fdbe302c","year":2024},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.935561Z"},"links":{"cited_paper":"/paper/2410.11299","citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:0caf89d2cc96e4d67c01e6ee16d05f19b75ec03c921eeb4ec95a5463f1e1a719","observation_id":"38d1f91e-193d-48cb-a0d1-73980d2d4881","resolution":{"observed_at":"2026-08-11T15:43:01.305284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.788171Z","title":"V oice- box: Text-guided multilingual universal speech generation at scale, 2023","venue":null,"work_id":"e1b938f2-90c2-467e-a00c-ab777621cc1f","year":2023},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.940625Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:7f94f12c31edacca2a2886f62984f8e9e30f7959f5530a09532e2a82601af5a8","observation_id":"b8b58e80-68ad-478f-a8f0-d83a2c93cfa3","resolution":{"observed_at":"2026-08-11T15:43:01.793935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-11T15:43:00.945415Z","title":"Flow matching for generative mod- eling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.945415Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:c7bdc7d026c10323ff910fe9f49454dfb6b2b2089cc85fff40a8f636e03c651e","observation_id":"67ef12d0-af5a-4b55-9d23-416a97f5b652","resolution":{"observed_at":"2026-08-11T15:43:00.945415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.771771Z","title":"Audi- oLDM: Text-to-audio generation with latent diffusion mod- els","venue":null,"work_id":"620d32a9-58e4-4f32-a320-887ea0746161","year":2023},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.950472Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:0f41b8348ec3ec30267b5a1a038daec049c0210987a6a1756329028f322ad4a0","observation_id":"bddc6b1e-a04d-4b05-a33e-ea5dabcbdd7d","resolution":{"observed_at":"2026-08-11T15:43:01.776837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12266","last_updated":"2025-06-03T03:00:01Z","snapshot_observed_at":"2026-08-12T08:11:22.772822Z","submitted_at":"2024-10-16T06:06:30Z","title":"FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12266","snapshot_observed_at":"2026-08-11T15:43:00.955420Z","title":"Flashaudio: Rectified flows for fast and high-fidelity text-to-audio generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.955420Z"},"links":{"cited_paper":"/paper/2410.12266","citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:fa54a77fc9e6bc1ae9120f01e94442779a007302266241d63c608a1d878ea60d","observation_id":"78e9addd-a28d-476c-9917-4230865d43b7","resolution":{"observed_at":"2026-08-11T15:43:00.955420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.753820Z","title":"Plumbley","venue":null,"work_id":"5f12e476-8919-42a0-ba60-bece9e077ce2","year":2024},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.960680Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:3edaf01b93acd7e9a15bf07312be8595c1e730335891c6750d794880badda1ad","observation_id":"a8892f56-768c-46bc-bfca-c8d4807d0c24","resolution":{"observed_at":"2026-08-11T15:43:01.759012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-11T15:43:00.965632Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.965632Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:109480406ee92e5de406751c5645cc68e0a2cfa141fc08fa65c996b1e65f6f3b","observation_id":"8fcadfb4-164f-4c07-b2e9-6d9c8ec496b8","resolution":{"observed_at":"2026-08-11T15:43:00.965632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05037","last_updated":"2024-12-01T15:17:03Z","snapshot_observed_at":"2026-07-06T16:04:26.461227Z","submitted_at":"2023-08-09T16:09:44Z","title":"Separate Anything You Describe","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05037","snapshot_observed_at":"2026-08-11T15:43:00.970707Z","title":"Separate anything you describe","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.970707Z"},"links":{"cited_paper":"/paper/2308.05037","citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:8b5fe9e011f7612e1d1ed9c02c7d91d9b1730e3a1806c52bd7a987f19c5e5d82","observation_id":"78d0d2b7-7e5e-410d-935a-c9cac5453cd8","resolution":{"observed_at":"2026-08-11T15:43:00.970707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.738590Z","title":"Diff-foley: Synchronized video-to-audio synthesis with la- tent diffusion models, 2023","venue":null,"work_id":"4c19a174-1a79-4e5a-ae8f-849f1bd54fbc","year":2023},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.975676Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:0a6aee3fa057208e1834013d45c9fda3cf2a7f7bd2c343e0565ea70066c86cf0","observation_id":"8d314d68-d31e-46f1-b28a-60ad9c7dd7e9","resolution":{"observed_at":"2026-08-11T15:43:01.743876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.722767Z","title":"Albergo, Nicholas M","venue":null,"work_id":"a6c9f6ba-a3c4-426b-971a-5e8db2e5a094","year":2024},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.980418Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:99c6a810ba33c9ffab14aa97833b99b6c4d4f62374b01f4dc9843f7842454ead","observation_id":"19bb9429-a598-4d77-8b51-38262cfc3520","resolution":{"observed_at":"2026-08-11T15:43:01.727746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.705623Z","title":"Tango 2: Aligning diffusion-based text-to-audio generations through direct preference optimization, 2024","venue":null,"work_id":"ae0e1668-1c95-49f6-a9c5-e6aad22ada9b","year":2024},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.985150Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:9f07593f2d954a238d9a5ac07e61f4d98f93e0e048dc503301f5d993d15a628b","observation_id":"3c02fe20-b9e2-4a7f-9b7a-4668f091d418","resolution":{"observed_at":"2026-08-11T15:43:01.710578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.07837","last_updated":"2017-02-11T20:04:46Z","snapshot_observed_at":"2026-07-06T05:23:56.789662Z","submitted_at":"2016-12-22T23:28:47Z","title":"SampleRNN: An Unconditional End-to-End Neural Audio Generation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.07837","snapshot_observed_at":"2026-08-11T15:43:00.989949Z","title":"Samplernn: An unconditional end- to-end neural audio generation model","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.989949Z"},"links":{"cited_paper":"/paper/1612.07837","citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:dcd69879948a9ee332f1c145fc70f0a2488b06be52fbd789cda0c3ab1f19869b","observation_id":"d496671b-d7de-463a-87d5-87e22465082e","resolution":{"observed_at":"2026-08-11T15:43:00.989949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07938","last_updated":"2024-03-08T22:27:38Z","snapshot_observed_at":"2026-07-06T17:43:31.874919Z","submitted_at":"2024-03-08T22:27:38Z","title":"Text-to-Audio Generation Synchronized with Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07938","snapshot_observed_at":"2026-08-11T15:43:00.994918Z","title":"Text-to- audio generation synchronized with videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.994918Z"},"links":{"cited_paper":"/paper/2403.07938","citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:2fef07c91739005ce63fbb1ecd3d8a4c63e09723a89dbf72e54545562a774a2a","observation_id":"b6b1c667-3311-4ac6-be88-5c8557f19490","resolution":{"observed_at":"2026-08-11T15:43:00.994918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.690104Z","title":"Bal- ancing act: Distribution-guided debiasing in diffusion mod- els","venue":null,"work_id":"553179ee-e4dd-434f-bcbe-fe01377a8eaa","year":null},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.000235Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:ceecfb20adaa6ed2a30d6d2ec4d9621477f938342e5b7085b15360d247fdec7f","observation_id":"c193d648-be82-4cc0-9ed6-b7975fab2e0d","resolution":{"observed_at":"2026-08-11T15:43:01.695014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.674152Z","title":"Scalable diffusion models with transformers, 2023","venue":null,"work_id":"3fad658b-a877-469c-b417-a4c1b7772773","year":2023},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.004938Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:bc122c08319f54d3d7744e9c5e2597b24216764ccc3d13459852f2df24cd891e","observation_id":"060323ee-af08-4265-8a17-867538b01346","resolution":{"observed_at":"2026-08-11T15:43:01.679620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.658212Z","title":"Film: Visual reasoning with a general conditioning layer","venue":null,"work_id":"bdd71da0-c851-44a9-a35c-2c67529eb5cb","year":2018},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.009584Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:f2d7d35fb3e51fa8cc69b74cdc8f0452df4da4470f4cfb2cc2297eba9fe19844","observation_id":"341338be-00a1-4f5a-9cce-1df26449df12","resolution":{"observed_at":"2026-08-11T15:43:01.663487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.642691Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"a049e53b-8841-43f7-8825-418ca3019c00","year":2021},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.014105Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:9e9e5cc85516ee8f4b5038afcb0283a734204a83458ae1aa1f2112e58d13869e","observation_id":"91a4fadc-1435-4907-8ed2-f3cc48242973","resolution":{"observed_at":"2026-08-11T15:43:01.647834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.018952Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.018952Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:66f967138b742afee6321daa58d94da144bd8f3b6cb45b44360b989bdf473848","observation_id":"3b585338-d1ed-4056-9f83-e666efe31037","resolution":{"observed_at":"2026-08-11T15:43:01.018952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.024145Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.024145Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:8c347572ab7909f892d2ea0008bc9dc0656bec4394ee3b402f739a8cb702d83a","observation_id":"3fe98423-9360-4269-92b1-00befebb6bbe","resolution":{"observed_at":"2026-08-11T15:43:01.024145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.603119Z","title":"I hear your true colors: Image guided audio generation, 2022","venue":null,"work_id":"92b4de3c-9450-4b05-a6ec-63522896f232","year":2022},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.029283Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:d917f5a6f74eaaefad94aa7c0f97a7878cc777e5c4cec5090291f8685afd835f","observation_id":"757ba374-dd75-4de7-a979-d360d2eb4d65","resolution":{"observed_at":"2026-08-11T15:43:01.608310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.586715Z","title":"Auto- acd: A large-scale dataset for audio-language representation learning","venue":null,"work_id":"cf082089-57e6-463f-86e9-d74a1b27fed8","year":2024},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.034089Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:591766349853dc7d278287a722d2a35e9ddf43d4a61b4ade65000fc0e9a1eb97","observation_id":"42c483e9-14f8-407e-bf7b-ef23dc79e883","resolution":{"observed_at":"2026-08-11T15:43:01.591925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.10282","last_updated":"2018-02-28T12:41:50Z","snapshot_observed_at":"2026-07-06T06:11:35.990430Z","submitted_at":"2017-11-28T13:29:45Z","title":"Learning from Between-class Examples for Deep Sound Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.10282","snapshot_observed_at":"2026-08-11T15:43:01.039003Z","title":"Learning from between-class examples for deep sound recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.039003Z"},"links":{"cited_paper":"/paper/1711.10282","citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:365d4c048ee873a66b2be9c21f895c3e5db7a07935491414c02ae736538ccf22","observation_id":"b5e2a8e2-082f-4ce4-b38f-11c8bb590245","resolution":{"observed_at":"2026-08-11T15:43:01.039003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.044268Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.044268Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:6ba5f882e31e5810bab5a5125664aa3f29be7a9f5e0ac00bcbbc1cdfff52f9ad","observation_id":"9159ca6c-bf3d-4acf-b2aa-ae3f5fb14cb0","resolution":{"observed_at":"2026-08-11T15:43:01.044268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.557442Z","title":"Audiobox: Unified audio generation with natural language prompts, 2023","venue":null,"work_id":"6f0f7796-473c-4099-aa52-d02a01a9c02b","year":2023},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.049825Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:8c50c17e1551d803e38eab21dcdcda8a5de0e29c908a3b056bc008bacfc10506","observation_id":"dff84b15-706b-4178-a31c-c2e78cff4f93","resolution":{"observed_at":"2026-08-11T15:43:01.562666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.540664Z","title":"V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foun- dation models","venue":null,"work_id":"69564dbf-991a-4b9e-8c0f-fc5ffaf37b28","year":2024},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.054754Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:0618312acc8f3332e2cd7a04370ae5aae9ffd41c8e0276d07ed41c8b6557b0bd","observation_id":"44a95349-babf-4205-b7ce-e6d28e03dc31","resolution":{"observed_at":"2026-08-11T15:43:01.545952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11172","last_updated":"2023-05-18T17:59:06Z","snapshot_observed_at":"2026-08-05T16:34:22.561102Z","submitted_at":"2023-05-18T17:59:06Z","title":"ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11172","snapshot_observed_at":"2026-08-11T15:43:01.059533Z","title":"One-peace: Exploring one general representa- tion model toward unlimited modalities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.059533Z"},"links":{"cited_paper":"/paper/2305.11172","citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:7d009ef5f3ce37000204b15f0ea4b00be25bf34f22b0d78e0981a152e2c657ac","observation_id":"5a5265e9-f206-4211-991e-1848bed6af07","resolution":{"observed_at":"2026-08-11T15:43:01.059533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.523659Z","title":"Wav2clip: Learning robust audio repre- sentations from clip","venue":null,"work_id":"ce74ee31-a937-4e60-9b7f-d9472abb8154","year":2022},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.065138Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:f898b09c66b64f1f23184ae6924550aa98910a0281f9c17bb9066b410570d8ae","observation_id":"559861e4-be63-48f3-a037-448bc3afc367","resolution":{"observed_at":"2026-08-11T15:43:01.529275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.505418Z","title":"Large-scale con- trastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":"7f7ba7ad-e7c3-4215-a246-3faaaa3d4f4e","year":2023},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.069941Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:46d9bb21715d66db25774c35fce89277d087efdb741c814c14d7d0de489ce5ea","observation_id":"e8c49149-27bc-4322-8696-04682191ead8","resolution":{"observed_at":"2026-08-11T15:43:01.512058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.489395Z","title":"Son- icvisionlm: Playing sound with vision language models","venue":null,"work_id":"644f9612-c9d5-4584-82e3-a69f481f6c45","year":2024},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.074951Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:8ee575db4763b95afdc9c6811fdf87222fa15f6c43e1f5b5fbaa7613bc78c209","observation_id":"d7192d4f-08a4-4c10-b83c-894b0be99496","resolution":{"observed_at":"2026-08-11T15:43:01.494889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.079975Z","title":"Seeing and hearing: Open-domain visual- audio generation with diffusion latent aligners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.079975Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:37f95d906393fbd651f395403f3e31d262feb36d0d0d50ac9cfe4637c5c25dd8","observation_id":"436724e7-41b5-4930-a16c-78d0a5a465e6","resolution":{"observed_at":"2026-08-11T15:43:01.079975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.461171Z","title":"Diffsound: Discrete diffusion model for text-to-sound generation","venue":null,"work_id":"43efbe8f-45df-482f-8302-65edc109e7fb","year":2023},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.085034Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:b33aa6104b5d95253870ea80a0c24171e5d1a1ad4a9a1f035e37bc7ccdb266dc","observation_id":"6b8802d4-dd19-427d-b44a-c1a00998902c","resolution":{"observed_at":"2026-08-11T15:43:01.466318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.445255Z","title":"Diverse and aligned audio-to-video genera- tion via text-to-video model adaptation","venue":null,"work_id":"6cd8ed64-bfee-4323-8ed4-689093359903","year":2024},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.090156Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:da5e35b378cd1769cb3d8cb89e2ff63caf31b42c5ddeb5bc6ba0162a648d17a2","observation_id":"1403e556-2132-4faa-b35f-1318ecaba71c","resolution":{"observed_at":"2026-08-11T15:43:01.450177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.428632Z","title":"Foley- crafter: Bring silent videos to life with lifelike and synchro- nized sounds, 2024","venue":null,"work_id":"a8f67fd5-6d3b-45b0-99a8-055719a5505d","year":2024},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.095147Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:4d976f223a06574e2a60a9690dad7ebb4b54e2e5a900eccb656e960be90b782b","observation_id":"079eb143-1244-4a61-9e47-b3b193f10348","resolution":{"observed_at":"2026-08-11T15:43:01.434140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.412857Z","title":"Llava- next: A strong zero-shot video understanding model, 2024","venue":null,"work_id":"928e7534-e27b-4e09-93cd-6e1e78f48f61","year":2024},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.099877Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:8fbadf2c8ac3ae9c0bab4e4e63833d6b7f1f2a12aa85b7e7b9666ba6c0f5c1a1","observation_id":"8bafe478-14c6-4828-83f8-99f37de51dc7","resolution":{"observed_at":"2026-08-11T15:43:01.417921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:43:01.397433Z","title":null,"venue":null,"work_id":"769495b0-dd0d-4c4a-88d8-f29590d977f6","year":null},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.104419Z"},"links":{"citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:a9e7a2a82b06a5390dc3826621560101311afc250bc5b227974070dea675f325","observation_id":"c84ec568-408e-435f-8846-805b45ad41f6","resolution":{"observed_at":"2026-08-11T15:43:01.402261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18583","last_updated":"2024-06-05T17:53:26Z","snapshot_observed_at":"2026-08-06T11:25:48.819238Z","submitted_at":"2024-06-05T17:53:26Z","title":"Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18583","snapshot_observed_at":"2026-08-11T15:43:01.110656Z","title":"Wind blows","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:01.110656Z"},"links":{"cited_paper":"/paper/2406.18583","citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:676c20bb8ab7557f57765d332d4463acf4ba17bdf721dd76c3245fd29ec183ec","observation_id":"10fc6dca-0337-4a2c-b5dd-4542c2b61058","resolution":{"observed_at":"2026-08-11T15:43:01.110656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":35},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 2 inbound Pith citation observations for arXiv:2412.10768."}