{"as_of":"2026-08-04T04:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca8dfa1089d1571ff8555c26747f8b714c4e162b1e7b227e551ed68deb4f2e59","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:55:17.332539Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.03762/citation-record","integrity":"/paper/2602.03762/integrity","json":"/paper/2602.03762/citation-record.json","paper":"/paper/2602.03762"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08797","last_updated":"2025-10-09T00:43:44Z","snapshot_observed_at":"2026-07-06T15:03:52.079498Z","submitted_at":"2023-03-15T17:43:42Z","title":"Stochastic Interpolants: A Unifying Framework for Flows and Diffusions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08797","snapshot_observed_at":"2026-08-03T04:55:12.097919Z","title":"Stochastic interpolants: A unifying frame- work for flows and diffusions, 2023.URL https://arxiv","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:12.097919Z"},"links":{"cited_paper":"/paper/2303.08797","citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:9ad72d6681bf09126b1197a993b8b391e28290992ae71d50a0c4ddbbdd57b534","observation_id":"dcb018c5-9232-4a81-a9c8-8b5c8182fbc9","resolution":{"observed_at":"2026-08-03T04:55:12.097919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:12.131508Z","title":"Diffusion-based unsupervised audio-visual speech enhancement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:12.131508Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:63b24c3d416dbd8404633f03d4b5f86aaa0a2b33cd28a64eb18db75b08ad368a","observation_id":"08ea8b95-f93b-4af3-9784-02b2e185a856","resolution":{"observed_at":"2026-08-03T04:55:12.131508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14017","last_updated":"2024-07-21T11:19:38Z","snapshot_observed_at":"2026-07-06T17:33:33.812898Z","submitted_at":"2024-02-21T18:56:03Z","title":"D-Flow: Differentiating through Flows for Controlled Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14017","snapshot_observed_at":"2026-08-03T04:55:12.149156Z","title":"D-flow: Differentiating through flows for controlled generation.arXiv preprint arXiv:2402.14017, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:12.149156Z"},"links":{"cited_paper":"/paper/2402.14017","citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:93bc03de94acc87d4e56b044ccaee36bd568085ff8ab48d0d86ab3a73e6ee8d7","observation_id":"19ca2430-ded3-471b-89c0-f7a67c50220d","resolution":{"observed_at":"2026-08-03T04:55:12.149156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07535","last_updated":"2025-08-22T10:28:35Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:03:07Z","title":"LBM: Latent Bridge Matching for Fast Image-to-Image Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07535","snapshot_observed_at":"2026-08-03T04:55:12.168179Z","title":"Lbm: Latent bridge match- ing for fast image-to-image translation.arXiv preprint arXiv:2503.07535, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:12.168179Z"},"links":{"cited_paper":"/paper/2503.07535","citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:a721c365153b136d318ef71dffd798b0fb67f784586b1d4ce1b1cbe4cf797126","observation_id":"f89b7e4e-0178-499c-b6f5-b0f3ed87aa35","resolution":{"observed_at":"2026-08-03T04:55:12.168179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:12.189245Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.Science China Information Sciences, 67(12):220101,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:12.189245Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:9c493b70fe2687a38a8ca67905e6f592f9ca2d3b4bdf4f5cfc4227d637dfd06e","observation_id":"a4567355-30c9-4c85-b6b2-9ce257e9c62d","resolution":{"observed_at":"2026-08-03T04:55:12.189245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:12.262685Z","title":"Mmaudio: Taming multimodal joint training for high-quality video-to- audio synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:12.262685Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:2a88343f97a409b2a45e0ca6c88ecd3857708ed7ad5f70e713129aa7724a876b","observation_id":"83a732a9-6a78-4526-803b-3781a7c6fdaa","resolution":{"observed_at":"2026-08-03T04:55:12.262685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:12.354766Z","title":"Samwise: Infusing wisdom in sam2 for text-driven video segmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:12.354766Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:c5a942afec36a5c37c0c28802c4afc9a55c5ab4ad36a04c78e1bf5401adf6086","observation_id":"c99690fe-1d2d-460e-b6c9-a5130cd37165","resolution":{"observed_at":"2026-08-03T04:55:12.354766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06610","last_updated":"2024-08-13T03:45:11Z","snapshot_observed_at":"2026-08-02T22:08:17.634881Z","submitted_at":"2024-08-13T03:45:11Z","title":"CROME: Cross-Modal Adapters for Efficient Multimodal LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06610","snapshot_observed_at":"2026-08-03T04:55:12.422928Z","title":"Crome: cross-modal adapters for efficient multi- modal llm.arXiv preprint arXiv:2408.06610, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:12.422928Z"},"links":{"cited_paper":"/paper/2408.06610","citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:b7d9e7ffe0138d137a2bcb629e7baeeed0e5611046ffc5e6e5ce3fc0f08cd917","observation_id":"3ee101ae-a0ae-4677-839c-aa2058ef089c","resolution":{"observed_at":"2026-08-03T04:55:12.422928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03619","last_updated":"2018-08-09T21:22:37Z","snapshot_observed_at":"2026-07-06T06:32:41.685350Z","submitted_at":"2018-04-10T16:28:59Z","title":"Looking to Listen at the Cocktail Party: A Speaker-Independent Audio-Visual Model for Speech Separation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03619","snapshot_observed_at":"2026-08-03T04:55:12.603924Z","title":"Looking to listen at the cocktail party: A speaker-independent audio-visual model for speech sepa- ration.arXiv preprint arXiv:1804.03619, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:12.603924Z"},"links":{"cited_paper":"/paper/1804.03619","citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:e9fbdf70a7c20d4a27101dbb9b84aed2a7eb0d3143f2b91683b63e0c3517fbe8","observation_id":"1ad81d4e-55b3-46b5-a4ee-483eba98a371","resolution":{"observed_at":"2026-08-03T04:55:12.603924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:12.728994Z","title":"Visualvoice: Audio- visual speech separation with cross-modal consistency","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:12.728994Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:fb788567576f7b8bc1f5e22e114b6cc486208e5baac49489b3efade0c5b9411a","observation_id":"a78143f0-78d2-4b52-9ba6-bb9c1bffff07","resolution":{"observed_at":"2026-08-03T04:55:12.728994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:12.774161Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:12.774161Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:cf258d6e96a35c7608ac0d1d64d0ca21608ab1fe3910515c25bb22b628cdf863","observation_id":"143aba14-314d-47ca-baef-0edf86a03602","resolution":{"observed_at":"2026-08-03T04:55:12.774161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:12.863400Z","title":"Denoising dif- fusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:12.863400Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:4411296e413a00daf475707f18b1b88d82fa6fd899c8a9e944366abfaaae830a","observation_id":"25ef3e7e-e350-43d7-9d91-fc5da5c7b93a","resolution":{"observed_at":"2026-08-03T04:55:12.863400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:12.940550Z","title":"Davis: High-quality audio-visual separation with generative diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:12.940550Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:3fb646ebfb686fc9f01b1a8553ec910c4f86c772252b8fc7cd82eff120b9db2f","observation_id":"f25a9529-024e-4e1c-a241-30dc4b7b91b0","resolution":{"observed_at":"2026-08-03T04:55:12.940550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:12.958618Z","title":"Learning to highlight audio by watching movies","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:12.958618Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:f6c887e2d27564aa76e2c48b37dc7e39eb4d55b59820d0949276a622824a3d16","observation_id":"7a27e098-c6e5-498e-8e75-4cb3cdfe25eb","resolution":{"observed_at":"2026-08-03T04:55:12.958618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:13.017673Z","title":"High-quality sound separation across diverse categories via visually-guided generative modeling.arXiv preprint arXiv:2509.22063, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:13.017673Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:3fc101ac60565a02ef0be2809e38d9ab998f486b4307c7eda965f48f70a46c68","observation_id":"11cc946d-4341-43f8-a33e-dc0b241f76d7","resolution":{"observed_at":"2026-08-03T04:55:13.017673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:13.071397Z","title":"Mu- sic mixing style transfer: A contrastive learning approach to disentangle audio effects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:13.071397Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:6d5639244b1b8c869dfef66190b6adecdbcf47067403f4528e62309947dc630e","observation_id":"7e4996ba-7a04-43d0-aeaf-d7ec6b020c74","resolution":{"observed_at":"2026-08-03T04:55:13.071397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-07-06T11:56:27.690032Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-03T04:55:13.142515Z","title":"Efficient training of audio transformers with patchout.arXiv preprint arXiv:2110.05069, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:13.142515Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:a798e8eeda1593f1637ce4cbdc3a988598d11d8eaf1a164e010145a35e69e4d9","observation_id":"4bb54ab7-7168-4529-8112-4002e8e33a81","resolution":{"observed_at":"2026-08-03T04:55:13.142515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:13.251521Z","title":"Seeing through the conversation: Audio-visual speech separation based on diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:13.251521Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:7a2887e5944c40bdea766856c6c5eb03e0c7b70846f1beb6a90f74d4e79e6beb","observation_id":"7c76bbe8-888b-41d7-9408-841c3c8ccc79","resolution":{"observed_at":"2026-08-03T04:55:13.251521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:13.292769Z","title":"Detecting mo- ments and highlights in videos via natural language queries","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:13.292769Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:50fd2f5c1b1f740455b97f96ad29dabc261396467b45c97b8bd008cef2dbceac","observation_id":"e2498842-f216-4347-84a1-d231f5a3a3c8","resolution":{"observed_at":"2026-08-03T04:55:13.292769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:13.431879Z","title":"Storm: A diffusion-based stochastic regen- eration model for speech enhancement and dereverberation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:13.431879Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:2d0b28c2577c45eeb2332cd9505634098d02b17240b877740315658785976314","observation_id":"4032d820-1c23-4e1b-b88f-adc2b083a3a4","resolution":{"observed_at":"2026-08-03T04:55:13.431879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:13.509646Z","title":"Av-nerf: Learning neural fields for real-world audio-visual scene synthesis.Advances in Neural Informa- tion Processing Systems, 36:37472–37490, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:13.509646Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:ddaa599c6bf2a6bbd80d1805f027233d6fe58a3622aec89dcdd96aa2ab562ba3","observation_id":"1325f259-c34c-4a88-902a-89b905692995","resolution":{"observed_at":"2026-08-03T04:55:13.509646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:13.587719Z","title":"Univtg: Towards unified video- language temporal grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:13.587719Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:51601ea041c3b0c586aa71e340d3de26482f58ba3eebc77bd17e468632f525df","observation_id":"5af4acf7-3558-434d-b64b-16e6e8c26f89","resolution":{"observed_at":"2026-08-03T04:55:13.587719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:13.690488Z","title":"Flow matching for generative mod- eling.ICLR, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:13.690488Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:3225e2759f4eef817e4fbc27555615169eef4dab1a1638c44fcf75373f060e0f","observation_id":"bde8db0e-c462-420b-a5e4-81f68314e2d4","resolution":{"observed_at":"2026-08-03T04:55:13.690488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.14699","last_updated":"2022-08-31T08:58:10Z","snapshot_observed_at":"2026-07-06T13:47:14.953794Z","submitted_at":"2022-08-31T08:58:10Z","title":"Let us Build Bridges: Understanding and Extending Diffusion Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.14699","snapshot_observed_at":"2026-08-03T04:55:13.895260Z","title":"Let us build bridges: Understanding and extending diffusion gener- ative models.arXiv preprint arXiv:2208.14699, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:13.895260Z"},"links":{"cited_paper":"/paper/2208.14699","citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:e36d183fc47863bbe4fe473146baec7cc93e8d982163354bd7dec6fcbfeee55c","observation_id":"ec5615f8-feae-45b2-9ded-c61ff83b4433","resolution":{"observed_at":"2026-08-03T04:55:13.895260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:13.974182Z","title":"Umt: Unified multi-modal transformers for joint video moment retrieval and highlight detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:13.974182Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:5b745074d27c72dbb245218915df3f7e4c7fbba6868ec80b24629990299f6d4a","observation_id":"15152251-b812-44af-86a0-8634980cf528","resolution":{"observed_at":"2026-08-03T04:55:13.974182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02257","last_updated":"2024-03-18T11:39:29Z","snapshot_observed_at":"2026-07-06T14:48:25.973457Z","submitted_at":"2023-02-04T23:18:36Z","title":"Multi-Source Diffusion Models for Simultaneous Music Generation and Separation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.02257","snapshot_observed_at":"2026-08-03T04:55:14.055110Z","title":"Multi-source diffusion models for simultaneous music generation and sep- aration.arXiv preprint arXiv:2302.02257, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:14.055110Z"},"links":{"cited_paper":"/paper/2302.02257","citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:b26c95ef2052dce86e2ab579494ff4067831f009a964f0e3193627c3f66c2f52","observation_id":"c5eb4f62-7979-4937-bd29-6a3a0031149f","resolution":{"observed_at":"2026-08-03T04:55:14.055110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:14.108968Z","title":"Deep learning for black-box modeling of audio effects.Applied Sciences, 10(2):638, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:14.108968Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:9044fd45c3d22f4d41b2ad092d22920259e63faf76ebaf0f7b0e3422fc589cdd","observation_id":"2aaf0f95-2f27-453f-97de-f7c52ae69e47","resolution":{"observed_at":"2026-08-03T04:55:14.108968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:14.181056Z","title":"On discriminative vs","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:14.181056Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:2c87c5d57fca8033745f77092725aa22d71a14176e247a0f0ee6fff7ac570dc6","observation_id":"27f79caa-f928-4cbe-936e-a2e2eef9de04","resolution":{"observed_at":"2026-08-03T04:55:14.181056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15321","last_updated":"2024-04-10T18:13:00Z","snapshot_observed_at":"2026-07-06T16:11:47.380913Z","submitted_at":"2023-08-29T14:16:09Z","title":"Elucidating the Exposure Bias in Diffusion Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.15321","snapshot_observed_at":"2026-08-03T04:55:14.323365Z","title":"Elucidating the exposure bias in diffusion models.arXiv preprint arXiv:2308.15321, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:14.323365Z"},"links":{"cited_paper":"/paper/2308.15321","citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:83c70a09cbc8fac66acb650273b0fa86b021ad9baf499fe20abde97f8776d579","observation_id":"a6282e1a-01ce-4ad4-baba-6c29edad9be9","resolution":{"observed_at":"2026-08-03T04:55:14.323365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-03T04:55:14.391930Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:14.391930Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:31bbd78d769b0976a47f6c635fb3ca920d08da4faa48cf88e0f377d2412b7279","observation_id":"9ddd07c8-a515-4eaf-b561-b5ec4802fcd3","resolution":{"observed_at":"2026-08-03T04:55:14.391930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:14.470045Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:14.470045Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:61e0212f571e213e394cff14cebe9ba3305252b961643cbf6c251ada821b0e59","observation_id":"dd8812b6-b87c-4afe-817e-5aef23f19540","resolution":{"observed_at":"2026-08-03T04:55:14.470045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:14.524917Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of machine learning research, 21(140):1–67, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:14.524917Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:85d357d1156238cfb4a767b33697490f20a3b27651e3b6fa72d9df244d4b5ec7","observation_id":"592b5884-4994-487d-ae83-9357c62d0de2","resolution":{"observed_at":"2026-08-03T04:55:14.524917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:14.623311Z","title":"Model- ing nonlinear audio effects with end-to-end deep neural net- works","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:14.623311Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:d43d97ebd9b3340fbd9595c61b49007e916d2aa5e4776e57ef312ecc928b11c3","observation_id":"2e9a38d3-88af-41b0-a582-42c43f24a9f0","resolution":{"observed_at":"2026-08-03T04:55:14.623311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:14.694302Z","title":"Sequence level training with recurrent neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:14.694302Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:319a683554a56ecb6ef06e98a8ff031691520b313c638d5f06b5d06e2023e911","observation_id":"288dfbfc-eaa4-4799-aec9-1c05ecc2283f","resolution":{"observed_at":"2026-08-03T04:55:14.694302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:14.809643Z","title":"Hybrid transformers for music source separation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:14.809643Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:75b768c5399815129031477f04a3de6eaf230a8a36007a3b108937d25a041c5e","observation_id":"93ab2f1e-aa85-41d0-a44b-e80d6cfb9217","resolution":{"observed_at":"2026-08-03T04:55:14.809643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16119","last_updated":"2025-07-18T00:23:27Z","snapshot_observed_at":"2026-08-03T02:09:42.503107Z","submitted_at":"2025-05-22T01:52:06Z","title":"Source Separation by Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16119","snapshot_observed_at":"2026-08-03T04:55:14.983041Z","title":"Source separation by flow matching.arXiv preprint arXiv:2505.16119, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:14.983041Z"},"links":{"cited_paper":"/paper/2505.16119","citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:2d885ae1aae846a52429b6c135d711acf6abde9ad90134a1c0697ed185dbe8fc","observation_id":"197db680-9a1e-48f8-93be-37fa82b8cf1a","resolution":{"observed_at":"2026-08-03T04:55:14.983041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:15.237244Z","title":"Physical modeling using recurrent neu- ral networks with fast convolutional layers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:15.237244Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:2d9217a6496fdf12f8f252a8e44cd1cf2eb60caa6b74cf0be473d051fad61eb2","observation_id":"fa012a8f-be05-4833-bb6f-42ea517e43be","resolution":{"observed_at":"2026-08-03T04:55:15.237244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:15.305094Z","title":"Improved techniques for training consistency models.ICLR, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:15.305094Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:d303143fbf58dfcef04e291738112c4c24b87322ed5e3414fb5e212d41a3ef51","observation_id":"c630fc7d-8219-4c77-ac26-309a4281b438","resolution":{"observed_at":"2026-08-03T04:55:15.305094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:15.406955Z","title":"Consistency models.ICLR, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:15.406955Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:6b2e5589fae44b721a9be0588e32014498e42650b75f82c0560ea11ed5c63607","observation_id":"ebdabe01-dbd0-4a2e-b301-fceaabf8fcd4","resolution":{"observed_at":"2026-08-03T04:55:15.406955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.08759","last_updated":"2022-07-18T17:06:19Z","snapshot_observed_at":"2026-07-06T13:32:38.285820Z","submitted_at":"2022-07-18T17:06:19Z","title":"Style Transfer of Audio Effects with Differentiable Signal Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.08759","snapshot_observed_at":"2026-08-03T04:55:15.462383Z","title":"Style transfer of audio effects with differentiable signal pro- cessing.arXiv preprint arXiv:2207.08759, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:15.462383Z"},"links":{"cited_paper":"/paper/2207.08759","citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:ef9939f44b8487f8e9f3d44e48d0cae072bbaea0deb706fb40694650a49ab873","observation_id":"d891c011-1753-437d-b09c-2cda18d979d6","resolution":{"observed_at":"2026-08-03T04:55:15.462383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10522","last_updated":"2026-04-15T16:32:32Z","snapshot_observed_at":"2026-07-31T02:51:01.521373Z","submitted_at":"2025-03-13T16:30:59Z","title":"AudioX: A Unified Framework for Anything-to-Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10522","snapshot_observed_at":"2026-08-03T04:55:15.558525Z","title":"Audiox: Diffusion transformer for anything-to-audio generation.arXiv preprint arXiv:2503.10522, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:15.558525Z"},"links":{"cited_paper":"/paper/2503.10522","citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:169986ecf7db89f8ea434360633893ed6899d497a5f7f34a37e5555deeeddb61","observation_id":"f18f7a01-4fde-4a93-9624-9b5b3f9bc50b","resolution":{"observed_at":"2026-08-03T04:55:15.558525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00482","last_updated":"2024-03-11T14:27:48Z","snapshot_observed_at":"2026-07-06T14:47:04.817434Z","submitted_at":"2023-02-01T14:47:17Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00482","snapshot_observed_at":"2026-08-03T04:55:15.774393Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport.arXiv preprint arXiv:2302.00482, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:15.774393Z"},"links":{"cited_paper":"/paper/2302.00482","citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:6b15e83a39c56e2c6edfc0db3d5180928615815aa9a5b6d9ebc0f44b9d8a2c65","observation_id":"f6ab1385-76bb-4a28-ac5f-a7c752010573","resolution":{"observed_at":"2026-08-03T04:55:15.774393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08889","last_updated":"2024-07-11T23:06:47Z","snapshot_observed_at":"2026-07-06T18:45:05.905995Z","submitted_at":"2024-07-11T23:06:47Z","title":"Diff-MST: Differentiable Mixing Style Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08889","snapshot_observed_at":"2026-08-03T04:55:15.879850Z","title":"Diff- mst: Differentiable mixing style transfer.arXiv preprint arXiv:2407.08889, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:15.879850Z"},"links":{"cited_paper":"/paper/2407.08889","citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:ab2408e4a20f706879c38a8b4118e07957d14e08cfdab2fc19f05b66a2c45500","observation_id":"12509606-6a23-48f7-9f45-9512df7e4ff0","resolution":{"observed_at":"2026-08-03T04:55:15.879850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-03T04:55:15.963640Z","title":"Self-consistency improves chain of thought reason- ing in language models.arXiv preprint arXiv:2203.11171,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:15.963640Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:0ddce5e449064379a658ecd0bb9a5247c7351a58f75ac00d548578b833577e7a","observation_id":"aea663de-c192-4579-b61b-aa59a341e6c3","resolution":{"observed_at":"2026-08-03T04:55:15.963640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:16.048112Z","title":"A generalized band- split neural network for cinematic audio source separation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:16.048112Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:23b7e88b54b3bb407b0db6a9281cdbb0ba602b5eecd7a86a6cac128849c4c7f1","observation_id":"ef11026f-595f-4d30-ae2f-30c670372a06","resolution":{"observed_at":"2026-08-03T04:55:16.048112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:16.166636Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:16.166636Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:2bdfe981f778894033d8b3982400dfd2e04254a4477d383b0691a17736a8792c","observation_id":"b9dd051e-3f3e-48d6-bbcb-ccb401d3e7fb","resolution":{"observed_at":"2026-08-03T04:55:16.166636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01485","last_updated":"2025-03-03T12:49:09Z","snapshot_observed_at":"2026-08-04T04:25:05.713463Z","submitted_at":"2025-03-03T12:49:09Z","title":"FlowDec: A flow-based full-band general audio codec with high perceptual quality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01485","snapshot_observed_at":"2026-08-03T04:55:16.382839Z","title":"Flowdec: A flow-based full-band general audio codec with high perceptual quality.arXiv preprint arXiv:2503.01485,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:16.382839Z"},"links":{"cited_paper":"/paper/2503.01485","citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:bc658210f4acf0bf9792c43192a452858654ce0765e069b67ba096ec9ce0530a","observation_id":"05f88f90-8aa9-4455-be9e-d7dc700f3c89","resolution":{"observed_at":"2026-08-03T04:55:16.382839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:16.447053Z","title":"Large-scale con- trastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:16.447053Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:98ab3b50ac83d34d4b3974f42a008fade21e4da69e24b31c4002e880e38a34ad","observation_id":"afc3ee98-8ab6-4c6c-bf36-a2c85a489682","resolution":{"observed_at":"2026-08-03T04:55:16.447053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:16.506970Z","title":"Visually informed binaural au- dio generation without binaural audios","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:16.506970Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:5f23c7e1005c4bcf53c5e3689f3bf665c0caff116cb2415eeea7f593531f55cd","observation_id":"6721cc05-3066-4c0e-88c3-2c24cb29a106","resolution":{"observed_at":"2026-08-03T04:55:16.506970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:16.656865Z","title":"The sound of pixels","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:16.656865Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:eee131a480d1a1bdfb4e6a799de58e776c8cd607b927bf35070aad3baedb00e5","observation_id":"ec389530-180e-4dca-bab1-8d74577351a9","resolution":{"observed_at":"2026-08-03T04:55:16.656865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:16.766369Z","title":"Table 5 presents the results obtained on this variant of the dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:16.766369Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:b6c27d4c919895433b3d8c8e5fe56d5619e836a44d64f01855a563f2c3754f44","observation_id":"2caee42c-1691-4b03-9001-0b39b5981904","resolution":{"observed_at":"2026-08-03T04:55:16.766369Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:16.958526Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:16.958526Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:154e2b1f67d5a52a8ea0ec83b3ec4552fa7dfecb6cfdaffef486634428e70c3c","observation_id":"f330bd86-2e44-4b8f-8974-bc84a5b27041","resolution":{"observed_at":"2026-08-03T04:55:16.958526Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:17.027290Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:17.027290Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:100bda08f785253769052ca9f22f8e4bf1e76b2fea723bba828e6bc620fa1b46","observation_id":"16b6620d-24dc-48b5-86e1-864cdc738dcc","resolution":{"observed_at":"2026-08-03T04:55:17.027290Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:17.132619Z","title":"However, when its contribution becomes too dominant, the trajectories exhibit non-linear behavior again","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:17.132619Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:891f963d43c669831cf92b94e3b9f304d7558c0bca1482b6cbb0ba275ed868fd","observation_id":"a1b604da-29fa-4b7a-8bd0-9fb6722788e3","resolution":{"observed_at":"2026-08-03T04:55:17.132619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:17.204233Z","title":"The rollout loss allows more consistent predictions across steps, resulting in more highlighted sources","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:17.204233Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:9d4368241bc123f9e210f48fd0b7759d6e6b99e5632224ee6d93c572e45e3e64","observation_id":"d74ba8d7-358e-42fc-90e9-6285000803a9","resolution":{"observed_at":"2026-08-03T04:55:17.204233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:55:17.332539Z","title":"Future work should evaluate the model on real-world data once such datasets become available","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:17.332539Z"},"links":{"citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:ec268a60d8b3fb8d81fae7bf960b39ebeab289dc6892253e924d96dd157e940a","observation_id":"c82e4946-497c-4455-b200-dfdeacfc13d7","resolution":{"observed_at":"2026-08-03T04:55:17.332539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","latest_version":4,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-03T04:54:49.364854Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2602.03762."}