{"as_of":"2026-08-22T07:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:563807e0b62c051fca1963a2ba0c0830a42531df00c633e9efeb76278db137cf","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T14:46:41.586652Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:50:07.266379Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:13:54.329150Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"cited_work":{"arxiv_id":"2607.18666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.18666","snapshot_observed_at":"2026-08-07T00:13:54.329150Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","venue":"cs.CL","work_id":"19fee096-0f69-40cc-b740-63a03a75e90b","year":2026},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-18T06:59:07.778687Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:53.298988Z"},"links":{"cited_paper":"/paper/2607.18666","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:4656f7d753ba9ff924dbd3d4266e5b6a004eb4ba64bc884c73766d678ed245a5","observation_id":"b21b671d-365c-4e1d-b228-490938aed096","resolution":{"observed_at":"2026-08-07T00:13:54.384676Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.18666","snapshot_observed_at":"2026-08-08T00:50:07.266379Z","title":"Fusion embedding: A unified embedding space for text, image, video, and audio,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04043","last_updated":"2026-08-04T06:08:21Z","snapshot_observed_at":"2026-08-15T11:51:27.286553Z","submitted_at":"2026-08-04T06:08:21Z","title":"Tactus: Open-Vocabulary Object Recognition from Low-Cost Pressure Arrays","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:07.266379Z"},"links":{"cited_paper":"/paper/2607.18666","citing_paper":"/paper/2608.04043"},"observation_digest":"sha256:79127d3c17222c63a21b7c23cba9f174282a0ee579102cf36c597e758b8d3871","observation_id":"e8ce1989-4146-47c9-8c32-b3bb1f51097e","resolution":{"observed_at":"2026-08-08T00:50:07.266379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.18666/citation-record","integrity":"/paper/2607.18666/integrity","json":"/paper/2607.18666/citation-record.json","paper":"/paper/2607.18666"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-08-17T03:00:38.806206Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-01T14:46:34.810923Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:34.810923Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:e1a68006c13104c45e5727fbb646befa7d44d26f1e6ccaf5ecd332dd8d46ba79","observation_id":"57684541-261b-488e-9973-dbc2176ff3ac","resolution":{"observed_at":"2026-08-01T14:46:34.810923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-21T11:14:56.479942Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18953","snapshot_observed_at":"2026-08-01T14:46:34.886995Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:34.886995Z"},"links":{"cited_paper":"/paper/2411.18953","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:dba1ceabb4d56fe9c2dc0d25b78158d7cb83ec706793e47f79adc817d0c7bf57","observation_id":"03c50d2d-29da-42ee-90ed-d6ba7bb606b0","resolution":{"observed_at":"2026-08-01T14:46:34.886995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.12777","last_updated":"2022-04-18T19:41:32Z","snapshot_observed_at":"2026-08-16T17:32:16.430957Z","submitted_at":"2021-12-23T18:51:58Z","title":"Cross Modal Retrieval with Querybank Normalisation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.12777","snapshot_observed_at":"2026-08-01T14:46:34.942567Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:34.942567Z"},"links":{"cited_paper":"/paper/2112.12777","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:a6ea65de12d12a9cb54757cb5be69eb766a613faa3e0ccde739951858394cd20","observation_id":"242164de-1c8d-46b7-a021-cd9b27f28338","resolution":{"observed_at":"2026-08-01T14:46:34.942567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.14368","last_updated":"2020-09-25T00:26:52Z","snapshot_observed_at":"2026-08-11T15:01:50.172126Z","submitted_at":"2020-04-29T17:46:54Z","title":"VGGSound: A Large-scale Audio-Visual Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.14368","snapshot_observed_at":"2026-08-01T14:46:35.018173Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:35.018173Z"},"links":{"cited_paper":"/paper/2004.14368","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:a946d7f2376026888cd6a0316bca946d54f4d1af38a22869d1056236c77c5fd9","observation_id":"bf783d6b-2f12-4a0f-a51e-a82bd4abfd61","resolution":{"observed_at":"2026-08-01T14:46:35.018173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00224","last_updated":"2020-10-21T06:39:24Z","snapshot_observed_at":"2026-08-18T18:00:44.464673Z","submitted_at":"2020-07-01T04:25:24Z","title":"Debiased Contrastive Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00224","snapshot_observed_at":"2026-08-01T14:46:35.110010Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:35.110010Z"},"links":{"cited_paper":"/paper/2007.00224","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:df4cfb7cd53e5d2c03ec6aa84c4559f633668d1d9dde1795354ece09eb353be4","observation_id":"296b60f5-0f1c-4cfb-9137-57dcd02e2971","resolution":{"observed_at":"2026-08-01T14:46:35.110010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:35.176107Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:35.176107Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:4d7dacee953d125b5d2bef9e00ff47697e6a2381ca740322d076b9eb848d773c","observation_id":"4202d1d2-ba6c-46eb-92f2-b77b47d1e43a","resolution":{"observed_at":"2026-08-01T14:46:35.176107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06992","last_updated":"2024-06-13T04:38:02Z","snapshot_observed_at":"2026-08-16T13:44:18.074840Z","submitted_at":"2024-06-11T06:44:54Z","title":"Scaling up masked audio encoder learning for general audio classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06992","snapshot_observed_at":"2026-08-01T14:46:35.218459Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:35.218459Z"},"links":{"cited_paper":"/paper/2406.06992","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:dff0a9d05dbe02c123a626e873b0ed88db14e3c4c6c88e1a7467af5ea2f76204","observation_id":"c46ce0a0-409c-4b8c-bad2-cd897e7b0403","resolution":{"observed_at":"2026-08-01T14:46:35.218459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09387","last_updated":"2019-10-21T14:06:01Z","snapshot_observed_at":"2026-08-10T12:14:01.060108Z","submitted_at":"2019-10-21T14:06:01Z","title":"Clotho: An Audio Captioning Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09387","snapshot_observed_at":"2026-08-01T14:46:35.273134Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:35.273134Z"},"links":{"cited_paper":"/paper/1910.09387","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:27d75617c50db14e83dbbfeb3658bc452d64d2baeb122cba5e84d36a505063cd","observation_id":"1bb70593-9ea8-46d8-870c-9f531e446cea","resolution":{"observed_at":"2026-08-01T14:46:35.273134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:35.355685Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:35.355685Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:b931ee7a1e922a8c7b287a58ccf017c2d208cac2873b329677aa5a85ea8d293f","observation_id":"ef2afe84-bda0-4101-a002-d9f0b655fa38","resolution":{"observed_at":"2026-08-01T14:46:35.355685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.00475","last_updated":"2022-04-23T20:12:00Z","snapshot_observed_at":"2026-08-16T19:16:33.203758Z","submitted_at":"2020-10-01T15:07:25Z","title":"FSD50K: An Open Dataset of Human-Labeled Sound Events","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.00475","snapshot_observed_at":"2026-08-01T14:46:35.435587Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:35.435587Z"},"links":{"cited_paper":"/paper/2010.00475","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:bac8448f000ed6708ce9e91ead517f4d7f09afa9f11e4e67e2aad698d84f4ee8","observation_id":"7fb4a74b-5154-47f9-9d28-fbcc3f8f59a8","resolution":{"observed_at":"2026-08-01T14:46:35.435587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05665","last_updated":"2023-05-31T04:57:12Z","snapshot_observed_at":"2026-08-18T09:52:42.083004Z","submitted_at":"2023-05-09T17:59:07Z","title":"ImageBind: One Embedding Space To Bind Them All","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05665","snapshot_observed_at":"2026-08-01T14:46:35.520484Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:35.520484Z"},"links":{"cited_paper":"/paper/2305.05665","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:7cae52228b8e531c84c572da66ab3d933cb5e602f6411970ccb4d228bf291a75","observation_id":"ca4e6d03-8add-4756-a62d-18245f5a083d","resolution":{"observed_at":"2026-08-01T14:46:35.520484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03183","last_updated":"2023-07-06T17:58:28Z","snapshot_observed_at":"2026-08-16T15:18:09.177606Z","submitted_at":"2023-07-06T17:58:28Z","title":"Whisper-AT: Noise-Robust Automatic Speech Recognizers are Also Strong General Audio Event Taggers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03183","snapshot_observed_at":"2026-08-01T14:46:35.599874Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:35.599874Z"},"links":{"cited_paper":"/paper/2307.03183","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:a22bd93077ad0aed289e1f00655af9b9e72e1d65e416c93782ff42f69f000f52","observation_id":"a3493da3-643c-4812-a2c6-07c005deb742","resolution":{"observed_at":"2026-08-01T14:46:35.599874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:35.680898Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:35.680898Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:d1aec6811fdeddf131dec7274ae266c714d8db94da1dd2b8a828f29bcb41f11c","observation_id":"d2a70e26-d842-459e-8545-be39bd557b7f","resolution":{"observed_at":"2026-08-01T14:46:35.680898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:35.924125Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:35.924125Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:fc8c7b3bd706b718f8ca91b491106c15766093b7b4380e726dcf96ce65e5b40f","observation_id":"df098999-84fb-4e24-a248-f25fdd37b765","resolution":{"observed_at":"2026-08-01T14:46:35.924125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:36.008176Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:36.008176Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:7697b10937f605bfbbc9d830d0adb021c133686eb866f71eabbbf2e5126bc1e9","observation_id":"11bb537f-801d-4aba-a5db-69bbd204d499","resolution":{"observed_at":"2026-08-01T14:46:36.008176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13147","last_updated":"2024-02-08T03:21:26Z","snapshot_observed_at":"2026-08-16T16:57:34.407283Z","submitted_at":"2022-05-26T04:33:56Z","title":"Matryoshka Representation Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.13147","snapshot_observed_at":"2026-08-01T14:46:36.068844Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:36.068844Z"},"links":{"cited_paper":"/paper/2205.13147","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:ee4da45475c17ae096847985fd9d7a540fbcbaa10cfd3780bd7aab1a6aa46322","observation_id":"5d425ea7-cb0e-463e-9cdc-f29fdaf1eb04","resolution":{"observed_at":"2026-08-01T14:46:36.068844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13275","last_updated":"2024-06-25T08:07:36Z","snapshot_observed_at":"2026-08-21T01:51:12.445829Z","submitted_at":"2024-06-19T07:09:46Z","title":"Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13275","snapshot_observed_at":"2026-08-01T14:46:36.225816Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:36.225816Z"},"links":{"cited_paper":"/paper/2406.13275","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:09cb78013ac6f61e0123eb6139991479bd3ac0de47bfa04923a2cb4b70bf7b32","observation_id":"69113afc-ea52-4ef1-975b-5bf0ac9db095","resolution":{"observed_at":"2026-08-01T14:46:36.225816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17395","last_updated":"2024-07-18T22:20:31Z","snapshot_observed_at":"2026-08-16T15:44:03.757604Z","submitted_at":"2023-03-30T14:07:47Z","title":"WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17395","snapshot_observed_at":"2026-08-01T14:46:36.312770Z","title":"Plumbley, Yuexian Zou, and Wenwu Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:36.312770Z"},"links":{"cited_paper":"/paper/2303.17395","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:d80f4e40808b0e23b4a817ad3d330f820315ceeee43fcbdc25aabba6bdc96ffa","observation_id":"97cd49ab-0e2e-4030-b8c0-f60474ab909f","resolution":{"observed_at":"2026-08-01T14:46:36.312770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04590","last_updated":"2025-07-07T00:51:57Z","snapshot_observed_at":"2026-08-08T15:48:31.665148Z","submitted_at":"2025-07-07T00:51:57Z","title":"VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04590","snapshot_observed_at":"2026-08-01T14:46:36.392432Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:36.392432Z"},"links":{"cited_paper":"/paper/2507.04590","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:e4f3ce641e69e466728263cfdc8afed5f728f30491ec45f6f08fb012cf266739","observation_id":"22ea5032-9e87-416a-a7da-f8a923c320ff","resolution":{"observed_at":"2026-08-01T14:46:36.392432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:36.527677Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:36.527677Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:768f0c07ae52c4a733b7440b17f50a86fad9cd60c50d7e0ff4f9bd404738fe4c","observation_id":"1505e678-0dd3-497d-9131-d24882b32d28","resolution":{"observed_at":"2026-08-01T14:46:36.527677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-01T14:46:36.628398Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:36.628398Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:915f0c366e26158088786f29de6365c17bee8168244aef6f533a3a70a075e7b4","observation_id":"bae42b79-20c9-403c-94f3-ca2738838678","resolution":{"observed_at":"2026-08-01T14:46:36.628398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-08-21T19:17:37.837527Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-01T14:46:36.719806Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:36.719806Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:a7855ff292c9ec4883669eff3410c4a6abdb4a2941ca2b23157bd11c66877339","observation_id":"5afa41be-7b07-4e50-a3a3-3bc5122dab85","resolution":{"observed_at":"2026-08-01T14:46:36.719806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04592","last_updated":"2021-01-24T22:19:30Z","snapshot_observed_at":"2026-08-18T17:53:57.208912Z","submitted_at":"2020-10-09T14:18:53Z","title":"Contrastive Learning with Hard Negative Samples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04592","snapshot_observed_at":"2026-08-01T14:46:36.787822Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:36.787822Z"},"links":{"cited_paper":"/paper/2010.04592","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:943cbf70f4676c14d82a05c7ecbc195f24c025423cb218dcfc9d8d5ed46d3ce2","observation_id":"c21cdf96-475e-4b8e-99ad-456da980eb74","resolution":{"observed_at":"2026-08-01T14:46:36.787822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.01719","last_updated":"2016-07-06T17:35:55Z","snapshot_observed_at":"2026-08-21T15:35:12.493880Z","submitted_at":"2016-07-06T17:35:55Z","title":"Deep CORAL: Correlation Alignment for Deep Domain Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.01719","snapshot_observed_at":"2026-08-01T14:46:36.861796Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:36.861796Z"},"links":{"cited_paper":"/paper/1607.01719","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:ff2ffbc6de632b2a2073d564a1b686724421b28fd19adcfb815d0d0d00e3e7e2","observation_id":"1722764a-e47b-4f7a-b2c5-3704b6d0fc5c","resolution":{"observed_at":"2026-08-01T14:46:36.861796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11172","last_updated":"2023-05-18T17:59:06Z","snapshot_observed_at":"2026-08-19T13:45:51.736749Z","submitted_at":"2023-05-18T17:59:06Z","title":"ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11172","snapshot_observed_at":"2026-08-01T14:46:37.000739Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:37.000739Z"},"links":{"cited_paper":"/paper/2305.11172","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:c731ada672afd2d40a8f73cbbfcfb94fca99d6d01007aefeba780b7e686ba033","observation_id":"7a516517-397a-4f39-9f64-924ee457cd8b","resolution":{"observed_at":"2026-08-01T14:46:37.000739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04883","last_updated":"2024-05-10T07:18:00Z","snapshot_observed_at":"2026-08-16T13:54:25.513308Z","submitted_at":"2024-05-08T08:32:34Z","title":"FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04883","snapshot_observed_at":"2026-08-01T14:46:37.087060Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:37.087060Z"},"links":{"cited_paper":"/paper/2405.04883","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:504b391fe5f7c14328fec2a761dc9929cff657ce86edaae312af55ca8da98d1b","observation_id":"16fb1421-1626-4ff0-8819-e61a07bb8cec","resolution":{"observed_at":"2026-08-01T14:46:37.087060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11895","last_updated":"2024-07-16T16:24:31Z","snapshot_observed_at":"2026-08-16T13:33:41.891783Z","submitted_at":"2024-07-16T16:24:31Z","title":"OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11895","snapshot_observed_at":"2026-08-01T14:46:37.144047Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:37.144047Z"},"links":{"cited_paper":"/paper/2407.11895","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:1080d1c5faf900ee94776fc43ecaf261a129a0579c5d106f1895b8c9e37d3780","observation_id":"5c244156-7a6f-4b8b-a694-fb7c9f93d971","resolution":{"observed_at":"2026-08-01T14:46:37.144047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02415","last_updated":"2024-05-30T04:45:34Z","snapshot_observed_at":"2026-08-16T14:29:46.614553Z","submitted_at":"2024-01-04T18:59:12Z","title":"LLaMA Pro: Progressive LLaMA with Block Expansion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02415","snapshot_observed_at":"2026-08-01T14:46:37.217436Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:37.217436Z"},"links":{"cited_paper":"/paper/2401.02415","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:cf255fc5b1dd6971c78e0d37c0080aaf0fd2dee06a6ca3ce5a25d65f2da2eda9","observation_id":"69d92c79-17be-4057-992c-9775f701c4a2","resolution":{"observed_at":"2026-08-01T14:46:37.217436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06687","last_updated":"2024-03-21T21:35:04Z","snapshot_observed_at":"2026-08-20T19:36:56.701359Z","submitted_at":"2022-11-12T15:25:20Z","title":"Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.06687","snapshot_observed_at":"2026-08-01T14:46:37.267511Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:37.267511Z"},"links":{"cited_paper":"/paper/2211.06687","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:9da0d32fd83f3980b1b97e4a4a78812390601cfee69436dc4da0ee70e9616c6c","observation_id":"466884e3-e9a4-4cb0-8fe1-c4c759f3ddd1","resolution":{"observed_at":"2026-08-01T14:46:37.267511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18360","last_updated":"2026-07-07T23:45:36Z","snapshot_observed_at":"2026-08-13T09:45:26.814183Z","submitted_at":"2026-04-20T14:50:33Z","title":"Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.18360","snapshot_observed_at":"2026-08-01T14:46:37.452149Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:37.452149Z"},"links":{"cited_paper":"/paper/2604.18360","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:a2b593dea241f388fa3b143750df69355b0a6172aae7da6881d94e4bc2062114","observation_id":"6bdb6fd7-8c7f-4bb0-a7d5-6875b20e7d87","resolution":{"observed_at":"2026-08-01T14:46:37.452149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-16T17:54:32.088103Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-01T14:46:37.507620Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:37.507620Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:84a37e438dfc4c6e0fe189f485b91f0deb438e9640551c93619f3fa26f23f241","observation_id":"9f2ca9a1-f9c7-4202-b1aa-55997cda9d8b","resolution":{"observed_at":"2026-08-01T14:46:37.507620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06986","last_updated":"2024-09-30T16:15:24Z","snapshot_observed_at":"2026-08-16T14:19:39.640988Z","submitted_at":"2024-02-10T16:34:26Z","title":"Cacophony: An Improved Contrastive Audio-Text Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06986","snapshot_observed_at":"2026-08-01T14:46:37.580702Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:37.580702Z"},"links":{"cited_paper":"/paper/2402.06986","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:c035f0d3c44d94545de24cbf74732de673817e80f9a11f32aae79a7ecca9fb45","observation_id":"1c5044bf-9698-4589-9779-b99ceea62a69","resolution":{"observed_at":"2026-08-01T14:46:37.580702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:37.635148Z","title":"Proceedings of the 38th International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:37.635148Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:523722dd138b622220e1d5fa21060d18cb84be70d9c8092473e489beb5c4f1a6","observation_id":"fd0d16ba-1e07-4306-9b19-f2682e1fc1be","resolution":{"observed_at":"2026-08-01T14:46:37.635148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:37.681871Z","title":"IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:37.681871Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:e06cb020eb2e76b425a1342119a1b20aabebff69d639eb6200c98310281854e5","observation_id":"fa801a38-2d2c-4f50-a062-a5a306221f7a","resolution":{"observed_at":"2026-08-01T14:46:37.681871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:37.725928Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:37.725928Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:ace0231a933266bda62339ba97460811013c64484b314a24b69d6d19226d9656","observation_id":"599f4eb7-17db-44f4-9c7b-faad7eaed3ea","resolution":{"observed_at":"2026-08-01T14:46:37.725928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:37.801557Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:37.801557Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:5deab4f03e9aa6855cb0c307bfc95998403abd305709fbff476949b368abdc6a","observation_id":"e781a5ab-81a0-4df7-b7fb-4e3e8fc0e30b","resolution":{"observed_at":"2026-08-01T14:46:37.801557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:37.855705Z","title":"arXiv preprint arXiv:2503.22104 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:37.855705Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:7e3a3a1730d638195fb0a76172b88dcd1e0336e9623c53aac705275d8332f507","observation_id":"2dfa1100-0031-4ca3-82c9-ecc7068e01b8","resolution":{"observed_at":"2026-08-01T14:46:37.855705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:37.894574Z","title":"IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:37.894574Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:552cda64f98ad42cede0a0fe551f18cfc9588df6ded06a8d6cb62b63c68cb50a","observation_id":"061103b7-6c54-45fa-bbc7-636c46071a40","resolution":{"observed_at":"2026-08-01T14:46:37.894574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:37.952707Z","title":"Proceedings of Interspeech , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:37.952707Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:6b183ea1d3a55f5671606527653093e5db1b58f4119a358b08f71cd282903cd8","observation_id":"952714c6-b091-4fd4-8dfb-bffe40bc37f9","resolution":{"observed_at":"2026-08-01T14:46:37.952707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:37.999121Z","title":"IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:37.999121Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:0ff899cb2d6d0d10c3a89754165d4e9406533f90f7fc680a4fc3ede98cac149e","observation_id":"cb7a9ca5-6e72-48a3-bfbd-4b9b9141d9ff","resolution":{"observed_at":"2026-08-01T14:46:37.999121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:38.057883Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:38.057883Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:7046349b2437af705084e20e35fcfa3a3848e6eb033dc75902e12855dba4022c","observation_id":"3a98c961-34bd-4f77-af8f-8f28281cc7d2","resolution":{"observed_at":"2026-08-01T14:46:38.057883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:38.105039Z","title":"NeurIPS 2024 Workshop on Audio Imagination , year =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:38.105039Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:6fc07cb6336640ecf1f8dc3c675e9719a96d44350832d13399e5a1b161aa0342","observation_id":"2415df8d-c687-4351-aed6-2560df305a3d","resolution":{"observed_at":"2026-08-01T14:46:38.105039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:38.159072Z","title":"Proceedings of the Annual Meeting of the Association for Computational Linguistics (ACL) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:38.159072Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:56db4cef57f43339971ab4baf3a34389f9fc252765743ee96cd451aa489c53c7","observation_id":"e1289a50-85c5-4696-8087-93709f687896","resolution":{"observed_at":"2026-08-01T14:46:38.159072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:38.180937Z","title":"arXiv preprint arXiv:2602.18010 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:38.180937Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:2588b3a9f6d04e4a997eacc6473900707fef39416f5e5c3f5095dad3a7bbb6a2","observation_id":"d312b185-47de-430b-9a07-43a04289dc71","resolution":{"observed_at":"2026-08-01T14:46:38.180937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:38.190713Z","title":"IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:38.190713Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:1dbf5463a65088b2521fd246bc85100f968041b16ecfc094c8f7b22cefa34375","observation_id":"fbc09cc0-077c-4eb5-8efc-3d8d06d458b3","resolution":{"observed_at":"2026-08-01T14:46:38.190713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:38.345481Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:38.345481Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:715abb1f129f42aedb1ada274ae9633506a0a6945648eb7045ccd35bba341f14","observation_id":"80f6a33a-30a6-4d31-887f-7209a011635d","resolution":{"observed_at":"2026-08-01T14:46:38.345481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:38.581883Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:38.581883Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:09f9f093220a1da5864dd404596bd759a398d84b50a4d431db4f6f8b82047e05","observation_id":"a5ff43d4-5367-4828-9ccd-f27d986b2e10","resolution":{"observed_at":"2026-08-01T14:46:38.581883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:38.748217Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:38.748217Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:d05eaf9bdf0d37b42c0cde99772cd8da1227bff9408c484cbdb8a3728b7a57f4","observation_id":"29b6ff79-97ed-4a18-be6c-0d86169c30eb","resolution":{"observed_at":"2026-08-01T14:46:38.748217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05160","last_updated":"2025-01-02T05:26:47Z","snapshot_observed_at":"2026-08-17T02:26:12.770175Z","submitted_at":"2024-10-07T16:14:05Z","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05160","snapshot_observed_at":"2026-08-01T14:46:38.841577Z","title":"arXiv preprint arXiv:2410.05160 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:38.841577Z"},"links":{"cited_paper":"/paper/2410.05160","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:faa2e9742b289d968c050c9abdd31de54cd91956c870901de8501bd701b35376","observation_id":"7259845c-4ffd-4294-8ecc-1215f35304e2","resolution":{"observed_at":"2026-08-01T14:46:38.841577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:38.958639Z","title":"2025 , note =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:38.958639Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:331e63fe5ca09bb677015482bd74bce8267aed784b1b50553da22a4a4adbb710","observation_id":"86e71f96-af87-4432-8e3c-dc9f73061587","resolution":{"observed_at":"2026-08-01T14:46:38.958639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.04720","last_updated":"2026-01-19T09:03:26Z","snapshot_observed_at":"2026-08-14T12:22:57.900954Z","submitted_at":"2026-01-08T08:36:06Z","title":"Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.04720","snapshot_observed_at":"2026-08-01T14:46:39.076080Z","title":"arXiv preprint arXiv:2601.04720 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:39.076080Z"},"links":{"cited_paper":"/paper/2601.04720","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:4f545a62bed4e74745e4da8010016be9be1bd5616b83f84b2849cbf224f543fd","observation_id":"d08b9b34-db73-45bd-83e1-18c7d7791da9","resolution":{"observed_at":"2026-08-01T14:46:39.076080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-01T14:46:39.196285Z","title":"arXiv preprint arXiv:2503.20215 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:39.196285Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:e31cd1a27c4881b25a43c4ea8a173182eb0d0ffd19f5c5ea4e37f091730ae8f6","observation_id":"8c1e66ad-1c0a-4d6b-99a7-3319471a8826","resolution":{"observed_at":"2026-08-01T14:46:39.196285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:39.387161Z","title":"Proceedings of the 40th International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:39.387161Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:1081869435ada5734e591ec9e8820888246b45878479a6a1095bd4bda0eb97ec","observation_id":"bb53797d-d1a0-482d-93c2-7f5783ddd66a","resolution":{"observed_at":"2026-08-01T14:46:39.387161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:39.547173Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:39.547173Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:80c292341452e45cfb0c5784fb21af46f2ff2fd03b2fadc5672d4a5029b2dfaa","observation_id":"7f793620-dc88-486f-bf46-aeba4f56aec4","resolution":{"observed_at":"2026-08-01T14:46:39.547173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:39.715292Z","title":"2024 , note =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:39.715292Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:79e5e0782366a5e47af0482fcb93f111ac504ad5a1c3a30a20682e144b4da7a0","observation_id":"04eb5247-40af-4f8e-af5a-04d69deb0837","resolution":{"observed_at":"2026-08-01T14:46:39.715292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08384","last_updated":"2026-06-05T21:57:48Z","snapshot_observed_at":"2026-08-11T13:55:38.585800Z","submitted_at":"2026-05-08T18:45:15Z","title":"jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.08384","snapshot_observed_at":"2026-08-01T14:46:39.850618Z","title":"arXiv preprint arXiv:2605.08384 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:39.850618Z"},"links":{"cited_paper":"/paper/2605.08384","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:605b54d75ab18bca27a43149abe34eb5acbcd1a41afba6c51cd05641dcb531ca","observation_id":"52ac5066-cd7d-4ce6-9123-5feb62406751","resolution":{"observed_at":"2026-08-01T14:46:39.850618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-01T14:46:39.962437Z","title":"arXiv preprint arXiv:1807.03748 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:39.962437Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:99567f1b7bcf2074f18c11b6d26ff4ad0b29871a26c406253b90d12136081f77","observation_id":"e9bc642b-c236-4b50-857b-a291c80e89dc","resolution":{"observed_at":"2026-08-01T14:46:39.962437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:40.118060Z","title":"European Conference on Computer Vision (ECCV) Workshops , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:40.118060Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:7859d5fd9b7a00b30a4877797f9978567af1fd15147fcccc1642be0f6e0ce19a","observation_id":"ebb58c2a-665a-4d20-a1d9-1552299344fc","resolution":{"observed_at":"2026-08-01T14:46:40.118060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:40.258916Z","title":"Proceedings of NAACL-HLT , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:40.258916Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:77aa08d742ba6358baf21c72b6f8051fed09c38adf354a4b0fd7fbfd1b785813","observation_id":"fbaca78a-f0da-416d-88ef-0dbfeeaa8cdf","resolution":{"observed_at":"2026-08-01T14:46:40.258916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:40.365360Z","title":"2025 , note =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:40.365360Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:6773fe731b67c5029006f1352e2f5307baf6ff0e06f9beeae5f7411d81aed5a5","observation_id":"91b90cb9-a1f3-4862-8d5d-132ec57dfad7","resolution":{"observed_at":"2026-08-01T14:46:40.365360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:40.527250Z","title":"IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:40.527250Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:6d477a780c3348d3b438d655f4b00e4d3fc4cc7eb4edafdb4ac70adeaf426084","observation_id":"f89ec496-6970-4802-9775-eb2cf4c13327","resolution":{"observed_at":"2026-08-01T14:46:40.527250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:40.664514Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:40.664514Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:e8593d3cafd8dff814bff8aeddac2b64d1b6644269fe00e7fc2053d0d8120879","observation_id":"c95594cd-9c5d-44f8-92db-ec7b4d5b23aa","resolution":{"observed_at":"2026-08-01T14:46:40.664514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:40.786590Z","title":"IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:40.786590Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:6cfc13b4a5ce34cf0001dde6e3e15e398b50a20f3e79c44f63c0e81eaf1f93af","observation_id":"694240ea-f39b-454b-9f16-0dc740280031","resolution":{"observed_at":"2026-08-01T14:46:40.786590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:40.895832Z","title":"Proceedings of the 23rd ACM International Conference on Multimedia , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:40.895832Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:f33261ebcdeeec9ce41984bf8fed3112f28a9400ecdb58b1dd8dcd0f56574526","observation_id":"0ef6708a-a80b-4f44-b2d0-7c83bda471da","resolution":{"observed_at":"2026-08-01T14:46:40.895832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:41.004932Z","title":"Proceedings of Interspeech , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:41.004932Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:847d9afbad1d3e9131379d234db3c41f5526d574d50319ddf9f6437d90fda206","observation_id":"9ebc7435-2115-4e6b-bde4-3403d1f32732","resolution":{"observed_at":"2026-08-01T14:46:41.004932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:41.150952Z","title":"Proceedings of Interspeech , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:41.150952Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:6da6da5e0d55c8d87aa5031c58910a0258534f1cdb36112ca96b062184fb444e","observation_id":"b6359bc2-20b6-43c5-9391-5569c67d2768","resolution":{"observed_at":"2026-08-01T14:46:41.150952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:41.223342Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:41.223342Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:f7539244d10c7085e19661e75c934a3a6d032a30c36e3850e795fde8868f0432","observation_id":"65fe257b-aab3-4299-b080-e6cddc37614b","resolution":{"observed_at":"2026-08-01T14:46:41.223342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:41.299158Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:41.299158Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:aed2ec48ee63aba7608236ea2412549b1416762889638d4b2ad50f9f2df75050","observation_id":"bac82362-830d-4c79-b817-39cecad1d3d9","resolution":{"observed_at":"2026-08-01T14:46:41.299158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:41.381838Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:41.381838Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:53f3348deec1d186971bca2cfe7cb265665daae3995ffc3f0d6418b4cf7e38f8","observation_id":"871750c1-3fb7-4a76-9732-f124b8e0bf12","resolution":{"observed_at":"2026-08-01T14:46:41.381838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:41.476775Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:41.476775Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:3cf3cb7e104943241ab7b81707e64909524db5c8b226d64f8452aee85497d4f6","observation_id":"e7c46df3-0d70-4dbe-89ee-082ef7a5542c","resolution":{"observed_at":"2026-08-01T14:46:41.476775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:46:41.586652Z","title":"International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:41.586652Z"},"links":{"citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:4ad246d7368c46bc6a3457ffae906859ec7948e9f9be1eadb478521c25909c2d","observation_id":"5b437d22-4816-4edf-84e9-98204630fe69","resolution":{"observed_at":"2026-08-01T14:46:41.586652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":71,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 2 inbound Pith citation observations for arXiv:2607.18666."}