{"as_of":"2026-08-19T10:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:56587897b45e4db1f686c1d23c6fc5fe9d3cc9a593c75ad3951cf1ee7125ef06","coverage":[{"denominator":4,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T18:59:42.949686Z","state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T14:46:37.452149Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.18360","last_updated":"2026-07-07T23:45:36Z","snapshot_observed_at":"2026-08-13T09:45:26.814183Z","submitted_at":"2026-04-20T14:50:33Z","title":"Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.18360","snapshot_observed_at":"2026-08-01T14:46:37.452149Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-17T16:58:02.976368Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:37.452149Z"},"links":{"cited_paper":"/paper/2604.18360","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:a2b593dea241f388fa3b143750df69355b0a6172aae7da6881d94e4bc2062114","observation_id":"6bdb6fd7-8c7f-4bb0-a7d5-6875b20e7d87","resolution":{"observed_at":"2026-08-01T14:46:37.452149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.18360/citation-record","integrity":"/paper/2604.18360/integrity","json":"/paper/2604.18360/citation-record.json","paper":"/paper/2604.18360"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T18:59:42.949686Z","title":"Benjamin Elizalde, Soham Deshmukh, Mahmoud Al Is- mail, and Huaming Wang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.18360","last_updated":"2026-07-07T23:45:36Z","snapshot_observed_at":"2026-08-13T09:45:26.814183Z","submitted_at":"2026-04-20T14:50:33Z","title":"Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T18:59:42.949686Z"},"links":{"citing_paper":"/paper/2604.18360"},"observation_digest":"sha256:3138825ab628532ce28ff94d453d304da30a626dc7ed1dc4484933004717f232","observation_id":"24e758f3-f4c4-40d2-915a-9144ccc93b36","resolution":{"observed_at":"2026-07-12T18:59:42.949686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T18:59:42.949686Z","title":"InProceedings of the IEEE/CVF Interna- tional Conference on Computer Vision (ICCV), pages 10274–10284","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.18360","last_updated":"2026-07-07T23:45:36Z","snapshot_observed_at":"2026-08-13T09:45:26.814183Z","submitted_at":"2026-04-20T14:50:33Z","title":"Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T18:59:42.949686Z"},"links":{"citing_paper":"/paper/2604.18360"},"observation_digest":"sha256:36cd92d3bd479a9bf6c4ac372df8567ac4ed064c6a7460ce96fd3e8eacdd7541","observation_id":"a739d04b-8478-412c-ad99-7947c3d3b5cb","resolution":{"observed_at":"2026-07-12T18:59:42.949686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16505","last_updated":"2025-02-20T00:51:26Z","snapshot_observed_at":"2026-08-16T13:07:13.015498Z","submitted_at":"2024-10-21T20:55:33Z","title":"Do Audio-Language Models Understand Linguistic Variations?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16505","snapshot_observed_at":"2026-07-12T18:59:42.949686Z","title":"InAdvances in In- formation Retrieval: 44th European Conference on IR Research (ECIR), pages 397–412","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.18360","last_updated":"2026-07-07T23:45:36Z","snapshot_observed_at":"2026-08-13T09:45:26.814183Z","submitted_at":"2026-04-20T14:50:33Z","title":"Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T18:59:42.949686Z"},"links":{"cited_paper":"/paper/2410.16505","citing_paper":"/paper/2604.18360"},"observation_digest":"sha256:b32ac653b449716223252595405050ef87691d7a0a9926807dacc755466dc02e","observation_id":"4a46be4b-f81e-4621-98ff-aa683d63ea23","resolution":{"observed_at":"2026-07-12T18:59:42.949686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23511","last_updated":"2026-05-11T14:54:52Z","snapshot_observed_at":"2026-08-15T03:45:58.298182Z","submitted_at":"2025-07-31T12:47:43Z","title":"MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23511","snapshot_observed_at":"2026-07-12T18:59:42.949686Z","title":"Simulated garbled radio traffic with crosstalk","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.18360","last_updated":"2026-07-07T23:45:36Z","snapshot_observed_at":"2026-08-13T09:45:26.814183Z","submitted_at":"2026-04-20T14:50:33Z","title":"Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T18:59:42.949686Z"},"links":{"cited_paper":"/paper/2507.23511","citing_paper":"/paper/2604.18360"},"observation_digest":"sha256:e127848f600705d78797c15541051b63bd6a8d8310be97b905a40b3628599e05","observation_id":"8c92d7c9-e623-4437-89c9-a362addbd4a7","resolution":{"observed_at":"2026-07-12T18:59:42.949686Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2604.18360","last_updated":"2026-07-07T23:45:36Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T09:45:26.814183Z","submitted_at":"2026-04-20T14:50:33Z","title":"Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval"},"reference_resolution":{"displayed":4,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":4},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 4 of 4 outbound references and 1 inbound Pith citation observation for arXiv:2604.18360."}