{"as_of":"2026-07-26T23:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1d2a6fa45a6f8c1242260d07226c22461d9e6fd251b116de258820340f014d2e","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T05:57:09.345415Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-26T06:30:07.085553+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.29628/citation-record","integrity":"/paper/2605.29628/integrity","json":"/paper/2605.29628/citation-record.json","paper":"/paper/2605.29628"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:7e793ed89f9ca96ef05bf07ee2d5ad9e3973e11e28ecba68ccc7d69b154691a6","observation_id":"bf76a0b9-a4c2-41ac-a666-a51fe07e10ac","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Natural language supervision for general-purpose audio representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:5f56496e138eff787ea8981210fd1545b851783b773f5f0ac6f6fbb94bc87dca","observation_id":"bf90d5c1-6494-4fb1-9e32-91fb3086d426","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:0c1b73eab43f1f81e421a460071ccdf4be96e9a614f38bbcea592685bb6bf75a","observation_id":"ba783362-e1b2-421e-8a32-2b5c9326cd14","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Wavcaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio- language multimodal research,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:a8eabcbd0742b6f57a3b291e3bda112abacb8c779d9356208b55757508842fa3","observation_id":"80c9bca2-1158-4312-ae47-5a8ac9944ab7","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Auto-acd: A large-scale dataset for audio-language representation learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:b29f26f59d605b6f3f63b4add66a2dfeeaaa875b47eff5e1d917e86da2b30d9d","observation_id":"4005e1c8-976b-44d3-8a32-15db5fa0a721","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Audiosetcaps: An enriched audio-caption dataset using automated gener- ation pipeline with large audio and language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:cb8d27b4b211af8ca0f4388aa2d74a7ee34eaa4fdd8c86c4a901ff33e25ea9e1","observation_id":"2bac5fcd-947d-4c25-85d2-cbb94a2516b2","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"A knowledge distillation approach to im- proving language-based audio retrieval models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:334861ff76601bc0666e3812cf7decad593d8e047fadf14ffef8c36e757902a1","observation_id":"a32f3683-0ed4-40b7-b62b-175adab839d7","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Aistat lab system for dcase 2025 task6: Language-based audio retreival,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:f8123ce96597ccfc04cc538bf896cb79ff5ba13744624166d6fbc99f81892c00","observation_id":"e90fdce7-0e45-4ea7-9ebc-b5ef48b75733","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Recap: Retrieval-augmented audio captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:f0ccf6c1ef74329c8ba7cbd463b14b9d3ec84f7eff4c83ea4e06f2e0f4108d9a","observation_id":"12a2bdaf-b58f-4c48-9d74-14c602bb9587","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Diffusion-based diverse audio captioning with retrieval-guided langevin dynamics,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:edad0cbaf3c57589f60a6984ba64f55f0b8e136b8ff9bd60f90c1ba7360046a3","observation_id":"cd402f97-9875-47d3-8617-653c8ab47446","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Zero-shot diverse audio captioning with diffusion models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:665a10afa5e8a68a61fef741ab21a91e97c6e6526f1923b2f1f8ba1d0543794d","observation_id":"0a1c4316-182a-424f-8aea-467bf608a4c3","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Audioldm: text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:5e027ea7712ab0a7aac2a3e111a559ea258c19423bb65065fc9224526eb1e63c","observation_id":"9e10c007-48f9-4dbe-b198-a8bef43d222a","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"AudioLDM 2: Learning holistic audio generation with self-supervised pretraining,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:d652e35031381cfa229f214340675d393a7865bf59ca82096941164df7750aea","observation_id":"ad1a90de-32d4-4aec-8ca0-ce3d60bac504","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Weakly-supervised automated audio captioning via text only training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:d0cae3e4779bc4b24cb77cce95beed94c9a0bdb3a96425234e3a0dac2286d271","observation_id":"b5f6122b-f453-4d12-a221-57290e772d20","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Training audio captioning models without audio,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:3d39d75d07f43fc34639a12830d05bc716c5635e543f04a21ba71564314fc85e","observation_id":"40c80b2f-542d-4ae2-b716-31f0052450ba","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Zero-shot audio captioning using soft and hard prompts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:5fb2c04e726579d8c4d68123d48a0e127cc57adfa7d39b65af1a9cd8b5515e8d","observation_id":"705d6885-3fa2-4e53-ba52-40dc94a1b6b3","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Drcap: Decoding clap latents with retrieval-augmented generation for zero-shot audio captioning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:619202cb0ae72c030b5196059e89a50bbc149e8df129496c532165acd45a2c2b","observation_id":"517d37dc-d995-4b18-9050-d58d15f201f3","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:f51c88cfb1aff8150c3712a7f9d5f671ae08f4f2c506f94faac16fc30010c7c2","observation_id":"3405abec-0aef-4e87-b326-398c3540b467","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Two effects, one trigger: On the modality gap, object bias, and information imbalance in contrastive vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:32d3bae55cc883dc662744cbf460ef210fdd548fb9acc738eb9731a8e28bd2d5","observation_id":"9467263a-50c7-4a30-a2af-b1f1ec2e94ef","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.03268","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:03:08.635478Z","title":"Decipher the modality gap in multimodal contrastive learning: From convergent representations to pairwise alignment.arXiv preprint arXiv:2510.03268","venue":null,"work_id":"637d6e2b-7dfc-4367-8ec5-f59c7ca04eb1","year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:6eb351e788511260ff62b12700f078360c235841ee0ea768a3f788ba5286923c","observation_id":"b121d8e5-0998-4b21-af9c-b7c55158ceb5","resolution":{"observed_at":"2026-06-29T06:03:08.636879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Decap: Decoding CLIP latents for zero-shot captioning via text-only training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:54157735e8879893b6d5fc8eefd97f9f1d7de693b4fd9e71805f298e4b31a4dd","observation_id":"d9f79375-a353-42c1-9e42-f2e43fc89d16","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Diffgap: A lightweight diffusion module in contrastive space for bridging cross-model gap,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:2a02763b4b095b214a6589173cd98f1142e385a7998adbb307dac2e472418f94","observation_id":"f8bc2571-5742-47e3-b795-747b74dc22d2","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:03:08.637896Z","title":"Diffusion-link: Diffusion probabilistic model for bridging the audio-text modality gap,","venue":null,"work_id":"92bba0c3-b074-499e-bf0a-8a03fdf6f3c4","year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:8c6c6bf1aa7c2b1ac0c8952db88c2dabda45acc80b205dd49cf875beff0a5096","observation_id":"6aebe9d8-22a5-4281-9766-c294568d773c","resolution":{"observed_at":"2026-06-29T06:03:08.639371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Pull it together: Reducing the modality gap in contrastive learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:b1260d55c6a5bf3e671ed8b0f74e1a08273db6d901f56400e4c32daa918265e7","observation_id":"2abe19dc-5c38-4b5c-afc7-fccac2fb3c0a","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Interpreting clip with sparse linear concept embeddings (splice),","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:17198d458deb7eff4ea3035d7aa8b16619b3f2e05a6a48639e5a2efc33987e80","observation_id":"54a2e44b-1341-4541-8f30-8ad2955ac96b","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13831","last_updated":"2025-06-16T02:43:11Z","snapshot_observed_at":"2026-07-06T21:43:08.398464Z","submitted_at":"2025-06-16T02:43:11Z","title":"Quantifying Structure in CLIP Embeddings: A Statistical Framework for Concept Interpretation","version":1},"cited_work":{"arxiv_id":"2506.13831","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13831","snapshot_observed_at":"2026-06-29T06:03:08.630097Z","title":"Quantifying structure in clip embeddings: A statistical framework for concept interpretation,","venue":null,"work_id":"337f57b1-e959-4db2-8571-f579c09f72a2","year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"cited_paper":"/paper/2506.13831","citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:4e804764a313b42120e4481834ea8c7d2de4efd8cf5df48906c3c558bd0f8b0a","observation_id":"cd08f819-fcaa-467b-a8d8-3e96c3809afc","resolution":{"observed_at":"2026-06-29T06:03:08.631498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.13884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:03:08.635148Z","title":"Scocca: Multi-modal sparse concept decomposition via canonical correlation analysis,","venue":null,"work_id":"4e835fb3-ddef-4250-a524-540f13e1ae92","year":2026},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:eef45cb8fe9a33b302cb2974598b564cfddbdf0bc0236a113ec37159f0321ee1","observation_id":"ad996e2e-43f7-4f05-ae86-3585194ea51f","resolution":{"observed_at":"2026-06-29T06:03:08.636518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Momentum contrast for unsupervised visual representation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:615be4a1749bdab1c5ef011bfbe2cd9e3d817da19d295e178b69154b6ce84f0e","observation_id":"4da3e290-4b67-44a2-89ca-d6f74da0be72","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Pengi: An audio language model for audio tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:b307caad8fd6846bc48a79f1090846fb8db612e08e47d2448ea6fd98d9a76921","observation_id":"475ea1a4-0854-46e7-8870-78bb50e2c591","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.14003","last_updated":"2026-04-15T19:46:03Z","snapshot_observed_at":"2026-07-06T22:30:07.020487Z","submitted_at":"2025-09-17T14:13:40Z","title":"RFM-Editing: Rectified Flow Matching for Text-guided Audio Editing","version":2},"cited_work":{"arxiv_id":"2509.14003","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.14003","snapshot_observed_at":"2026-07-04T05:39:39.405695Z","title":"RFM-Editing: Rectified Flow Matching for Text-guided Audio Editing","venue":"cs.SD","work_id":"0e3c7410-f571-4b4b-abda-e46b0b76d1af","year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"cited_paper":"/paper/2509.14003","citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:8c98248e13f6943ee51497bb24a03f9a1e8dca6dbc1523054b49563cd197b3d6","observation_id":"b05a1972-270b-4202-9cb2-4fb9dafd1a4c","resolution":{"observed_at":"2026-06-29T06:03:08.638708Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"A holistic approach to unifying automatic concept extraction and concept importance estimation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:d5380229e93b972469f4de25d38934a20f434b43d11b63dd02f216d4dc02e542","observation_id":"833b8a30-19f8-4a9f-ba06-48d2ce7367a5","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Interpretability beyond feature attribution: Quantitative testing with concept activation vectors (tcav),","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:6914623182bf2e34be94b204efbfbd26ac009fa0efe39a00ed4777d15976cccb","observation_id":"d9cd8797-0d9f-4b94-a66d-ca639d40d7fe","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Craft: Concept recursive activation factorization for explainability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:419452f9f10067694e9c359fea9f539a21efa4b203c1e12734955dc388b79138","observation_id":"2f2fcb08-1e0e-4218-ac1f-fd56129ea48c","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Multi-dimensional concept discovery (mcd): a unifying framework with completeness guarantees,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:5da0b6734072e6a6f132f049eae25bb6f3bb92083e90cfc0f2bdf30935cdabe6","observation_id":"d7a63104-7bc1-4639-9236-52274dc23bee","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Concept bottleneck models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:67c296b50e8d3b1f42483a2b78e70804cadbbb50ae6487dcf96865dcb5827378","observation_id":"26bfd95d-d137-4e49-b0c2-40e4839c881b","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Label-free concept bottleneck models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:dca033498b4e6059e91ca84b9c488feee35243875bd83b2c990b4e0e5b30d1c5","observation_id":"0446b9f3-4703-4683-824f-d11d1cd78ded","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Post-hoc concept bottleneck models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:6dd35958651ae89dc3d8aa7d2d450c474b116ba578383b2c2d1aa34e1f62111e","observation_id":"4dfd76a3-7016-4a37-aa6a-0b1305a3bc06","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Transformation of audio embeddings into interpretable, concept-based representations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:c738c3429e5fc8850b9345f10101a7b8ed44f7bb677a95b086b906e1d6a59021","observation_id":"cb7b42c9-3a10-4abf-877f-d21751c8924c","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Pre-trained vision-language models learn discoverable visual concepts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:c308b825dd4cd8ca02d9a3c5ab546fc078ecd71e31a5d5ee3cd02253bab11e47","observation_id":"95ea3e1a-cb9b-41d3-8908-b33ac34e4a29","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Diagnosing and rectifying vision models using language,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:0d86b80b9b09fde7f3c4f51a89205b25b47aac0cf36245386a342b5cbd22a0c0","observation_id":"5f2570ed-f8f8-4d36-a6fa-40e79b8fc1c4","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Towards understanding the modality gap in clip,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:db53c386e9e37db11d6a7c9a94d7d66b66ad3166cedbfb3f3820e4a037091b15","observation_id":"f2ad5a0f-563c-4a19-b6f4-9729f40ce458","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Connect, collapse, corrupt: Learning cross-modal tasks with uni-modal data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:7a18970da269e02de9819fac4e3f3b631a06fae140ce10c3c30b4b1ee59f13c0","observation_id":"9a4233b3-6db7-402a-a92a-8511f24b90a4","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Closing the modality gap for mixed modality search,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:2dbc26089e91b5cb94b757b453e01787ea39eb561020c00bc05277f29cc094ca","observation_id":"73851fe5-8e83-4ff8-a1bc-dcea43511a14","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Explaining and mitigating the modality gap in contrastive multimodal learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:c47a83bde4ea98613c94615519b96d829ce7478b4b0cd9864be8bd56270e7ff0","observation_id":"3ef71513-dca9-4e70-b460-07b04c34407d","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Closing the modality gap enables novel multimodal learning applications,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:c500404ca65baba0a2c5ee2dba138439a16b28bc6e0d807879d8503f9560a522","observation_id":"23b7f815-7f4b-4b2c-a518-66246661df5c","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Accept the modality gap: An exploration in the hyperbolic space,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:ad02a8e4c0b482cb54946bd7a825ef9efbdff265b5cafadd43163b91146f27f6","observation_id":"a49361d7-a67b-47cd-b02d-e9b55aecd243","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18570","last_updated":"2024-06-06T20:29:21Z","snapshot_observed_at":"2026-07-06T18:21:35.476139Z","submitted_at":"2024-05-28T20:28:07Z","title":"It's Not a Modality Gap: Characterizing and Addressing the Contrastive Gap","version":3},"cited_work":{"arxiv_id":"2405.18570","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.18570","snapshot_observed_at":"2026-06-29T06:03:08.639826Z","title":"It’s not a modality gap: Characteriz- ing and addressing the contrastive gap,","venue":null,"work_id":"c9e03b07-8bec-433e-83dc-e9911ac42632","year":2024},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"cited_paper":"/paper/2405.18570","citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:4f18c35915127bc886ff377e7d602d440418a07dad60c66a1b14d8e0b05d0f61","observation_id":"095f858a-977d-41b5-a884-82c73fa1597d","resolution":{"observed_at":"2026-06-29T06:03:08.641708Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Understanding contrastive representation learning through alignment and uniformity on the hypersphere,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:c6ec3683648645770e779b7fe9af76ed8a40ce6c9f0e8f88569da3f4ab35748f","observation_id":"000e53ae-7bb6-4eb8-9572-d56466ec55b3","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"I0t: Embedding standard- ization method towards zero modality gap,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:cdd01af1cdda200902fc282525de71df8354f74d4bce76f585ff28682c75235f","observation_id":"18969ec8-56ac-4c81-9eb2-70180cf56ebb","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Mitigate the gap: Improving cross-modal alignment in clip,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:ec9b604fd394b76beae98e2fdc372274e839ff127589c337b0e1aa2e928c4ce4","observation_id":"4a659d79-3bd4-4f65-b54e-bbccc4a8234f","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Diffusion bridge: leveraging diffusion model to reduce the modality gap between text and vision for zero-shot image captioning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:92c748849deb8d8e00a1a5ea99a8e04fd6a6d69505942cb00cc38a896e034787","observation_id":"91826cf2-389b-49cc-816c-6b9b2729b342","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Text-only training for image captioning using noise-injected clip,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:b87cc435cb5bb740bfb8bb87eb76b097ccd15dd4b137a4f2869ea055321d951a","observation_id":"37c0ad62-10ac-41fb-9714-702e18ca2f81","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"I can’t believe there’s no images! learning visual tasks using only language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:6cc775943ab434a24bcf0a435d391d70bf4e2c1011a77a9ddda1c5558eb9ee45","observation_id":"ddfa88a2-fb46-4d02-a494-89b72c930154","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Zero-shot audio cap- tioning with audio-language model guidance and audio context keywords,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:6aa17f44c01427a3f12541be2597dc84b7b3a419b2b724dc3afcf9bd6b55884d","observation_id":"6d5e0f4e-f693-49de-86aa-7aaa162dd587","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:ce44a6f6b5427045af5641b871364a2dc2e3d10bff146ada52a57c923268cfea","observation_id":"747cfef5-1816-4fc2-b7b5-0c2c4ff288a2","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03884","last_updated":"2023-09-07T17:45:58Z","snapshot_observed_at":"2026-07-06T16:15:50.904062Z","submitted_at":"2023-09-07T17:45:58Z","title":"Zero-Shot Audio Captioning via Audibility Guidance","version":1},"cited_work":{"arxiv_id":"2309.03884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.03884","snapshot_observed_at":"2026-06-29T06:03:08.643154Z","title":"Zero-shot audio captioning via audibility guidance,","venue":null,"work_id":"c80ca778-38df-4351-b41c-ff649135e5cc","year":2023},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"cited_paper":"/paper/2309.03884","citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:3206cd8ba33c053150ae33cd400c3d7a592203906c9d2adcb3597ea1a0e8d887","observation_id":"f36373dd-d80d-4431-9350-ee07b5b97023","resolution":{"observed_at":"2026-06-29T06:03:08.644737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Clotho: An audio caption- ing dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:2f430516f25afdd3ae9434b81393a8853db3a983fe59bc7cce759a1bb0a32499","observation_id":"4c7c599f-ad27-4bd3-8e18-a15e5170f782","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Audiocaps: Generating captions for audios in the wild,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:77a6ffdc7eecfff676fbf71a43fbde5802f55ec3be499927f8aac5d6e2e6f363","observation_id":"4faa5d1c-f4fd-4235-9302-be6dcdd01529","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Sound- vecaps: Improving audio generation with visually enhanced captions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:54809c3d25fbe692e398b2b35ae766db5b64f4089c5b6aa63bf041910f6bd744","observation_id":"6f0c301b-1a3e-4849-9cbf-fb22df780c68","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:89191539f0117cee69a51d8c13359c025385b4e40bcb9591f36caca9aae8d8d7","observation_id":"6b0b85f9-6c33-4ccc-a111-c3e92e7af6ba","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:ff61a688ff2005be57dde1eb4ae89df26170cf0c95f449aeeaad00d16dc907f1","observation_id":"34a35603-cffa-40f4-bbc7-efca01fa73aa","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:f58e64f8245b7d5e93af5a9ecd7b6868cf0a4ab26ebc3d4faf14775aade647da","observation_id":"0512697c-fceb-4c5c-9d30-cff754efb79b","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:bba2a0a460b13e9d9d7a74c4493b04134e162f1edba790ef8a35d2e9e9f5d328","observation_id":"476834c8-0eb4-4527-8896-c91a0022b29f","resolution":{"observed_at":"2026-06-29T06:03:08.647152Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Minimum bayes-risk decoding for statistical machine translation,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:4a5ea24fd966194422918f949cbabc861ceaa978b9048a8f70caca0cf902e8c1","observation_id":"3e8b5a78-a490-4e51-b9b0-446119adac02","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"HTS-AT: A hierarchical token-semantic audio transformer for sound classification and detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:76a776c39058c60015a1587aca64fdc27e5a4e64be669489daa9bb720e6b336f","observation_id":"04e30bf6-da41-4fe0-8399-f93dcc6b0ece","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"BLEU: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:263b8e94cf8778604bf1a9a750149caa36cbbb4ae63848e9abb591ae1c680ecf","observation_id":"014ba787-2807-48e7-80a7-fedf2e8a7d72","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"METEOR: An automatic metric for mt evalu- ation with improved correlation with human judgments,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:194d44ef16e707ebab9ae37ca958629747a32f538105cbb14c92c4eaebbc8ad4","observation_id":"b05a7edc-830e-44c8-8514-07331e3ac093","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"ROUGE: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:dd285e154eccc9898b9d54ba658b9c5f59a7a4f5dd4370cb1dbd16cdcec289b1","observation_id":"18ffae39-cf05-409b-8be9-8f3b17fd2bd0","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"CIDEr: Consensus- based image description evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:007aa385c36ea0699d2bf55f28ed1c212c67fab398b6fe71e3561431ccd614a1","observation_id":"36c29d42-09ff-496f-8ed6-0f3cbd3e2dd2","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Spice: Semantic propositional image caption evaluation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:19b4533284ad0c5eb63cbbe875cdda0992509db6d5b58945176448199b3c85bd","observation_id":"7ee97865-41ce-49c8-b69c-d956dca43a94","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:57:09.345415Z","title":"Improved image captioning via policy gradient optimization of spider,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-29T05:57:09.345415Z"},"links":{"citing_paper":"/paper/2605.29628"},"observation_digest":"sha256:8c9f2ddd8ac538bbcea529dddf416e2db20a8b7b2252829ebe805dc5ccfab297","observation_id":"85e1deeb-d75c-4cb7-ad86-e0adf153b31e","resolution":{"observed_at":"2026-06-29T05:57:09.345415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.29628","last_updated":"2026-05-28T09:00:44Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:00:44Z","title":"COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":8,"verified_fuzzy":0},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"thesis":"As of 26 July 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2605.29628."}