{"as_of":"2026-08-18T17:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16ac13914b8aa0714c7f9c204584e9947c67784b39041a88b36a3d3c18a1dec6","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:29:30.849620Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.01356/citation-record","integrity":"/paper/2412.01356/integrity","json":"/paper/2412.01356/citation-record.json","paper":"/paper/2412.01356"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:31.168298Z","title":"Language-Based Audio Retrieval Task in DCASE 2022 Challenge,","venue":null,"work_id":"8590091d-4cb4-4896-901f-1125e76df3c9","year":2022},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.756641Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:c01af1dd47368b3af5e2a69ab3d94ba57a8a4e87eb3f3163ee4109a86d094e22","observation_id":"d54ccc7c-78ef-43de-891d-e2760bac62ad","resolution":{"observed_at":"2026-08-12T04:29:31.171487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:31.158207Z","title":"Improving Natural-Language-Based Audio Retrieval with Transfer Learning and Audio & Text Augmentations,","venue":null,"work_id":"f6aa9cd9-d80b-43ff-9f5e-6e90e724a001","year":2022},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.760639Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:ffc77f9ba318735cff7698eba9c4b038600e77319ea9b9f8c71e0c2845650474","observation_id":"f62bbf35-64f5-40d8-8267-bee3aae09633","resolution":{"observed_at":"2026-08-12T04:29:31.161685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:31.147916Z","title":"Matching Text and Audio Embeddings: Exploring Transfer-Learning Strategies for Language-Based Audio Retrieval,","venue":null,"work_id":"080f38f9-a2ed-4cc6-b82d-68520cc1720f","year":2022},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.764107Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:17cbed5b4eba4cc944fa63281a12b1553fb7f5ad00d28d51a28411e17336dd34","observation_id":"d3d6a855-df62-41aa-a998-ef08512a331f","resolution":{"observed_at":"2026-08-12T04:29:31.151265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:31.138339Z","title":"Large-Scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation,","venue":null,"work_id":"e41ad189-f2b2-42e2-a4c0-35e09da73537","year":2023},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.767800Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:3b613457d1888d07fe8621eedaa349bf76f66bd28e214ef637934a4ece31a191","observation_id":"932fcd97-c9a4-4002-baf7-e022f3b1eb62","resolution":{"observed_at":"2026-08-12T04:29:31.141738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:31.128130Z","title":"WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research,","venue":null,"work_id":"eebf28d6-8e2a-40b0-add2-56771eb96ff9","year":2024},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.772078Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:e0403f0d9e1294aa72a5572723414aa13aa499c9a6c896decd2c6134e5e7901b","observation_id":"dd3dbe2f-db55-4696-9997-d2104e6f41f1","resolution":{"observed_at":"2026-08-12T04:29:31.132169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:31.117478Z","title":"Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning,","venue":null,"work_id":"16225f10-7bbb-4e2d-98c3-106eef7eb5f5","year":2024},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.776273Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:4de3e2e39934332811cc34231a32f4c8e884f08f3b06d894f61bd2e2d52611be","observation_id":"cffba290-5e42-4089-9ee6-0a04c523689f","resolution":{"observed_at":"2026-08-12T04:29:31.121899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:31.107640Z","title":"Advancing Natural-Language Based Audio Retrieval with Passt and Large Audio-Caption Data Sets,","venue":null,"work_id":"ac1c0a3c-03fe-44f7-b672-efc83105bf40","year":2023},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.779789Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:b310c2b83213faa1b48a88c5ad3d5ae79611db3e9eae99ec43e70e1700bd05a2","observation_id":"8fb02410-cb4e-4d2d-954d-174335f52f97","resolution":{"observed_at":"2026-08-12T04:29:31.111192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:31.097411Z","title":"Language-based Audio Retrieval in DCASE 2023 Challenge,","venue":null,"work_id":"98010854-3109-4350-9557-2781f7eb9387","year":2023},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.783281Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:b5e8238f0955e5eb6d5057934a4be8c100b23b5f87c91cb78355481318769380","observation_id":"b2fab24d-c5ba-4752-a01a-a134a45c827c","resolution":{"observed_at":"2026-08-12T04:29:31.101147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:31.087025Z","title":"AudioCaps: Generating Cap- tions for Audios in The Wild,","venue":null,"work_id":"edab845b-1dcb-4824-b652-b2663f765ac3","year":2019},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.786604Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:75813aeeed2ebb23e986d3623dcfa85c68056ebe7742aa023107efd458c00bfd","observation_id":"4f6547c7-2fa3-4bb2-bc93-b781b1605063","resolution":{"observed_at":"2026-08-12T04:29:31.090549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:31.077256Z","title":"Clotho: an Audio Captioning Dataset,","venue":null,"work_id":"44541b8a-5613-4599-a309-8f327335a49e","year":2020},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.789720Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:94a191770414b719b75ba1461140cd6a070f3114043c5d07a657137fab456235","observation_id":"2a84f74e-62bf-48c7-a417-791813cf2f8a","resolution":{"observed_at":"2026-08-12T04:29:31.080742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:31.067198Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks,","venue":null,"work_id":"05bd8200-83bd-45a7-aaae-ea9a21b2fb70","year":2019},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.793581Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:8eeed1c095d31c20297507739223b075da39cf53c07d3f81a90aa29bb34a5f39","observation_id":"73cdbc5b-87b8-47e1-88fd-b13e44179738","resolution":{"observed_at":"2026-08-12T04:29:31.070655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:31.057597Z","title":"Graded Relevance,","venue":null,"work_id":"2c9d6fe0-a026-4d7a-8544-6036301a95db","year":2021},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.797234Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:dd935df247760421eacd812441b5972a693088ccbe7896af557856f54a89be4f","observation_id":"293b2e9f-5f5c-4ff6-a492-e3cd7cd04e0a","resolution":{"observed_at":"2026-08-12T04:29:31.060980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:31.046426Z","title":"On the effect of relevance scales in crowdsourcing relevance assessments for Information Retrieval evaluation,","venue":null,"work_id":"55852a07-5f1f-4b11-85d3-59c97051d5f6","year":2021},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.800644Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:bae07ecd2e89b60c57a207e6701b1a2d687b7ff63eb2ed6bd0bc4c8ae31cdc26","observation_id":"f75ef85d-f33b-4c95-ab54-88d4ceac6072","resolution":{"observed_at":"2026-08-12T04:29:31.050644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:31.036900Z","title":"Crowdsourcing and Evaluating Text-Based Audio Retrieval Relevances,","venue":null,"work_id":"e111597d-b1f7-4e4b-a529-34d7c3a2657d","year":2023},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.804013Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:ec64d2e1c7f8e63c97a1a78b8b110ea38dea29936a636b778ad0e7a270fa84e7","observation_id":"5416fdc1-b405-4654-90bb-878c841f2856","resolution":{"observed_at":"2026-08-12T04:29:31.040285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14939","last_updated":"2024-08-27T10:23:26Z","snapshot_observed_at":"2026-08-16T13:23:33.136989Z","submitted_at":"2024-08-27T10:23:26Z","title":"Integrating Continuous and Binary Relevances in Audio-Text Relevance Learning","version":1},"cited_work":{"arxiv_id":"2408.14939","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.14939","snapshot_observed_at":"2026-08-12T04:29:30.927656Z","title":"Integrating Continuous and Binary Relevances in Audio-Text Relevance Learning","venue":"eess.AS","work_id":"8c1b1219-a816-47c5-82d6-1cdd4bbc9549","year":2024},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.807338Z"},"links":{"cited_paper":"/paper/2408.14939","citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:c2cfb8a8fdd99a91f4f2a48074e52f37c333cc13adad9d395e3658378adf0d2e","observation_id":"b8bb1445-9b22-41b0-9c59-ca365e320b1c","resolution":{"observed_at":"2026-08-12T04:29:30.931577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11641","last_updated":"2024-08-21T14:10:58Z","snapshot_observed_at":"2026-08-16T13:24:53.269631Z","submitted_at":"2024-08-21T14:10:58Z","title":"Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval","version":1},"cited_work":{"arxiv_id":"2408.11641","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.11641","snapshot_observed_at":"2026-08-12T04:29:30.914209Z","title":"Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval","venue":"eess.AS","work_id":"69c927d7-65f7-4db8-bf7c-8ae8bb428e1b","year":2024},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.810891Z"},"links":{"cited_paper":"/paper/2408.11641","citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:fa4e78c6cb7e41c28ef327545f96239cd18ebf44f9fc0410f14c02dd6ea89411","observation_id":"3e037dc8-4f0e-47e6-a502-fa7717086dbd","resolution":{"observed_at":"2026-08-12T04:29:30.917928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:31.026825Z","title":"Learning to Rank: From Pairwise Approach to Listwise Approach,","venue":null,"work_id":"7a07757a-ed68-4b38-8d4c-1f3e02c16576","year":2007},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.814229Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:8f0c4d7357cf9052783ab07af35ce9b672aee3e799e26552830309a89f78fa23","observation_id":"dd0aa89d-c1d4-4730-9ad4-80e70c453f0b","resolution":{"observed_at":"2026-08-12T04:29:31.030190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11319","last_updated":"2022-10-20T14:52:34Z","snapshot_observed_at":"2026-08-16T16:22:31.586949Z","submitted_at":"2022-10-20T14:52:34Z","title":"Image-Text Retrieval with Binary and Continuous Label Supervision","version":1},"cited_work":{"arxiv_id":"2210.11319","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.11319","snapshot_observed_at":"2026-08-12T04:29:30.897952Z","title":"Image-Text Retrieval with Binary and Continuous Label Supervision","venue":"cs.CV","work_id":"d39d3412-0661-45aa-95f2-e65100a8de58","year":2022},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.817138Z"},"links":{"cited_paper":"/paper/2210.11319","citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:fad6975ee67e82f4d6a530be9e9c38975970e988d049fab99ff0af6a135e99c1","observation_id":"f718f14e-6ca7-4604-a238-c06c5766a496","resolution":{"observed_at":"2026-08-12T04:29:30.903867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:31.016541Z","title":"Integrating Listwise Ranking into Pairwise-based Image-Text Retrieval,","venue":null,"work_id":"c5bf8653-7108-4d36-8922-9fc256e5a0fc","year":2024},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.820672Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:c82f5ef40fdc764a404407e411d46a246a2d405b708aeadb72b100391b52acde","observation_id":"6ac29d83-9077-4ee8-be3d-b052e91e8680","resolution":{"observed_at":"2026-08-12T04:29:31.020252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:31.006580Z","title":"Freesound Technical Demo,","venue":null,"work_id":"101ba513-25f8-45d8-a820-8af3d6b68f7c","year":2013},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.823645Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:814544fcbd0c5ce3c73e8cfe018817183d54ebb1d054aa4a8f068709d1b5c287","observation_id":"9d1228eb-5555-42f0-bd00-00002d6f57de","resolution":{"observed_at":"2026-08-12T04:29:31.010085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:30.994794Z","title":"BBC Sound Effects,","venue":null,"work_id":"f5d22080-a9cf-4f54-b849-7d22a54529d6","year":2024},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.826930Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:f29e0ae34b9d581b2e0d9ef6091e31e43f3d9c4350a8cf4a5b7e4445762fb37e","observation_id":"63af5136-c1ae-4ed2-81f3-692e514dc221","resolution":{"observed_at":"2026-08-12T04:29:30.998687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:30.983619Z","title":"SoundBible,","venue":null,"work_id":"b637402a-86d5-4e01-bb7d-abdf4a811a66","year":2024},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.830028Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:8d7e331fc53ba347ef62988b87f4e48264b009d4375337f1c4fca792b9215895","observation_id":"4cf472e2-8dfe-4c29-8ac7-a9f3dafcd981","resolution":{"observed_at":"2026-08-12T04:29:30.987322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:30.973275Z","title":"The Benefit of Temporally-Strong Labels in Audio Event Classification,","venue":null,"work_id":"bd4229be-fdcd-4e6a-898a-84ea90d1d50d","year":2021},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.833197Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:935cf8a03dced0b3888fe3104ba9383bc8b567677495d6dd9930429ee5ab0085","observation_id":"0c1be653-1ff1-4e4f-a461-af16978f09c4","resolution":{"observed_at":"2026-08-12T04:29:30.976781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:30.961386Z","title":"Language-based Audio Retrieval in DCASE 2024 Challenge,","venue":null,"work_id":"26136863-5f3e-48bd-893c-baf80e84fbf1","year":2024},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.836301Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:7a67e0f3171b4353dd11d05e418798178fba7fa33c58c91143676b756168d6cf","observation_id":"3921b18b-826e-4cc7-bdf9-bd3c10dfc271","resolution":{"observed_at":"2026-08-12T04:29:30.965574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:30.950979Z","title":"Efficient Training of Audio Transformers with Patchout,","venue":null,"work_id":"3949f357-3262-46d9-89ca-e4b06fe584d7","year":2022},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.839396Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:0ce5664e8e1297ed446d3cbcd4e045bd2b1bfdd075d5bf73c624a9862fca474e","observation_id":"a1ff3e74-046f-4aea-a084-2ef2fc42d95a","resolution":{"observed_at":"2026-08-12T04:29:30.954811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-12T04:29:30.842632Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.842632Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:6e311f1375fba1a262abc855ee69211a295ef1678cfa16b5cbe8f0f5fbf93f62","observation_id":"98763c99-d3e5-469e-a47e-4cb60febaaf5","resolution":{"observed_at":"2026-08-12T04:29:30.842632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-12T04:29:30.845996Z","title":"Representation Learning with Contrastive Predictive Coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.845996Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:9eed67a9d505ee94f25cfe17ce9384ad5ba594072c026c26b471903fd09ca1ef","observation_id":"2e1ff558-e9ed-4098-aea2-61ba95c9401a","resolution":{"observed_at":"2026-08-12T04:29:30.845996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:29:30.938939Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts,","venue":null,"work_id":"0c675a3c-1adf-406d-ad1f-aa3199e6bdf6","year":2017},"citing_paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T04:29:30.849620Z"},"links":{"citing_paper":"/paper/2412.01356"},"observation_digest":"sha256:59705170d6b6413a7671566bda2d0aa8874a68b48458d2203b69508b1deef8af","observation_id":"c6a3a6c6-771b-40d9-8e12-631211197e55","resolution":{"observed_at":"2026-08-12T04:29:30.943386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.01356","last_updated":"2024-12-02T10:34:05Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-17T02:50:33.734413Z","submitted_at":"2024-12-02T10:34:05Z","title":"Text-based Audio Retrieval by Learning from Similarities between Audio Captions"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":3,"verified_fuzzy":23},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2412.01356."}