{"as_of":"2026-08-11T17:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:20bc2ba45c1048e317f7634ce913af07d654856402d393836ff05428b12db5cd","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:11:53.338754Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.20914/citation-record","integrity":"/paper/2412.20914/integrity","json":"/paper/2412.20914/citation-record.json","paper":"/paper/2412.20914"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2209.09967","last_updated":"2022-10-04T13:50:20Z","snapshot_observed_at":"2026-07-06T13:54:29.815715Z","submitted_at":"2022-09-20T19:51:53Z","title":"Language-based Audio Retrieval Task in DCASE 2022 Challenge","version":3},"cited_work":{"arxiv_id":"2209.09967","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.09967","snapshot_observed_at":"2026-08-10T23:11:53.471820Z","title":"Language-based Audio Retrieval Task in DCASE 2022 Challenge","venue":"eess.AS","work_id":"59bbeefb-ebbd-4c7d-ba65-b5874e2882ed","year":2022},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.207613Z"},"links":{"cited_paper":"/paper/2209.09967","citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:d7983ae64059eedd71ec2697fd1749e37d3f7b3d3975bfd3cf33eb9696a7def0","observation_id":"9aa033aa-f697-4706-9212-d2e9f86151ef","resolution":{"observed_at":"2026-08-10T23:11:53.478857Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.801283Z","title":"Language- based audio retrieval with gpt-augmented captions and self-attended audio clips,","venue":null,"work_id":"e508d83c-1c93-4188-9827-fa47e19ba119","year":2024},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.213405Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:c47e56b361b4e7feff25fc6be9b7683995a4152b5ffbd25319e2e6eae6702aa1","observation_id":"4da52f8e-65e7-4c62-8056-e2f46ac56379","resolution":{"observed_at":"2026-08-10T23:11:53.805965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.786841Z","title":"Dynamic modality interaction modeling for image-text retrieval,","venue":null,"work_id":"4a261c38-8295-4d7a-ae5a-616a994da217","year":2021},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.218440Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:e40148b9b623bea84f73516b5a40241cd86aad9b2fb45dec1d6f82b821f867c5","observation_id":"0e1d112d-5f07-49bc-956c-61183aea2df7","resolution":{"observed_at":"2026-08-10T23:11:53.791604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.771284Z","title":"Look, listen, and attend: Co-attention network for self-supervised audio-visual representa- tion learning,","venue":null,"work_id":"21587704-9395-483a-b517-dca3e4eafe52","year":2020},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.223460Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:acd69345c5d396cdd23af040b9edc6ca12b54c071e862543d2d6492f80b827b2","observation_id":"01607172-21c6-4127-a020-e504e1cf9779","resolution":{"observed_at":"2026-08-10T23:11:53.776723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.756353Z","title":"Audio-text retrieval in context,","venue":null,"work_id":"e31e47b1-8737-4994-adb9-45cdd7f99bc0","year":2022},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.228603Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:cf0f6566ad470338150aea12f8307130024e286034f45771d1a83482c9ede709","observation_id":"680ed02a-0ab9-4f34-bf58-121edbe1a70e","resolution":{"observed_at":"2026-08-10T23:11:53.761242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.741554Z","title":"Improving text-audio retrieval by text- aware attention pooling and prior matrix revised loss,","venue":null,"work_id":"5b707201-96d4-4573-b184-198e6c76d57c","year":2023},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.233420Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:370532e357044e65739861965d153492fde52c5749634b128c424f5141a5aed8","observation_id":"56935820-ef78-46a3-9b31-ff43499ce979","resolution":{"observed_at":"2026-08-10T23:11:53.746653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.726409Z","title":"A ResNet-Based CLIP Text-to-Audio Retrieval System for DCASE Challenge 2022 Task 6B,","venue":null,"work_id":"aa4c1838-61db-4bd0-9bf4-ac9e3cb9a515","year":2022},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.238887Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:9e8cb35eb4ab569458dfc6f775af4954d0d14c5df4b5bb9f63d1029bd8d711f1","observation_id":"5df9c68c-5113-4144-b9e8-65cea9a02dc4","resolution":{"observed_at":"2026-08-10T23:11:53.731345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.710199Z","title":"Improved fusion of visual and language representations by dense symmetric co-attention for visual question answering,","venue":null,"work_id":"88d6c4d1-caeb-4f44-849c-55b70dfca949","year":2018},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.243606Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:443d9cce8f45e62057ccfffb13340a5026e76aa02391e1b200321f1081456f32","observation_id":"c1957c6f-84a6-4e42-9fde-da08ffb3f409","resolution":{"observed_at":"2026-08-10T23:11:53.715522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.04290","last_updated":"2021-11-22T09:35:30Z","snapshot_observed_at":"2026-08-09T21:40:39.573851Z","submitted_at":"2021-09-09T14:10:43Z","title":"Improving Video-Text Retrieval by Multi-Stream Corpus Alignment and Dual Softmax Loss","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.04290","snapshot_observed_at":"2026-08-10T23:11:53.248081Z","title":"Improving video-text retrieval by multi-stream corpus alignment and dual softmax loss,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.248081Z"},"links":{"cited_paper":"/paper/2109.04290","citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:b534380816ccc9675968431c1f0f06529db218f9facc4280f620fc90d98d8c46","observation_id":"dd9b1ac8-f38d-49ec-ace9-3cf8cf4551c1","resolution":{"observed_at":"2026-08-10T23:11:53.248081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.695468Z","title":"Audio-text retrieval in context,","venue":null,"work_id":"1e0bdc18-3d53-4e56-89fb-d81dfc796b42","year":2022},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.253195Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:7eeea9fcf12782a68982394e4f4548cac63aae8d69830e85c20ef8edd353c446","observation_id":"a3bb2161-e228-4d1e-b0d2-d8bc28753664","resolution":{"observed_at":"2026-08-10T23:11:53.700118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.680807Z","title":"Audio retrieval with natural language queries: A benchmark study,","venue":null,"work_id":"e9f53375-94b0-4fed-8d4a-fa5880eb4355","year":2021},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.257714Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:77addaa5f879bcaacbd3847a1b8229efdb4b9a5d229a15db9ebc596a115f3ce7","observation_id":"0868d13b-e32d-4ced-bbda-565045ea2662","resolution":{"observed_at":"2026-08-10T23:11:53.685697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.03609","last_updated":"2016-02-11T03:06:33Z","snapshot_observed_at":"2026-08-02T16:03:57.821528Z","submitted_at":"2016-02-11T03:06:33Z","title":"Attentive Pooling Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.03609","snapshot_observed_at":"2026-08-10T23:11:53.262353Z","title":"Attentive pooling networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.262353Z"},"links":{"cited_paper":"/paper/1602.03609","citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:47a634160b50deda9b5920ae3a2f7ea2826a3c3f14cf7ba9f61d57cf5f71d888","observation_id":"82e821b3-cc4b-4e6c-8b3c-f72bf39af2c8","resolution":{"observed_at":"2026-08-10T23:11:53.262353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.665492Z","title":"Multi-pointer co-attention networks for recommendation,","venue":null,"work_id":"12cdbeec-ce1d-4eb6-addd-9c25b820490a","year":2018},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.267464Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:86a731933ba9bd2e374ea19bef24cae56d932445f9489d87a8dcb76c6ea25eda","observation_id":"c27f7d74-445b-45c4-b2f6-b0c9f2c63b0c","resolution":{"observed_at":"2026-08-10T23:11:53.671184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.649345Z","title":"Query by example of audio signals using euclidean distance between gaussian mixture models,","venue":null,"work_id":"38248d0d-9df6-4a40-bbb9-19b6efe8c5c5","year":2007},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.272748Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:27247ff8606aec9953c4271b8436a8a806aa30a691d22b07f0c9fcbb218d9897","observation_id":"5e94300f-3af7-499a-abee-bf95cf38df05","resolution":{"observed_at":"2026-08-10T23:11:53.654247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.634337Z","title":"Semantic-audio retrieval,","venue":null,"work_id":"3874c9d9-72c7-4896-a06c-93d8b21935ae","year":2002},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.277373Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:58c6baf02ee604a5b76e837bc4a247265bc989134ffef765ca4e476b6fba55b0","observation_id":"0bc3020f-ef14-4fcf-89c8-209b58750fb9","resolution":{"observed_at":"2026-08-10T23:11:53.639148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.618231Z","title":"Music information retrieval using social tags and audio,","venue":null,"work_id":"610d5457-c297-45d9-a75e-89ea5af4230e","year":2009},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.282220Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:04ac1ed4810288b7461e68cb1d808b9290ae7d45236898b3326c3481093138f3","observation_id":"a7f1cc83-dc32-4ac3-b925-1857c0d3c73f","resolution":{"observed_at":"2026-08-10T23:11:53.623933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.603205Z","title":"Deep visual-semantic alignments for generating image descriptions,","venue":null,"work_id":"c7dc1506-52eb-487e-bf69-ebc9d3bbdb99","year":2015},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.286769Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:1f5e039516580307d837f0947fdb07f6626054bbd0bfd48ae5cfb9edd0c56cfe","observation_id":"9de22329-1f1d-4bdf-95d2-6ec5904131f1","resolution":{"observed_at":"2026-08-10T23:11:53.608077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.588523Z","title":"Cross modal audio search and retrieval with joint embeddings based on text and audio,","venue":null,"work_id":"39d812a0-bc71-43b7-8f96-19a3862471ab","year":2019},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.291376Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:313cfb5a26ac21aefb7de3cf1c4f99adbb6eb611ebf6111d3a16e9964c680f9b","observation_id":"5b0165e1-e89b-434c-a70e-54939682360d","resolution":{"observed_at":"2026-08-10T23:11:53.593365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.572801Z","title":"Clap learning audio concepts from natural language supervision,","venue":null,"work_id":"40cbf223-d6f2-4650-920a-f39e97776586","year":2023},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.296009Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:6437a6d81effb6cf7c4a553a5a19bbc470411ae8c33da56528d3c6138767e826","observation_id":"cfcbfd94-a3d3-4c24-855f-109a54f2ec06","resolution":{"observed_at":"2026-08-10T23:11:53.578328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-10T23:11:53.300501Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.300501Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:93252f460dbc02694496b0c677187814ced1a9bff1ba885fbf296683b9dbc5b2","observation_id":"9c28ddac-6366-4f65-b40f-ea4f8d17769c","resolution":{"observed_at":"2026-08-10T23:11:53.300501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T23:11:53.305661Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.305661Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:a09c39216f32f2218e0dfa42c0ade542427e325ee98d08817afd64c8891e972e","observation_id":"dd487599-81a5-488c-9df2-821922247c59","resolution":{"observed_at":"2026-08-10T23:11:53.305661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01604","last_updated":"2018-03-06T22:45:53Z","snapshot_observed_at":"2026-08-04T04:04:59.281152Z","submitted_at":"2016-11-05T04:53:40Z","title":"Dynamic Coattention Networks For Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01604","snapshot_observed_at":"2026-08-10T23:11:53.310693Z","title":"Dynamic coattention networks for question answering,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.310693Z"},"links":{"cited_paper":"/paper/1611.01604","citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:9d99b75303e9ea02dfbda2b31cdcbc368e1f4e60b8c3df6d5fd3346a3a58ba2e","observation_id":"5d9f756f-3af9-4b6a-9aa0-0af87cade58d","resolution":{"observed_at":"2026-08-10T23:11:53.310693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.555381Z","title":"Co-attention network with label embedding for text classification,","venue":null,"work_id":"37eec48d-301f-480e-9970-dfe9bb8d2628","year":2021},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.315763Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:9dc3eae77e001d6ae802824bf73ca5b97f41311e751c3b85f713d232af475cd7","observation_id":"4aa8024a-b191-4e11-bc4e-c9706e32de90","resolution":{"observed_at":"2026-08-10T23:11:53.560744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.539663Z","title":"Attentive interactive neural networks for answer selection in community question answering,","venue":null,"work_id":"0e128ebc-3446-4348-bced-5d4ef90b6598","year":2017},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.320357Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:f52178261945021e693a36110df5fbf67d8d1186ee67eecbf86d74d3e6445b47","observation_id":"4161afbd-e238-4fd1-9995-471a30c11b46","resolution":{"observed_at":"2026-08-10T23:11:53.544650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.522741Z","title":"Make-an-audio: Text-to-audio generation with prompt-enhanced diffusion models,","venue":null,"work_id":"f7421814-1f1d-4516-acef-a0b8b8223f96","year":2023},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.324944Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:91307f0a4cc8ab6865a05a8cfaf284245be69248f22495487b6d9d5a138abdea","observation_id":"ed42d913-afb8-423e-b632-4a4206628043","resolution":{"observed_at":"2026-08-10T23:11:53.527825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-10T23:11:53.329420Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.329420Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:b7d0432096e13eb02d3ab886e78b9e9b0d03987150ad60a3a0e7c159c786afc1","observation_id":"ab6ba47b-87d3-4c06-ad22-2fa9a56c3afc","resolution":{"observed_at":"2026-08-10T23:11:53.329420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.506153Z","title":"Clotho: an audio captioning dataset,","venue":null,"work_id":"b0d6735f-cfc4-4012-906c-08f2f62bf9a6","year":2020},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.334182Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:2199d2911cbe438a1c85ff8a25b7f634ed946a7bb3b9e7d2365ea5eeadd0683a","observation_id":"0ab219a1-5345-4849-83c7-4875f6f135fe","resolution":{"observed_at":"2026-08-10T23:11:53.511284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:11:53.490116Z","title":"AudioCaps: Generating captions for audios in the wild,","venue":null,"work_id":"2d183fb0-1ec8-47b8-8466-939250603e7e","year":2019},"citing_paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T23:11:53.338754Z"},"links":{"citing_paper":"/paper/2412.20914"},"observation_digest":"sha256:83cf1586c3bdcb600ae832e38d0bfdf91db0a293c5e3a2ff54f069e876bd69ef","observation_id":"4b35fb4c-967b-42d0-9c96-eda303bf2ed6","resolution":{"observed_at":"2026-08-10T23:11:53.495327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.20914","last_updated":"2024-12-30T12:49:55Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-11T01:31:44.758397Z","submitted_at":"2024-12-30T12:49:55Z","title":"Language-based Audio Retrieval with Co-Attention Networks"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2412.20914."}