{"as_of":"2026-08-07T11:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f9f1303b6e1a658a37af211b9d8647b28a9095ef2869ca202e03877bbbf3700f","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:13:53.805682Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01560/citation-record","integrity":"/paper/2608.01560/integrity","json":"/paper/2608.01560/citation-record.json","paper":"/paper/2608.01560"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.17395","last_updated":"2024-07-18T22:20:31Z","snapshot_observed_at":"2026-07-06T15:10:08.462773Z","submitted_at":"2023-03-30T14:07:47Z","title":"WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17395","snapshot_observed_at":"2026-08-07T00:13:52.600060Z","title":"Niklas Muennighoff, Nouamane Tazi, Loïc Magne, and Nils Reimers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-07T00:07:02.163437Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.600060Z"},"links":{"cited_paper":"/paper/2303.17395","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:da61ea7761561a95e07fa3f5eaf6c22669cfd4bec86a0096fa482fa257cfc322","observation_id":"a028c132-d4b3-4f80-80f1-0c0b5f449658","resolution":{"observed_at":"2026-08-07T00:13:52.600060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07316","last_updated":"2023-03-19T13:37:01Z","snapshot_observed_at":"2026-07-06T14:04:58.943383Z","submitted_at":"2022-10-13T19:42:08Z","title":"MTEB: Massive Text Embedding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07316","snapshot_observed_at":"2026-08-07T00:13:52.736101Z","title":"Yu Pan, Yanni Hu, Yuguang Yang, Wen Fei, Jixun Yao, Heng Lu, Lei Ma, and Jianjun Zhao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-07T00:07:02.163437Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.736101Z"},"links":{"cited_paper":"/paper/2210.07316","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:32cbda9f388ed56ad4bc9ebcbcd47511cccaf8dbde289c7d4200e9d61656d2c7","observation_id":"c1dd2c93-60cf-432a-8602-9c63e3541725","resolution":{"observed_at":"2026-08-07T00:13:52.736101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07848","last_updated":"2023-12-04T06:27:50Z","snapshot_observed_at":"2026-07-06T15:42:06.758676Z","submitted_at":"2023-06-13T15:28:10Z","title":"GEmo-CLAP: Gender-Attribute-Enhanced Contrastive Language-Audio Pretraining for Accurate Speech Emotion Recognition","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07848","snapshot_observed_at":"2026-08-07T00:13:52.886296Z","title":"Joshua Robinson, Ching-Yao Chuang, Suvrit Sra, and Stefanie Jegelka","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-07T00:07:02.163437Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.886296Z"},"links":{"cited_paper":"/paper/2306.07848","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:e5ec34880f192e6f03c59d113afe5e6421790b20028c0548ec0d7652e1138295","observation_id":"af0f95bd-1df9-460e-b0bc-12c42e17a5bf","resolution":{"observed_at":"2026-08-07T00:13:52.886296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04592","last_updated":"2021-01-24T22:19:30Z","snapshot_observed_at":"2026-08-07T09:28:19.837584Z","submitted_at":"2020-10-09T14:18:53Z","title":"Contrastive Learning with Hard Negative Samples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04592","snapshot_observed_at":"2026-08-07T00:13:53.022159Z","title":"Joshua Robinson, Li Sun, Ke Yu, Kayhan Batmanghe- lich, Stefanie Jegelka, and Suvrit Sra","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-07T00:07:02.163437Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:53.022159Z"},"links":{"cited_paper":"/paper/2010.04592","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:5466a744a79da42b5e2f401a5095c3cf046442f83363a5a208b8bd7a6d1ee47d","observation_id":"b83880a0-f5fe-4558-b0a9-e50d9f4fb031","resolution":{"observed_at":"2026-08-07T00:13:53.022159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11230","last_updated":"2021-12-19T11:16:33Z","snapshot_observed_at":"2026-07-06T11:21:24.392582Z","submitted_at":"2021-06-21T16:22:43Z","title":"Can contrastive learning avoid shortcut solutions?","version":3},"cited_work":{"arxiv_id":"2106.11230","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.11230","snapshot_observed_at":"2026-08-07T00:13:54.582345Z","title":"Can contrastive learning avoid shortcut solutions?","venue":"cs.LG","work_id":"a09a5a5a-ab6e-48ca-b5cd-c3dd4e0b1157","year":2021},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-07T00:07:02.163437Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:53.147059Z"},"links":{"cited_paper":"/paper/2106.11230","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:fb4745f89e3480144538b93ee1433d94eef486a740ec4074702f0dcb5ef81c4b","observation_id":"2ecaa0ab-8f4b-4b27-8021-f1f2fa36a7cd","resolution":{"observed_at":"2026-08-07T00:13:54.693089Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-06T07:56:47.796949Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"cited_work":{"arxiv_id":"2607.18666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.18666","snapshot_observed_at":"2026-08-07T00:13:54.329150Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","venue":"cs.CL","work_id":"19fee096-0f69-40cc-b740-63a03a75e90b","year":2026},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-07T00:07:02.163437Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:53.298988Z"},"links":{"cited_paper":"/paper/2607.18666","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:4b727f929895a04fe6fd6d31e627900b3501a2c6c681b32c1f4e296f10afe86a","observation_id":"b21b671d-365c-4e1d-b228-490938aed096","resolution":{"observed_at":"2026-08-07T00:13:54.384676Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06687","last_updated":"2024-03-21T21:35:04Z","snapshot_observed_at":"2026-08-02T19:54:31.470003Z","submitted_at":"2022-11-12T15:25:20Z","title":"Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.06687","snapshot_observed_at":"2026-08-07T00:13:53.628346Z","title":"Jihai Zhang, Xiang Lan, Xiaoye Qu, Yu Cheng, Mengling Feng, and Bryan Hooi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-07T00:07:02.163437Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:53.628346Z"},"links":{"cited_paper":"/paper/2211.06687","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:63cc97c7dd04d6114f403c9c45b0586612076940c66e9dcbd3a45d9daeb742ce","observation_id":"70845207-61b5-4aad-b78c-9e1cd873b88c","resolution":{"observed_at":"2026-08-07T00:13:53.628346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11816","last_updated":"2024-07-15T14:28:46Z","snapshot_observed_at":"2026-07-06T17:31:58.268105Z","submitted_at":"2024-02-19T04:13:33Z","title":"Learning the Unlearned: Mitigating Feature Suppression in Contrastive Learning","version":3},"cited_work":{"arxiv_id":"2402.11816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11816","snapshot_observed_at":"2026-08-07T00:13:53.975852Z","title":"Learning the Unlearned: Mitigating Feature Suppression in Contrastive Learning","venue":"cs.CV","work_id":"7fc6bafa-b391-4e61-82b0-c293080dcd4f","year":2024},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-07T00:07:02.163437Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:53.805682Z"},"links":{"cited_paper":"/paper/2402.11816","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:65582b55c5d0172cfc34725b99eaf6da2b84b20233abcfbceb99bd31a9899215","observation_id":"3227e367-80fd-4445-8a81-e303308d8d4e","resolution":{"observed_at":"2026-08-07T00:13:54.118372Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03209","last_updated":"2018-04-09T19:58:17Z","snapshot_observed_at":"2026-07-06T06:32:32.083176Z","submitted_at":"2018-04-09T19:58:17Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03209","snapshot_observed_at":"2026-08-07T00:13:53.463904Z","title":"Yusong Wu, Ke Chen, Tianyu Zhang, Yuchen Hui, Marianna Nezhurina, Taylor Berg-Kirkpatrick, and Shlomo Dubnov","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-07T00:07:02.163437Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:53.463904Z"},"links":{"cited_paper":"/paper/1804.03209","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:aa2374a941c5152d9a5ae674a1b2f26ef596cb49ac3d5445f1aa6efd6312fbb9","observation_id":"8ad9a670-8b50-45a1-967c-068b9e1b39d1","resolution":{"observed_at":"2026-08-07T00:13:53.463904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07780","last_updated":"2023-11-21T15:22:43Z","snapshot_observed_at":"2026-07-06T09:12:52.864215Z","submitted_at":"2020-04-16T17:18:49Z","title":"Shortcut Learning in Deep Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07780","snapshot_observed_at":"2026-08-07T00:13:52.229065Z","title":"Aditya Kusupati, Gantavya Bhatt, Aniket Rege, Matthew Wallingford, Aditya Sinha, Vivek Ramanu- jan, William Howard-Snyder, Kaifeng Chen, Sham Kakade, Prateek Jain, and Ali Farhadi","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-07T00:07:02.163437Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.229065Z"},"links":{"cited_paper":"/paper/2004.07780","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:90afb36b7977803921c58d328107ed9fac5476f0254e3129e6ac5cdf38245912","observation_id":"9dc3efa2-3379-46a4-b513-be2467aff359","resolution":{"observed_at":"2026-08-07T00:13:52.229065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.02803","last_updated":"2021-10-23T18:25:17Z","snapshot_observed_at":"2026-08-05T21:09:47.171916Z","submitted_at":"2020-11-05T13:19:48Z","title":"Intriguing Properties of Contrastive Losses","version":3},"cited_work":{"arxiv_id":"2011.02803","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.02803","snapshot_observed_at":"2026-08-07T00:13:55.243611Z","title":"Intriguing Properties of Contrastive Losses","venue":"cs.LG","work_id":"0e8a4180-8b43-471b-9b97-3ce4c01302e4","year":2020},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-07T00:07:02.163437Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:51.926174Z"},"links":{"cited_paper":"/paper/2011.02803","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:79c8d2625f787ac641e10be0d51f688ae5218c39a518dba35db07baf22fbe7a0","observation_id":"8003aa6a-11dc-4ec3-aa4a-76703c8b9a1d","resolution":{"observed_at":"2026-08-07T00:13:55.346283Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13147","last_updated":"2024-02-08T03:21:26Z","snapshot_observed_at":"2026-07-06T13:14:06.120131Z","submitted_at":"2022-05-26T04:33:56Z","title":"Matryoshka Representation Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.13147","snapshot_observed_at":"2026-08-07T00:13:52.324203Z","title":"Steven R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-07T00:07:02.163437Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.324203Z"},"links":{"cited_paper":"/paper/2205.13147","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:5a5c32e43daf65c5c143411dedba8e14410125d3ff4e11bab658744b125a13b9","observation_id":"9d98e0ee-b112-4a56-8aa4-8e6287efff0e","resolution":{"observed_at":"2026-08-07T00:13:52.324203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04769","last_updated":"2022-06-09T21:16:10Z","snapshot_observed_at":"2026-08-04T21:36:01.107247Z","submitted_at":"2022-06-09T21:16:10Z","title":"CLAP: Learning Audio Concepts From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04769","snapshot_observed_at":"2026-08-07T00:13:52.065013Z","title":"InIEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-07T00:07:02.163437Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.065013Z"},"links":{"cited_paper":"/paper/2206.04769","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:5cf1ac41e3d7063c53e4f701e95a3e7bdf62a991b0ab753e17722cab7e735eab","observation_id":"9ba6b2d1-d4f9-4aef-b18a-41944a65099a","resolution":{"observed_at":"2026-08-07T00:13:52.065013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17510","last_updated":"2024-07-31T21:02:12Z","snapshot_observed_at":"2026-08-04T04:04:53.743132Z","submitted_at":"2024-02-27T13:50:34Z","title":"Demonstrating and Reducing Shortcuts in Vision-Language Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17510","snapshot_observed_at":"2026-08-07T00:13:51.851266Z","title":"InTransactions on Machine Learning Re- search (TMLR)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-07T00:07:02.163437Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:51.851266Z"},"links":{"cited_paper":"/paper/2402.17510","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:e877ba03c9f93ecae2d4afd2007e59f0a26d86ad3c9fb8939028226c54155bf8","observation_id":"52b56ada-bc48-42b5-8437-6b8dd70795af","resolution":{"observed_at":"2026-08-07T00:13:51.851266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"cited_work":{"arxiv_id":"2607.03806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.03806","snapshot_observed_at":"2026-08-07T00:13:54.931212Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","venue":"eess.AS","work_id":"97c10890-2639-4f0a-b3a2-9c47eecadfe6","year":2026},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-07T00:07:02.163437Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.441021Z"},"links":{"cited_paper":"/paper/2607.03806","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:14214f52e8dc12d5e667efc40980f128357528306dfd77fef6ffe77e222c4f37","observation_id":"4e582ce5-864a-400c-aeb7-2df1822df112","resolution":{"observed_at":"2026-08-07T00:13:55.009060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T00:07:02.163437Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2608.01560."}