{"as_of":"2026-08-08T08:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d034d1a0f928f672fb8b29e17eaf80d11b1e08a0edbf1a263f81ff74e6c519a5","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:36:15.094780Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:49:53.551896Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T22:41:14.663492Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14562","snapshot_observed_at":"2026-08-07T05:49:53.551896Z","title":"Representation learning for semantic alignment of language, audio, and visual modalities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.551896Z"},"links":{"cited_paper":"/paper/2505.14562","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:86193018d104b5ceb97145d39c5e30e352ce2882ebc01a13d274033b56f6669c","observation_id":"367aff17-6b04-4fb6-9b8f-f32f317f4eed","resolution":{"observed_at":"2026-08-07T05:49:53.551896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"cited_work":{"arxiv_id":"2505.14562","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.14562","snapshot_observed_at":"2026-08-06T22:41:14.663492Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","venue":"cs.SD","work_id":"62c94015-01e2-4e1f-a6fd-35808f87e957","year":2025},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.839628Z"},"links":{"cited_paper":"/paper/2505.14562","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:05e9222e4c8175be7345d4f853d783e70615a25e5e88c08ea5c034547823484f","observation_id":"3301051a-947f-4ff9-90c4-2bd38cb9021d","resolution":{"observed_at":"2026-08-06T22:41:14.716289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14562/citation-record","integrity":"/paper/2505.14562/integrity","json":"/paper/2505.14562/citation-record.json","paper":"/paper/2505.14562"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:17.475093Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"005a92c9-dfe5-4e36-b5ed-f4e2b91d8b7a","year":2021},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:13.452064Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:1e11e14b05754ece4fa9a1ca1491f61603c7e7c7492975ef847f1f4995c86bd0","observation_id":"99e7f0db-e75a-41eb-b099-380885e3ee43","resolution":{"observed_at":"2026-08-07T15:36:17.549401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:17.304957Z","title":"CLAP learning audio concepts from natural lan- guage supervision,","venue":null,"work_id":"226ce8aa-465d-4cc5-8c4e-ed999cce6dd3","year":2023},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:13.496702Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:26d95caa907a9fddf4490000466d7060b87efd69ac66886b19c8be9412bb37ca","observation_id":"2b93de3d-88e2-43dd-a87b-ba987bbb8709","resolution":{"observed_at":"2026-08-07T15:36:17.408674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:17.160224Z","title":"Multimodal learn- ing with deep boltzmann machines,","venue":null,"work_id":"ea9c63ad-e5ff-4e46-a552-0590c252cc06","year":2012},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:13.595143Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:2898cbc24a9c367afbd4d37db4a90f8ea0b29620635b4f160ab354348149687b","observation_id":"fabf8d23-e5c5-46de-8acd-fa912c52bd6b","resolution":{"observed_at":"2026-08-07T15:36:17.235540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:17.008998Z","title":"Learning visual features from large weakly supervised data,","venue":null,"work_id":"ec380082-4442-488f-9395-f58bd8df1ebc","year":2016},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:13.679426Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:f752353e4b35b3f88974f2ba2973631f7a9881776a0bdabbaa5459960f5ae908","observation_id":"e96eb8f0-4007-4a5a-aa42-9441bc759fe2","resolution":{"observed_at":"2026-08-07T15:36:17.052093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:16.839551Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":"80a300e2-304b-450f-bc93-10335fb2a7e5","year":2021},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:13.759296Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:50421ecd428fef2416a8eb499312ef4eda56b100c4a33b6dd883ad7b65f5ab47","observation_id":"db6b673f-9dbc-45ab-9532-31d92af84d9d","resolution":{"observed_at":"2026-08-07T15:36:16.912027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-07T15:36:13.877031Z","title":"Florence: A new foundation model for computer vision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:13.877031Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:b39ba9bc1f8031257ca1283a6582257d9cf0ca740df4c235c7bb1ee279cc4b07","observation_id":"32e3baa8-88bc-4130-b9d7-aaa8079621cf","resolution":{"observed_at":"2026-08-07T15:36:13.877031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:16.700254Z","title":"Wav2CLIP: Learning robust audio representa- tions from CLIP,","venue":null,"work_id":"66ffebf9-a9eb-45cb-85b2-1bfaf8266105","year":2022},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:13.958279Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:01c9e4dc54397dde91ae1d5258fbea5f112c8d74086b49d077f946fc36ce9181","observation_id":"bb57bd20-a237-4aa2-84a2-75e9ed2c7cdd","resolution":{"observed_at":"2026-08-07T15:36:16.768700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:16.543114Z","title":"Microsoft COCO: Common objects in context,","venue":null,"work_id":"97879f48-ca9f-454a-b3b1-1773653c822d","year":2014},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:14.079730Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:1fdd703671dc74a1eefc5071f77be4a60ec09aa3050a98189f67470cd7683351","observation_id":"396192f0-8fa6-4f63-a623-313544346d70","resolution":{"observed_at":"2026-08-07T15:36:16.591992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:16.362271Z","title":"Visual genome: Connecting lan- guage and vision using crowdsourced dense image annotations,","venue":null,"work_id":"8d8b4765-1db0-462f-9658-6a97bb6d6181","year":2017},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:14.223807Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:dc75f4a0a2d6fedb64937a8816ee27d7ed16ba81a817b0096ec5d6299fd6f687","observation_id":"64a99d06-0983-431a-90d9-1fd6fb60e89d","resolution":{"observed_at":"2026-08-07T15:36:16.430857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:16.184447Z","title":"YFCC100M: The new data in multimedia research,","venue":null,"work_id":"34b66d02-4f70-4791-85df-2dae7939773a","year":2016},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:14.325160Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:c0a6dc227edaabd5d22a50dd274b241cd06b47928bf865c6d2de63a6a9f373ea","observation_id":"07f760c5-d9c6-4ada-86c1-3a2436579f30","resolution":{"observed_at":"2026-08-07T15:36:16.243583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:16.032935Z","title":"FSD50K: An open dataset of human-labeled sound events,","venue":null,"work_id":"a1e060be-87a7-4745-b854-61a024106ea7","year":2022},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:14.486000Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:f85191dd2a8239a773cbbe6db0ae0f5c59a3f15ba509b3030dcb44d10d7a39fd","observation_id":"9f471ed8-3cb0-4790-a9ae-65f3e2d60f93","resolution":{"observed_at":"2026-08-07T15:36:16.106720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:15.886880Z","title":"Clotho: An audio captioning dataset,","venue":null,"work_id":"dd4d887d-e4f2-49c1-ba64-9c9f47ccdcfc","year":2020},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:14.547487Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:2e790543823931bf197e4eae388b3728c724358124c9c8d8e94e754a232fd3b3","observation_id":"68537183-119f-44b4-955e-a282dceffadf","resolution":{"observed_at":"2026-08-07T15:36:15.929498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:15.744690Z","title":"AudioCaps: Generating captions for audios in the wild,","venue":null,"work_id":"6df2726d-16ea-4a20-aea7-c2b8294e23e2","year":2019},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:14.665385Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:9094bd47d8eb841f8a44ac3b5688768506d90dc107731cf8b2cb4641a6d40ce5","observation_id":"67bd587a-e2c3-4fa3-9363-a1501bb6a625","resolution":{"observed_at":"2026-08-07T15:36:15.814031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:15.569281Z","title":"What is the ground truth? reliability of multi-annotator data for audio tag- ging,","venue":null,"work_id":"802e68f7-a225-489b-920c-73843cb181be","year":2021},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:14.761764Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:453d316dd0b5a225170d68b6845d31314f5d85127905ce9009ec65050c9aae82","observation_id":"0aeba42d-176e-414e-9584-807e916a9439","resolution":{"observed_at":"2026-08-07T15:36:15.632294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:15.444111Z","title":"Audio- CLIP: Extending CLIP to image, text and audio,","venue":null,"work_id":"51cab54b-9633-428c-be8c-d45821c4f363","year":2022},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:14.816806Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:84554262444400798d3ba78e0835e306db4557c750c90481844f9358a9009a9b","observation_id":"d814e34b-9f97-4733-98df-56ee70e7696b","resolution":{"observed_at":"2026-08-07T15:36:15.484053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:15.287479Z","title":"Audio Set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":"341646ab-ac74-4031-9476-1d69ee0dfa51","year":2017},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:14.933049Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:acb8865a4e909f023410a16421f74ee6bc5dbf5de453b9dd8446b9029193a6f0","observation_id":"2ece6d4f-4a63-40ea-a543-ceba1cabcdaf","resolution":{"observed_at":"2026-08-07T15:36:15.380850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.14536325","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:15.191275Z","title":"Sudarsanam, I","venue":null,"work_id":"ad0ea718-cbf1-4c3c-8fec-08a3db0e38ad","year":2024},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:15.021689Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:9717e5189d1b8afb8d283feaad4abc28145aa2581043cf15ef079f8798a479d6","observation_id":"3dbc9405-fb1f-4ae3-a221-602119900054","resolution":{"observed_at":"2026-08-07T15:36:15.236385Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T15:36:15.094780Z","title":"Representa- tion learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:15.094780Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:773d9869d040448bf9bfe4dc6533508155c5ba9cb196b36cbc93612a4c5ead98","observation_id":"7a0b3938-31fc-49ce-ae4f-2a5ff4c5c74e","resolution":{"observed_at":"2026-08-07T15:36:15.094780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":1,"verified_fuzzy":15},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 2 inbound Pith citation observations for arXiv:2505.14562."}