{"as_of":"2026-08-09T10:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca549562897dbd29e1cd5acb1e2e60c26746aeea9e4cadbeb86163cf2e4f9b9e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:58:02.280500Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T15:47:06.204617Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-09T10:28:41.771465Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-07T05:58:02.280500Z","title":"Natural language supervision for general-purpose audio representations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.280500Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:f9495e91d5edfd303da154ce9da426960c630a52f26e054c3f30fb93e845ee4f","observation_id":"b97ce92b-dd08-458a-a942-8ba4a2e442af","resolution":{"observed_at":"2026-08-07T05:58:02.280500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-09T10:28:41.771465Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-07T00:23:16.501373Z","title":"Natural language supervision for general-purpose audio representations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:16.501373Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:bd9fa7a32477742d1558ac98cbd23b898a6bda697583076cc92effa458a83445","observation_id":"56e5fd14-df51-4958-83a5-9fbf72c1ac10","resolution":{"observed_at":"2026-08-07T00:23:16.501373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-09T10:28:41.771465Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-06T18:36:58.841041Z","title":"Natural language supervision for general-purpose audio representations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-06T18:30:26.717637Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.841041Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:e7097131335caea67a52396471e5397209835eecdd7138ea58e09fc9aada32e2","observation_id":"8c7295bf-8c98-4fc3-92bc-ed14beb24e5f","resolution":{"observed_at":"2026-08-06T18:36:58.841041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-09T10:28:41.771465Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-05T17:56:51.732238Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15418","last_updated":"2025-08-21T10:20:00Z","snapshot_observed_at":"2026-08-08T09:52:34.305122Z","submitted_at":"2025-08-21T10:20:00Z","title":"LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T17:56:51.732238Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2508.15418"},"observation_digest":"sha256:aef85bbfc01c4c6366007c480417c1b9b00b146b90a52b9b55e1e7b78d028c88","observation_id":"d0df0562-3026-4658-90ea-b6d7ec5705da","resolution":{"observed_at":"2026-08-05T17:56:51.732238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-09T10:28:41.771465Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-05T11:41:37.651853Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.651853Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:abb0561e323d2a87efdab35753d871693d26563840de352b875aa7f4d943df8d","observation_id":"f6cfd9a2-ca3e-476d-a1b4-21d2210b9d49","resolution":{"observed_at":"2026-08-05T11:41:37.651853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-09T10:28:41.771465Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-03T19:00:14.134519Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.134519Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:a644fc0b649e3b93e3920218cf2943ad9e8a1feaf6b1dbae220a0aefe244c44d","observation_id":"ac7a9a48-9cd1-43a8-ae44-9dccf9fa0056","resolution":{"observed_at":"2026-08-03T19:00:14.134519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-09T10:28:41.771465Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":"2309.05767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-07-02T15:47:06.204617Z","title":"InProceedings of the 18th International Society for Music Information Retrieval Conference (ISMIR 2017), pages 316–323","venue":null,"work_id":"3fc22ec9-6fb2-45f1-a160-8f23a225bdfb","year":2017},"citing_paper":{"arxiv_id":"2604.20847","last_updated":"2026-02-10T15:24:41Z","snapshot_observed_at":"2026-07-06T23:07:31.559812Z","submitted_at":"2026-02-10T15:24:41Z","title":"Revisiting Content-Based Music Recommendation: Efficient Feature Aggregation from Large-Scale Music Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T02:39:46.434831Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2604.20847"},"observation_digest":"sha256:69306d296f16a4c4ed0051dc3f01a211863254a7158efda03c2d080f48b3af7a","observation_id":"e94647d9-cd93-430c-936c-48719fd21b48","resolution":{"observed_at":"2026-05-16T02:40:30.841192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-09T10:28:41.771465Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":"2309.05767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-07-02T15:47:06.204617Z","title":"InProceedings of the 18th International Society for Music Information Retrieval Conference (ISMIR 2017), pages 316–323","venue":null,"work_id":"3fc22ec9-6fb2-45f1-a160-8f23a225bdfb","year":2017},"citing_paper":{"arxiv_id":"2606.06615","last_updated":"2026-06-04T18:05:39Z","snapshot_observed_at":"2026-08-02T17:34:11.164458Z","submitted_at":"2026-06-04T18:05:39Z","title":"FIGMA: Towards FIne-Grained Music retrievAl","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T23:32:09.401023Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2606.06615"},"observation_digest":"sha256:d831a1148077962de375f4aa49dfdff6033ee721004077d1c696057db44dd3fa","observation_id":"a1fde89a-d60c-4ce4-a1db-b92907dcca09","resolution":{"observed_at":"2026-07-02T15:47:06.206175Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2309.05767/citation-record","integrity":"/paper/2309.05767/integrity","json":"/paper/2309.05767/citation-record.json","paper":"/paper/2309.05767"},"outbound":[],"paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T10:28:41.771465Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2309.05767."}