{"as_of":"2026-08-06T16:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cc656d29835d007628bcfdec0d71e4aece8249cf59d5c90fc82b0ed4f3f557c3","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T15:40:07.421894Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T15:40:07.421894Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-15T15:41:12.087219Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"cited_work":{"arxiv_id":"2603.05094","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.05094","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","venue":"cs.SD","work_id":"6bb3cbea-64cd-42fe-9dce-42095e900ba7","year":2026},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"cited_paper":"/paper/2603.05094","citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:6f386abfa02b1e3e751e6b6083a9000c7f62a6f2f334bba37c9e3817aeee03f1","observation_id":"c2ad3e17-146d-47eb-8c94-d0335a3f926a","resolution":{"observed_at":"2026-05-15T15:41:12.090471Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.05094/citation-record","integrity":"/paper/2603.05094/integrity","json":"/paper/2603.05094/citation-record.json","paper":"/paper/2603.05094"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"cited_work":{"arxiv_id":"2603.05094","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.05094","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","venue":"cs.SD","work_id":"6bb3cbea-64cd-42fe-9dce-42095e900ba7","year":2026},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"cited_paper":"/paper/2603.05094","citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:6f386abfa02b1e3e751e6b6083a9000c7f62a6f2f334bba37c9e3817aeee03f1","observation_id":"c2ad3e17-146d-47eb-8c94-d0335a3f926a","resolution":{"observed_at":"2026-05-15T15:41:12.090471Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b257d624-c32d-4720-9320-0f2e20fc8f86","year":null},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:8f787931f1c264c8559b507bf6696463ce8e387ff35559f93fb12a4f24d751df","observation_id":"c1d7ee02-2725-4d0a-b589-b43a669cf98f","resolution":{"observed_at":"2026-05-15T15:41:12.535746Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"acoustic long-tail","venue":null,"work_id":"fd705707-c127-46ca-bfed-6a6142fe9067","year":null},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:b9b7ec8f78c173623c9e501e9b9f80377d317879b87f109bbf8892afb43cd88e","observation_id":"58dc4f1c-1a71-4e0c-bdd4-4c66a4cf9c8a","resolution":{"observed_at":"2026-05-15T15:41:12.539993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9b9c31f1-05fe-4f1d-b5e4-34193e1f2072","year":null},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:b9f58aba0d7bc4ac12033d3b5ca94cad407f58063e41842e5157c47c02f67b69","observation_id":"c3a18b3d-3762-497f-a18e-4ec2015e42aa","resolution":{"observed_at":"2026-05-15T15:41:12.666275Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"To preserve speech-free soundmarks, clips where both ASRs yield empty outputs bypass the text check","venue":null,"work_id":"f0d7d77f-88ee-4324-b76d-6d1595bcbf34","year":null},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:07e5616c00591430b7974d931b67b9a2be45346700e214211b1c12601307c98a","observation_id":"eaabe514-74a4-4f48-ace0-10d9ab9592d6","resolution":{"observed_at":"2026-05-15T15:41:12.656907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"add4b316-1fe4-49ca-b68a-ad30e2dc4102","year":null},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:e1ef0fa7f3a7e96f71ae8467b852e7eb9e4ce0f371358d3c5026df6ab6503b37","observation_id":"a5c7abf1-20f0-4e0f-b76f-ef565e77dd8e","resolution":{"observed_at":"2026-05-15T15:41:12.661985Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hello everyone","venue":null,"work_id":"6605dae4-b5a9-4660-a1b5-02731d78e424","year":null},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:6b87fdd33691027175b788a15c87d15c8f639c01d937a9ee1031e4a808084113","observation_id":"61b305de-86fc-4728-85e5-ce1b2c649505","resolution":{"observed_at":"2026-05-15T15:41:12.670278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Experimental Setup Implementation Details:The proposed model, Tai-LALM, is developed as a localized adaptation of the DeSTA 2.5-Audio framework","venue":null,"work_id":"666f5c59-6545-4495-9a4d-5c4b50dd61fa","year":null},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:33b6b0bdd00f291cb6763f523d15fbdd89bf1f666d9713349f49172eef1e5770","observation_id":"ba5f6592-67c2-4563-a3e3-aafa29c606b3","resolution":{"observed_at":"2026-05-15T15:41:12.544488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Architectural scal- ing alone is insufficient for robust sound-to-meaning ground- ing without localized acoustic semantics","venue":null,"work_id":"ee2904a4-bb8b-47b8-b339-4e1b4d14c332","year":null},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:295a215da1fc63c508ffc7cf432a2762c0e1669e252b620008677b6576461999","observation_id":"944ae7f0-7b37-4398-97ba-a9f7769ac5c6","resolution":{"observed_at":"2026-05-15T15:41:12.643132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond the Taiwanese context, this pipeline offers a method for regional adaptation","venue":null,"work_id":"32bfe874-bd84-4adb-9713-2a144dd45c36","year":null},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:7d823d89d9da91daeb4aa9829669e11f2e9914d8adb29dfaa133c7f875a81803","observation_id":"e02ad1cd-4a20-4dcf-8ac0-0ab1f5aaf742","resolution":{"observed_at":"2026-05-15T15:41:12.647763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The perfor- mance gains underscore the necessity of the VGC pipeline for robust training-time curation and Dual-ASR arbitration for sta- bilizing inference","venue":null,"work_id":"c749d57f-c381-4e32-b593-edb59bc18bd4","year":null},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:58277e64a15033cc6c98e654975d8307ea50a5faf93c776f4cde6db26963dfc3","observation_id":"3ab9292e-e197-4519-b3b5-3d214061f0da","resolution":{"observed_at":"2026-05-15T15:41:12.674762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-02T02:42:46.945082Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:f9bd6369e91ca44a551c27488b39448e8991de9344c11aa2bc9b26035edb5099","observation_id":"b65cae82-50fa-4474-8a71-11e63c0c172f","resolution":{"observed_at":"2026-05-16T07:07:57.965390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic-SUPERB Phase-2: A collaboratively expanding benchmark for measuring the capa- bilities of spoken language models with 180 tasks","venue":null,"work_id":"16cf0deb-b562-4b39-b19a-9c1e93b089cf","year":2025},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:f797c7df049751017d8dba50b71411a30045b969827830f9c41f69a2ad5e56bc","observation_id":"75e9f46a-c54b-45ad-b32d-60bdc1d41b2e","resolution":{"observed_at":"2026-05-15T15:41:12.633129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Listen, think, and understand","venue":null,"work_id":"e72ed927-92af-4c65-bc56-f1575dfa06bb","year":2024},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:9cbb46b36dca86596c2cb2325be27ced061724cbd150060a8b2c1eb21c807219","observation_id":"8dc8a962-a94b-49f4-a55e-d0b1629820e1","resolution":{"observed_at":"2026-05-15T15:41:12.552340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SALMONN: Towards generic hearing abilities for large language models","venue":null,"work_id":"c75f1c46-b954-4a4d-b0ae-35d72ffe38c0","year":2024},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:e7dfd193f0495920917c36cff93c92bb286f6346bfd143095ba63575a673855e","observation_id":"e0a623f6-c828-4464-b9e0-9fc2fc9bb675","resolution":{"observed_at":"2026-05-15T15:41:12.565753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:677e2820136a36409dddd6586e2e2dda99312849bf3ce2531349f68d0f7de786","observation_id":"4eaee3f0-f2e7-4f2a-89ec-0f84c995de76","resolution":{"observed_at":"2026-05-15T15:41:12.014149Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CultureLLM: Incorporating cultural differences into large language models","venue":null,"work_id":"daeb032f-910f-44e3-b67a-808c7236dfc9","year":2024},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:579c95edbe7ea70dbb3727f0c812b72f7ce5a4e39dbde0431b97af3818e18486","observation_id":"cce735d0-dced-49b6-86da-d08e9df6816c","resolution":{"observed_at":"2026-05-15T15:41:12.548439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Universal paralinguistic speech representations using self-supervised con- formers","venue":null,"work_id":"62348d1a-de3d-455d-8bf2-5040b238120d","year":2022},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:2657190fa25cf94a5925f7e7e2c770da47a8d4bc0cfac1ee9e75ba1326261ebc","observation_id":"3adab25d-ddcf-42b0-b2ae-5dffbb57b0ea","resolution":{"observed_at":"2026-05-15T15:41:12.624284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07111","last_updated":"2024-12-27T07:29:19Z","snapshot_observed_at":"2026-07-06T19:48:32.368124Z","submitted_at":"2024-11-11T16:37:40Z","title":"Building a Taiwanese Mandarin Spoken Language Model: A First Attempt","version":2},"cited_work":{"arxiv_id":"2411.07111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.07111","snapshot_observed_at":"2026-07-04T11:59:50.259182Z","title":"Building a taiwanese mandarin spoken language model: A first attempt","venue":null,"work_id":"124b430d-5f85-4a49-a1a2-0e0ff371dbcb","year":2024},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"cited_paper":"/paper/2411.07111","citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:8a4dd1666a4d9a257d87d0a621009d139c3a9673123800747111e99e49696424","observation_id":"a00cccf8-d019-448b-8617-d4d74dfe1569","resolution":{"observed_at":"2026-05-15T15:41:12.036461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding sounds, missing the questions: The challenge of object hallucination in large audio-language models","venue":null,"work_id":"42d45d15-4d93-4c34-8990-2ced233a6063","year":2024},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:e1e3751d2e10f2df04b161a1e4fa3d9431cc6e37f82066caa45434b1f472d2fb","observation_id":"b4a85159-a69d-4ed1-a07f-9f381714c7cb","resolution":{"observed_at":"2026-05-15T15:41:12.611522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating subgroup dis- parities in multi-label speech emotion recognition: A pseudo- labeling and unsupervised learning approach","venue":null,"work_id":"94886098-4c38-4a11-bfe1-39d91c4387d7","year":2025},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:2a67be9f40c420f1744e57b886be83ef14a4ebcaf098a85f3d34e573445cb339","observation_id":"04407e70-5fd3-4939-afd3-cddb23e862ff","resolution":{"observed_at":"2026-05-15T15:41:12.556825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AudioSet: An ontology and human-labeled dataset for audio events","venue":null,"work_id":"1aab3ce3-f417-402d-a1fa-a7de0b724571","year":2017},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:4509bd7321e8f8b986c31f8450c2fa7a9287769e5b41546c72701afd8ebb3037","observation_id":"0110998a-97a3-4756-a826-22975c002534","resolution":{"observed_at":"2026-05-15T15:41:12.615657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lib- riSpeech: An ASR corpus based on public domain audio books","venue":null,"work_id":"1606d3b0-6c6d-43ce-9a11-198b42a4209c","year":2015},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:b608757c50f902f41e619d4be26cba70953b6a1ad1ff32e810ecb44fdd82c1ac","observation_id":"cd723bb6-25f5-4c47-808b-76a4968ca288","resolution":{"observed_at":"2026-05-15T15:41:12.561496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"WenetSpeech: A 10000+ hours multi-domain mandarin corpus for speech recognition","venue":null,"work_id":"ba28b5d6-1bbb-4e20-b366-f5a9eb5f97f2","year":2022},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:ed136714df565cb9657ff545604a76fcbf5365df9adc1009544eb6d44693a437","observation_id":"31f3d6d9-cfe5-4661-a66a-4cf0dea0c4cd","resolution":{"observed_at":"2026-05-15T15:41:12.652162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AudioGen: Tex- tually guided audio generation","venue":null,"work_id":"9b41559b-4f92-4e64-bc89-d32661b54494","year":2023},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:fce14b08b2cadda4d4d904714f94a183796c14b7eb9932f62fa7414549060a82","observation_id":"9bc4780a-01bc-4901-8c04-2fb1c7fb6497","resolution":{"observed_at":"2026-05-15T15:41:12.607808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15407","last_updated":"2025-08-21T09:58:24Z","snapshot_observed_at":"2026-08-05T17:55:24.444881Z","submitted_at":"2025-08-21T09:58:24Z","title":"When Audio and Text Disagree: Revealing Text Bias in Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2508.15407","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15407","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"When audio and text disagree: Reveal- ing text bias in large audio-language models","venue":null,"work_id":"18585a90-c919-42a5-8f96-3bee9d545a54","year":2025},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"cited_paper":"/paper/2508.15407","citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:463617392a790d4cb4452358bebb52e0682cadea0be49557b6cae0bdc3039096","observation_id":"da662ac1-43f3-41c4-bf05-78d6facf5437","resolution":{"observed_at":"2026-05-15T15:41:12.029178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20976","last_updated":"2025-08-28T16:29:46Z","snapshot_observed_at":"2026-08-06T13:41:02.244589Z","submitted_at":"2025-08-28T16:29:46Z","title":"WoW-Bench: Evaluating Fine-Grained Acoustic Perception in Audio-Language Models via Marine Mammal Vocalizations","version":1},"cited_work":{"arxiv_id":"2508.20976","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20976","snapshot_observed_at":"2026-07-04T18:00:00.275733Z","title":"Wow- bench: Evaluating fine-grained acoustic perception in audio- language models via marine mammal vocalizations","venue":null,"work_id":"904ee92a-f1f8-4bd5-a1a2-a8f3dd61f750","year":2025},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"cited_paper":"/paper/2508.20976","citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:5250e7b6ee5a9ea3eb87bc3e4b7f0fc8e61097ef94b91a75559b2882540adc22","observation_id":"90cd461a-39cf-41a4-a45f-a9b9926f70e0","resolution":{"observed_at":"2026-05-15T15:41:12.042921Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ke- Speech: An open source speech dataset of Mandarin and its eight subdialects","venue":null,"work_id":"1349676d-0fda-48a0-b8bc-2c2dcb7bcc01","year":2021},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:6b40b5eb99fd63436cc4f0342837828338f9a9e3c2c8f40cc8367c57fa350a8e","observation_id":"b8819a61-e5ed-4733-8bf8-cacc9813cd48","resolution":{"observed_at":"2026-05-15T15:41:12.569860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LESS: Large language model enhanced semi-supervised learning for speech foundational models using in-the-wild data","venue":null,"work_id":"f9d334e4-9cbb-4d81-972a-a649fe33f065","year":2026},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:70d8f6ba8346c56c3ada723018cff21b9fd06533af11950548f705c25d5e2a23","observation_id":"0863d271-bea5-4dde-8292-44d96213b520","resolution":{"observed_at":"2026-05-15T15:41:12.597404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language mod- els to follow instructions with human feedback","venue":null,"work_id":"3ec18801-9ce6-4231-a5ac-ad2c65e60d6d","year":2022},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:d90d704c6bd0bc5ad78d15a5714402ecbe377470d76a78c62daa4a31ae2bcae9","observation_id":"b00ad799-b7d4-4046-a998-7c2f3cda719e","resolution":{"observed_at":"2026-05-15T15:41:12.586867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.20860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:17:24.062530Z","title":"Data-centric lessons to improve speech-language pretraining","venue":null,"work_id":"e74743d3-dc29-4817-aeb2-787221b634be","year":2025},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:ba3a82338a0c4d550a9cc56516a7c567d9c54e17f928002b48ea737aec259471","observation_id":"efa01878-ef1b-4e10-8478-cd0d23bff92e","resolution":{"observed_at":"2026-05-15T15:41:12.056262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reducing ob- ject hallucination in large audio-language models via audio-aware decoding","venue":null,"work_id":"ea315426-f150-4a07-918f-f43b99000cb8","year":2025},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:89c475871638ef81c0ddbaea2dce058f48b62e704b104e562ee2b259a26e5549","observation_id":"300b3fd7-8048-4c67-ae5b-09cced34f132","resolution":{"observed_at":"2026-05-15T15:41:12.592199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond transcription: Mechanistic interpretability in ASR","venue":null,"work_id":"222ff9a5-a188-4aee-a701-329452b9525a","year":2026},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:8a631369870968ecbdbcfbb846353a13507509298e5f58dec5a9e7d4feaf4302","observation_id":"075cd9f5-c2ee-428d-8f81-d231c6423f2a","resolution":{"observed_at":"2026-05-15T15:41:12.602913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TAU: A benchmark for cultural sound understanding beyond semantics","venue":null,"work_id":"12398a67-fed0-424b-8c2f-01d8459a99da","year":2026},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:34a03c6e5a1ca0af3035985e59e47289aa361c58753dad10e75ba495f0f63646","observation_id":"46975b0f-9fff-4e39-bb9c-6e1e06c911ac","resolution":{"observed_at":"2026-05-15T15:41:12.619954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeSTA2.5-Audio: Toward general- purpose large audio language model with self-generated cross- modal alignment","venue":null,"work_id":"717befde-cf0a-48a5-be65-0b2fd24aab2d","year":2026},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:bd82fd40a73a1eb4ca724c2106ff24928c4af8a4b2ef72e61679c42ea8bd16a2","observation_id":"63112cbf-69af-4d20-b282-69d48e16c237","resolution":{"observed_at":"2026-05-15T15:41:12.628540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention- passing models for robust and data-efficient end-to-end speech translation","venue":null,"work_id":"0ef946ff-ca84-4f0d-88dc-600713742dce","year":2019},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:a7020aab98efb0958013ba19222205f66e183e445ebcd921ba41d15e1aa19282","observation_id":"fb14dec9-9e30-49d3-ab98-5dc0eda6dfb4","resolution":{"observed_at":"2026-05-15T15:41:12.638215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lost in transcription, found in distribution shift: Demystifying hallucination in speech foundation models","venue":null,"work_id":"e4f90f7d-45fe-4f37-a803-abafee633ba3","year":2025},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:91c406569d0920717dfad74191f45524739c8d35d566c768ea6fb89517ba27e0","observation_id":"df6cac8d-acff-4af8-b471-8312b88f3a36","resolution":{"observed_at":"2026-05-15T15:41:12.582394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching audio-aware large language models what does not hear: Mitigating hallucinations through synthesized negative samples","venue":null,"work_id":"b2d0a02c-eb7d-4fff-ad17-e58165f6184b","year":2025},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:58a0e1fb89908dedb310c01cef361df38e0914149d84ccbe6fb829f7e9da4af0","observation_id":"eafd01da-5065-411d-8b0c-f6a289d81f4a","resolution":{"observed_at":"2026-05-15T15:41:12.577996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01572","last_updated":"2024-01-03T06:56:56Z","snapshot_observed_at":"2026-07-06T17:11:04.789413Z","submitted_at":"2024-01-03T06:56:56Z","title":"Hallucinations in Neural Automatic Speech Recognition: Identifying Errors and Hallucinatory Models","version":1},"cited_work":{"arxiv_id":"2401.01572","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01572","snapshot_observed_at":"2026-07-04T12:29:52.169335Z","title":"Hallucinations in neural automatic speech recognition: Identifying errors and hallucinatory models","venue":null,"work_id":"94ea041f-5422-4df1-b445-a95bca798000","year":2024},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"cited_paper":"/paper/2401.01572","citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:c5afe1dfc2e986692e2cf69f83c61ad9724fb8d567b7ee76bf6b2f4d6372b2f6","observation_id":"2086a53c-cd28-4c44-8134-1640c39e5fea","resolution":{"observed_at":"2026-05-15T15:41:12.022755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust speech recognition via large-scale weak su- pervision","venue":null,"work_id":"37ee45aa-5f42-41c3-b58e-c0df306a0ebc","year":2023},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:88b798f1058f55b8ee5e86f082039e794773a470fe162cbfff40e0d1ebe709da","observation_id":"bd2de4d1-4754-464e-be92-2f2d992f940f","resolution":{"observed_at":"2026-05-15T15:41:12.573996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-06T00:42:36.144034Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":"2407.04051","doi":"10.48550/arxiv.2407.04051","metadata_source":"pith","pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Funaudiollm: Voice understanding and generation foundation models for natural interaction between humans and llms.arXiv preprint arXiv:2407.04051","venue":"cs.SD","work_id":"7cd6d289-dca2-414f-99e0-809f37c065fa","year":2024},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:76c58f0c4695f091d74b4eefdc7fc5363faeffe6c8946a0d967e52a858e3a2e8","observation_id":"814d604a-bab6-4ee4-a3bd-e5d0fba97762","resolution":{"observed_at":"2026-05-15T15:41:12.084111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:52.218158+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:52.218158+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:6bb13ea3492e45cc679f8eea64b2e6d71c81ddb08e5b5f4a9667cc6626e70051","observation_id":"c05e7224-bbf4-4475-ab49-064a0f8c7e9c","resolution":{"observed_at":"2026-05-15T15:41:12.062679Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:99646d1da618aee14732e21782516cdfeab689a434b5a6d326830abf4ff5738c","observation_id":"d1ab2d00-a676-43e9-bbfa-04079f2a6d73","resolution":{"observed_at":"2026-05-15T15:41:12.049671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:0a553445a6303a0757ea45d6b3c7d0d119a9b0dcdedfba5f1afca989e3c89274","observation_id":"33308ca8-b00c-4034-be1d-b4d7af0aec01","resolution":{"observed_at":"2026-05-15T15:41:12.070080Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-05T04:04:57.122045Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":12,"verified_fuzzy":29},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2603.05094."}