{"as_of":"2026-08-06T09:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:57ddb7319d1d20b677a887585f2a9c6ea195baf36de35748b49fa1c5dc771e0f","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T21:02:19.300441Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T21:02:19.300441Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T20:07:21.311003Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"cited_work":{"arxiv_id":"2606.07264","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.07264","snapshot_observed_at":"2026-07-02T20:07:21.311003Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","venue":"eess.AS","work_id":"96466545-dcb6-4630-8d1c-20ce9aa90083","year":2026},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"cited_paper":"/paper/2606.07264","citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:a2296bd672b1dfce2c83db6c3e7daca976cdf0899e1197dd10291dfe4fb77786","observation_id":"bd5140ac-3ff4-43d4-9c8c-c3e38065556a","resolution":{"observed_at":"2026-07-02T20:07:21.312390Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.07264/citation-record","integrity":"/paper/2606.07264/integrity","json":"/paper/2606.07264/citation-record.json","paper":"/paper/2606.07264"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:19.300441Z","title":"LALM as a Tool","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:25c6ae21f57a948ff591bd087f1b93aee92118c7ed1194305f1f9747811f9b7d","observation_id":"a63c1d5e-4774-40c6-8ac9-ba36c7fa6d36","resolution":{"observed_at":"2026-06-27T21:02:19.300441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"cited_work":{"arxiv_id":"2606.07264","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.07264","snapshot_observed_at":"2026-07-02T20:07:21.311003Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","venue":"eess.AS","work_id":"96466545-dcb6-4630-8d1c-20ce9aa90083","year":2026},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"cited_paper":"/paper/2606.07264","citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:a2296bd672b1dfce2c83db6c3e7daca976cdf0899e1197dd10291dfe4fb77786","observation_id":"bd5140ac-3ff4-43d4-9c8c-c3e38065556a","resolution":{"observed_at":"2026-07-02T20:07:21.312390Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5987.5073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T20:07:21.338658Z","title":"Rubrics” denotes the official CoT quality score, and “Acc","venue":null,"work_id":"288b203e-4e4a-4886-b201-9d07ea5571a7","year":2026},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:dec1fb3cf7f200cbd56534a576d784d632fec81af5165d5d38b60798ff42eb80","observation_id":"a31e052f-d9e8-48d2-ada9-a3e24bed4898","resolution":{"observed_at":"2026-07-02T20:07:21.340478Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:19.300441Z","title":"VISA enhances LALMs with visualized acoustic evidence and structured inference strategies, achieving strong accuracy while maintaining high-quality, rubric-aligned reasoning chains","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:199fcfcb14ebacb9e2c87f2bd3cb1452573f4cb5776415636227c68f76cf417b","observation_id":"94371ccf-a5d0-4ef1-8f5f-dfe468420d28","resolution":{"observed_at":"2026-06-27T21:02:19.300441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:19.300441Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:0978e1498455697c6e2b69ac99d676369dd002b337242ab6f8f7b11553ab40b5","observation_id":"9fedd6af-7084-47d8-9e11-b23d17ac20d3","resolution":{"observed_at":"2026-06-27T21:02:19.300441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21337","last_updated":"2026-01-30T02:58:48Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T06:58:13Z","title":"Qwen3-ASR Technical Report","version":2},"cited_work":{"arxiv_id":"2601.21337","doi":"10.48550/arxiv.2601.21337","metadata_source":"pith","pith_arxiv_id":"2601.21337","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-ASR Technical Report","venue":"cs.CL","work_id":"db50e258-4a3d-4141-ba30-f76f8f953880","year":2026},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"cited_paper":"/paper/2601.21337","citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:9c0817c4774ff9c355d177c56990053c20aab2eab3c2c9b5cc92a71b9de09083","observation_id":"80de9e50-b765-40e3-96c9-f171ee09268a","resolution":{"observed_at":"2026-07-02T20:07:21.300241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.18184","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.819917Z","title":"VIBEVOICE-ASR technical report","venue":null,"work_id":"8c3744fb-dfff-4f53-8445-4806dbf5929a","year":2026},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:1a2e88e0b15ddf5ae75a002dd9af2ed5b11b2c8010346420b4ab4c3f05890dd6","observation_id":"7a11220c-8db8-4a6c-a7f3-012f067ce4ef","resolution":{"observed_at":"2026-07-02T20:07:21.334692Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:19.300441Z","title":"Fine-tune the pretrained atst model for sound event detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:861d0dab8a6086bd3e115483db038d55f7b6a86fc75e1ad32f5c5b1c19a956cd","observation_id":"cf1ccb35-9c64-46b4-bb64-fd7b87bcee39","resolution":{"observed_at":"2026-06-27T21:02:19.300441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:19.300441Z","title":"Flexsed: Towards open-vocabulary sound event detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:464d40518b4155fe879dd02854752b6331d9151a497a6b2c24d4dfc59c26d947","observation_id":"01b7c42b-0f00-451a-9288-1c7aa84bc3ff","resolution":{"observed_at":"2026-06-27T21:02:19.300441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.12720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:19:47.960326Z","title":"Omni-captioner: Data pipeline, mod- els, and benchmark for omni detailed perception","venue":null,"work_id":"45c714fa-2889-45f5-8032-5201e7b58b2d","year":2025},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:019e9212002048b6339ae8ac4a52ec05e9248081a64ad6e1e7aeca04b31a1121","observation_id":"19a76a11-e8bb-498a-b02f-fbe75230176d","resolution":{"observed_at":"2026-07-02T20:07:21.287304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:9c3017f0cd40bb6ae855e573bd00ca5f031a26be6ce587bfb141e200159e02d0","observation_id":"73ce4fd9-5570-4668-be65-cb53f16badaa","resolution":{"observed_at":"2026-07-02T20:07:21.297222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:aa7716d43c67cc6a378265d6c3ae4a7cdf7b0f187fc0657cb28ff9baab926647","observation_id":"a06c5d99-ab51-4dee-8921-181969b635fb","resolution":{"observed_at":"2026-07-02T20:07:21.303276Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"cited_work":{"arxiv_id":"2507.08128","doi":"10.48550/arxiv.2507.08128","metadata_source":"pith","pith_arxiv_id":"2507.08128","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","venue":"cs.SD","work_id":"67c2892d-8e27-4da1-8198-71c48e673e96","year":2025},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"cited_paper":"/paper/2507.08128","citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:d640f473da4f79f319c7802d512b332780fbee52d763d90eba4875a63f8739c8","observation_id":"d4f30352-c353-4700-820d-85490c20c9aa","resolution":{"observed_at":"2026-07-02T20:07:21.291088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13032","last_updated":"2025-05-19T12:18:42Z","snapshot_observed_at":"2026-08-04T21:45:55.994640Z","submitted_at":"2025-05-19T12:18:42Z","title":"MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix","version":1},"cited_work":{"arxiv_id":"2505.13032","doi":"10.48550/arxiv.2505.13032","metadata_source":"pith","pith_arxiv_id":"2505.13032","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mmar: A challenging benchmark for deep reasoning in speech, audio, music, and their mix","venue":"cs.SD","work_id":"fe97a573-dedf-4e07-af07-b22508260a10","year":2025},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"cited_paper":"/paper/2505.13032","citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:a2c18df854dd2bbaf5e5b39b97797567b4db1e1b85a26e61ceb06aef0b28d914","observation_id":"332d5daa-7dc9-4bb5-82d2-4df03117a0d1","resolution":{"observed_at":"2026-07-02T20:07:21.343611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13992","last_updated":"2025-08-19T16:33:49Z","snapshot_observed_at":"2026-08-05T18:48:28.371759Z","submitted_at":"2025-08-19T16:33:49Z","title":"MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence","version":1},"cited_work":{"arxiv_id":"2508.13992","doi":"10.48550/arxiv.2508.13992","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13992","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Mmau-pro: A challenging and comprehensive benchmark for holistic evaluation of audio general intelligence","venue":null,"work_id":"34fbbc93-cd79-4b11-a99d-32d597b71a37","year":2025},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"cited_paper":"/paper/2508.13992","citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:5dba77f8b06e091b9f597721395982d5f0a90809606670d2994968e6e3662660","observation_id":"b2a49e64-eb0b-47c9-a1cf-8e50004d6314","resolution":{"observed_at":"2026-07-02T20:07:21.319265Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2409.15272","doi":"10.48550/arxiv.2409.15272","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omnibench: Towards the future of universal omni-language models","venue":"arXiv (Cornell University)","work_id":"22ef480d-b306-4048-8e0c-5a0948c9b57a","year":2024},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:7ef41f3af1f97cdb9c15d27243b7d2cb05f3975029a61d02ffbcef1215be8ae8","observation_id":"bf974f15-4254-4ade-86a5-d650b5473196","resolution":{"observed_at":"2026-07-02T20:07:21.331864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:e627d4e67f5a88d5f7ff26224a4c15f84f90ec8594746b7156c5e4268c00da3d","observation_id":"580a64e8-560c-401d-85df-77c076954a39","resolution":{"observed_at":"2026-07-02T20:07:21.322160Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:19.300441Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:fedf1ff0f3c37447a1613aa4dfc389dce0adb4230067bfc8e4dc03af44af5669","observation_id":"ac9ed5f6-9606-4c38-bed0-3ff129b52307","resolution":{"observed_at":"2026-06-27T21:02:19.300441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.02318","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T00:04:22.645021Z","title":"Audio-reasoner: Improving reasoning capability in large audio language models","venue":null,"work_id":"a04842be-5517-4c05-977a-3581be081263","year":2025},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:9dd7d057b81416c1bce4daacfd673d23121fb4265eeea9e6f5d0018538a4a407","observation_id":"91e7d3b7-08f6-4084-8219-84d1878793c1","resolution":{"observed_at":"2026-07-02T20:07:21.337899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.08039","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T00:04:22.382702Z","title":"Audio-thinker: Guiding audio language model when and how to think via reinforcement learning","venue":null,"work_id":"cf80154c-35ad-4790-8ebd-2a8878db0ee6","year":2025},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:588a93708349d79aae9796578cf8736fa8d6648a89b3cd787ff207402a189c67","observation_id":"bc6c46f2-a1e8-4fb5-8786-fdbf8fd99fa2","resolution":{"observed_at":"2026-07-02T20:07:21.306568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.16971","doi":"10.48550/arxiv.2509.16971","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Audiogenie-reasoner: A training- free multi-agent framework for coarse-to-fine audio deep reasoning","venue":null,"work_id":"ccb6953c-a124-48da-bafd-bf91c30902d4","year":2025},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:d096fc136e5d6ea55c673441dba6769629c368412875dc69efe29ecff67e4ae2","observation_id":"c352da55-a2d8-402d-a4c1-b3c1f898cf76","resolution":{"observed_at":"2026-07-02T20:07:21.310238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.02995","doi":"10.48550/arxiv.2510.02995","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Au- diotoolagent: An agentic framework for audio-language mod- els","venue":"arXiv (Cornell University)","work_id":"e46ac902-9b95-4f03-945e-f84f6394862b","year":2025},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:fed8c2bd529c0d1fa304c710e3ec3411d857ab16b92486d0d411f7cb86d6fdce","observation_id":"6b371150-f247-4915-92eb-4abed557b377","resolution":{"observed_at":"2026-07-02T20:07:21.356442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.06483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T20:07:21.313913Z","title":"Sar-lm: Symbolic audio reasoning with large language models","venue":null,"work_id":"f4fbd31c-61a3-4913-84a4-19b9fe326312","year":2025},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:5b1acecc70cd1daebdcf3ee1513eff76d37518aa462346b940a6b3f41e83978b","observation_id":"39c9ab2c-fc39-49b5-8f93-862392f27cfa","resolution":{"observed_at":"2026-07-02T20:07:21.315974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15848","doi":"10.48550/arxiv.2511.15848","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-audio-r1 technical report","venue":"arXiv (Cornell University)","work_id":"80b24600-9960-4df9-97b2-66714cfd73f5","year":2025},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:f0642deba48875773d48324ac8ff89f761a261499cb84a7cb15f2685d841860d","observation_id":"54130624-b072-4b6f-b1a0-74cb0df2715e","resolution":{"observed_at":"2026-07-02T20:07:21.294370Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:b6cee140a29667425fa97de00221d644c0bffa31da1ee70dacee875daa602780","observation_id":"8370f724-23ed-4a74-ab00-3bb19b93ead2","resolution":{"observed_at":"2026-07-02T20:07:21.359471Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.14224","doi":"10.48550/arxiv.2602.14224","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The interspeech 2026 audio reasoning chal- lenge: Evaluating reasoning process quality for audio reasoning models and agents","venue":"Open MIND","work_id":"235d1022-58e5-4528-8ba4-9e2e87a97242","year":2026},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:973bb3ecc05a6630232f47328c9d73e111142f73b6eac81647944fd7b64e4d03","observation_id":"3a1d640f-d0de-42db-8c65-d2e8e7a7dd4d","resolution":{"observed_at":"2026-07-02T20:07:21.353393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:19.300441Z","title":"Gemini 2.5 flash,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:61d4f849a7194ba778e5af9a7923ddf662f99fa8fea48cdc4e4ec7c6dc9b2c53","observation_id":"f4c7359b-1373-4f9e-b88f-ab0317bd4b36","resolution":{"observed_at":"2026-06-27T21:02:19.300441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07246","last_updated":"2025-01-13T11:54:40Z","snapshot_observed_at":"2026-08-01T10:25:58.860404Z","submitted_at":"2025-01-13T11:54:40Z","title":"Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model","version":1},"cited_work":{"arxiv_id":"2501.07246","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07246","snapshot_observed_at":"2026-07-03T07:57:44.602800Z","title":"Audio-cot: Exploring chain-of-thought reasoning in large audio language model","venue":null,"work_id":"a29ac5b5-b39a-4024-b423-9a8a9f536e29","year":2025},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"cited_paper":"/paper/2501.07246","citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:e0e0805b293a6fac3971cd3a006c2347f7d4b012da51a7ad457d45321ab475c8","observation_id":"ab455650-dc21-44a6-b3ac-a30ed14f413d","resolution":{"observed_at":"2026-07-02T20:07:21.325490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11197","last_updated":"2025-05-14T02:12:43Z","snapshot_observed_at":"2026-07-06T20:52:37.081347Z","submitted_at":"2025-03-14T08:43:53Z","title":"Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering","version":4},"cited_work":{"arxiv_id":"2503.11197","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.11197","snapshot_observed_at":"2026-07-02T20:07:21.344787Z","title":"Reinforcement learning outperforms supervised fine-tuning: A case study on audio question an- swering","venue":null,"work_id":"124c7cde-3047-4ea3-b487-b56039243100","year":2025},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"cited_paper":"/paper/2503.11197","citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:ad59e1df3ab54c9713fbd49ff9c32e1f1800451970eedd277d893473ca1734d2","observation_id":"7cfff068-1d25-4f50-8ef7-0f8da95b5d03","resolution":{"observed_at":"2026-07-02T20:07:21.346714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:aef9d189925ba2441e959bca99af72094038e32cd81ab5c2ec212fa57843260d","observation_id":"77147c05-85ff-4019-9fac-892b0c41fcf9","resolution":{"observed_at":"2026-07-02T20:07:21.349522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"cited_work":{"arxiv_id":"2508.06471","doi":"10.48550/arxiv.2508.06471","metadata_source":"pith","pith_arxiv_id":"2508.06471","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","venue":"cs.CL","work_id":"5bb4e5d7-985e-431b-bb0d-75576cdc2950","year":2025},"citing_paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:19.300441Z"},"links":{"cited_paper":"/paper/2508.06471","citing_paper":"/paper/2606.07264"},"observation_digest":"sha256:5740e6289055a85e5b3da9bad6b16ad36a719fad8d278542e3eea4803654968d","observation_id":"76f4109d-ad13-424a-a29a-813fd5dd1622","resolution":{"observed_at":"2026-07-02T20:07:21.328561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T05:23:01.474969+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T05:23:01.474969+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.07264","last_updated":"2026-06-05T13:39:39Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T13:39:39Z","title":"VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":7,"verified_exact":23,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2606.07264."}