{"as_of":"2026-08-17T05:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:24c4352e3c8651b574a475132ef6296cf5766802c78c86c8b1bfe6fff88c9a36","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":36,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:05:27.317435Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-16T00:05:27.317435Z","title":"Audio flamingo 2: An audio-language model with long-audio understanding and expert reasoning abilities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.03054","last_updated":"2025-05-12T19:49:55Z","snapshot_observed_at":"2026-08-17T00:13:33.833008Z","submitted_at":"2025-05-05T22:28:53Z","title":"BLAB: Brutally Long Audio Bench","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T00:05:27.317435Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2505.03054"},"observation_digest":"sha256:ac51920ced6b2f49cda082729162a50da13e9e1ce746a413ac9941f1766223ca","observation_id":"ad9a24e6-3bfd-487b-8adb-81255a67fd56","resolution":{"observed_at":"2026-08-16T00:05:27.317435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-15T20:25:12.593547Z","title":"Audio Flamingo 2: An audio-language model with long-audio understanding and expert reasoning abilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13032","last_updated":"2025-05-19T12:18:42Z","snapshot_observed_at":"2026-08-15T20:19:07.938731Z","submitted_at":"2025-05-19T12:18:42Z","title":"MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:12.593547Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2505.13032"},"observation_digest":"sha256:95fab4907f6ab5b72ff5598fc4757c6dca50b149f26469758dea4fb2fdfce94e","observation_id":"87703216-962f-4ed3-be43-2d13eac1b752","resolution":{"observed_at":"2026-08-15T20:25:12.593547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-07T05:44:06.028974Z","title":"Available: https://arxiv.org/abs/2503.03983","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-15T19:21:09.044173Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:06.028974Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:462ac5277634da868f7096a5759209e564041adf43e5b310d73cd200f29a1357","observation_id":"faaf1430-0060-4ed1-99b9-2e4d8b354f35","resolution":{"observed_at":"2026-08-07T05:44:06.028974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-07T00:59:50.218454Z","title":"Audio flamingo 2: An audio-language model with long-audio understanding and expert reasoning abili- ties,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-16T16:08:07.333631Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:50.218454Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:736a172776a889b8141979ce1b768adb523dbea6039664394d9d74cc07a61635","observation_id":"f78fe07d-4bdf-4cf2-8357-5353d91130da","resolution":{"observed_at":"2026-08-07T00:59:50.218454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-07T00:41:34.161298Z","title":"Audio flamingo 2: An audio-language model with long-audio under- standing and expert reasoning abilities.arXiv preprint arXiv:2503.03983, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13284","last_updated":"2025-06-16T09:27:48Z","snapshot_observed_at":"2026-08-13T16:04:27.350434Z","submitted_at":"2025-06-16T09:27:48Z","title":"AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:34.161298Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2506.13284"},"observation_digest":"sha256:78f6f1eaf278677f5bfaf11ac075d6098a375898da7b790e0823162449ffc049","observation_id":"d6eb32c1-0faf-4999-86af-f60a5b54c463","resolution":{"observed_at":"2026-08-07T00:41:34.161298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-15T19:05:24.546999Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17815","last_updated":"2025-06-21T21:04:09Z","snapshot_observed_at":"2026-08-17T01:22:24.543503Z","submitted_at":"2025-06-21T21:04:09Z","title":"SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:24.546999Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2506.17815"},"observation_digest":"sha256:6c774e61d1f47f4b2c2c0fce0da3909fa5ece9b12cf9965ebc929dbb34c32da1","observation_id":"9daf461b-eab3-46d9-8e7c-7a68f1a3d7a1","resolution":{"observed_at":"2026-08-15T19:05:24.546999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-06T19:12:02.450734Z","title":"Audio flamingo 2: An audio-language model with long-audio understanding and expert reasoning abilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06329","last_updated":"2025-07-08T18:33:26Z","snapshot_observed_at":"2026-08-14T22:56:03.693923Z","submitted_at":"2025-07-08T18:33:26Z","title":"MixAssist: An Audio-Language Dataset for Co-Creative AI Assistance in Music Mixing","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T19:12:02.450734Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2507.06329"},"observation_digest":"sha256:53781c9dce6accf5c251cb6f9bc89794365620cc84d2ea801f0ed5f071eca818","observation_id":"2482effc-92ad-4225-a722-cc2ace70b7e1","resolution":{"observed_at":"2026-08-06T19:12:02.450734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2503.03983","doi":"10.48550/arxiv.2503.03983","metadata_source":"pith","pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio flamingo 2: An audio- language model with long-audio understanding and expert rea- soning abilities","venue":"cs.SD","work_id":"c3d168cb-8267-475f-bc18-b33bba54b60d","year":2025},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-08-13T23:38:52.637908Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:407d7de9c778cca4fabf273ea1faa2312c29353760ba1a8fbe3979764bd3013a","observation_id":"cc18c3e4-6860-40e5-82f7-e582062a4df1","resolution":{"observed_at":"2026-05-16T05:59:51.015617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-06T14:50:04.261844Z","title":"ArXiv abs/2503.03983 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-16T00:23:52.964920Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.261844Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:6025c2418bc24b61c61daffed6fcbaca1b838cda00d86cf5ec3c38f1f23f1f8d","observation_id":"790b06dd-25e5-44b1-8942-25f3c8f43102","resolution":{"observed_at":"2026-08-06T14:50:04.261844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T17:56:51.971766Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15418","last_updated":"2025-08-21T10:20:00Z","snapshot_observed_at":"2026-08-14T16:19:43.372797Z","submitted_at":"2025-08-21T10:20:00Z","title":"LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T17:56:51.971766Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2508.15418"},"observation_digest":"sha256:25df9fc42fe875b31ed38e971906bbd613cf58a0e8d0ffe584c6932bcdddc0b4","observation_id":"ce6d2a7f-0377-48f8-9a32-3893dc6f4dcb","resolution":{"observed_at":"2026-08-05T17:56:51.971766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T14:43:27.210402Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20976","last_updated":"2025-08-28T16:29:46Z","snapshot_observed_at":"2026-08-16T14:54:25.126703Z","submitted_at":"2025-08-28T16:29:46Z","title":"WoW-Bench: Evaluating Fine-Grained Acoustic Perception in Audio-Language Models via Marine Mammal Vocalizations","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T14:43:27.210402Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2508.20976"},"observation_digest":"sha256:b3a0d6822adb0cc6033d5b2ec01530c454f0cc90de7004182cd9202bd7c49538","observation_id":"1ca8e5ab-f5dc-433b-90a8-29a0b028f2ad","resolution":{"observed_at":"2026-08-05T14:43:27.210402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-03T12:02:00.050889Z","title":"Audio flamingo 2: An audio-language model with long-audio understanding and expert reasoning abil- ities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06199","last_updated":"2026-06-01T03:39:22Z","snapshot_observed_at":"2026-08-15T17:09:58.548655Z","submitted_at":"2026-01-08T07:46:03Z","title":"FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T12:02:00.050889Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2601.06199"},"observation_digest":"sha256:66d40a7c0b7634c5133ae097102e5898bfa753aa4dc2965951b8f31eeab0c33a","observation_id":"1da3cfc8-93d9-40e5-9552-ac757a222577","resolution":{"observed_at":"2026-08-03T12:02:00.050889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2503.03983","doi":"10.48550/arxiv.2503.03983","metadata_source":"pith","pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio flamingo 2: An audio- language model with long-audio understanding and expert rea- soning abilities","venue":"cs.SD","work_id":"c3d168cb-8267-475f-bc18-b33bba54b60d","year":2025},"citing_paper":{"arxiv_id":"2602.07064","last_updated":"2026-04-07T13:49:35Z","snapshot_observed_at":"2026-08-11T15:55:44.194747Z","submitted_at":"2026-02-05T14:04:51Z","title":"OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-16T07:09:46.254851Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2602.07064"},"observation_digest":"sha256:f48dae5c63addaee7bd1e130d1b4c655ca684a614ac7d70644853fea1036a9ee","observation_id":"9e029be1-4592-4b6f-a584-2dbfc5d5dded","resolution":{"observed_at":"2026-05-16T07:10:43.108380Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2503.03983","doi":"10.48550/arxiv.2503.03983","metadata_source":"pith","pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio flamingo 2: An audio- language model with long-audio understanding and expert rea- soning abilities","venue":"cs.SD","work_id":"c3d168cb-8267-475f-bc18-b33bba54b60d","year":2025},"citing_paper":{"arxiv_id":"2604.13023","last_updated":"2026-08-10T09:20:13Z","snapshot_observed_at":"2026-08-14T13:37:59.572304Z","submitted_at":"2026-04-14T17:57:01Z","title":"SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T13:54:52.275011Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2604.13023"},"observation_digest":"sha256:7d6e16589bb31a84d842d8a88101c5a46f38968c929eba05addf4579f2396a44","observation_id":"2652559e-6df6-4a18-abe9-e3b7c8d37e5c","resolution":{"observed_at":"2026-05-10T13:55:28.631705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2503.03983","doi":"10.48550/arxiv.2503.03983","metadata_source":"pith","pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio flamingo 2: An audio- language model with long-audio understanding and expert rea- soning abilities","venue":"cs.SD","work_id":"c3d168cb-8267-475f-bc18-b33bba54b60d","year":2025},"citing_paper":{"arxiv_id":"2604.13804","last_updated":"2026-04-15T12:39:03Z","snapshot_observed_at":"2026-08-15T08:40:26.674407Z","submitted_at":"2026-04-15T12:39:03Z","title":"Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T14:22:25.660785Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2604.13804"},"observation_digest":"sha256:6a140accaace6f51a04e3b8112a0884f73bbc3cc69f60f714e026b64a8a9187a","observation_id":"59f72fc5-5d63-4c36-8b5c-8dbe497526bb","resolution":{"observed_at":"2026-05-10T14:25:30.051834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2503.03983","doi":"10.48550/arxiv.2503.03983","metadata_source":"pith","pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio flamingo 2: An audio- language model with long-audio understanding and expert rea- soning abilities","venue":"cs.SD","work_id":"c3d168cb-8267-475f-bc18-b33bba54b60d","year":2025},"citing_paper":{"arxiv_id":"2604.23717","last_updated":"2026-04-26T14:00:31Z","snapshot_observed_at":"2026-08-02T21:00:22.453264Z","submitted_at":"2026-04-26T14:00:31Z","title":"HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T05:20:30.823304Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2604.23717"},"observation_digest":"sha256:8c62a3d383c7f08584b2b9e01ccb076d5de69488136373c4647a6630a0961b30","observation_id":"bf4b9018-0016-4edd-9b2e-362ec6250864","resolution":{"observed_at":"2026-05-11T21:31:14.370153Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2503.03983","doi":"10.48550/arxiv.2503.03983","metadata_source":"pith","pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio flamingo 2: An audio- language model with long-audio understanding and expert rea- soning abilities","venue":"cs.SD","work_id":"c3d168cb-8267-475f-bc18-b33bba54b60d","year":2025},"citing_paper":{"arxiv_id":"2605.07593","last_updated":"2026-05-08T11:06:43Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T11:06:43Z","title":"TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T01:53:01.939765Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2605.07593"},"observation_digest":"sha256:0431a19305b9fdf0c83466dd22bc13740827dc058c267975604c0dbc687d8dfc","observation_id":"79924e11-1dd8-426b-ba6e-5a07000b7e4f","resolution":{"observed_at":"2026-05-11T04:15:56.072605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2503.03983","doi":"10.48550/arxiv.2503.03983","metadata_source":"pith","pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio flamingo 2: An audio- language model with long-audio understanding and expert rea- soning abilities","venue":"cs.SD","work_id":"c3d168cb-8267-475f-bc18-b33bba54b60d","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-16T00:00:14.809961Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":129,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:34faeacdb3d170885e3ceb9fba889a166b74a74fd938b8037a5bbbf6e095f53f","observation_id":"8016a153-88ae-481b-8b36-36e61735ea75","resolution":{"observed_at":"2026-05-21T07:39:48.998577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2503.03983","doi":"10.48550/arxiv.2503.03983","metadata_source":"pith","pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio flamingo 2: An audio- language model with long-audio understanding and expert rea- soning abilities","venue":"cs.SD","work_id":"c3d168cb-8267-475f-bc18-b33bba54b60d","year":2025},"citing_paper":{"arxiv_id":"2605.27741","last_updated":"2026-05-26T22:34:03Z","snapshot_observed_at":"2026-08-16T18:40:52.288346Z","submitted_at":"2026-05-26T22:34:03Z","title":"Escape the Language Prior: Mitigating Late-Stage Modality Collapse in Audio Reasoning via Modality-Aware Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T17:45:10.339950Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2605.27741"},"observation_digest":"sha256:f5035638a7941a6bef9196e7b41285fb4c67fb666353963555a94fa046b35a76","observation_id":"e8ae7566-cd02-4b84-b8da-3f3f3ebf7645","resolution":{"observed_at":"2026-06-29T17:53:46.697224Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2503.03983","doi":"10.48550/arxiv.2503.03983","metadata_source":"pith","pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio flamingo 2: An audio- language model with long-audio understanding and expert rea- soning abilities","venue":"cs.SD","work_id":"c3d168cb-8267-475f-bc18-b33bba54b60d","year":2025},"citing_paper":{"arxiv_id":"2606.05121","last_updated":"2026-06-03T17:26:11Z","snapshot_observed_at":"2026-08-14T14:46:55.727050Z","submitted_at":"2026-06-03T17:26:11Z","title":"Audio Interaction Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T04:57:05.062465Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2606.05121"},"observation_digest":"sha256:b37a50426473cd6834471b76cea2539ed7dd08e4a102d3fed8d602a387c44cc6","observation_id":"d9c56024-a811-499c-bbbc-f8ed687dbe10","resolution":{"observed_at":"2026-07-02T10:46:52.388730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2503.03983","doi":"10.48550/arxiv.2503.03983","metadata_source":"pith","pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio flamingo 2: An audio- language model with long-audio understanding and expert rea- soning abilities","venue":"cs.SD","work_id":"c3d168cb-8267-475f-bc18-b33bba54b60d","year":2025},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:7514d111213f36120f12902f156f333ef9a6dc04ea7f4c8a7086a8997e366708","observation_id":"d46a9922-240c-492b-a61c-4259fec8c112","resolution":{"observed_at":"2026-07-02T23:17:29.827782Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2503.03983","doi":"10.48550/arxiv.2503.03983","metadata_source":"pith","pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio flamingo 2: An audio- language model with long-audio understanding and expert rea- soning abilities","venue":"cs.SD","work_id":"c3d168cb-8267-475f-bc18-b33bba54b60d","year":2025},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-05T20:46:41.277498Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:60549fd23cb4c5b36a000a674aaf5daccb6f54658d3a733ff17221fcf1bf0f1d","observation_id":"3956a836-13a2-4a95-a7af-7bd398394a8c","resolution":{"observed_at":"2026-06-30T22:15:05.308750Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2503.03983","doi":"10.48550/arxiv.2503.03983","metadata_source":"pith","pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio flamingo 2: An audio- language model with long-audio understanding and expert rea- soning abilities","venue":"cs.SD","work_id":"c3d168cb-8267-475f-bc18-b33bba54b60d","year":2025},"citing_paper":{"arxiv_id":"2606.11260","last_updated":"2026-06-09T02:38:17Z","snapshot_observed_at":"2026-08-10T17:48:14.041315Z","submitted_at":"2026-06-09T02:38:17Z","title":"RAIL: Rethinking Auditory Intelligence in Large Audio-Language Models with a CHC-Grounded Benchmark","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T12:11:56.629002Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2606.11260"},"observation_digest":"sha256:fcafcedef7318438661b294ad1678f150c91f70f4343c06368818c40a581c1d6","observation_id":"178befd7-2047-465e-a124-f93262f31937","resolution":{"observed_at":"2026-07-03T07:17:43.954076Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2503.03983","doi":"10.48550/arxiv.2503.03983","metadata_source":"pith","pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio flamingo 2: An audio- language model with long-audio understanding and expert rea- soning abilities","venue":"cs.SD","work_id":"c3d168cb-8267-475f-bc18-b33bba54b60d","year":2025},"citing_paper":{"arxiv_id":"2606.18273","last_updated":"2026-06-05T11:38:30Z","snapshot_observed_at":"2026-08-12T18:50:06.738816Z","submitted_at":"2026-06-05T11:38:30Z","title":"Continuous Audio Thinking for Large Audio Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T21:52:49.839901Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2606.18273"},"observation_digest":"sha256:733d472891956a8cbd73a7b14f6015a49b2f74b8fa18804ed817934e07af9824","observation_id":"a152d5c4-cb10-4a61-a202-8841013b14ac","resolution":{"observed_at":"2026-07-02T17:47:18.002241Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2503.03983","doi":"10.48550/arxiv.2503.03983","metadata_source":"pith","pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio flamingo 2: An audio- language model with long-audio understanding and expert rea- soning abilities","venue":"cs.SD","work_id":"c3d168cb-8267-475f-bc18-b33bba54b60d","year":2025},"citing_paper":{"arxiv_id":"2606.20077","last_updated":"2026-08-13T16:20:55Z","snapshot_observed_at":"2026-08-16T23:12:09.626355Z","submitted_at":"2026-06-18T10:52:49Z","title":"The Hidden Evolution of Disguised Visual Context inside the VLM","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T18:08:56.044278Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2606.20077"},"observation_digest":"sha256:57d9f7409400484d4696e219f700cc93800e94c5298eb6060a2446315b844cee","observation_id":"24985778-cf4a-4593-9557-8599f6dd6b6d","resolution":{"observed_at":"2026-07-04T03:29:29.155417Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2503.03983","doi":"10.48550/arxiv.2503.03983","metadata_source":"pith","pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio flamingo 2: An audio- language model with long-audio understanding and expert rea- soning abilities","venue":"cs.SD","work_id":"c3d168cb-8267-475f-bc18-b33bba54b60d","year":2025},"citing_paper":{"arxiv_id":"2606.20101","last_updated":"2026-07-13T22:06:08Z","snapshot_observed_at":"2026-08-15T03:39:06.977921Z","submitted_at":"2026-06-18T11:20:08Z","title":"RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-26T15:51:48.672086Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2606.20101"},"observation_digest":"sha256:aeb1c32d1257899a936d4b861f503ed8164fedbdc5a0fb6b3242b51056a34058","observation_id":"b147afc1-d365-467a-aac4-435a39917103","resolution":{"observed_at":"2026-07-04T05:39:39.332502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2503.03983","doi":"10.48550/arxiv.2503.03983","metadata_source":"pith","pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio flamingo 2: An audio- language model with long-audio understanding and expert rea- soning abilities","venue":"cs.SD","work_id":"c3d168cb-8267-475f-bc18-b33bba54b60d","year":2025},"citing_paper":{"arxiv_id":"2606.20101","last_updated":"2026-07-13T22:06:08Z","snapshot_observed_at":"2026-08-15T03:39:06.977921Z","submitted_at":"2026-06-18T11:20:08Z","title":"RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-03T23:36:39.368933Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2606.20101"},"observation_digest":"sha256:2bece3e1b4d5b67ff462e1467610dd13ada675208287023da0e764fdf8b3e5e2","observation_id":"42d05f29-ac5f-4c73-a39c-3b055e3b27a1","resolution":{"observed_at":"2026-07-03T23:39:03.004309Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-07-15T10:41:34.347336Z","title":"Audio flamingo 2: An audio-language model with long-audio understanding and expert reasoning abilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20101","last_updated":"2026-07-13T22:06:08Z","snapshot_observed_at":"2026-08-15T03:39:06.977921Z","submitted_at":"2026-06-18T11:20:08Z","title":"RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-15T10:41:34.347336Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2606.20101"},"observation_digest":"sha256:6f12b74dfb6801cfbda7433c2b345b354db2790c3d9e786a840a1f79754f14de","observation_id":"85c4457d-8f24-4970-8c7b-1551134ddaa4","resolution":{"observed_at":"2026-07-15T10:41:34.347336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2503.03983","doi":"10.48550/arxiv.2503.03983","metadata_source":"pith","pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio flamingo 2: An audio- language model with long-audio understanding and expert rea- soning abilities","venue":"cs.SD","work_id":"c3d168cb-8267-475f-bc18-b33bba54b60d","year":2025},"citing_paper":{"arxiv_id":"2606.30682","last_updated":"2026-06-27T03:56:57Z","snapshot_observed_at":"2026-08-15T09:15:18.170973Z","submitted_at":"2026-06-27T03:56:57Z","title":"ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-01T06:47:53.308909Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2606.30682"},"observation_digest":"sha256:ca4a237a568c3175eaa376ea034c897f1448c5f3dcde8d01076b7b4aaeec4806","observation_id":"c6db14df-ebe8-4c4c-8a2c-7ec07b92283f","resolution":{"observed_at":"2026-07-01T09:05:37.193075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2503.03983","doi":"10.48550/arxiv.2503.03983","metadata_source":"pith","pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio flamingo 2: An audio- language model with long-audio understanding and expert rea- soning abilities","venue":"cs.SD","work_id":"c3d168cb-8267-475f-bc18-b33bba54b60d","year":2025},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-13T19:24:37.674798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:c0c180918adfe8867b67656f08d14028a934aee5c57932674a471b6d5662e278","observation_id":"a17a7f5c-b979-4e1d-bbc6-f5190ad4fc7f","resolution":{"observed_at":"2026-07-08T00:04:22.631058Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2503.03983 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-13T19:24:37.674798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:aab221c5f82bfd741ead033fa91eb66360151a60226b0c0c7e07800663ba6cc2","observation_id":"87ae1241-5a59-47df-934c-0d21baebe401","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-07-14T12:48:58.688011Z","title":"arXiv preprint arXiv:2503.03983 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10299","last_updated":"2026-07-11T13:04:24Z","snapshot_observed_at":"2026-08-15T02:39:13.703530Z","submitted_at":"2026-07-11T13:04:24Z","title":"Empowering Long-form Omni-modal Understanding with Robust Audio Perception","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T12:48:58.688011Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2607.10299"},"observation_digest":"sha256:8188f90aea7b9d344bca2938f4e933fe793593550bc2be2784d123be04c2358a","observation_id":"ea274fe0-9202-4966-b8b5-ad83df298189","resolution":{"observed_at":"2026-07-14T12:48:58.688011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-01T07:12:17.567045Z","title":"arXiv preprint arXiv:2503.03983 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:17.567045Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:3c61a8876ae67f2ec8056d97e82e4e3e1fd2c2baadf2092a48ab492d5cb0ccc2","observation_id":"ada37a26-5187-4f53-b72a-338eaae07299","resolution":{"observed_at":"2026-08-01T07:12:17.567045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-01T00:26:25.777254Z","title":"Sakshi and Jaehyeon Kim and Wei Ping and Rafael Valle and Dinesh Manocha and Bryan Catanzaro , title =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:25.777254Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:db2d678f0a5c3bd9aae8a8223acdda481f85b2111605fb4b99bb49af5fd637e2","observation_id":"c6893a8c-bff4-45e4-9398-5ea127d52293","resolution":{"observed_at":"2026-08-01T00:26:25.777254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-15T15:03:19.576273Z","title":"Sakshi and Jaehyeon Kim and Wei Ping and Rafael Valle and Dinesh Manocha and Bryan Catanzaro , title =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-17T00:13:31.301332Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.576273Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:4bdd4608f3827889f482ede56e65a89fe20deab6b81a691a52780240d7d1c11b","observation_id":"ed269b75-4fc8-4ee2-8213-14e5013f8b44","resolution":{"observed_at":"2026-08-15T15:03:19.576273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-14T04:35:59.434263Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-16T23:00:27.831775Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.434263Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:e67405e6b0786237760759fb255db54e9e54ad2bf3f062cde72136528ed6f6b4","observation_id":"a6654286-5e25-4ae2-b20f-3e67995c7063","resolution":{"observed_at":"2026-08-14T04:35:59.434263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.03983/citation-record","integrity":"/paper/2503.03983/integrity","json":"/paper/2503.03983/citation-record.json","paper":"/paper/2503.03983"},"outbound":[],"paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 36 inbound Pith citation observations for arXiv:2503.03983."}