{"as_of":"2026-08-16T18:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5939729bcc50c2bc8ba9ee64a1a2447ee74127deb24aa335fb16308a6f853d8d","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:52:34.201226Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:52:33.994758Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T15:52:34.272945Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"cited_work":{"arxiv_id":"2509.15680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.15680","snapshot_observed_at":"2026-08-15T15:52:34.272945Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","venue":"cs.SD","work_id":"bf56a4f2-2fa4-4c3f-b8d7-603abaacf443","year":2025},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:33.994758Z"},"links":{"cited_paper":"/paper/2509.15680","citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:ddcad8545643d123e1d9a18483299dba571b9ad59a39b34cc3be3fc30666e7c7","observation_id":"b3049d6d-ce10-43d5-b88a-9c7a1b3ef7d6","resolution":{"observed_at":"2026-08-15T15:52:34.279765Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.15680/citation-record","integrity":"/paper/2509.15680/integrity","json":"/paper/2509.15680/citation-record.json","paper":"/paper/2509.15680"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:35.032275Z","title":"Prior works have improved their ability in various ways, including large-scale QA datasets, curriculum- learning strategy, and advanced connector architectures","venue":null,"work_id":"546c538b-5d2a-4ed6-ba83-07e493bebab8","year":null},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:33.989045Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:be4be57932348726bf14828862bee2f6ff66ba6d6dd7540e9325eadd8e2156d9","observation_id":"34b2f0ff-f804-449f-9442-ded1a9c622d6","resolution":{"observed_at":"2026-08-15T15:52:35.037335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"cited_work":{"arxiv_id":"2509.15680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.15680","snapshot_observed_at":"2026-08-15T15:52:34.272945Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","venue":"cs.SD","work_id":"bf56a4f2-2fa4-4c3f-b8d7-603abaacf443","year":2025},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:33.994758Z"},"links":{"cited_paper":"/paper/2509.15680","citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:ddcad8545643d123e1d9a18483299dba571b9ad59a39b34cc3be3fc30666e7c7","observation_id":"b3049d6d-ce10-43d5-b88a-9c7a1b3ef7d6","resolution":{"observed_at":"2026-08-15T15:52:34.279765Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:35.000785Z","title":"Write an audio caption describing the sound","venue":null,"work_id":"009c9466-25b7-4a25-8c2d-530b01ad0953","year":null},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.004897Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:950686f11684e4ea6a071fc2c7d8c108dac4b34c3293b72972df8a81da1d5b6e","observation_id":"de72343b-6cfe-45ed-b426-0e30fe751946","resolution":{"observed_at":"2026-08-15T15:52:35.005633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.984588Z","title":null,"venue":null,"work_id":"966ca50e-6596-4168-9f08-6741654d277b","year":null},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.010160Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:5eb9f2f252e033f69236286fe812e49e7eb4c8a0687191dfe28154de3c917b2f","observation_id":"7b02b90e-da14-4d97-bf44-1e642031264f","resolution":{"observed_at":"2026-08-15T15:52:34.989829Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.968802Z","title":"For future work, we plan to investigate the effects of advanced connector designs that enable token mixing and Mamba-Transformer hybrid architectures in audio language modeling","venue":null,"work_id":"82cba9fb-ab61-4244-a8a9-271819b4d956","year":null},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.015396Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:b17e7345b34ecdff20c8d0d0d445bd0323c476a589de1abfb555f03f8fc7ba37","observation_id":"8628da76-b2a8-4362-920d-df238e4449cf","resolution":{"observed_at":"2026-08-15T15:52:34.974028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.884527Z","title":"GAMA: A large audio-language model with advanced audio understanding and complex reasoning abilities,","venue":null,"work_id":"30d88c6e-02bb-4c03-aeac-6f294566ffc6","year":2024},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.043862Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:0632dda5ed744b49adb48176c71c00c489c675462430004f1b611398ff638462","observation_id":"214c0e4c-cc07-4ee5-86df-bcd5e41a61d5","resolution":{"observed_at":"2026-08-15T15:52:34.889187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.020228Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.020228Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:ba1deec454adc0b24f86e6b3fda95e3925ac27b5cd401874791996be2bbb9f26","observation_id":"22e71d62-c33c-4e4c-be3d-142a95fef6fb","resolution":{"observed_at":"2026-08-15T15:52:34.020228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.943436Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":"0a226615-15db-4fab-84bb-3513221a9ae2","year":2023},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.024935Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:a6434a792c9f5c13d25df0e29b484fb71af8dc72ea044502147870412b891f26","observation_id":"43f5121f-191c-48c1-8015-63f6d4246ff3","resolution":{"observed_at":"2026-08-15T15:52:34.948110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.928485Z","title":"Opt-iml: Scaling language model instruc- tion meta learning through the lens of generalization,","venue":null,"work_id":"70b0cc60-8e06-4690-bbd0-c545d9f3b36b","year":2023},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.029675Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:3675972c8eb400ace045cb04154f752f57f8cf333d1bb09cf33cd5b9e129e81b","observation_id":"88565375-3273-408a-b3ca-b01eda865464","resolution":{"observed_at":"2026-08-15T15:52:34.933254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.914181Z","title":"Qwen2.5 technical report,","venue":null,"work_id":"af9274cb-0438-4d9e-82ab-1a06e26f9c78","year":2025},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.034341Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:ba891f9762b8e8112bf96bc2c63e6e4a628311df955093742261f1c713b57890","observation_id":"bc775082-d7d0-436f-8a60-2235e484c08c","resolution":{"observed_at":"2026-08-15T15:52:34.918701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.899186Z","title":"Listen, think, and understand,","venue":null,"work_id":"fbd0c293-887f-4839-96ce-f2062002997e","year":2024},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.038873Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:b8ed774daf02e1b29b0ba2fb4654a4be0e4334c83e01bfab3d3ffaa2a1cd383e","observation_id":"bb6bbe74-1ceb-4a6d-9c84-7055db0044e3","resolution":{"observed_at":"2026-08-15T15:52:34.904023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.812870Z","title":"Transformers are ssms: generalized models and efficient algorithms through structured state space duality,","venue":null,"work_id":"7d66f452-d38c-4e33-8d3c-2f072f70c2cb","year":2024},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.071847Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:0f39e1548a653021977ae106fd480018f6b6da2831acc7d33c9aba780994fd61","observation_id":"91ea9b0d-32ed-4b60-9e5f-5ad7a01ad702","resolution":{"observed_at":"2026-08-15T15:52:34.817581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.870148Z","title":"SALMONN: Towards generic hearing abil- ities for large language models,","venue":null,"work_id":"2054af13-519a-4334-a6c6-6958de779c5f","year":2024},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.048518Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:735d7be98966e71db669cc83502d1437bc22a26da2d7fe2460058418878319e9","observation_id":"0dcacb6f-e8ef-430c-a614-aae77ac4ad9f","resolution":{"observed_at":"2026-08-15T15:52:34.875026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.856179Z","title":"Audio flamingo 2: An audio-language model with long-audio understanding and expert reasoning abil- ities,","venue":null,"work_id":"99dd2386-9c47-4515-a623-f768ff2009bd","year":2025},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.053073Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:be735f837e84464c9251746eafad46db4233c18697b52221ed77da2b189b2dd5","observation_id":"65b03824-6831-46fa-a8af-3630565e0ab0","resolution":{"observed_at":"2026-08-15T15:52:34.860745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.841392Z","title":"Qwen2-audio technical report,","venue":null,"work_id":"27740b1c-e76a-4d9b-843c-460e58cc3065","year":2024},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.057894Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:0611bd9c0c26d070b5f6dad3799eaaea5de041e57d14253a99f9cb7f9985500c","observation_id":"3ddb7568-6508-4a2e-9cf0-0c66f8bec392","resolution":{"observed_at":"2026-08-15T15:52:34.845860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.827036Z","title":"Mellow: a small audio language model for reasoning,","venue":null,"work_id":"477781e7-019b-4939-ad89-22ac7d913597","year":2025},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.062451Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:ba8ed943eb606e4bea7e88b060982bda25ba4459f203c93bd2742dc76a2222dc","observation_id":"fda0436f-6ef9-4067-8d70-4da53e5b895d","resolution":{"observed_at":"2026-08-15T15:52:34.831690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-15T15:52:34.067089Z","title":"Mamba: Linear-time sequence modeling with selective state spaces,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.067089Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:65f32d2ca5cef5df1fda95681d2e18dd13296d156ceb6f41988bfc98bb72983d","observation_id":"04448f11-cee8-45a9-bf26-48973402c580","resolution":{"observed_at":"2026-08-15T15:52:34.067089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.740036Z","title":"Eat: Self-supervised pre-training with efficient audio transformer,","venue":null,"work_id":"8b3d3973-81c9-4e0c-b771-4930116d58d7","year":2024},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.099940Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:94669d57302258f95d44e38eafd93805babff59e0ac3dd37f80d164114b7a65e","observation_id":"d0c41cb4-1a56-4d5f-99a8-7b92078e8638","resolution":{"observed_at":"2026-08-15T15:52:34.744663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.798255Z","title":"Ml-mamba: Efficient multi-modal large language model utilizing mamba-2,","venue":null,"work_id":"ea22a353-2c32-4fd4-bb05-c6ac6a51d769","year":2024},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.076562Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:81eb8b0a6d06b597669eec1bd42e207fdc4a5adf1f17d8e5cdfbd679d6af3a3b","observation_id":"a36fcd49-aaee-497e-b479-6321fa11a17d","resolution":{"observed_at":"2026-08-15T15:52:34.802931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.783914Z","title":"VL-Mamba: Exploring state space models for multimodal learning,","venue":null,"work_id":"89b37719-0fd6-46cb-8458-e296fbe16152","year":2024},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.081222Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:0864fff8496344891ec060ef5f84a2aa76ad998cb96bf034f89213c6c837af38","observation_id":"163366c4-b587-4510-9bbd-6f6f7330bd4f","resolution":{"observed_at":"2026-08-15T15:52:34.788480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.769442Z","title":"Shaking up VLMs: Comparing transformers and structured state space models for vision & language modeling,","venue":null,"work_id":"8747ffb4-0675-4962-914b-d2c61278b7c5","year":2024},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.086247Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:875c53b59c5579870745f4cfccce6b51be7b23890ab9d81e224bfd02c64e327f","observation_id":"8858a6af-f693-4b02-84f4-84432bfa7a39","resolution":{"observed_at":"2026-08-15T15:52:34.774150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15685","last_updated":"2024-11-24T02:21:28Z","snapshot_observed_at":"2026-08-15T15:30:05.123291Z","submitted_at":"2024-11-24T02:21:28Z","title":"State-Space Large Audio Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15685","snapshot_observed_at":"2026-08-15T15:52:34.090565Z","title":"State-space large audio language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.090565Z"},"links":{"cited_paper":"/paper/2411.15685","citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:307a5c206932cd16b4eabdd7cf1e33e7134c0a1c46d4403e2c9b873302b27066","observation_id":"ff6c3f51-30b5-4e3e-92a2-4974422e8aa9","resolution":{"observed_at":"2026-08-15T15:52:34.090565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.754562Z","title":"On the parameterization and initialization of diagonal state space models,","venue":null,"work_id":"cb603f55-48c8-4878-8a2f-148003cd75a6","year":2022},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.095165Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:9858ac45f8a8b6332ce45f3ac02528786b4b149238fa5ad5133978a92abcfea9","observation_id":"02901a8d-65a0-49d8-9265-41415d635809","resolution":{"observed_at":"2026-08-15T15:52:34.759670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.544556Z","title":"MambaPEFT: Exploring parameter-efficient fine-tuning for mamba,","venue":null,"work_id":"7b60a6ed-2b4e-4b78-b82d-9a5baa2beb8e","year":2025},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.126370Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:9cf7f496434c3cd139437c074f92081116cc651582499292ab90dfe6083030d9","observation_id":"93010108-d17c-4705-9626-6973486f9b4b","resolution":{"observed_at":"2026-08-15T15:52:34.549328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.725649Z","title":"Audio set: An ontology and human- labeled dataset for audio events,","venue":null,"work_id":"99ec4ff9-9f44-47e2-b9f3-a4072185ed87","year":2017},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.104304Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:92d448882500f08c2e424f184ec100342d60d85c36487e39cb8cfa52022d5a69","observation_id":"d5d54761-7f60-46bf-b2e5-ff8078f73426","resolution":{"observed_at":"2026-08-15T15:52:34.730225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.711580Z","title":"Slam-aac: Enhancing audio captioning with paraphrasing augmentation and clap-refine through llms,","venue":null,"work_id":"e226c5b8-be7f-41ed-9f73-c9ea1fe34763","year":2025},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.108730Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:5bdaff4b0adb5409ae6a89237f5ee6147746d29c539bee527a23c8dd730cbd76","observation_id":"2fbfffec-e55e-42ba-8277-13da51e20b4a","resolution":{"observed_at":"2026-08-15T15:52:34.716082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.697148Z","title":"Sjtu-thu automated audio captioning system for dcase 2024,","venue":null,"work_id":"1a3613bc-212b-4be7-8c6c-457e65e33796","year":2024},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.113012Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:96153819a5f2c0cfeb8600b8c18915fc2fe0caaee8f11c7e9c39933fa641f598","observation_id":"abed0099-02d4-45df-b59f-0beb49cf7f2e","resolution":{"observed_at":"2026-08-15T15:52:34.701876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.574543Z","title":"VMamba: Visual state space model,","venue":null,"work_id":"134a3b9c-0f90-48c0-b76e-f405c80fcaff","year":2024},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.117522Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:415a05ddcacb6b9bbb7e9689a80aa8e9f8c8eea1fc0939389730a0b39c527caf","observation_id":"cc571dd9-6b1b-462c-a41d-4064c99f3000","resolution":{"observed_at":"2026-08-15T15:52:34.680464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.559689Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":"a051176e-1cb2-4921-b4e3-565f1a35ca15","year":2022},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.122074Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:b5ae9a08ef253d7ea01acd62307542bedd68515ae4682a52fcd171c87f2c88c1","observation_id":"1259f0f5-98ae-4664-b064-f6ae607c0c7e","resolution":{"observed_at":"2026-08-15T15:52:34.564257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.451529Z","title":"Vggsound: A large-scale audio-visual dataset,","venue":null,"work_id":"ee2d4af9-3dea-477f-83b2-9401a3fe8d3c","year":2020},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.153187Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:455e99709a012caa814f846d609545de7f4fcf3c46b834dbdd976bb33cde6729","observation_id":"0e0e683d-b49e-4a34-8e5c-bb10425905cb","resolution":{"observed_at":"2026-08-15T15:52:34.456944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.528523Z","title":"Parameter-efficient fine-tuning of state space models,","venue":null,"work_id":"c4029f40-1c7d-4e08-89a1-c02fb90f5917","year":2025},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.130716Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:17a96d4748da3574a6cb548933cba24dda60005db29258b95586a33ecb8783da","observation_id":"6e6f22ed-17d5-410e-8e6a-c91a6d49a426","resolution":{"observed_at":"2026-08-15T15:52:34.533480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.513123Z","title":"Flashattention-2: Faster attention with better par- allelism and work partitioning,","venue":null,"work_id":"827c1db1-37a3-479d-b935-af9064d395bb","year":2024},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.135334Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:36f5d638d7336b20f3175c109f7593b6f2eeb4e99d8eade211742c7436aad4ba","observation_id":"8e872c0a-9c4b-4afc-8540-0169fd380c27","resolution":{"observed_at":"2026-08-15T15:52:34.517928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.498479Z","title":"Esc: Dataset for environmental sound classifi- cation,","venue":null,"work_id":"b3485065-7325-451b-acc5-bb81b4ae9e3e","year":2015},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.139673Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:3f5f68acf218c88fc6a5f1892931d810aca5d13359180eb539e3014dbb60c840","observation_id":"80d19e94-e767-423a-8766-4e1898acf06f","resolution":{"observed_at":"2026-08-15T15:52:34.503223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.483583Z","title":"Sound event detection of weakly labelled data with cnn-transformer and automatic threshold optimiza- tion,","venue":null,"work_id":"27b0e0a8-fc59-4a4e-a3b8-8bb78b89faf1","year":2020},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.144392Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:ee0ea9d94e1be13324055a96a636746a9d82695be7db9a1dc2461598362250ee","observation_id":"e4ef902a-f664-4973-bc1d-7daa16b6da8c","resolution":{"observed_at":"2026-08-15T15:52:34.488360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.468405Z","title":"V ocalsound: A dataset for improving human vocal sounds recognition,","venue":null,"work_id":"3f9fb76d-973a-4aa0-be2d-6218640850c2","year":2022},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.148882Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:7314d1d882a8506d52074f7d53fbe4c614a748cac75a77ce9ad991b2fbafa401","observation_id":"99d9ea46-2e78-4e77-b490-3b21099faf45","resolution":{"observed_at":"2026-08-15T15:52:34.473079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.339070Z","title":"BLIP-2: Bootstrapping language-image pre- training with frozen image encoders and large language models,","venue":null,"work_id":"3803990c-5311-4d2d-be16-94c37742f850","year":2023},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.186999Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:e28c2f4c0089479c1af77e19abb0bb319ac093d99d7dbdffacf13fab3b0ed705","observation_id":"7a25311d-7ed0-4260-9e9d-e578e2de058b","resolution":{"observed_at":"2026-08-15T15:52:34.344218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.434271Z","title":"Fsd50k: An open dataset of human-labeled sound events,","venue":null,"work_id":"64adc57f-e032-44ad-82c8-daef3daa8c3c","year":2021},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.158535Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:177435bdec1d04d651cdc7cc22cb8a8273b345ea21c0608a5c277b1e52be1aab","observation_id":"40f2e6fe-ba7c-45ec-a3cb-7a7580005cb0","resolution":{"observed_at":"2026-08-15T15:52:34.439364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.418440Z","title":"Spice: Semantic propositional image caption evaluation,","venue":null,"work_id":"f43e8c66-d765-47a6-95de-e25a7e22fb9b","year":2016},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.163297Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:05cc79f8e572bd69f986c5bc4a764a1f50e40b20189fdae2b6d8f609bd376781","observation_id":"c43b2cb6-0a08-4f2e-a77e-625e49374762","resolution":{"observed_at":"2026-08-15T15:52:34.423460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.402584Z","title":"AudioCaps: Generating captions for audios in the wild,","venue":null,"work_id":"04168f2a-0330-4b8f-af8c-eabe55eb117a","year":2019},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.168052Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:85541a577459020883f4c8d39285714433e0e81c0f2f6d1959c1055ab5c26557","observation_id":"aa8bff82-83da-4567-bc6e-24a1c925bb7e","resolution":{"observed_at":"2026-08-15T15:52:34.407637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.387863Z","title":"119–132, Association for Computational Lin- guistics","venue":null,"work_id":"d129aba5-5214-4d63-979a-9b159578831c","year":2019},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.172538Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:cc7a494157c8f53d20a9ab2906fe4c0b6546efd4781688cff53f43896f812821","observation_id":"23c78040-988b-40b4-8b03-40f0087be24b","resolution":{"observed_at":"2026-08-15T15:52:34.392567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.372365Z","title":"Clotho: an audio captioning dataset,","venue":null,"work_id":"957c8f15-d877-4ab2-ba6c-27769a21446d","year":2020},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.177321Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:ba8a8217bf4a978f45d8a3f31d5b05b8ac6596e575e28ea1eb66593de27a6f82","observation_id":"ee354d0e-76f3-4c99-b887-84c7aea21df2","resolution":{"observed_at":"2026-08-15T15:52:34.377042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.355280Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmen- tation,","venue":null,"work_id":"9da64f9d-77a6-465c-a725-c4f98109d7a8","year":2023},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.182300Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:62585a5153194ba88672f9867ba0bef30a24c653e663da3a568066a228f9b4e6","observation_id":"c9832d8c-d146-469c-b31c-148409d8f9b9","resolution":{"observed_at":"2026-08-15T15:52:34.360764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.322274Z","title":"The effective rank: A measure of effective dimensionality,","venue":null,"work_id":"3ffb0fc8-8e71-4a1e-9b39-c694e7e77cce","year":2007},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.191770Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:8b0d630011aa834aa977a3beeafee1a19838f5047b7d3f57afb89238418a9efb","observation_id":"747ec156-4349-417e-90e9-579895ed4511","resolution":{"observed_at":"2026-08-15T15:52:34.327747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.306364Z","title":"Open-world objectness modeling unifies novel object detection,","venue":null,"work_id":"336ec055-b58d-4498-9465-9a6ccb80ceb0","year":2025},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.196753Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:0b88a5e29344d51daf03e50a468f945e649e969324fd64b2a5dcaf4c59d80f8e","observation_id":"3a38bcb5-8392-4f2a-98ec-84b8ec3ee9a0","resolution":{"observed_at":"2026-08-15T15:52:34.311220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:34.290818Z","title":"Diff-erank: A novel rank-based metric for evaluating large language models,","venue":null,"work_id":"4231d6b3-f488-43ad-9afd-5e2e06f06fdf","year":2024},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:34.201226Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:d58d5c2f8a0c523925a6123a14544e533d2c8d01d0e9e30b689f3c8c7226ab48","observation_id":"364627d7-5739-4317-8afb-c9bd4fe1ce35","resolution":{"observed_at":"2026-08-15T15:52:34.295746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:35.016571Z","title":"Prior works on ALMs of- ten use mean pooling to reduce the length of audio tokens, mitigating the quadratic computational cost of self-attention","venue":null,"work_id":"e590fe6b-6cb0-4f91-a942-376b1fc1a39a","year":null},"citing_paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model","version":3},"reference_index":6144,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:33.999881Z"},"links":{"citing_paper":"/paper/2509.15680"},"observation_digest":"sha256:10fa003052e83126d0c8a916e0dfa6d2787207b8632ff940497dd0eca0ee8c4f","observation_id":"dfbd7c2b-c1d4-4278-b932-2faf3bd15624","resolution":{"observed_at":"2026-08-15T15:52:35.021809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.15680","last_updated":"2026-06-10T03:06:55Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-15T17:27:08.206343Z","submitted_at":"2025-09-19T06:54:42Z","title":"SAM: A Mamba-2 State-Space Audio-Language Model"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":41},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2509.15680."}