{"as_of":"2026-08-22T08:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:41b15619fddedd04303214e7e04669d2a7fbd7d33120a107700d2a57ec4dfd8e","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T18:18:41.816342Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T18:18:41.816342Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T23:17:29.793601Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"cited_work":{"arxiv_id":"2606.08425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.08425","snapshot_observed_at":"2026-07-02T23:17:29.793601Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","venue":"cs.SD","work_id":"ab236878-4bff-44e9-867b-0468e949d902","year":2026},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"cited_paper":"/paper/2606.08425","citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:ac29284088bf53b56436044026e6ea310a3a5685fc2f3166623016b98b72936a","observation_id":"cb5c2fb2-1cfb-4f60-bbd5-dde65a0a55ed","resolution":{"observed_at":"2026-07-02T23:17:29.794806Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.08425/citation-record","integrity":"/paper/2606.08425/integrity","json":"/paper/2606.08425/citation-record.json","paper":"/paper/2606.08425"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:00182c51db87806c9c8f281de92623cfc551f71f1dd94783707e74d7169bec3b","observation_id":"8de9056b-cc86-4425-8d84-6edc35107c02","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":"Despite this, audio remains chal- lenging due to high temporal density and overlapping signals","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:1967d209532849a951ffbca9dc81128de8c362e3330e0490eeb1c8e77356cde7","observation_id":"87086648-7cca-41be-8ef1-db7e8f846ed1","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"cited_work":{"arxiv_id":"2606.08425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.08425","snapshot_observed_at":"2026-07-02T23:17:29.793601Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","venue":"cs.SD","work_id":"ab236878-4bff-44e9-867b-0468e949d902","year":2026},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"cited_paper":"/paper/2606.08425","citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:ac29284088bf53b56436044026e6ea310a3a5685fc2f3166623016b98b72936a","observation_id":"cb5c2fb2-1cfb-4f60-bbd5-dde65a0a55ed","resolution":{"observed_at":"2026-07-02T23:17:29.794806Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:900e89a7c8fad301702df0a87aaa166ccfb4b27846ceb07e8295b58915cc8cd0","observation_id":"e98fd795-88fe-4e75-9690-0b7e9259655b","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:f650cb13f6ed7c7216cd76d848b8a6755c6b78fa9c4ed05683b7f24f9a29fd9c","observation_id":"f18adbf5-25f8-40fa-a5f7-13632710850d","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":"Features are expanded, convolved, and projected back: Xconv = Lin2(σ(DConv17(σ(Lin1(X)))))(6) Zconv = LayerNorm(X+ Dropout(X conv))(7)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:68e57ab49e26d1c9139603e17704d3a792ad93b4d6358f5259a850d8dca53e3e","observation_id":"24d7349e-9894-4406-949e-cee72e5ac3ea","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:e12e87c24ee56a7fd3e1abe4f9f86f177126a324f837a0a7c80c15b8e0fd7120","observation_id":"9613ba3d-b698-41f5-94d8-317cf0c32a57","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:b27ff57f2a66931d67025f1ee14ea57158538dfd0de369d9b8f0ad0227267638","observation_id":"bdc596be-df45-4216-af32-c6b2d368bb5d","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":"Dataset Training Data.We utilize all publicly available subsets of the CoTA dataset [11] hosted on Hugging Face, totaling558,423 instruction-tuning samples","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:e7130a88d8c742d0f81a33e0345845db447341616f208d03b88a3dad63e75dbc","observation_id":"115aa275-553f-4599-9f93-889365534d99","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6754.1741","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T23:17:29.804214Z","title":null,"venue":null,"work_id":"38c330b1-962b-4afa-b3d2-89953c646d70","year":null},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:6d4e574071144f04bade2f39a6a52c2a901253be4933534f4c210f77974d258b","observation_id":"135bdaac-3179-4dec-a02a-f79aad756382","resolution":{"observed_at":"2026-07-02T23:17:29.805736Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2238.8933","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T23:17:29.801018Z","title":null,"venue":null,"work_id":"9f40f049-cecc-40f1-9cb9-0e8f041fe7ac","year":null},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:d9dc416e530b1545ac15edf92a94f67040012c29cbc995b088106fe9926867e1","observation_id":"eb493daf-547d-438b-a03a-d344468e637e","resolution":{"observed_at":"2026-07-02T23:17:29.802885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1823.5341","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T23:17:29.807179Z","title":"Perception 31.54 39.6044.3043.62 +12.08Speaker Analysis 39.58 41.67 41.6745.83 +6.25","venue":null,"work_id":"564a692d-fdd7-4bd7-b7e9-fe9f2beffcd1","year":null},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:7d13dfccda53a46b73e94d8a417aac98c199e970d8ba8bf714deeead207013bc","observation_id":"3e8a8e74-6c68-4f47-af53-8a1f16f91baf","resolution":{"observed_at":"2026-07-02T23:17:29.808540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:f005a4bc528e5d1647e668771d54ac10980d6525b2f0f6f79859020e0a9f83cb","observation_id":"190b6fe1-d79f-4b2b-ace8-fa149f625022","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":"This suggests IQ primes the attention layers, enabling CLAP’s semantic an- chor for precise deduction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:3f41fb8ed1363f594d3ab3580cc994b8e7ebb6f02e4e97ffc2212312ebce66f6","observation_id":"f6711afc-f5dc-4288-8553-142c3a005305","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:7ba86edb578c5717f4ec8fece84f37f245ff7a277e98f715072ca1806662b105","observation_id":"b4f64e72-d52d-4439-b367-4d7e2f43ec0c","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":"All scientific content, experi- mental design, and results were produced by the author","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:a542322dc1b85750586cd7ace683d9d94d519cf90d46b2612e7f6ec124d5f0f8","observation_id":"629c04d9-fc2c-4d16-bb78-6e9b549dc6b5","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.14224","doi":"10.48550/arxiv.2602.14224","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The interspeech 2026 audio reasoning chal- lenge: Evaluating reasoning process quality for audio reasoning models and agents","venue":"Open MIND","work_id":"235d1022-58e5-4528-8ba4-9e2e87a97242","year":2026},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:7663e5dd8dd4a087bd622d6e2b48f3122d5d1d18c28e925c4a27ff1e6f615f91","observation_id":"3fdaa42c-4302-414d-8f38-de26c1e0ec34","resolution":{"observed_at":"2026-07-02T23:17:29.825264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13032","last_updated":"2025-05-19T12:18:42Z","snapshot_observed_at":"2026-08-20T13:35:17.416522Z","submitted_at":"2025-05-19T12:18:42Z","title":"MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix","version":1},"cited_work":{"arxiv_id":"2505.13032","doi":"10.48550/arxiv.2505.13032","metadata_source":"pith","pith_arxiv_id":"2505.13032","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mmar: A challenging benchmark for deep reasoning in speech, audio, music, and their mix","venue":"cs.SD","work_id":"fe97a573-dedf-4e07-af07-b22508260a10","year":2025},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"cited_paper":"/paper/2505.13032","citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:a21cff0c34ea76eb4956b6b6d1b224919574318fd49656bd14ca0ad8fa0e1b69","observation_id":"999708c9-b3b1-45c6-9cc8-a69c06fd7859","resolution":{"observed_at":"2026-07-02T23:17:29.792398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:94093f9cefd5a64f5b2f600b4b766cc7f3cdf503f1b8194e2fe31b716e6cf85b","observation_id":"fce461ad-46db-415f-ad29-e100036b812e","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-21T12:15:18.108504Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":"2310.13289","doi":"10.1016/j.ajhg.2009.06.010","metadata_source":"pith","pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","venue":"cs.SD","work_id":"b06d6def-ea7a-4cbd-8bb3-73f6a81db238","year":2023},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:64ad22eb58fa27befe5cba5beb84aaf0b5a01c133ed5ae98a6bc57c86bcb905c","observation_id":"4ecfa943-d059-4ae0-a892-6771ac5ec1d6","resolution":{"observed_at":"2026-07-02T23:17:29.799788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:0595bf51943010290fb69d5f418bbe03b8ab6de57f6342c7381ab67f53909035","observation_id":"067fdf0a-b453-4f96-a717-1e9ffdb5a907","resolution":{"observed_at":"2026-07-02T23:17:29.789452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:eeba3f3c60916ebe69ee3c6b7b73ed95b146f7d0f5d189b89c42152eda94a917","observation_id":"abb99b8d-7a9c-4053-b2d4-b1a084a9e238","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:812bc5400dbcf1503feb609cad52b881f234be4260acdf2043c4bdc9237bc47a","observation_id":"387ad760-700d-4116-8db3-e4f35661f257","resolution":{"observed_at":"2026-07-02T23:17:29.787134Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":"E-branchformer: Branchformer with enhanced merging for speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:fa7aa833a008a95f68cef71536d6d30ef66e5e495891a1f00184204e18590792","observation_id":"e48cf8d3-602b-48f2-b255-01eef0655aa6","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:af1303b7741557d04e6c6a0a886d914467fe72aa99edc753e9a0323a0a670d92","observation_id":"e5d0cc35-3f15-4763-a460-a9523655e5dc","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":"Hts-at: A hierarchical token-semantic audio transformer for sound classification and detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:1f7577493a6ea20949aa2ae35c0f2b22fc15eb94583da69ed12ab18545561781","observation_id":"b5b3729a-1b06-47d0-8d7e-370600d52c5b","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":"Clap learning audio concepts from natural language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:4e38b203b85440cfa81b6566b6c33cdb71fdd57790076bac70a1e61aeff0e57a","observation_id":"10e2ec8d-fce5-4c04-b3ec-ab3a0abf4678","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":"Audio- reasoner: Improving reasoning capability in large audio language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:31e5044be09d1360d3c910d853db4117e2c6204970ec5a8a7f46249180f4a0dc","observation_id":"0167e603-27a1-4ff6-a5a4-e5f578c4e38c","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":"AudioCaps: Generating captions for audios in the wild,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:4bc362b136424d9f98dc5c977e02f330e30e9143f707cf12f0ff739b3b736249","observation_id":"6f8f8f6f-73e6-40bc-ae99-7a5d0dfe94aa","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":"Clotho: an audio cap- tioning dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:6f1b6ca8cfcf5f2a5e5929212e8813d3791f2b93a0c1ba00dee88e5f0498c36e","observation_id":"e03e1551-abe7-4699-a3dc-58d793461027","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":"MELD: A multimodal multi-party dataset for emotion recognition in conversations,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:657daed1cbd91a5dbaa7b756b8afdbefcf148874a1e7ae7dd349441708dd4d04","observation_id":"eb0466b5-171c-4ca2-8ca3-257bc823e2f9","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.10310","last_updated":"2020-10-24T06:07:01Z","snapshot_observed_at":"2026-08-21T16:19:27.620004Z","submitted_at":"2020-07-20T17:53:35Z","title":"CoVoST 2 and Massively Multilingual Speech-to-Text Translation","version":3},"cited_work":{"arxiv_id":"2007.10310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.10310","snapshot_observed_at":"2026-07-04T20:30:07.211214Z","title":"Covost 2 and massively multilingual speech-to-text translation","venue":null,"work_id":"6c9bffaf-0bd1-4fa9-ac70-56e01e042f08","year":2007},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"cited_paper":"/paper/2007.10310","citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:072f8acbcb170418efb74d7e7e76181b74e9dc3f90eb8f51156e873af2accb1d","observation_id":"e60d5b5f-106d-43d5-94bc-6acc1a0ba74d","resolution":{"observed_at":"2026-07-02T23:17:29.797505Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":"Mustango: Toward controllable text-to-music generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:60edf3e75430b8fb1ad85b8b7184c20487a4c11e3c4752715c9e9f8575a18f71","observation_id":"35e3c1d8-4b85-44d3-ae3a-1e10a23ff534","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-20T02:46:37.707168Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2503.03983","doi":"10.48550/arxiv.2503.03983","metadata_source":"pith","pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio flamingo 2: An audio- language model with long-audio understanding and expert rea- soning abilities","venue":"cs.SD","work_id":"c3d168cb-8267-475f-bc18-b33bba54b60d","year":2025},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:93577d7686c8088486b1fa6546875a270fc2bdff9b4fe9a71c99fee44b9959bc","observation_id":"d46a9922-240c-492b-a61c-4259fec8c112","resolution":{"observed_at":"2026-07-02T23:17:29.827782Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":"Joint audio and speech understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:cf8f37fe37003262cad60d93f8a2961ab0844c5d25f4bd35c09518b82436b554","observation_id":"5f52fa5a-5fc0-460d-b1a4-0594fa08280e","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-21T16:14:12.045334Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2406.11768","doi":"10.48550/arxiv.2406.11768","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GAMA: A large audio- language model with advanced audio understanding and complex rea- soning abilities","venue":"arXiv (Cornell University)","work_id":"f407a4af-a90d-4687-b15e-70573cc84a5d","year":2024},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:4b6b3c4c34b7481f4429199bc2c7accb848ca71960a9eab89b2e9db5da8cb436","observation_id":"b41efbd5-ea20-4409-a767-f73043369a62","resolution":{"observed_at":"2026-07-02T23:17:29.830453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":"Gpt-4o: The cutting-edge advance- ment in multimodal llm,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:e2d4660e4346cb729f9b450d30d9f5003735284e545c2e9008b4a58a4976e85a","observation_id":"d33a810a-b313-4670-8f9b-627a79ebef54","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07246","last_updated":"2025-01-13T11:54:40Z","snapshot_observed_at":"2026-08-16T18:04:08.829886Z","submitted_at":"2025-01-13T11:54:40Z","title":"Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model","version":1},"cited_work":{"arxiv_id":"2501.07246","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07246","snapshot_observed_at":"2026-07-03T07:57:44.602800Z","title":"Audio-cot: Exploring chain-of-thought reasoning in large audio language model","venue":null,"work_id":"a29ac5b5-b39a-4024-b423-9a8a9f536e29","year":2025},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"cited_paper":"/paper/2501.07246","citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:6c847dd607babf7beef77d5f940f19850b615c6dd8bde3fa29df36aa966fac76","observation_id":"3d9f9e8d-5f9e-4426-a25f-0c2a226b3bf4","resolution":{"observed_at":"2026-07-02T23:17:29.817376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:18:41.816342Z","title":"Baichuan-omni-1.5 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:f4f8bff2133a2c474ae8dcb4b708734e53dad9cab047de2352d09f30efc8cb0a","observation_id":"cb5360bb-e194-439b-86ef-6f878f12977f","resolution":{"observed_at":"2026-06-27T18:18:41.816342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:1fb7bd5d4577a9c6dddbbada152d48ef543a4ffb21bff65a898793fd07b35b85","observation_id":"c3a861db-0710-4e74-8976-d67f537ba344","resolution":{"observed_at":"2026-07-02T23:17:29.822537Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:6a44e3718a79302eae17b67efd62b45929692429b6a7d9da697d5f8dc27c9bc6","observation_id":"f299105b-c22c-4a07-9fbf-c9d3999c5d7d","resolution":{"observed_at":"2026-07-02T23:17:29.820017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:13.453678+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:13.453678+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:dff01a9388c0d127c04166e66483c6f98be5e708645a55fcb59c5f14e4c41ab0","observation_id":"bfa75435-aa53-4136-bc11-be89dfeb0f28","resolution":{"observed_at":"2026-07-02T23:17:29.811163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:d96d654f59686004d766e6a9a04469ebdabf25dc1b10100b37ad0b1e8788f20b","observation_id":"2a826166-0b37-4fbf-9328-ad0975aeb000","resolution":{"observed_at":"2026-07-02T23:17:29.814456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:12.229447+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:12.229447+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":26,"verified_exact":14,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2606.08425."}