{"as_of":"2026-08-08T19:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8bd83d97cfe85129a80964097c0f269f306e038a7b962c084d84352dd26fa1a2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:38:17.057432Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":18,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-18T02:29:46.242983Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2310.13289"},"observation_digest":"sha256:cb6be5fac76285acb4bc49c3ab2c265faf9c6e924423a148e63e9a59fe96a4d8","observation_id":"ae54b952-a671-44b9-a4dd-944c328f4b6e","resolution":{"observed_at":"2026-05-18T02:29:46.312500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-08T15:38:17.057432Z","title":"Listen, think, and understand,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06390","last_updated":"2025-02-11T04:42:24Z","snapshot_observed_at":"2026-08-08T15:33:58.231746Z","submitted_at":"2025-02-10T12:20:08Z","title":"When Data Manipulation Meets Attack Goals: An In-depth Survey of Attacks for VLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T15:38:17.057432Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2502.06390"},"observation_digest":"sha256:cd1336e200e2a5e86719386e0154bf8e7e7bea9488daf07a2cbc3b2503a6e9d9","observation_id":"cd77a381-8ad5-4801-b6df-7d80726574a8","resolution":{"observed_at":"2026-08-08T15:38:17.057432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T15:23:01.487032Z","title":"Listen, think, and understand // arXiv preprint arXiv:2305.10790","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.487032Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:ee520139493440a4e63f6859d02bcf8eead5b6f0ba15784ce984165a9b3f8484","observation_id":"1bcd468c-9691-4cef-ad2d-f78d419acf2b","resolution":{"observed_at":"2026-08-07T15:23:01.487032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T14:33:46.290154Z","title":"Listen, think, and understand,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18517","last_updated":"2025-05-24T05:28:22Z","snapshot_observed_at":"2026-08-08T15:41:54.286673Z","submitted_at":"2025-05-24T05:28:22Z","title":"LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:46.290154Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2505.18517"},"observation_digest":"sha256:93022f73ddd24384ff7fc8961108a2d4f3584f9ad691f98f7d3c8793493418a8","observation_id":"2dc77620-fe8f-4b0e-9d6d-95e4b0b6e9f9","resolution":{"observed_at":"2026-08-07T14:33:46.290154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T14:07:22.512637Z","title":"H., Karlinsky, L., and Glass, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-08T15:42:12.589463Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:22.512637Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:951b4247c4758cd31a4d4cd99cca1b9f1d7585325c38813f6cc1346df500a81c","observation_id":"4ee1ee6e-52f7-4975-adb3-778e897e1cef","resolution":{"observed_at":"2026-08-07T14:07:22.512637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T12:46:43.933695Z","title":"Listen, think, and understand","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23625","last_updated":"2025-05-29T16:31:45Z","snapshot_observed_at":"2026-08-07T12:39:19.252682Z","submitted_at":"2025-05-29T16:31:45Z","title":"ZeroSep: Separate Anything in Audio with Zero Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:43.933695Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2505.23625"},"observation_digest":"sha256:2b5569d7ee0608e89c311fd5310dca25347882f021f737a951745b80eea55a7d","observation_id":"9f77e224-6bc4-4f47-9b94-1564d3bedd32","resolution":{"observed_at":"2026-08-07T12:46:43.933695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T10:50:52.670777Z","title":"Listen, think, and understand.arXiv preprint arXiv:2305.10790, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.670777Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:48f8716fd09786216b554244f2bcffcd38af0ff29df6421a674cc525f6e79f5b","observation_id":"b19e6aaa-7840-46aa-9110-6e641672ca3c","resolution":{"observed_at":"2026-08-07T10:50:52.670777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T05:15:46.367352Z","title":"H., Karlinsky, L., and Glass, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08524","last_updated":"2025-06-11T05:18:01Z","snapshot_observed_at":"2026-08-07T05:05:48.868065Z","submitted_at":"2025-06-10T07:42:56Z","title":"Teaching Physical Awareness to LLMs through Sounds","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:15:46.367352Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2506.08524"},"observation_digest":"sha256:4ae66f15477b256cce609bc64675d0d65d712fae4119514125a3c7df62240538","observation_id":"552328a7-1953-4cf0-8c24-8804d68a40a1","resolution":{"observed_at":"2026-08-07T05:15:46.367352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T04:54:13.382210Z","title":"Lis- ten, think, and understand,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:13.382210Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:d306e879083db372f8ec6479144ccb57ca0b05e85462af051b572e38f538d776","observation_id":"ed050362-11eb-4766-9b85-376437709e6e","resolution":{"observed_at":"2026-08-07T04:54:13.382210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T00:15:33.044745Z","title":"Listen, think, and understand,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-07T03:22:54.643653Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:33.044745Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:b888a0c56610c66c2e52f3fa00fef3dfe6b050b72e0d3f677d768a419bf848a2","observation_id":"da6c1df5-b888-478a-a255-ece4e2b54297","resolution":{"observed_at":"2026-08-07T00:15:33.044745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-06T19:12:02.588908Z","title":"Listen, think, and understand","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06329","last_updated":"2025-07-08T18:33:26Z","snapshot_observed_at":"2026-08-07T13:56:04.875098Z","submitted_at":"2025-07-08T18:33:26Z","title":"MixAssist: An Audio-Language Dataset for Co-Creative AI Assistance in Music Mixing","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T19:12:02.588908Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2507.06329"},"observation_digest":"sha256:467bd59bed91a5b8785113b2ddf889fbefacd953e71ad39488c1a674ffc64347","observation_id":"4862910b-5f00-43ed-aa02-27eb8444c0a2","resolution":{"observed_at":"2026-08-06T19:12:02.588908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:24869f466ebfae9f9e52cfe46ca29fa7c33dcd5de81df356c2087e5b5c984292","observation_id":"74ecce0c-3ad2-4bb4-8d8d-44359d549937","resolution":{"observed_at":"2026-05-16T05:59:51.125480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T16:46:48.796047Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-08T02:19:42.525581Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:48.796047Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:16d4d341e80bc926bf528a2f484e03c7143ad116ba721840d5937d658c371fd0","observation_id":"003dd5a5-a870-433e-8397-f892f8ba0cb1","resolution":{"observed_at":"2026-08-05T16:46:48.796047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-04T17:54:57.049705Z","title":"Lis- ten, think, and understand,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.049705Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:137222ff58b0e3c424a791c0a20823b081eaeadfc736681169f1fc1ba84ba288","observation_id":"bac6bdd2-ca36-427f-a2f2-b3064ac08d97","resolution":{"observed_at":"2026-08-04T17:54:57.049705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-04T11:23:17.396777Z","title":"Listen, think, and understand,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:17.396777Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:57787cc330fd110c04ef706cd80a27a1cb36c7ea249db3118131ad0b56e79c40","observation_id":"589131f7-a8e1-4d51-9804-9259c77714ec","resolution":{"observed_at":"2026-08-04T11:23:17.396777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2604.12527","last_updated":"2026-07-03T08:49:19Z","snapshot_observed_at":"2026-07-12T21:18:44.451500Z","submitted_at":"2026-04-14T10:00:39Z","title":"Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T14:10:03.707886Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2604.12527"},"observation_digest":"sha256:77e6e3767ccc076e5a2791316d9e48d9339b313b93e74181ae98d46817db5297","observation_id":"0c8682ac-6584-4734-bcc3-398ed0e6e7e3","resolution":{"observed_at":"2026-05-10T14:10:28.361593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-07-12T21:18:46.566338Z","title":"Listen, think, and understand,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.12527","last_updated":"2026-07-03T08:49:19Z","snapshot_observed_at":"2026-07-12T21:18:44.451500Z","submitted_at":"2026-04-14T10:00:39Z","title":"Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T21:18:46.566338Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2604.12527"},"observation_digest":"sha256:66c509a655eaa5c0f008197d04af9b5ea07da2aebc00203abca8b551b3214c93","observation_id":"229861e9-348b-4d92-95c9-344776e2ebe3","resolution":{"observed_at":"2026-07-12T21:18:46.566338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2605.19101","last_updated":"2026-05-18T20:41:08Z","snapshot_observed_at":"2026-07-06T23:29:52.061489Z","submitted_at":"2026-05-18T20:41:08Z","title":"Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-20T07:13:29.041056Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2605.19101"},"observation_digest":"sha256:dbc5a79c3121da8c85d3bf8a3c4ac716f2773c7f2ae65f2fc48de0f72cb6c49f","observation_id":"879e6f45-04f2-405d-a31d-8cc5cf3ef6a5","resolution":{"observed_at":"2026-05-20T07:18:07.291974Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2605.20519","last_updated":"2026-05-21T17:49:53Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T21:39:52Z","title":"Codec-Robust Attacks on Audio LLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-21T06:43:52.735211Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2605.20519"},"observation_digest":"sha256:31e7313337ca7f31bde445c55770e8a6e245966aa33255b880f463592849069f","observation_id":"812223e5-8250-45f0-81da-584609534252","resolution":{"observed_at":"2026-05-21T06:44:00.649442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2605.20519","last_updated":"2026-05-21T17:49:53Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T21:39:52Z","title":"Codec-Robust Attacks on Audio LLMs","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-25T05:44:46.831360Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2605.20519"},"observation_digest":"sha256:68d3e96036d6c06f47524e7ecd96c77b6e885d23cc99ca36c60c521ee593ed62","observation_id":"680c47f9-08d4-44d4-b32f-47f012750bae","resolution":{"observed_at":"2026-05-25T05:45:23.640485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2606.10147","last_updated":"2026-06-08T20:26:09Z","snapshot_observed_at":"2026-08-03T03:43:21.595942Z","submitted_at":"2026-06-08T20:26:09Z","title":"From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T16:12:53.387567Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2606.10147"},"observation_digest":"sha256:ac2dc682e18b7cd55d17610d6de3406f82f96ee4ade4d940e89b7db72a8da412","observation_id":"f870973a-d165-4d40-a668-bba16ed9cd2c","resolution":{"observed_at":"2026-07-03T01:57:32.387037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-05T20:46:41.277498Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:ed4db3a7b8273d97e6acbc118953f35d3e8462d5a0ec57b1dedb905211306f98","observation_id":"66c1f981-7254-4d5d-899a-28b74ca0c293","resolution":{"observed_at":"2026-06-30T22:15:05.497306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2606.18273","last_updated":"2026-06-05T11:38:30Z","snapshot_observed_at":"2026-07-06T23:53:45.117607Z","submitted_at":"2026-06-05T11:38:30Z","title":"Continuous Audio Thinking for Large Audio Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T21:52:49.839901Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2606.18273"},"observation_digest":"sha256:2017168e327d144cc9380a84bc267ee730687eb109622c1cd92699e7d7deaeef","observation_id":"a30199de-f6a5-4b06-947d-5661731f3b2b","resolution":{"observed_at":"2026-07-02T17:47:17.990037Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2606.25391","last_updated":"2026-06-24T04:42:57Z","snapshot_observed_at":"2026-08-04T17:58:05.494359Z","submitted_at":"2026-06-24T04:42:57Z","title":"From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-25T20:36:24.901454Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2606.25391"},"observation_digest":"sha256:6b18f099ae26f5274f24d6d6138b8969cec7096360bebb984e2c75fab3f975bc","observation_id":"85c02625-1456-4d85-8dbf-f919989e25da","resolution":{"observed_at":"2026-07-04T20:10:07.985482Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2607.00247","last_updated":"2026-08-02T10:40:21Z","snapshot_observed_at":"2026-08-06T23:24:46.404599Z","submitted_at":"2026-06-30T22:55:22Z","title":"Adaptive Perturbation Selection for Contrastive Audio Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-02T16:59:50.615875Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2607.00247"},"observation_digest":"sha256:e4d35deac16c56c313844ad7ed68fb516b7fdd9e7de948fe223d969df20c66d6","observation_id":"ce9e0568-b53f-4f2a-9712-b936fe1e0f0c","resolution":{"observed_at":"2026-07-02T17:07:12.186524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-04T04:34:50.710186Z","title":"Listen, think, and understand,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00247","last_updated":"2026-08-02T10:40:21Z","snapshot_observed_at":"2026-08-06T23:24:46.404599Z","submitted_at":"2026-06-30T22:55:22Z","title":"Adaptive Perturbation Selection for Contrastive Audio Decoding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T04:34:50.710186Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2607.00247"},"observation_digest":"sha256:f1aa5d9fd121d4e5fb103925146b0ffe3c0486904c2a8dc1d6cad4e936b604e9","observation_id":"a95e9065-c56c-4d0a-ac26-03416fe65a3e","resolution":{"observed_at":"2026-08-04T04:34:50.710186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-08T14:15:13.834590Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:7d894e4b65cc153d049ba8f75ca23c7278281c10ae2b557a30bdea30c2328b2c","observation_id":"7250104c-9e57-4d1b-890a-bd66ef6cea78","resolution":{"observed_at":"2026-07-08T00:04:22.649038Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2305.10790 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-08T14:15:13.834590Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:1181b2213a91d531b43826801dce68c1eac3dc9613a1f9c0031f4a2115df5bf2","observation_id":"c1c12e22-8a62-4bc5-9aac-0135690ebf68","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-01T21:22:41.155465Z","title":"arXiv preprint arXiv:2305.10790 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-06T12:38:24.456240Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.155465Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:34e1dda832353eac746c6502482a9c0ecc61a33a0fa08cd1ca4f358444c2c4ec","observation_id":"e780d499-6b41-4c88-aca9-5acb343089f9","resolution":{"observed_at":"2026-08-01T21:22:41.155465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.10790/citation-record","integrity":"/paper/2305.10790/integrity","json":"/paper/2305.10790/citation-record.json","paper":"/paper/2305.10790"},"outbound":[],"paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","latest_version":3,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 29 inbound Pith citation observations for arXiv:2305.10790."}