{"as_of":"2026-08-08T22:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:19573caff7e7901dcb02b0269bf6aad22e2b5ea9fa4578af939ad30265cc5cf3","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T21:12:22.824098Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:09:41.262186Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.15704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-07-04T08:09:41.262186Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704","venue":null,"work_id":"14b6b6ca-3c9e-434a-8eb7-ebdcbf08efc6","year":2024},"citing_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T21:08:19.570050Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2501.01957"},"observation_digest":"sha256:88e3ba8f287fac058d827806e9b2d2a32c4783d34c8482690b20495d80d77edd","observation_id":"9086d914-ea15-4b8d-9bdf-78ee8ccc431c","resolution":{"observed_at":"2026-05-17T21:08:19.780200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.15704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-07-04T08:09:41.262186Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704","venue":null,"work_id":"14b6b6ca-3c9e-434a-8eb7-ebdcbf08efc6","year":2024},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:61b08bf3b5560f513a409d307a13c8124c10035c69092767b5ab3457b767cf5d","observation_id":"5bb29447-6df8-40f9-ac9b-062ec74a97f6","resolution":{"observed_at":"2026-05-11T01:19:59.769347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.15704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-07-04T08:09:41.262186Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704","venue":null,"work_id":"14b6b6ca-3c9e-434a-8eb7-ebdcbf08efc6","year":2024},"citing_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-17T05:53:26.066674Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2502.04326"},"observation_digest":"sha256:5afb4c0a1b68d8a59ce9fedf015c24fbcaf299d99f35a5c7e64f3a3854981044","observation_id":"ad3b723d-8515-4fca-9182-b78bbe47eea3","resolution":{"observed_at":"2026-05-17T05:53:26.429149Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-08T21:12:22.824098Z","title":"video-salmonn: Speech-enhanced audio-visual large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-08T21:07:00.179148Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.824098Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:0fb70e411f27fe291fb717581c4149841b0097713e1a4493c54754f3e7bd531f","observation_id":"0584da7b-ea17-4e07-a9b1-c028c05681c0","resolution":{"observed_at":"2026-08-08T21:12:22.824098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.15704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-07-04T08:09:41.262186Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704","venue":null,"work_id":"14b6b6ca-3c9e-434a-8eb7-ebdcbf08efc6","year":2024},"citing_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T15:04:22.690503Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2503.12937"},"observation_digest":"sha256:5a9ffdc238319b0d7f1d2c496e668889cf73c2d3a6711c33375d76b001de3475","observation_id":"e34c96dd-e627-42eb-a36b-329e70e30d8b","resolution":{"observed_at":"2026-05-16T15:04:22.884144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.15704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-07-04T08:09:41.262186Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704","venue":null,"work_id":"14b6b6ca-3c9e-434a-8eb7-ebdcbf08efc6","year":2024},"citing_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T17:54:03.225439Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2503.20215"},"observation_digest":"sha256:d8d4f2022e6cd37afb6abd8f595d8f6c1b5fd7264c130061367e4ff5143e3de7","observation_id":"622d2af9-d6df-4961-af0d-9b68a07042d5","resolution":{"observed_at":"2026-05-10T17:54:03.428921Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-07T14:06:49.812070Z","title":"video-salmonn: Speech-enhanced audio-visual large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:49.812070Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:8ca26465ccddbd87afd44e04f76916cfaea7058301a0b09e97c9d8f0aeda6ef5","observation_id":"abae598a-bd1a-4bf1-b652-9477b1db0b36","resolution":{"observed_at":"2026-08-07T14:06:49.812070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-07T10:27:05.563770Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.563770Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:f1f2729802903236e2a601f300435ee6d866215da0cbf35f7d660c8a85fbd7ab","observation_id":"3a2e00d1-6dff-4ecc-9867-4cf0fc9abd08","resolution":{"observed_at":"2026-08-07T10:27:05.563770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-07T05:49:53.321734Z","title":"video-salmonn: Speech-enhanced audio-visual large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.321734Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:ff2187359e00eed5900686c45cf9e4679cfbbc24345d7dd98074fd2ef9de1450","observation_id":"75b41b82-8f33-443b-a107-50688a16e005","resolution":{"observed_at":"2026-08-07T05:49:53.321734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-06T13:12:40.387502Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-06T13:12:37.106962Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:40.387502Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:653442875c64827831c89b997de52cae7add2fb03d11d4fbcf0ba9c5a6fcaf3e","observation_id":"121a0ef3-6a52-41a4-83b9-bcc9bd4d0e63","resolution":{"observed_at":"2026-08-06T13:12:40.387502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.15704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-07-04T08:09:41.262186Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704","venue":null,"work_id":"14b6b6ca-3c9e-434a-8eb7-ebdcbf08efc6","year":2024},"citing_paper":{"arxiv_id":"2510.15148","last_updated":"2026-04-04T21:55:10Z","snapshot_observed_at":"2026-07-06T22:32:51.756468Z","submitted_at":"2025-10-16T21:10:22Z","title":"XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T05:45:07.700571Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2510.15148"},"observation_digest":"sha256:6fcc731ad03ef24a8d02b780b27294cc66f19509b506eb2ec117cc3e636bbe18","observation_id":"ca268976-1cb6-4ddb-9811-eec61b099fe3","resolution":{"observed_at":"2026-05-18T05:45:56.083406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.15704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-07-04T08:09:41.262186Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704","venue":null,"work_id":"14b6b6ca-3c9e-434a-8eb7-ebdcbf08efc6","year":2024},"citing_paper":{"arxiv_id":"2511.14582","last_updated":"2026-04-20T05:56:36Z","snapshot_observed_at":"2026-07-31T08:04:43.452255Z","submitted_at":"2025-11-18T15:22:32Z","title":"OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-17T20:45:37.418493Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2511.14582"},"observation_digest":"sha256:991e869ab1a40673e885209735210fa9228b328eed8a9aa9a9f2e71408f55403","observation_id":"9e80efd4-13a0-4024-a623-69ec58345c4a","resolution":{"observed_at":"2026-05-17T20:50:15.076824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.15704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-07-04T08:09:41.262186Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704","venue":null,"work_id":"14b6b6ca-3c9e-434a-8eb7-ebdcbf08efc6","year":2024},"citing_paper":{"arxiv_id":"2512.02231","last_updated":"2026-04-10T02:23:14Z","snapshot_observed_at":"2026-07-06T22:37:31.360740Z","submitted_at":"2025-12-01T21:57:26Z","title":"See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-17T02:12:55.170296Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2512.02231"},"observation_digest":"sha256:49e979a0e53758d5dfbd8049258054ac2434d0a5574c3af552ba63a722a02f2d","observation_id":"ec66fa16-1fb0-4246-a5c9-9226ad4ccf26","resolution":{"observed_at":"2026-05-17T02:13:52.158743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-03T14:31:59.486559Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20117","last_updated":"2026-06-29T07:20:38Z","snapshot_observed_at":"2026-08-03T14:31:55.232086Z","submitted_at":"2025-12-23T07:21:21Z","title":"Delayed Bidirectional Alignment via Disentangled Audio Semantics for Audio-Visual Segmentation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T14:31:59.486559Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2512.20117"},"observation_digest":"sha256:72dd64c39eb3c6fc074426b6a481d134d5b2291ccbd17a5c72da762ffd9e3a6d","observation_id":"3e6f9156-1428-40c7-a443-58f5f2f11e38","resolution":{"observed_at":"2026-08-03T14:31:59.486559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.15704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-07-04T08:09:41.262186Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704","venue":null,"work_id":"14b6b6ca-3c9e-434a-8eb7-ebdcbf08efc6","year":2024},"citing_paper":{"arxiv_id":"2604.02605","last_updated":"2026-04-03T00:48:49Z","snapshot_observed_at":"2026-07-31T12:45:01.220506Z","submitted_at":"2026-04-03T00:48:49Z","title":"Do Audio-Visual Large Language Models Really See and Hear?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T20:56:19.815569Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2604.02605"},"observation_digest":"sha256:a0b93f5705ab4588796efc665a2eb40d2b1deb357797ac7bda0035f9e2173a98","observation_id":"0eab07e7-a0fc-4847-b52c-70ee7a568482","resolution":{"observed_at":"2026-05-13T20:58:15.814841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.15704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-07-04T08:09:41.262186Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704","venue":null,"work_id":"14b6b6ca-3c9e-434a-8eb7-ebdcbf08efc6","year":2024},"citing_paper":{"arxiv_id":"2604.11244","last_updated":"2026-04-15T07:55:01Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T09:50:36Z","title":"Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T15:07:45.595260Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2604.11244"},"observation_digest":"sha256:2924561e757da05a663a3827c349598dca16790981f5a5eaff48dbfb1cc2a501","observation_id":"117f93a6-94a4-43bb-840d-11d718dadabc","resolution":{"observed_at":"2026-05-11T11:11:03.707399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.15704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-07-04T08:09:41.262186Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704","venue":null,"work_id":"14b6b6ca-3c9e-434a-8eb7-ebdcbf08efc6","year":2024},"citing_paper":{"arxiv_id":"2605.01024","last_updated":"2026-05-01T18:35:49Z","snapshot_observed_at":"2026-07-06T23:14:20.123289Z","submitted_at":"2026-05-01T18:35:49Z","title":"EmoMM: Benchmarking and Steering MLLM for Multimodal Emotion Recognition under Conflict and Missingness","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-09T19:24:23.119301Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2605.01024"},"observation_digest":"sha256:b8078a3fb99ae8ef84a1cfd31b3a44743fe70c4363b4b77f2fbea63e4c73b380","observation_id":"fbf1a986-5b57-4442-a0e3-722dde0c147d","resolution":{"observed_at":"2026-05-11T15:42:00.943353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.15704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-07-04T08:09:41.262186Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704","venue":null,"work_id":"14b6b6ca-3c9e-434a-8eb7-ebdcbf08efc6","year":2024},"citing_paper":{"arxiv_id":"2605.12056","last_updated":"2026-05-12T12:42:44Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:42:44Z","title":"OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T04:52:03.076788Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2605.12056"},"observation_digest":"sha256:1a5442f6e58d2739d22bac6bfd94b81593fc70ba8ae29958320d75680f3c5d43","observation_id":"ba12e385-0a6d-4efe-8d44-e926dfc201b7","resolution":{"observed_at":"2026-05-13T04:52:16.308057Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.15704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-07-04T08:09:41.262186Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704","venue":null,"work_id":"14b6b6ca-3c9e-434a-8eb7-ebdcbf08efc6","year":2024},"citing_paper":{"arxiv_id":"2606.00508","last_updated":"2026-05-30T03:54:44Z","snapshot_observed_at":"2026-07-06T23:41:10.825760Z","submitted_at":"2026-05-30T03:54:44Z","title":"V-LynX: Token Interface Alignment for Video+X LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T19:00:18.702121Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2606.00508"},"observation_digest":"sha256:35d2ee052d623476e39ecba7a335320f8799c23ab0edade4633cbd5761a32371","observation_id":"32598e10-9203-4fcb-9211-f2c0e35caee2","resolution":{"observed_at":"2026-06-28T19:02:34.180082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.15704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-07-04T08:09:41.262186Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704","venue":null,"work_id":"14b6b6ca-3c9e-434a-8eb7-ebdcbf08efc6","year":2024},"citing_paper":{"arxiv_id":"2606.00579","last_updated":"2026-05-30T07:04:27Z","snapshot_observed_at":"2026-08-06T06:13:01.994998Z","submitted_at":"2026-05-30T07:04:27Z","title":"Sandboxed Coding Agents are Competitive Omni-modal Task Solvers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T18:59:51.362554Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2606.00579"},"observation_digest":"sha256:d58c2fbe0af28270e624a571a8d4a888e6de18d00e377ea025a99e5a482b6443","observation_id":"cbfa1188-5433-46fc-ad43-3954fedc130e","resolution":{"observed_at":"2026-06-28T19:02:34.203166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.15704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-07-04T08:09:41.262186Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704","venue":null,"work_id":"14b6b6ca-3c9e-434a-8eb7-ebdcbf08efc6","year":2024},"citing_paper":{"arxiv_id":"2606.21949","last_updated":"2026-06-20T08:37:32Z","snapshot_observed_at":"2026-08-06T09:36:36.931955Z","submitted_at":"2026-06-20T08:37:32Z","title":"CapRiCorn-1K: A Comprehensive Benchmark for Video Captioning and Subject Referential Consistency Across Temporal Scales","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T12:09:01.026544Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2606.21949"},"observation_digest":"sha256:3d231459b846973df578441d92b8a20e0e46e617d6f0559883651e1e77bdce81","observation_id":"cc3dad78-4e04-49cc-b6bf-f569a1205fa5","resolution":{"observed_at":"2026-07-04T08:09:41.263959Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-02T01:27:23.278012Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14681","last_updated":"2026-07-16T07:43:27Z","snapshot_observed_at":"2026-08-06T12:57:36.194341Z","submitted_at":"2026-07-16T07:43:27Z","title":"ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:23.278012Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2607.14681"},"observation_digest":"sha256:4c637e1c620da7f4ecb46472f8cb07923e78321a2ff52f95a930af3a2d70cd1a","observation_id":"4eb56518-0312-4c00-aa23-69c13833f974","resolution":{"observed_at":"2026-08-02T01:27:23.278012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-01T21:22:41.603969Z","title":"arXiv preprint arXiv:2406.15704 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-06T12:38:24.456240Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.603969Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:77d9bd1c13ace74c3dd9bc18efe72c15a2e4e11cd55531ee82af5c07b620ca14","observation_id":"81ebca45-58da-47b9-9c4a-b1bb9cbe8de0","resolution":{"observed_at":"2026-08-01T21:22:41.603969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-01T03:25:31.574785Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-07T05:36:43.359157Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T03:25:31.574785Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:f57b20d438506b9ae89df2827c87160e9f7409e16ad27619aad0d22530567a90","observation_id":"9ef2309b-b41d-4c52-8a47-59b364c4fd80","resolution":{"observed_at":"2026-08-01T03:25:31.574785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-04T04:02:54.482439Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-07T05:36:43.359157Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.482439Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:804bf36a648bbda1b466703754b8cc76651f6011878d5a14f2786c13cab96022","observation_id":"9942ec5b-7557-407f-b7d9-2993050d133e","resolution":{"observed_at":"2026-08-04T04:02:54.482439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.15704/citation-record","integrity":"/paper/2406.15704/integrity","json":"/paper/2406.15704/citation-record.json","paper":"/paper/2406.15704"},"outbound":[],"paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2406.15704."}