{"as_of":"2026-08-06T12:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f9d50aa0ccbeabbcce77a21f05208ff7967c1f1c45f980783bb338322e3ff249","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T19:03:07.832466Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:49:57.266999Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T08:34:36.824053Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2505.23747"},"observation_digest":"sha256:3f600879ad99e7b8c2ce68510f43207da3c3dcb49cb422d9b88483859dc81953","observation_id":"72593941-1480-4b2f-8cae-5df4ae47d81a","resolution":{"observed_at":"2026-05-16T08:34:36.856851Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T00:59:13.826054Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2505.23747"},"observation_digest":"sha256:126b2dc8ac2390fa8427107cc703a70d69010ba48fb8715ad0e486052f46a487","observation_id":"f4be1992-5bfe-4944-9db6-92afa7afd6d1","resolution":{"observed_at":"2026-05-22T01:00:51.428555Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2507.05920","last_updated":"2026-04-20T01:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T12:05:05Z","title":"High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T06:10:57.219445Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2507.05920"},"observation_digest":"sha256:e7f48bf41445c53f1a4f90a4732b1cd9910c8b241310f70a07976a7308d5fe92","observation_id":"891797d4-fed9-483a-87f6-fb8f24729b7f","resolution":{"observed_at":"2026-05-19T06:12:07.011738Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-05T19:03:07.832466Z","title":"Ola: Pushing the frontiers of omni-modal language model with progressive modality alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13692","last_updated":"2025-08-19T09:52:04Z","snapshot_observed_at":"2026-08-05T19:03:01.792773Z","submitted_at":"2025-08-19T09:52:04Z","title":"HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T19:03:07.832466Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2508.13692"},"observation_digest":"sha256:d78abeb53613e31c505356542dbe672b8751f33ca574b2b454cdc8dad965afda","observation_id":"96ea2f47-d8aa-495b-8e66-fb699670c22b","resolution":{"observed_at":"2026-08-05T19:03:07.832466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-05T14:42:21.059602Z","title":"Ola: Pushing the frontiers of omni-modal language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21113","last_updated":"2025-09-02T13:37:38Z","snapshot_observed_at":"2026-08-05T14:42:19.666014Z","submitted_at":"2025-08-28T17:48:19Z","title":"R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T14:42:21.059602Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2508.21113"},"observation_digest":"sha256:5a768a31fce909c1e755aeba91af527cc9b36960f1f2aa984ce238c1e1f23c51","observation_id":"93a144e0-8404-42a2-b380-4c3252808c8b","resolution":{"observed_at":"2026-08-05T14:42:21.059602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-03T17:16:40.028245Z","title":"Ola: Pushing the frontiers of omni-modal language model.arXiv:2502.04328, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10324","last_updated":"2026-06-22T06:41:41Z","snapshot_observed_at":"2026-08-03T17:16:35.340426Z","submitted_at":"2025-12-11T06:18:58Z","title":"EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T17:16:40.028245Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2512.10324"},"observation_digest":"sha256:0e8e982b68bf58c7cb8639ea9d2e897963d32ff6a69acc7c670287fcf72cdeb7","observation_id":"1b28e4ed-9481-4ad9-9b68-ffef3d04fb0f","resolution":{"observed_at":"2026-08-03T17:16:40.028245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-03T09:30:01.361938Z","title":"Ola: Pushing the frontiers of omni-modal language model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:01.361938Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:3d462b10edd6c094ceb6f3aa762c144c78e091d299350a5d0efb041e081fe7c5","observation_id":"52c170a9-6577-4502-9730-ac4b1ecd25c6","resolution":{"observed_at":"2026-08-03T09:30:01.361938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2604.14520","last_updated":"2026-04-16T01:21:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T01:21:14Z","title":"Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T12:05:54.551728Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2604.14520"},"observation_digest":"sha256:b5754722c73c3a2df43eea9827a535dd61f44393e358429ee180ca10d5734060","observation_id":"feb94f13-ae33-40bc-a428-480a624c18e5","resolution":{"observed_at":"2026-05-10T12:10:22.170122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2604.16617","last_updated":"2026-04-17T18:13:27Z","snapshot_observed_at":"2026-08-02T22:28:35.019925Z","submitted_at":"2026-04-17T18:13:27Z","title":"AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T08:02:53.574120Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2604.16617"},"observation_digest":"sha256:75e9649ba5536acfdfe819587357b96244c1dbecd3fbc93396b480520b52003d","observation_id":"2c6d5228-e79f-41a6-952e-3860e9100e21","resolution":{"observed_at":"2026-05-10T09:18:32.227284Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2604.18460","last_updated":"2026-04-20T16:16:36Z","snapshot_observed_at":"2026-07-06T23:05:17.639285Z","submitted_at":"2026-04-20T16:16:36Z","title":"Learning Invariant Modality Representation for Robust Multimodal Learning from a Causal Inference Perspective","version":1},"reference_index":281,"source":"arxiv_source","source_observed_at":"2026-05-10T04:32:29.428080Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2604.18460"},"observation_digest":"sha256:19fa2402927d3c94c9c719c9e77d826a508900bcad747efde0a5c24613ab5f4e","observation_id":"23330239-3260-46ab-bcb0-7c3a5a358b14","resolution":{"observed_at":"2026-05-11T11:51:03.196437Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2605.01278","last_updated":"2026-05-06T13:38:25Z","snapshot_observed_at":"2026-08-03T15:19:19.861810Z","submitted_at":"2026-05-02T06:25:48Z","title":"Valley3: Scaling Omni Foundation Models for E-commerce","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-09T14:53:55.160230Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2605.01278"},"observation_digest":"sha256:42aff28afeb757c54ab68db5d9694e3cd561924ec65e3b2cf3a5170bde9febcc","observation_id":"1f256362-ffdb-4a6b-bfac-9af589abdda7","resolution":{"observed_at":"2026-05-11T16:51:05.976588Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2605.07593","last_updated":"2026-05-08T11:06:43Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T11:06:43Z","title":"TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T01:53:01.939765Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2605.07593"},"observation_digest":"sha256:43d1b4f743e7e1b10b9a86c09cc076e24c295eacc2c2dfcd236fb08d576dc3d9","observation_id":"bea1c93c-b9e3-4145-bf8c-0242fa2c665f","resolution":{"observed_at":"2026-05-11T04:15:55.936975Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2605.13737","last_updated":"2026-05-13T16:14:44Z","snapshot_observed_at":"2026-08-02T19:04:36.897911Z","submitted_at":"2026-05-13T16:14:44Z","title":"Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T18:06:27.962891Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2605.13737"},"observation_digest":"sha256:ad907bd7546ab99fa0b67e98c7fe2c78edee425198ebe592d5e234c449fc81fe","observation_id":"576aaaa5-9692-4b5a-bcf5-e9d11540dc1b","resolution":{"observed_at":"2026-05-14T18:07:33.673297Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2605.18710","last_updated":"2026-05-18T17:44:29Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:44:29Z","title":"Mosaic: Towards Efficient Training of Multimodal Models with Spatial Resource Multiplexing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T07:53:11.761843Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2605.18710"},"observation_digest":"sha256:bdee137334b9443496c22bf8a29a4a65a66467e533e61d60fa594d1edcd5a14d","observation_id":"e310f04a-6116-4a6b-a3ad-cf50d7278c41","resolution":{"observed_at":"2026-05-20T07:53:24.776257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2605.22907","last_updated":"2026-05-21T18:00:22Z","snapshot_observed_at":"2026-08-02T16:30:28.109405Z","submitted_at":"2026-05-21T18:00:22Z","title":"VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T05:51:49.390597Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2605.22907"},"observation_digest":"sha256:bc660050b7ff59fabc8c879b1c7d16de7defef107230ed9fe7a02f0619f26799","observation_id":"e046fc4b-1d3e-439a-8325-8d14bb80a7b7","resolution":{"observed_at":"2026-05-25T05:55:24.901284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2605.27918","last_updated":"2026-05-27T03:44:27Z","snapshot_observed_at":"2026-08-06T09:29:05.594633Z","submitted_at":"2026-05-27T03:44:27Z","title":"Addressing Variable Heterogeneity in Distributed Multimodal Training with Entrain","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T10:20:12.860927Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2605.27918"},"observation_digest":"sha256:b96d89eb3fd6e2d4721274f8c0345c3adc2cb86a4db4e2b58bc7323e070254cd","observation_id":"3843e84b-bbca-4776-8646-153ed1d55dc8","resolution":{"observed_at":"2026-06-29T10:23:17.992169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:12d61356d055da197b46c7881bb2304b4e2f5a3d5a7502a69957cc26f11a6abf","observation_id":"1ed0ee24-4c98-4e50-97f0-f325d22baf69","resolution":{"observed_at":"2026-06-29T13:03:26.177260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:32b671eaa3600cca6c2fdc656873f97695c910b44e68d89c836f9d5bd579bc96","observation_id":"65eca983-78dc-43d8-af42-ee4c9ea5a895","resolution":{"observed_at":"2026-07-01T23:06:21.391014Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2606.10147","last_updated":"2026-06-08T20:26:09Z","snapshot_observed_at":"2026-08-03T03:43:21.595942Z","submitted_at":"2026-06-08T20:26:09Z","title":"From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T16:12:53.387567Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2606.10147"},"observation_digest":"sha256:73f0e689aaf9b23148fe9226cb4a1ddfbca02410cb5734af39443a224c458f9d","observation_id":"0a3d6fd9-e5aa-4f55-851a-05d55517200a","resolution":{"observed_at":"2026-07-03T01:57:32.365632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2606.12018","last_updated":"2026-06-10T12:44:02Z","snapshot_observed_at":"2026-08-03T20:21:32.396120Z","submitted_at":"2026-06-10T12:44:02Z","title":"MODF-SIR: A Multi-agent Omni-modal Distilled Framework for Social Intelligence Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T09:43:56.299302Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2606.12018"},"observation_digest":"sha256:ab22db789403e1a6420c221ee45e226c8340a7e2d280b615eb2aea841273eb99","observation_id":"ba0ac130-32b2-431e-a8a1-0f689da9c32a","resolution":{"observed_at":"2026-07-03T10:58:03.433035Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2606.20970","last_updated":"2026-06-18T22:17:18Z","snapshot_observed_at":"2026-08-01T20:10:55.070907Z","submitted_at":"2026-06-18T22:17:18Z","title":"CogniRoute: Learning to Route Social Evidence in Omni-Modal Models","version":1},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-06-26T17:37:11.371892Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2606.20970"},"observation_digest":"sha256:20b073b83930ad1944269c66b847f49fbd77ea0baad788195d0ecc34ed00677f","observation_id":"7c30ffa1-b114-4e1e-a1ce-e3adfb50705d","resolution":{"observed_at":"2026-07-04T03:49:30.386746Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2606.24286","last_updated":"2026-06-23T08:06:58Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:06:58Z","title":"AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T00:16:56.174638Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2606.24286"},"observation_digest":"sha256:2b598143770a7b42811b98c38efed29debb81ef769f5637a71bd8d7f6688762d","observation_id":"ae2729d0-56ea-4491-963f-4bd682948047","resolution":{"observed_at":"2026-07-04T16:49:57.269489Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2606.26968","last_updated":"2026-06-25T12:40:39Z","snapshot_observed_at":"2026-07-31T01:20:28.481331Z","submitted_at":"2026-06-25T12:40:39Z","title":"RedVox: Safety and Fairness Gaps in Speech Models Across Languages","version":1},"reference_index":128,"source":"arxiv_source","source_observed_at":"2026-06-26T04:37:00.399470Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2606.26968"},"observation_digest":"sha256:f945f7ecfbdd7037572711e3017a1cd902021d425c3df19b85e9dd1b40ceb73c","observation_id":"53305da3-9d94-4f90-9e0b-b2b6ea9cba5f","resolution":{"observed_at":"2026-07-04T13:59:52.872965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2502.04328 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:45cb6a4976972bdee6fd12b0032ebc7e40e1c969260dda720868148be7ff75ba","observation_id":"367c2df0-13f8-499a-b7d2-0f7a77a9917a","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-12T05:48:27.255331Z","title":"arXiv preprint arXiv:2502.04328 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02963","last_updated":"2026-07-03T05:13:19Z","snapshot_observed_at":"2026-07-30T02:56:56.587484Z","submitted_at":"2026-07-03T05:13:19Z","title":"Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T05:48:27.255331Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2607.02963"},"observation_digest":"sha256:8aa58169a0b640c44d862947d9eac2a7ff95591ffa415fc909c175994a3f5810","observation_id":"b27d6c40-0dd5-4988-85f7-3028d1c79fa7","resolution":{"observed_at":"2026-07-12T05:48:27.255331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-01T21:22:50.700260Z","title":"arXiv preprint arXiv:2502.04328 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-06T12:38:24.456240Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:50.700260Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:b7eae6b2bbd3f5d8b042797fb46407f64b91f20af981f950204da132f69d4494","observation_id":"66981f95-7734-4775-aed4-d246dfee7d91","resolution":{"observed_at":"2026-08-01T21:22:50.700260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04328/citation-record","integrity":"/paper/2502.04328/integrity","json":"/paper/2502.04328/citation-record.json","paper":"/paper/2502.04328"},"outbound":[],"paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2502.04328."}