{"as_of":"2026-08-07T18:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:392ea85eedc2c5140b52255cfe4b8e1af681150941c493c09e958cc7d10577d3","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T09:30:05.747416Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T01:53:01.939765Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T09:46:26.384867Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2601.13836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.13836","snapshot_observed_at":"2026-06-19T17:10:48.660379Z","title":"Futureomni: Eval- uating future forecasting from omni-modal context for multimodal llms","venue":null,"work_id":"e5fb16ea-06a7-4791-a09f-21348ceebac9","year":2026},"citing_paper":{"arxiv_id":"2604.27393","last_updated":"2026-04-30T04:05:43Z","snapshot_observed_at":"2026-07-06T23:12:52.141592Z","submitted_at":"2026-04-30T04:05:43Z","title":"MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-07T09:26:00.413651Z"},"links":{"cited_paper":"/paper/2601.13836","citing_paper":"/paper/2604.27393"},"observation_digest":"sha256:3f009cb348506992a4e0abe7a844c2e4f61d23bef8d90e0e2344fabc3f424cbc","observation_id":"075050cf-aab1-451b-8dc5-3b65d322515b","resolution":{"observed_at":"2026-06-19T17:10:48.660379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2601.13836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.13836","snapshot_observed_at":"2026-06-19T17:10:48.660379Z","title":"Futureomni: Eval- uating future forecasting from omni-modal context for multimodal llms","venue":null,"work_id":"e5fb16ea-06a7-4791-a09f-21348ceebac9","year":2026},"citing_paper":{"arxiv_id":"2605.07593","last_updated":"2026-05-08T11:06:43Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T11:06:43Z","title":"TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T01:53:01.939765Z"},"links":{"cited_paper":"/paper/2601.13836","citing_paper":"/paper/2605.07593"},"observation_digest":"sha256:1d98a0999654353321e9822141a485ff29cfd4b17054d046edd17c88cce369d6","observation_id":"9828d907-7b75-4569-a70c-691be18ed1f5","resolution":{"observed_at":"2026-06-19T17:10:48.660379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2601.13836/citation-record","integrity":"/paper/2601.13836/integrity","json":"/paper/2601.13836/citation-record.json","paper":"/paper/2601.13836"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:29:58.247681Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T09:29:58.247681Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:dd4821e4ea9ebb1f39f2fc9986777c50641a5d0c48c469755434624fcfe04db6","observation_id":"5342e9b2-2050-4423-834a-b4495beb432b","resolution":{"observed_at":"2026-08-03T09:29:58.247681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:29:58.342803Z","title":"Claude haiku 4.5.https://www.anthropic.com/news/claude-haiku-4-5, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T09:29:58.342803Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:78e0d975eae2f94d609b2119b617ac504da59ce1f416abc40f631e37b510250e","observation_id":"117b96c1-1289-4c89-8fa5-b8541330e63b","resolution":{"observed_at":"2026-08-03T09:29:58.342803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T09:29:58.420522Z","title":"Qwen3-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T09:29:58.420522Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:ae47484964712715b0f934ca9669ac6af456078fb762c7078ae8d3ea9a333f19","observation_id":"b9b5dc81-54ec-4d9e-8b4a-050b10c77247","resolution":{"observed_at":"2026-08-03T09:29:58.420522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T09:29:58.557515Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T09:29:58.557515Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:d08dec3909370112c43c9d8ecf906530ed91a0c92d79a5a66a47ee1e06755dd7","observation_id":"f93242b4-56c5-4950-9ebf-df4fbbcb86f4","resolution":{"observed_at":"2026-08-03T09:29:58.557515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.12772","last_updated":"2026-05-14T12:25:09Z","snapshot_observed_at":"2026-08-06T09:56:14.530160Z","submitted_at":"2025-12-14T17:23:21Z","title":"JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.12772","snapshot_observed_at":"2026-08-03T09:29:58.700322Z","title":"Jointavbench: A benchmark for joint audio-visual reasoning evaluation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T09:29:58.700322Z"},"links":{"cited_paper":"/paper/2512.12772","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:c549c26897f5e394f4f02d57cf2dc11b116a12c1ef48662d060daf92b34ce170","observation_id":"74decc1f-576f-4c53-bbbb-0510b7fcf13f","resolution":{"observed_at":"2026-08-03T09:29:58.700322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:29:58.751135Z","title":"Avocado: An audiovisual video captioner driven by temporal orchestration, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T09:29:58.751135Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:a79d6b63d64a1bd37d226dc3b8ffd9d5eb87a975675175baa3d85bbb2c6ac3bd","observation_id":"291f06fe-e5cc-4f5a-a1a3-08be9955d49e","resolution":{"observed_at":"2026-08-03T09:29:58.751135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-03T09:29:58.868545Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T09:29:58.868545Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:bd701cddefdf3485076f4c888b72704600756604a7d07bafeab8ac3c54e0e3a5","observation_id":"bdd9e760-8893-4b3a-9ab1-63ee9fc832ea","resolution":{"observed_at":"2026-08-03T09:29:58.868545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02135","last_updated":"2025-01-03T23:03:24Z","snapshot_observed_at":"2026-07-06T20:16:27.318761Z","submitted_at":"2025-01-03T23:03:24Z","title":"AVTrustBench: Assessing and Enhancing Reliability and Robustness in Audio-Visual LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02135","snapshot_observed_at":"2026-08-03T09:29:58.979284Z","title":"Avtrustbench: Assessing and enhancing reliability and robustness in audio-visual llms.arXiv preprint arXiv:2501.02135, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T09:29:58.979284Z"},"links":{"cited_paper":"/paper/2501.02135","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:e24e4f99190b007afa6d20a8ec75f806a5e16899c8203c11133b859c41ceeaa3","observation_id":"f94943c4-2e0a-4714-975b-c1967b14ffec","resolution":{"observed_at":"2026-08-03T09:29:58.979284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-03T09:29:59.113453Z","title":"Qwen2-audio technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T09:29:59.113453Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:363995a7141d195f7a16259476292b770dcf1da00239c84fea1ffd8ecc3f616f","observation_id":"6b74ba86-77ec-4db6-8b20-4449c4c74f80","resolution":{"observed_at":"2026-08-03T09:29:59.113453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-03T09:29:59.193365Z","title":"Deepseek-v3.2: Pushing the frontier of open large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T09:29:59.193365Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:773cffe093c24039f21335cf8a053b72eaa5a81d1e3e1e84f2925634fcc7293b","observation_id":"e4c8fac1-5cb4-430e-a2a6-bb14c36720b0","resolution":{"observed_at":"2026-08-03T09:29:59.193365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:29:59.272939Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T09:29:59.272939Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:57a6999fc3c8afdff6bd0ab469364bb645fe2b916e3f04023481b0d218ff8810","observation_id":"01b70bed-b4a6-4b00-888e-fbc0c43ce51b","resolution":{"observed_at":"2026-08-03T09:29:59.272939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:29:59.347795Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T09:29:59.347795Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:336929e1c6fca60875a127bc93d9356ce1c4b8d71629f900c9587dca7af6cbf7","observation_id":"6dbf7de3-6058-46c9-952b-695a5ec7021a","resolution":{"observed_at":"2026-08-03T09:29:59.347795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:29:59.418454Z","title":"Longvale: Vision-audio- language-event benchmark towards time-aware omni-modal perception of long videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T09:29:59.418454Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:df6008bef364c735baf1926168d0ffcfe08581e638bc89f5b2892ec7e6e367aa","observation_id":"c5d976f3-30e0-4bad-a67f-a22ea71eed09","resolution":{"observed_at":"2026-08-03T09:29:59.418454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:29:59.587619Z","title":"Gemini 3 flash: frontier intelligence built for speed","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T09:29:59.587619Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:1647986b4b4fafcfbff1ab630dcf48857cc466b0bbcb4f9367e29c6017ce4579","observation_id":"ee42a785-38e9-4c48-a9ca-1219c9646491","resolution":{"observed_at":"2026-08-03T09:29:59.587619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-03T09:29:59.696384Z","title":"Gemini2.5: Pushingthefrontierwithadvancedreasoning,multimodality,longcontext,andnextgeneration agentic capabilities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T09:29:59.696384Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:ae605b5e654448e83f591db657b3c457596eae6300e1af96cd5ccffc98514056","observation_id":"28da8c2f-0656-4530-b6f4-c4838e7d2a79","resolution":{"observed_at":"2026-08-03T09:29:59.696384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04326","snapshot_observed_at":"2026-08-03T09:29:59.779406Z","title":"Worldsense: Evaluating real-world omnimodal understanding for multimodal llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T09:29:59.779406Z"},"links":{"cited_paper":"/paper/2502.04326","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:6c6a9037f882182571459386d59ad7b98882ee7a23cdcf551926e15629872570","observation_id":"10659347-8211-4457-b856-c13cc9598dfe","resolution":{"observed_at":"2026-08-03T09:29:59.779406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:29:59.896596Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T09:29:59.896596Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:6695210cac0ab0f7ff791cba8d2feb89dbab8bbf226d53753c20f1189f1ca9dd","observation_id":"204b01f8-c23c-47b3-97fe-badefa6dd0d6","resolution":{"observed_at":"2026-08-03T09:29:59.896596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:00.164196Z","title":"WavLLM: Towards robust and adaptive speech large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:00.164196Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:a30a263c40603e8a0fa3af9feade7454f74142893f415147acdf89bde02196c4","observation_id":"815da43e-6d71-47a3-ad10-250e9834563a","resolution":{"observed_at":"2026-08-03T09:30:00.164196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:00.271973Z","title":"Forecastbench: A dynamic benchmark of AI forecasting capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:00.271973Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:3b009423782f5f4a988c41a0738cca9c3ae94f62dd9c266a99cf738a969275ac","observation_id":"8d12d096-ae67-436b-95c2-c3d37645874d","resolution":{"observed_at":"2026-08-03T09:30:00.271973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-03T09:30:00.354187Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:00.354187Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:9b45248bb15396497fb49342edcc396d01848c5233830433c0069db7e0bba4cf","observation_id":"0145f447-cc1b-4b41-8253-502b0bac7606","resolution":{"observed_at":"2026-08-03T09:30:00.354187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:00.438253Z","title":"What is more likely to happen next? video-and-language future event prediction","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:00.438253Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:86aa1fc785510f2d6d058e03e9915eff8bd23ec1b286fe8a92c153867a32b6e6","observation_id":"94a1e897-872f-4722-a3df-18de237e3985","resolution":{"observed_at":"2026-08-03T09:30:00.438253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:00.515548Z","title":"Omnivideobench: Towards audio-visual understanding evaluation for omni mllms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:00.515548Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:e0635b7eff6ed051521b3bcdddf4f4cef658dacc9decb65d8432f77a060b6552","observation_id":"e8dd5021-4dad-490f-9f84-a3c0e8855eb2","resolution":{"observed_at":"2026-08-03T09:30:00.515548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:00.627809Z","title":"Learning to answer questions in dynamic audio-visual scenarios","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:00.627809Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:ae95b2e1f46fa9e26d1538e511ee23688fcd94377390c7c5108f955a232b5488","observation_id":"34a15548-1bc1-49be-aa18-ddf1432f0031","resolution":{"observed_at":"2026-08-03T09:30:00.627809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:00.712306Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:00.712306Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:33e706f9b236b784107097ff2708e24169d32d9c6f92588c24fb7a5870c6446f","observation_id":"6431bbed-44f9-4d53-8491-82ed7ec2121d","resolution":{"observed_at":"2026-08-03T09:30:00.712306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:00.839550Z","title":"Intentqa: Context-aware video intent reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:00.839550Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:548eae3317cdcc6d6656f69952bbf3cc9891d82958e5be7e268fe89899789cc6","observation_id":"563cf7eb-5382-4076-b190-ef4b60f00b4a","resolution":{"observed_at":"2026-08-03T09:30:00.839550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:00.927299Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozenimageencodersandlargelanguagemodels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:00.927299Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:9108c2f99787a17ac33584accd7d2a2f62cda7f7945336b8b408f391fb229aa7","observation_id":"182110fe-57b5-48cc-9470-3a8e95219cd5","resolution":{"observed_at":"2026-08-03T09:30:00.927299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:01.017385Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:01.017385Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:3f3ce01deac800c9c9dfd7690c8871c9f0486d67953c8b9c5b4d5b90255c8c84","observation_id":"a77102ca-79f2-4f92-b77d-b882fcbe62b3","resolution":{"observed_at":"2026-08-03T09:30:01.017385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:01.105450Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:01.105450Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:85af5e605617824f62b1a03a38a02ccbf43bf07dfb83998431d823c43de9c878","observation_id":"a06cdbbc-e55d-41a5-a969-58a42594810e","resolution":{"observed_at":"2026-08-03T09:30:01.105450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:01.199391Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:01.199391Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:91bacfa50ed881cf5e4c02f3dec98971fdcbd65a15da5ed8c2eedc31737e7f07","observation_id":"8ed4ff97-65b9-4479-a7f4-d5dfaf9d1941","resolution":{"observed_at":"2026-08-03T09:30:01.199391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-03T09:30:01.361938Z","title":"Ola: Pushing the frontiers of omni-modal language model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:01.361938Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:3d462b10edd6c094ceb6f3aa762c144c78e091d299350a5d0efb041e081fe7c5","observation_id":"52c170a9-6577-4502-9730-ac4b1ecd25c6","resolution":{"observed_at":"2026-08-03T09:30:01.361938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02231","last_updated":"2026-04-10T02:23:14Z","snapshot_observed_at":"2026-07-06T22:37:31.360740Z","submitted_at":"2025-12-01T21:57:26Z","title":"See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02231","snapshot_observed_at":"2026-08-03T09:30:01.498544Z","title":"See, hear, and understand: Benchmarking audiovisual human speech understanding in multimodal large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:01.498544Z"},"links":{"cited_paper":"/paper/2512.02231","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:fa30d97d058c05d83c17395f6ee26dcd8b32bc3407f904eeb5d04fe2f59eeecf","observation_id":"5fe89d08-cb9d-45d4-8a54-1ef956aff6a6","resolution":{"observed_at":"2026-08-03T09:30:01.498544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T09:30:01.633482Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:01.633482Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:32ea104298204e39a9b8daf46e19630abe6a260c71eb40feb781e772b934f680","observation_id":"f4e04727-99ce-481b-8967-68008123f0ba","resolution":{"observed_at":"2026-08-03T09:30:01.633482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:01.732145Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:01.732145Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:21f703e35e38cde20d4fbd506c6a68c54af5a3312b88a74b69639482e8845da7","observation_id":"0d22d709-2fed-4727-b621-921d21e4624d","resolution":{"observed_at":"2026-08-03T09:30:01.732145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:01.829896Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:01.829896Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:58be1f65d774a1ccc12dba7466d841ce08a2e402eef50417207af1a0d34d5382","observation_id":"456f5fc6-ad34-43ed-ad58-4a866a3fe9eb","resolution":{"observed_at":"2026-08-03T09:30:01.829896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:01.955904Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:01.955904Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:9c10b8458dd1fb9da3bd824b7b485532abe74ab5a524df68de6ec35d4ee70b23","observation_id":"be511dd8-3e82-4048-a917-08c72cf835c7","resolution":{"observed_at":"2026-08-03T09:30:01.955904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:02.029586Z","title":"SALMONN: Towards generic hearing abilities for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:02.029586Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:f3c9d6005d24c1843db5f233da2aa03b8d8518de9a50e4c420bf788f7188106a","observation_id":"db963ebe-3076-45e8-9ccc-49841ec3cbb7","resolution":{"observed_at":"2026-08-03T09:30:02.029586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:02.081331Z","title":"video-salmonn 2: Caption-enhanced audio-visual large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:02.081331Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:78dfc07a307ada15be95caf470989f003e5d6bc9229a6177933aac24db38fb4d","observation_id":"e2b5552f-7812-439e-a4ac-c51df590b3c9","resolution":{"observed_at":"2026-08-03T09:30:02.081331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:02.167133Z","title":"Empoweringllmswithpseudo- untrimmed videos for audio-visual temporal understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:02.167133Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:ff6c2d9ad703bb8ef4b7b970da68dfc4390c56dbee8fd2ece0999bc96e0a6ed3","observation_id":"91eff93a-8fef-440f-88b3-520c1ba45c48","resolution":{"observed_at":"2026-08-03T09:30:02.167133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22457","snapshot_observed_at":"2026-08-03T09:30:02.227226Z","title":"Fostering video reasoning via next-event prediction, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:02.227226Z"},"links":{"cited_paper":"/paper/2505.22457","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:fabda2ec883f7173c51a4fb1b16fb22b4ccb062dc74030ffa8b6785c5eb2c70f","observation_id":"999cd9e9-7450-41b6-81d1-bffa35dbba45","resolution":{"observed_at":"2026-08-03T09:30:02.227226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15828","last_updated":"2021-06-27T10:11:02Z","snapshot_observed_at":"2026-07-06T10:29:11.807491Z","submitted_at":"2020-12-31T18:51:26Z","title":"MiniLMv2: Multi-Head Self-Attention Relation Distillation for Compressing Pretrained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15828","snapshot_observed_at":"2026-08-03T09:30:02.299564Z","title":"Minilmv2: Multi-head self-attention relation distillation for compressing pretrained transformers, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:02.299564Z"},"links":{"cited_paper":"/paper/2012.15828","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:2770df29c7e1d4d1b6f3fa1e4c071b5d30e12862312b2d564044dd1441eb472a","observation_id":"dd977d04-9f5f-4d6f-82bb-f33cbf209a1f","resolution":{"observed_at":"2026-08-03T09:30:02.299564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:02.389016Z","title":"Ugc-videocaptioner: An omni ugc video detail caption model and new benchmarks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:02.389016Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:9f0db10a10dc3725b3eda8415a282b1072d7fe4684d8ad7e0cf76cb240382158","observation_id":"eca52e40-6877-4180-8d03-2d94c40d9d87","resolution":{"observed_at":"2026-08-03T09:30:02.389016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-03T09:30:02.484164Z","title":"Qwen2.5-omni technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:02.484164Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:a5ec549c940b705365916e37d37a0c1c864f8f39a9812555b5d3d9ec3b5994ae","observation_id":"0bdd1548-18b8-44bd-aac7-5f0dfd162eb0","resolution":{"observed_at":"2026-08-03T09:30:02.484164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-03T09:30:02.555150Z","title":"Qwen3-omni technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:02.555150Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:a5ad1c08a68a1955ba15968bde4b9f5aca0a413430e18c60f8b9c0f590da7bb1","observation_id":"2019e343-a879-4850-b5a1-02cdacced65f","resolution":{"observed_at":"2026-08-03T09:30:02.555150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:02.635589Z","title":"Avqa: A dataset for audio-visual question answering on videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:02.635589Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:4594ac0f77feef8877329c25a7ec9110d427fa20fa14ea58af4f529b79dd9bdd","observation_id":"38782b91-8639-4079-acab-3b1d2adedec2","resolution":{"observed_at":"2026-08-03T09:30:02.635589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:02.702999Z","title":"Audio-centric video understanding benchmark without text shortcut","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:02.702999Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:74e86b019e155bdc06b3c8a1729bf4b66255694e70cf65ed4d580a180b424f15","observation_id":"876e2cf3-fa49-41bb-b316-52fe10104723","resolution":{"observed_at":"2026-08-03T09:30:02.702999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-03T09:30:02.762702Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprintarXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:02.762702Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:a87fde9226950e0d81e0c9d8426940b9521f2f66d2c8896be89c8d4dede14a48","observation_id":"2ee5adee-8905-4378-8267-8fc9fe604b3b","resolution":{"observed_at":"2026-08-03T09:30:02.762702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01231","last_updated":"2024-07-01T12:22:46Z","snapshot_observed_at":"2026-08-06T21:36:57.756316Z","submitted_at":"2024-07-01T12:22:46Z","title":"MIRAI: Evaluating LLM Agents for Event Forecasting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01231","snapshot_observed_at":"2026-08-03T09:30:02.869167Z","title":"MIRAI: evaluating LLM agents for event forecasting.CoRR, abs/2407.01231, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:02.869167Z"},"links":{"cited_paper":"/paper/2407.01231","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:8411dd2c77d5ddbc15ba1e367312d74f9b8a948f6e4bfe0925e9b6a2f813017f","observation_id":"f751875c-2764-451f-8691-af037b973ef2","resolution":{"observed_at":"2026-08-03T09:30:02.869167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11987","last_updated":"2025-09-05T09:15:55Z","snapshot_observed_at":"2026-08-05T19:39:12.827378Z","submitted_at":"2025-08-16T08:54:08Z","title":"FutureX: An Advanced Live Benchmark for LLM Agents in Future Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11987","snapshot_observed_at":"2026-08-03T09:30:02.970530Z","title":"Futurex: An advanced live benchmark for LLM agents in future prediction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:02.970530Z"},"links":{"cited_paper":"/paper/2508.11987","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:54549949eb6ea124f6201a05eea569d73e71c6a1076382cc9881dd559e33337f","observation_id":"9423e84a-2c86-49ad-8a40-bf144231d01e","resolution":{"observed_at":"2026-08-03T09:30:02.970530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:03.061661Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:03.061661Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:996de18905ffab1c2cacd06bb7a0cdd4fca9fba9b204b68ba010910f84e5840c","observation_id":"8d1f9cab-1f93-4e66-859d-6073e64b8a0b","resolution":{"observed_at":"2026-08-03T09:30:03.061661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:03.129471Z","title":"Video-LLaMA: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:03.129471Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:1ca03ce3e9d0a3c7502f2f9f08149a9e4aa77ccbb71bc91acc906129af7c292a","observation_id":"f3cb9f55-8729-4bff-ab24-21142c73b5af","resolution":{"observed_at":"2026-08-03T09:30:03.129471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:03.249768Z","title":"Timelens: Rethinking video temporal grounding with multimodal llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:03.249768Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:18e7ad9f7e9ad23c5086fc409d83b0a512e58afe0e190cd4e74761d5dcf08979","observation_id":"a7b9e03d-5771-4a71-8096-eb351e13d139","resolution":{"observed_at":"2026-08-03T09:30:03.249768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:03.362310Z","title":"Llava-next: A strong zero-shot video understanding model, April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:03.362310Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:135622777d6953fe5d402c933ae249cf6d7acb9f2e062092ca0b352dbbae8fd5","observation_id":"973440a7-ee75-4f4c-8cf5-03b5e5a9206f","resolution":{"observed_at":"2026-08-03T09:30:03.362310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:03.464504Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:03.464504Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:f12ecdf6837b89f0d15608a05c98e580326e59947b3f0af548f8207e7a98e1cb","observation_id":"fe91e45c-5946-485a-b0a7-7b14d573777b","resolution":{"observed_at":"2026-08-03T09:30:03.464504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:03.552949Z","title":"Mlvu: Benchmarkingmulti-tasklongvideounderstanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:03.552949Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:183c86cb2473323673e0c960edd57403d10834b5b030746a4b2e344752924e29","observation_id":"bac7dbdc-5309-4629-b6f8-72d54bc6a17a","resolution":{"observed_at":"2026-08-03T09:30:03.552949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:03.797705Z","title":"audio event","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:03.797705Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:40960d5eaa098e5e319ecd758e3103cf23eb28ec43461f2d5e36c595cbe289cd","observation_id":"411ac1a0-8bad-4adb-baa0-c8db2c5edcc9","resolution":{"observed_at":"2026-08-03T09:30:03.797705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:03.944481Z","title":"John walks down the street","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:03.944481Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:4bbeee1d37fe4a4d5d33dbb956b4f69d61d16a0d38795daaf16ef4f2029afae0","observation_id":"d6536786-ded1-44ac-b2ed-eaf005685b9c","resolution":{"observed_at":"2026-08-03T09:30:03.944481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:04.076476Z","title":"Given the premise event: ’[Description of Event A]’, which event is its most direct conclusion?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:04.076476Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:d5446d380afd4c97609bfca81b613f256f49b6fbf349a477b06c6a8a49d210d8","observation_id":"47f4dab8-a9ee-4cfc-b335-d57bf47d48d8","resolution":{"observed_at":"2026-08-03T09:30:04.076476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:04.254688Z","title":"decisive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:04.254688Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:d9f62c32dc0fc92d8a394f4780f784bd785ab90a175e48dfcd60e6958ae67316","observation_id":"97194122-7bbb-47b0-8e19-82ca4f0399aa","resolution":{"observed_at":"2026-08-03T09:30:04.254688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:04.367487Z","title":"motor jam","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:04.367487Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:ba7f22dfa3c19b8cc6cef0cabbebf875b3418752f01fda993ef59316f678cb13","observation_id":"94e7e43c-22c1-4f7c-a636-ce6f24ad63b6","resolution":{"observed_at":"2026-08-03T09:30:04.367487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:04.584169Z","title":"Understand the sequence of actions, the characters involved, and the overall flow of the narrative","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:04.584169Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:750d82a546d5a4ae80def86c37d9ec0b84c7ae4df4b42c75e8333d0a00237205","observation_id":"c83a88fa-3c1b-4262-9fb4-257c23e80f06","resolution":{"observed_at":"2026-08-03T09:30:04.584169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:04.746985Z","title":"A glass shatters","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:04.746985Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:0da105e2910c40c3beb88a62b9dfaf9f34e899b42c8525313624ffc099937ca1","observation_id":"f24d402a-5741-431c-b21d-a165a6ef7e5d","resolution":{"observed_at":"2026-08-03T09:30:04.746985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:04.831134Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:04.831134Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:d6565b58a56bada09452f09602a948833896110b75cb2b94e521b85ebe8936a2","observation_id":"6b1280f2-bee5-4c1a-9065-57c7b474c1c3","resolution":{"observed_at":"2026-08-03T09:30:04.831134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:04.939745Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:04.939745Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:c97ad66e71ce06d6b2324bfb2efa33f725fe8adee502a3d2e59e18979327b933","observation_id":"374b1e23-db9e-4304-abd7-475dd096059c","resolution":{"observed_at":"2026-08-03T09:30:04.939745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:04.987666Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:04.987666Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:d6dfba92868e4f1e4055c0144da33f5a2eae4b198f1bae060e46496296d3c618","observation_id":"252dd4f4-8327-4892-99ab-1869e9f6dd30","resolution":{"observed_at":"2026-08-03T09:30:04.987666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:05.076729Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:05.076729Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:cc2600748878c6866917b53b9a550bba0f23ebf2090edb803552f9479d184dd1","observation_id":"4ed0cc97-7cea-48bf-9c8e-1d34e1590372","resolution":{"observed_at":"2026-08-03T09:30:05.076729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:05.164587Z","title":"# Classification Criteria: You must classify the error into exactly one of the following four categories","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:05.164587Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:3655e1d349cc9cfa5dd2d4b93cc24a9954c9bab06f36704056364756d3995404","observation_id":"99c47ed7-c774-4274-b8eb-bd6c73c7f0cc","resolution":{"observed_at":"2026-08-03T09:30:05.164587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:05.277824Z","title":"## Indicator: The visual context alone is insufficient or misleading, and the model failed because it missed the acoustic cue (e.g., a doorbell ringing off-screen)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:05.277824Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:514aaf14aec385f5784e6081478507d1ef9f0f28e832241125bd96f02d546d6f","observation_id":"985fd226-c960-46c2-bf9b-ce2eb2964b74","resolution":{"observed_at":"2026-08-03T09:30:05.277824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:05.469030Z","title":"## Indicator: The model’s prediction contradicts clear visual evidence (e.g., predicting \"driving\" when the car is visually parked)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:05.469030Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:dd2daec407da6ece76c99f651cf7a86ce215034ed3c8b7dc8481028dd326bb20","observation_id":"f0b144f5-0f0e-4be2-a8cb-0c2c1884b761","resolution":{"observed_at":"2026-08-03T09:30:05.469030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:05.674423Z","title":"## Indicator: Understanding the scene requires prior knowledge (e.g., knowing that mixing specific chemicals causes an explosion, or knowing the rules of Chess)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:05.674423Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:54470d42045b66388d3119a5769d79c1ea61a6d9d985b70600a0d5ee17bb3c59","observation_id":"8f7bd563-303b-4f74-b37f-b65a2ac44f91","resolution":{"observed_at":"2026-08-03T09:30:05.674423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:30:05.747416Z","title":"he is exercising","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:05.747416Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:b73cbc86da43672441c3cca5415fd626349863b6a2db5c01957cdc1a66a6af97","observation_id":"69094d7c-2ee4-463a-853d-2df860ad8dfb","resolution":{"observed_at":"2026-08-03T09:30:05.747416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:29:59.991540Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T09:29:59.991540Z"},"links":{"citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:db36512f8a2d5d79f8256724606874838cd4340e6d40d986f01a694d67f0979d","observation_id":"1f515224-ed55-450d-a504-edbc430ba84e","resolution":{"observed_at":"2026-08-03T09:29:59.991540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":71,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 2 inbound Pith citation observations for arXiv:2601.13836."}