{"as_of":"2026-08-08T13:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cba9856dc953c8d9cca79edcbe084a3bf478981ec5dfe8bfd6bbfab3392563e2","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:52:35.700887Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:49:50.117587Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T10:58:02.808545Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04141","snapshot_observed_at":"2026-08-05T19:03:06.002557Z","title":"Mmr-v: What’s left unsaid? a benchmark for multimodal deep reasoning in videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13692","last_updated":"2025-08-19T09:52:04Z","snapshot_observed_at":"2026-08-08T00:06:34.475015Z","submitted_at":"2025-08-19T09:52:04Z","title":"HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T19:03:06.002557Z"},"links":{"cited_paper":"/paper/2506.04141","citing_paper":"/paper/2508.13692"},"observation_digest":"sha256:12bd8dc678e6a4ee6886c14d9a8ec14879c42733bca8915922505c1202c4c722","observation_id":"ebecd022-1635-4ac0-9adf-90481d7d2c4f","resolution":{"observed_at":"2026-08-05T19:03:06.002557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"cited_work":{"arxiv_id":"2506.04141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04141","snapshot_observed_at":"2026-07-21T02:21:18.406523Z","title":"Mmr-v: What’s left unsaid? a benchmark for multimodal deep reasoning in videos","venue":null,"work_id":"8b0cba3a-c8ac-4aed-99dc-f2f9f6dfdca4","year":2025},"citing_paper":{"arxiv_id":"2605.21988","last_updated":"2026-05-21T04:38:02Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T04:38:02Z","title":"Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-22T07:45:56.473188Z"},"links":{"cited_paper":"/paper/2506.04141","citing_paper":"/paper/2605.21988"},"observation_digest":"sha256:d7b8c5db2022e23ad005591eb86560cc92c0092456a8f7ed24419b99eee920b3","observation_id":"8fbfc4d0-759f-413e-a6ea-d4098a5fdc1f","resolution":{"observed_at":"2026-07-21T02:21:18.406523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"cited_work":{"arxiv_id":"2506.04141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04141","snapshot_observed_at":"2026-07-21T02:21:18.406523Z","title":"Mmr-v: What’s left unsaid? a benchmark for multimodal deep reasoning in videos","venue":null,"work_id":"8b0cba3a-c8ac-4aed-99dc-f2f9f6dfdca4","year":2025},"citing_paper":{"arxiv_id":"2606.12191","last_updated":"2026-06-10T15:15:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-10T15:15:01Z","title":"Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T09:46:30.702256Z"},"links":{"cited_paper":"/paper/2506.04141","citing_paper":"/paper/2606.12191"},"observation_digest":"sha256:9605978115def2e4b039642b5f6c780f259457f68b3991003e84c3eb55f2e7f5","observation_id":"891718a3-8afd-4116-abda-c9c01826bc0c","resolution":{"observed_at":"2026-07-21T02:21:18.406523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04141","snapshot_observed_at":"2026-08-08T00:49:50.117587Z","title":"Kejian Zhu, Zhuoran Jin, Hongbang Yuan, Jiachun Li, Shangqing Tu, Pengfei Cao, Yubo Chen, Kang Liu, and Jun Zhao","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03571","last_updated":"2026-08-06T02:46:18Z","snapshot_observed_at":"2026-08-08T12:15:16.490246Z","submitted_at":"2026-08-04T12:32:18Z","title":"Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T00:49:50.117587Z"},"links":{"cited_paper":"/paper/2506.04141","citing_paper":"/paper/2608.03571"},"observation_digest":"sha256:6e7793701a94ed11dc4af018eae9f8a6ccafaeef45dec65a2f63c495af828489","observation_id":"fc22239d-0da1-49c1-b065-5cfddb0ec259","resolution":{"observed_at":"2026-08-08T00:49:50.117587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04141/citation-record","integrity":"/paper/2506.04141/integrity","json":"/paper/2506.04141/citation-record.json","paper":"/paper/2506.04141"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T10:52:35.535059Z","title":"Openai o1 system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.535059Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:061313353197684a86142888556f0a4cf0d38dfdb38573808515e55bb66c23b3","observation_id":"8a16a489-26ec-4e1d-855e-a27405a9f5aa","resolution":{"observed_at":"2026-08-07T10:52:35.535059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:52:35.539038Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.539038Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:e57710da0e9f66c5ae79de4007f129a9ae8431a111b8a0ef2d6d6708abeb2d87","observation_id":"608af6c8-5391-47ea-883a-49f3e032d898","resolution":{"observed_at":"2026-08-07T10:52:35.539038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12605","snapshot_observed_at":"2026-08-07T10:52:35.542436Z","title":"Multimodal chain-of-thought reasoning: A comprehensive survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.542436Z"},"links":{"cited_paper":"/paper/2503.12605","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:03155af9f0c4d54718350581d0139ab06620b1c0594279abce8b889f9b9fc043","observation_id":"696125e8-28f7-4289-bcdf-0cc6e607d783","resolution":{"observed_at":"2026-08-07T10:52:35.542436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.181955Z","title":"Openai: Introducing openai o3 and o4-mini,","venue":null,"work_id":"f92e8513-c483-468a-b263-1d305a97fb76","year":2025},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.546254Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:64c881ef701e2fd5efa5f2dc3a7aaccfa881986eeb96ab30ce292ed952f5b9fb","observation_id":"2837dcb6-1fc7-4490-a770-0340dcad625f","resolution":{"observed_at":"2026-08-07T10:52:36.184407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.174458Z","title":"Research of intelligent home secu- rity surveillance system based on zigbee,","venue":null,"work_id":"2d54d6d0-3da0-41e9-a96c-0bc679bbf619","year":2008},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.549199Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:e0952b44d699c3c96f0a5b55ee7f99ac3f3d8b67a2d6e7b19c6760c86f1a9e2f","observation_id":"38117a36-c7c9-48b2-92fb-2433210e2447","resolution":{"observed_at":"2026-08-07T10:52:36.177611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-07T10:52:35.551878Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.551878Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:c66aa8b4a294dd9c943494216b72a0a8522df6ffa784e1ec2af07cbc51bc1019","observation_id":"8da11fa4-00ac-49d7-8db0-bbc9bafe1b09","resolution":{"observed_at":"2026-08-07T10:52:35.551878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T10:52:35.554510Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.554510Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:e2ae00027843eb8b8f22e34069ff2c005f10596882a736f29f64ee60fbab032b","observation_id":"c289e8f2-a3dc-4736-8ed1-02d23e992757","resolution":{"observed_at":"2026-08-07T10:52:35.554510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T10:52:35.557682Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.557682Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:64413fa37861bc75ca6be6eb64c365f4bb68ca2dc1b5dcf2b42b14192186b50b","observation_id":"f326eb43-54e8-478d-9c96-d0d02bd77ea7","resolution":{"observed_at":"2026-08-07T10:52:35.557682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:35.560026Z","title":"Heuristic and analytic processes in reasoning,","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.560026Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:f6e939f939d40a443c0b23589720a859728583fa5d977c0b3e4d9adba51cc2ab","observation_id":"815ece1e-e41f-4d65-99ae-0595086be7c3","resolution":{"observed_at":"2026-08-07T10:52:35.560026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.164512Z","title":"The clarion cognitive architecture: Extending cognitive modeling to social simulation,","venue":null,"work_id":"4261f5e6-5bb5-4ef9-9838-19a9a2579a71","year":2006},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.562565Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:4c3c3d961d6199bdd1d074b1cec948c9f01191966caad3c71bacec6c93a1f94b","observation_id":"e7a147bf-5864-4e56-b4ec-38a7aed68782","resolution":{"observed_at":"2026-08-07T10:52:36.167076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.158067Z","title":"Polanyi, Personal knowledge","venue":null,"work_id":"17821007-588e-473d-b9e6-3ab5c92ac96a","year":2012},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.565002Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:7d550fad10e3a644f03cb574df31245c8a17ca218c539e7ce437f419e06ba29f","observation_id":"5b9c24f5-db67-4ecf-a81b-62c1009f6fa6","resolution":{"observed_at":"2026-08-07T10:52:36.160499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.150570Z","title":"Kahneman, Thinking, fast and slow","venue":null,"work_id":"7f001cc7-7fb3-4f47-8b71-3827ab4bf7ec","year":2011},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.568284Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:89e76faa594daf45482b5dc9facba0058006d0c5fba22a9e5b4d23c412529cac","observation_id":"4dda2206-841f-4a8c-b824-b2ec497eb91e","resolution":{"observed_at":"2026-08-07T10:52:36.153382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T10:52:35.570857Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.570857Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:0ab0a8ccab6034c75a77624347ad924bb2af49fa26713badd3de521e054ca097","observation_id":"754fa109-f05c-449f-a839-53549b917c38","resolution":{"observed_at":"2026-08-07T10:52:35.570857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.142477Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset,","venue":null,"work_id":"bbad5fa7-bd47-4446-8e85-2e00887a3010","year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.573771Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:6be20ed8dac17cd26809e952c6b7441816b93d3310cd43381c67bab0f7ee47c4","observation_id":"3ae94a2c-6515-4e47-baf9-9371e5a6adfb","resolution":{"observed_at":"2026-08-07T10:52:36.145456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12381","last_updated":"2025-02-18T06:00:26Z","snapshot_observed_at":"2026-07-06T19:34:27.813248Z","submitted_at":"2024-10-16T09:04:57Z","title":"HumanEval-V: Benchmarking High-Level Visual Reasoning with Complex Diagrams in Coding Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12381","snapshot_observed_at":"2026-08-07T10:52:35.576700Z","title":"Humaneval-v: Evaluating visual understanding and reasoning abilities of large multimodal models through coding tasks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.576700Z"},"links":{"cited_paper":"/paper/2410.12381","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:a120457295c878b9e6d6dad51f4e5bed2f617a032fd9a7575ebca914adf7f22a","observation_id":"edb1385a-aa8f-4b6a-a67f-e6175f0dace0","resolution":{"observed_at":"2026-08-07T10:52:35.576700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T10:52:35.579503Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.579503Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:bee6429c7f57199da837e5ccc14646ac20fccc4f48fa9ad071dc2f03d75f7d66","observation_id":"93c96661-efa9-4687-8115-466c2b575ef9","resolution":{"observed_at":"2026-08-07T10:52:35.579503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.135978Z","title":"Chain-of- thought prompting elicits reasoning in large language models,","venue":null,"work_id":"05046b82-ac85-4291-bc22-70856b58ebf1","year":2022},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.581603Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:6aa3fc9b26254c6f3cfa957bfb5f46691350f4cf22c431645171ad8456242745","observation_id":"cf43c518-8b97-4078-bcae-45ad4cdfa3ac","resolution":{"observed_at":"2026-08-07T10:52:36.138576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.129375Z","title":"RankGen: Improving text generation with large ranking models,","venue":null,"work_id":"4412c51a-140a-44c8-a45c-ef7b2e6cc594","year":2022},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.584452Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:61b68b81207e1d60082b18c2a904c385d9f12bedc143e0b5e490d1cd0f59eb1f","observation_id":"c4d885aa-7179-4fe9-aecc-6e76ea3d0a9f","resolution":{"observed_at":"2026-08-07T10:52:36.131984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T10:52:35.588141Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.588141Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:6353283589ff4469861baddb208a4088dc0ee930f9da9cf7ea7e86f12de0276e","observation_id":"15f9f687-6393-4f1b-8cba-3fb5a58c9845","resolution":{"observed_at":"2026-08-07T10:52:35.588141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03690","last_updated":"2024-05-08T19:46:35Z","snapshot_observed_at":"2026-07-06T18:10:33.673157Z","submitted_at":"2024-05-06T17:59:45Z","title":"How Good is my Video LMM? Complex Video Reasoning and Robustness Evaluation Suite for Video-LMMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03690","snapshot_observed_at":"2026-08-07T10:52:35.590859Z","title":"How good is my video lmm? complex video reasoning and robustness evaluation suite for video-lmms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.590859Z"},"links":{"cited_paper":"/paper/2405.03690","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:5872af2bb6f9754d7dabd703b89ee2e66e33ad7370c9e7156bdb7b9a033a7d8f","observation_id":"dce1fa4e-302d-44ff-887f-749bc44c8912","resolution":{"observed_at":"2026-08-07T10:52:35.590859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.119922Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding,","venue":null,"work_id":"400986c4-b5e0-43cb-977b-8e826009d1c3","year":2023},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.593755Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:e53ddcb3d12945f317629b27efef2de9dc295e20d8c925eb1fcc839fe5f74e57","observation_id":"cb9b44b8-3b68-46e1-ad0f-119a3b6d46e6","resolution":{"observed_at":"2026-08-07T10:52:36.123300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.111443Z","title":"Perception test: A diagnostic benchmark for multimodal video models,","venue":null,"work_id":"bd3ab69c-4d20-459b-a883-2eda457fafde","year":2023},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.597811Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:0c630f721bcd5c1d422c0011b046912096212322bb6b39270f4717c7c42fd60d","observation_id":"8b7b15e2-7b1c-43da-b22d-6946373d3fa3","resolution":{"observed_at":"2026-08-07T10:52:36.114394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.105046Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions,","venue":null,"work_id":"1a8ab66a-903d-44d5-a295-e04c69949c76","year":2021},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.600619Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:e8a733e2df8031c9968066a0522d811b0a7a9da82aa9d7c71c483374f5263593","observation_id":"dad58a08-81a7-4ecc-8a96-3cfa5e286a49","resolution":{"observed_at":"2026-08-07T10:52:36.107625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.097154Z","title":"Video question answering via gradually refined attention over appearance and motion,","venue":null,"work_id":"3439b6c6-a2d0-46de-95ef-ed701a0ab8e7","year":2017},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.602947Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:e8f89060f89fccd31c3a4db159b29946939d4cb4a660f40934bb442132f3edcc","observation_id":"1e68601b-13b4-4b2b-b48c-1e5b8d02d133","resolution":{"observed_at":"2026-08-07T10:52:36.099703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.090651Z","title":"Msr-vtt: A large video description dataset for bridging video and language,","venue":null,"work_id":"6f2d67eb-183d-40b7-ae54-fe7a20255b68","year":2016},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.605131Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:a31b6de6056b291d1b8075ddafc9612ec1e7b92eb062ab4ef4bf5dabcb3cc04f","observation_id":"6009dc50-9be6-4b74-99c0-4c2b46d98e3a","resolution":{"observed_at":"2026-08-07T10:52:36.093405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.084043Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark,","venue":null,"work_id":"b6cf55a6-303b-4351-94a2-e1476447676e","year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.608093Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:5c786a5543c762ece725ecdc376070818a9979a6fc4938ac49ae5e900aaa7751","observation_id":"265751a1-b2e7-4379-ad90-d3336e43c38c","resolution":{"observed_at":"2026-08-07T10:52:36.086512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.076246Z","title":"Mmbench-video: A long- form multi-shot benchmark for holistic video understanding,","venue":null,"work_id":"f8f8ba5f-2ddf-440d-80d0-a323b82ca7ad","year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.610522Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:2582539a5b75d1833dea889e5dcdabdbdc6134e3d59dc1e18d155d40a79649fa","observation_id":"ba051163-bcca-49a4-83cb-e9ca4aaf9e11","resolution":{"observed_at":"2026-08-07T10:52:36.078924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-05T10:34:24.268925Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-07T10:52:35.612961Z","title":"Lvbench: An extreme long video understanding benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.612961Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:bf02bf39c1792f99e91352fc2fe050fc8dfa87ba7dc0bc2a7c2e1523c9bf53e3","observation_id":"8e1d8bd8-16f3-4858-b9d9-64466ebf18c2","resolution":{"observed_at":"2026-08-07T10:52:35.612961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.066119Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding,","venue":null,"work_id":"9bd67522-7ade-4041-be87-cf457aac8b75","year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.615998Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:27495d2a268b629a850534964c5ae61f91ccf1172168d48eb9762e84e196c27c","observation_id":"2c07c50b-6b93-43ff-b0bc-7924086641cc","resolution":{"observed_at":"2026-08-07T10:52:36.069252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T10:52:35.618681Z","title":"Kimi k1. 5: Scaling reinforcement learning with llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.618681Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:4d5543f265c4293807fe9fc9cb17e90aa6c8af66f13da73214d2bb5c8847464d","observation_id":"2bd4f8df-af75-426c-b290-f519c8a333c5","resolution":{"observed_at":"2026-08-07T10:52:35.618681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14405","last_updated":"2024-11-25T17:57:55Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:37:33Z","title":"Marco-o1: Towards Open Reasoning Models for Open-Ended Solutions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14405","snapshot_observed_at":"2026-08-07T10:52:35.621054Z","title":"Marco-o1: Towards open reasoning models for open-ended solutions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.621054Z"},"links":{"cited_paper":"/paper/2411.14405","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:c40324cfdeb4c62bb17ce01c11ea8f8c08994a2303767ab06d18f328b520ff5d","observation_id":"f4a9f28e-6d68-490d-9c0a-b92f8113a146","resolution":{"observed_at":"2026-08-07T10:52:35.621054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T10:52:35.623579Z","title":"Measuring mathematical problem solving with the math dataset,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.623579Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:01e453cebd0703513063f53240aac733e2d12579621273ad26b20f2957c650af","observation_id":"7477edea-e870-43d3-a06e-bbb798c429b6","resolution":{"observed_at":"2026-08-07T10:52:35.623579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15204","last_updated":"2025-01-03T11:44:51Z","snapshot_observed_at":"2026-08-04T21:07:04.238345Z","submitted_at":"2024-12-19T18:59:17Z","title":"LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15204","snapshot_observed_at":"2026-08-07T10:52:35.626941Z","title":"Long- bench v2: Towards deeper understanding and reasoning on realistic long-context multitasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.626941Z"},"links":{"cited_paper":"/paper/2412.15204","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:acb8b8e4bd8f8074d3e30a807a32472cb6ca3330049c26d14691e15b823089df","observation_id":"4bf18601-602f-438b-9b73-a25056ed88bb","resolution":{"observed_at":"2026-08-07T10:52:35.626941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T10:52:35.629166Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.629166Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:b17a696ed32c3ddde2fa12345554ee4cc82ce057c957d13cc9f39798dfa5967f","observation_id":"6307fcba-3259-4113-84d5-d4ccd70da711","resolution":{"observed_at":"2026-08-07T10:52:35.629166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.056530Z","title":"Gpqa: A graduate-level google-proof q&a benchmark,","venue":null,"work_id":"5d885ec8-6b42-4daa-8176-f12dfee31e61","year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.631579Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:4b7caa481bfae9ae60d909bfa0a39cfafb6347dd15196d2c7570b057ff8616df","observation_id":"5b806217-6fdf-455b-a7f3-ea38eaebe4f7","resolution":{"observed_at":"2026-08-07T10:52:36.059415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.049995Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding bench- mark,","venue":null,"work_id":"88d935db-0566-48fd-b83f-10c925adab7d","year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.634582Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:f9368eac7e7136a8a347fc339082f0f1b1efdcc4c73ca5b0307a3e207a0b0221","observation_id":"4896c574-0961-4e46-98b0-c87fd72cb4c2","resolution":{"observed_at":"2026-08-07T10:52:36.052675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-07T10:52:35.637054Z","title":"Swe-bench: Can language models resolve real-world github issues?,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.637054Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:23853fddd5a24488ffff06bda8161ceabaf03a1ac031852ab0cfb4c3c53e1d1e","observation_id":"223354ca-41cd-4172-a936-0abf93f001f4","resolution":{"observed_at":"2026-08-07T10:52:35.637054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17294","last_updated":"2024-10-08T06:58:27Z","snapshot_observed_at":"2026-08-08T00:41:26.316141Z","submitted_at":"2024-06-25T05:43:21Z","title":"Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17294","snapshot_observed_at":"2026-08-07T10:52:35.639817Z","title":"Math-llava: Bootstrapping mathematical reasoning for multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.639817Z"},"links":{"cited_paper":"/paper/2406.17294","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:b0a302be031e2dba49dfc8cddebdae6a100edf62c08719d98242d3e08119f412","observation_id":"dc10fc38-d2e6-452b-a61b-36f266a4b83d","resolution":{"observed_at":"2026-08-07T10:52:35.639817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16006","last_updated":"2024-04-24T17:37:05Z","snapshot_observed_at":"2026-07-06T18:05:03.284784Z","submitted_at":"2024-04-24T17:37:05Z","title":"MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16006","snapshot_observed_at":"2026-08-07T10:52:35.642571Z","title":"Mmt-bench: A comprehensive multimodal benchmark for evaluating large vision-language models towards multitask agi,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.642571Z"},"links":{"cited_paper":"/paper/2404.16006","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:f30292b325b8ae6fa387eabf5cedda9a7108309875786ec7cbc32619720aa2d7","observation_id":"0552af4a-974a-47da-b9ed-a3540cec5b83","resolution":{"observed_at":"2026-08-07T10:52:35.642571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.041709Z","title":"Lakoff and M","venue":null,"work_id":"9b00c59a-42b1-41e4-bd34-8aa9be5c29af","year":2008},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.645908Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:8f4b0bfb67ba539975fc8af6ed73a04ccb0db341a5282629192e0d5997e1dfaa","observation_id":"104ac23d-bed3-4f46-9dea-a9c5e2e4580a","resolution":{"observed_at":"2026-08-07T10:52:36.045708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.032508Z","title":"Openai: Hello gpt-4o,","venue":null,"work_id":"92d105e3-ae72-42b0-a1aa-5e8877fc10b0","year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.648604Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:f98ba14e7b9cec6e623044fd045b2dc7c32d402b29bd543f742acaa1f4428a53","observation_id":"d56947e7-039f-4d09-8949-cd08332cc74c","resolution":{"observed_at":"2026-08-07T10:52:36.036018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.023745Z","title":"Gpt-4o mini: advancing cost-efficient intelligence,","venue":null,"work_id":"6b612fa1-819f-42cd-a3b8-6666375e930e","year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.651452Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:5aff68c590871b728e5b084c06990a9267eb2b3a0d23011e8c18f501c3659ec8","observation_id":"2bc0ecf3-0ec5-4795-a9e5-1282987a84d9","resolution":{"observed_at":"2026-08-07T10:52:36.027076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.011951Z","title":"Introducing gpt-4.1 in the api","venue":null,"work_id":"f27e69ce-3155-408c-a9d3-7c495fe51181","year":2025},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.654068Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:c137478dacb27b33d4ce594961bb9fa9e34ee38f8c2f0b3d065d0755b4a7d7b7","observation_id":"ab86d69c-cbb5-4932-bd99-16234070d577","resolution":{"observed_at":"2026-08-07T10:52:36.015045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T10:52:35.656456Z","title":"Gemini 1.5: Unlocking multimodal understand- ing across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.656456Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:09dcc1135312e90d850bce2cd9c96aad924801453764a25cd247d2aabb18d4b6","observation_id":"6d61bee7-0ec2-430a-aad2-eeca0b8af9a6","resolution":{"observed_at":"2026-08-07T10:52:35.656456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.003421Z","title":"Gemini 2.5: Our most intelligent ai model,","venue":null,"work_id":"c4bcd98d-7a61-478e-a2a4-b7d28de841e1","year":2025},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.658759Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:b50a65e5c01cba954dbaa17ead3d7a1901380c0291afab3c3c2a8160f2a76694","observation_id":"58c4fed6-ce9d-495a-ba14-8d44dec453b5","resolution":{"observed_at":"2026-08-07T10:52:36.006568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:35.994237Z","title":"Anthropic: Introducing claude 3.5 sonnet,","venue":null,"work_id":"cdce3a81-4252-4750-9ed2-0d97bb9caae1","year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.661183Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:cf48d1cef5f9b7b87aef4899871b7c6b48d803b4b7115f2350bb2f1a2e63993e","observation_id":"a769eb1e-f719-45da-b3a6-30b59e601754","resolution":{"observed_at":"2026-08-07T10:52:35.997341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T10:52:35.663611Z","title":"Qwen2.5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.663611Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:58e05c19712ad86a01b3b933b546b90b422c8bdd734dad83ea5ef9e0f9fd3975","observation_id":"d5c5ea53-26e1-4b1b-8981-707069f2b507","resolution":{"observed_at":"2026-08-07T10:52:35.663611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T10:52:35.666040Z","title":"Gemma 3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.666040Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:e233c49d233fed1eaa6d57f982595890b579acff50b99121d179367bc8609f04","observation_id":"11546b1a-8c4d-4240-8fc3-7a2426ff067a","resolution":{"observed_at":"2026-08-07T10:52:35.666040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T10:52:35.668975Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.668975Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:881077504ef856a0b1cfb58b6620dc3b46335ef773b5b42251b34e3436540d8e","observation_id":"a93883e8-83a9-4a11-ac5c-a00642dd05e3","resolution":{"observed_at":"2026-08-07T10:52:35.668975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T10:52:35.671480Z","title":"Llava-onevision: Easy visual task transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.671480Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:cac46d65b34362ab68dd476ca3b20d5ba04e377524109c12c65ce859a3c5084a","observation_id":"d38a5394-b012-47c9-bd6a-84ce83e0ae64","resolution":{"observed_at":"2026-08-07T10:52:35.671480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T10:52:35.674042Z","title":"Video-llava: Learning united visual representation by alignment before projection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.674042Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:28aec80a84a06bb76a205bc0c1f4e7e49ac4777f9b2d32d56b9c616773b0f76f","observation_id":"de3a22ae-1e91-4360-9657-788ee22deb90","resolution":{"observed_at":"2026-08-07T10:52:35.674042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-07T10:52:35.677159Z","title":"Phi-4-mini technical report: Compact yet powerful multimodal language models via mixture-of-loras,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.677159Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:c71e24dab8c73c179100175d549c6d8940b024cf96aa6d01e16c27afc255cd17","observation_id":"fe7b0446-b8e9-499f-8209-0ad8c96a9e49","resolution":{"observed_at":"2026-08-07T10:52:35.677159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-05T11:54:14.447608Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T10:52:35.680171Z","title":"Cogvlm2: Visual language models for image and video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.680171Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:2d2ee58cdad58d1a92fa198c19b39102ce031a42c2881b7dbd1ef88571f43637","observation_id":"54be0b75-8e85-4d36-95de-86a8a0f15c25","resolution":{"observed_at":"2026-08-07T10:52:35.680171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T10:52:35.682714Z","title":"Nvila: Efficient frontier visual language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.682714Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:121a5a4b100bd753209281d7c62e53ad80b264c48865d02be038e8112e94eb38","observation_id":"56673960-7564-4da5-a3a2-2610c81da451","resolution":{"observed_at":"2026-08-07T10:52:35.682714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:35.985037Z","title":"Watch the video and answer the question and give a correct answer","venue":null,"work_id":"e15e7ac7-587f-4607-ad27-66ede62348fa","year":null},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.686243Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:4a078a856bb51ac28820ebf4c7643428a41bc96cdafa804124ad9ba631447e94","observation_id":"df71c6de-2a7d-4d99-9116-a1fef8e437d4","resolution":{"observed_at":"2026-08-07T10:52:35.988996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:35.976932Z","title":"High recognition interpretation?","venue":null,"work_id":"8998d8d0-a330-43ef-a654-ac443b145846","year":2023},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.688938Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:2a0e687e15af4d587a8cecabd866139c8952c43c92a1c4c72a87f5a6442d8b97","observation_id":"43116a44-f79e-4edc-bdf0-8526975beadd","resolution":{"observed_at":"2026-08-07T10:52:35.979480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:35.968675Z","title":null,"venue":null,"work_id":"f49d76f6-2577-4406-8104-f1f25488cda1","year":null},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.692710Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:d622b87071642e22d304cafd2063cf5d936949840faa43d745dab9411e56c7da","observation_id":"63ef1949-7e76-46d4-8d45-d312edc68e67","resolution":{"observed_at":"2026-08-07T10:52:35.971576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:35.959921Z","title":null,"venue":null,"work_id":"dc222760-7a1e-4f08-9939-83546c18f277","year":null},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.695310Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:d0bb3b67647c2e5372c53166ad0a05a678e359915ef97c23a0f053587d2f96ea","observation_id":"082f057b-d313-4e56-b086-1fb4e4699f0c","resolution":{"observed_at":"2026-08-07T10:52:35.962889Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:35.951350Z","title":null,"venue":null,"work_id":"ecc52a64-514d-4d2e-b0cc-153eb23fcf9a","year":null},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.698314Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:dd6c4080cea919675ea0da39b34c9b4ec08be28708e3aa8fb848ae2dde5dfc14","observation_id":"743b6930-a177-4b7a-8ec4-30b559a41c74","resolution":{"observed_at":"2026-08-07T10:52:35.954443Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:35.937520Z","title":"other frame desc","venue":null,"work_id":"36852488-42e2-4a00-8116-fe588adb7e8f","year":null},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.700887Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:ed5d2926ab14fd85e85c268a6664b41848c9aa9097260e047e3f91706003f597","observation_id":"311c2a08-1cf8-4df3-b88d-180c1aff6595","resolution":{"observed_at":"2026-08-07T10:52:35.940971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 4 inbound Pith citation observations for arXiv:2506.04141."}