{"as_of":"2026-08-06T06:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b843b1be00d24121d8063eec0e4d27557743291819215ce017e3af62cd885065","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:31:57.845882Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T02:44:28.049569Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-05T16:31:57.845882Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18421","last_updated":"2025-08-25T19:11:03Z","snapshot_observed_at":"2026-08-05T16:31:57.515039Z","submitted_at":"2025-08-25T19:11:03Z","title":"Why Relational Graphs Will Save the Next Generation of Vision Foundation Models?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T16:31:57.845882Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2508.18421"},"observation_digest":"sha256:b7c7c9ef1013e09719c3fc7c8c453673b59ee9927ba488c318033399404e53ec","observation_id":"bffba20d-c726-44ca-9288-01e43290b833","resolution":{"observed_at":"2026-08-05T16:31:57.845882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-05T16:20:59.685324Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18725","last_updated":"2025-08-26T06:50:11Z","snapshot_observed_at":"2026-08-05T16:20:55.703382Z","submitted_at":"2025-08-26T06:50:11Z","title":"Toward Edge General Intelligence with Agentic AI and Agentification: Concepts, Technologies, and Future Directions","version":1},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-08-05T16:20:59.685324Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2508.18725"},"observation_digest":"sha256:274ce33335c34f701286e240f092c86f087f481af22bc0c95575b28a332d6b0c","observation_id":"e45b5ec3-a23d-49ae-98a7-e04075498a79","resolution":{"observed_at":"2026-08-05T16:20:59.685324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-05T10:39:01.493981Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-05T10:38:56.478715Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:01.493981Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:bba1f9fd48200f53ba2781400f0dde8390faf127eafca4b43cb5a0567757c565","observation_id":"194346aa-9f27-42e6-b08f-ae432e5de4b5","resolution":{"observed_at":"2026-08-05T10:39:01.493981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-04T19:34:25.492417Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09193","last_updated":"2025-09-11T07:09:30Z","snapshot_observed_at":"2026-08-05T09:01:00.880374Z","submitted_at":"2025-09-11T07:09:30Z","title":"AI Reasoning for Wireless Communications and Networking: A Survey and Perspectives","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T19:34:25.492417Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2509.09193"},"observation_digest":"sha256:12cb9b5329f991bb3e714d9c0b6d74f5fc13fe238aab91a2405b13fab5bb62bd","observation_id":"d65d6905-acca-4367-9f24-339f66b6618b","resolution":{"observed_at":"2026-08-04T19:34:25.492417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2509.23322","last_updated":"2026-04-09T10:37:26Z","snapshot_observed_at":"2026-08-02T12:34:37.611019Z","submitted_at":"2025-09-27T14:13:41Z","title":"Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-18T12:31:25.257879Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2509.23322"},"observation_digest":"sha256:c1cc157416b726bc1da10c8c82bf1eeaa25533d3684de6319439b284d9f49618","observation_id":"616ab416-5f6c-42a8-bd47-e9155f0ad6a5","resolution":{"observed_at":"2026-05-18T12:32:36.361359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-05T23:09:55.506505Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T03:09:31.161760Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:45f754913e9ab09fd720840b846c27e9876edc87bb85d7f3a4f485e3a3f2fa3e","observation_id":"36a7b0d3-5897-4037-a822-8ca9115891bd","resolution":{"observed_at":"2026-05-17T03:11:30.087068Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-03T18:51:45.298957Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models.arXiv preprint arXiv:2505.04921, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-05T23:09:55.506505Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:45.298957Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:18f39905b6d3c51ec3a55d7c017af89de9535972c6aa0baa8671ccc3eecd2a93","observation_id":"ec5d3588-2cf9-4939-b169-9d4cc35722ef","resolution":{"observed_at":"2026-08-03T18:51:45.298957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-02T20:30:56.951607Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00171","last_updated":"2026-05-30T15:21:48Z","snapshot_observed_at":"2026-08-02T20:30:55.207815Z","submitted_at":"2026-02-26T15:41:26Z","title":"LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T20:30:56.951607Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2603.00171"},"observation_digest":"sha256:57f2859dedd6a6869955252232d9ea02faed02402ac692f56ccea02bfe5b47ac","observation_id":"6cd204ca-3d25-4713-9dd6-08f368f410ad","resolution":{"observed_at":"2026-08-02T20:30:56.951607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2604.08209","last_updated":"2026-04-09T13:09:40Z","snapshot_observed_at":"2026-07-06T22:57:22.475588Z","submitted_at":"2026-04-09T13:09:40Z","title":"OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T17:45:51.528645Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2604.08209"},"observation_digest":"sha256:49a20265f1bd5e4e4f8fff1120c019bfd9c9a9ac6eca9e96ef8ea09f6fb5831e","observation_id":"6d1c70cb-d8a9-40b9-b5b8-ec7df293a230","resolution":{"observed_at":"2026-05-11T06:11:01.552354Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2604.11240","last_updated":"2026-04-13T09:44:52Z","snapshot_observed_at":"2026-08-02T05:19:31.992123Z","submitted_at":"2026-04-13T09:44:52Z","title":"Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:15:04.261855Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2604.11240"},"observation_digest":"sha256:3667d03b45c5095f4f77fc7ecf9887870c98be8dedde03dbfe3adcc007216b03","observation_id":"438d5b62-a28e-4181-bc8a-a59a304a203a","resolution":{"observed_at":"2026-05-11T10:56:05.744774Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2604.17914","last_updated":"2026-04-20T07:47:51Z","snapshot_observed_at":"2026-08-02T06:34:24.155889Z","submitted_at":"2026-04-20T07:47:51Z","title":"Beyond Binary Contrast: Modeling Continuous Skeleton Action Spaces with Transitional Anchors","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T04:32:04.547197Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2604.17914"},"observation_digest":"sha256:ada4a4078c14ca92453c5fb110ba49c1f6cd01b617c59c0e8cef8429e97765a2","observation_id":"65ac6982-1253-44bc-8b74-f1915ca8ca32","resolution":{"observed_at":"2026-05-11T11:51:03.578653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2605.10106","last_updated":"2026-05-11T07:20:09Z","snapshot_observed_at":"2026-07-06T23:22:08.560919Z","submitted_at":"2026-05-11T07:20:09Z","title":"ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T04:00:23.681682Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2605.10106"},"observation_digest":"sha256:c9ed9cf38b09ced439a42f7b821c62df441d2a7fa158c967cb905f74360ae488","observation_id":"c0c8f5af-aa88-4182-a8e6-315ab58e9420","resolution":{"observed_at":"2026-05-12T06:46:36.421527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2605.23294","last_updated":"2026-05-22T07:10:57Z","snapshot_observed_at":"2026-07-06T23:33:29.550551Z","submitted_at":"2026-05-22T07:10:57Z","title":"NASiC: 3D NAND-based CAM-Selected Multibit CIM Architecture for Efficient On-Device Mixture-of-Experts LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T02:57:04.813106Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2605.23294"},"observation_digest":"sha256:a034b9fc31aa64f78ae816fdd30b7fc418b7940651b81470b4ab69dcb04b688c","observation_id":"5fc18d1e-fa3c-4bc0-9b50-8b7785c4f707","resolution":{"observed_at":"2026-05-25T03:00:16.019653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2605.24562","last_updated":"2026-05-23T12:56:44Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:56:44Z","title":"PEDESTRIANQA: A Benchmark for Vision-Language Models on Pedestrian Intention and Trajectory Prediction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T13:25:04.053283Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2605.24562"},"observation_digest":"sha256:23a8489db102977d1bfa48601c153fb0f02b474409719bceb1f1c92481c216b9","observation_id":"f2fe28ed-01c0-4b75-87bb-6b6533eebe8f","resolution":{"observed_at":"2026-06-30T13:34:40.936877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2605.25571","last_updated":"2026-05-25T08:26:34Z","snapshot_observed_at":"2026-07-06T23:35:31.372756Z","submitted_at":"2026-05-25T08:26:34Z","title":"AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T22:56:39.504430Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2605.25571"},"observation_digest":"sha256:97123330d339e7dad186c3e5f6c4c640f61c3f1ae411a545b3de6b1dcebc10ae","observation_id":"86f6ae4c-1b6e-4e9b-82de-283950f3170c","resolution":{"observed_at":"2026-06-30T00:14:04.662917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2605.27960","last_updated":"2026-05-27T04:54:07Z","snapshot_observed_at":"2026-08-03T00:24:19.442122Z","submitted_at":"2026-05-27T04:54:07Z","title":"Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T13:38:01.819121Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2605.27960"},"observation_digest":"sha256:6b8f926dd2f55816cfa0a57bde91f38286f0ebad110611d26e4237a79a05be13","observation_id":"50254a08-a76b-4ad7-94c6-df15f8d46f46","resolution":{"observed_at":"2026-06-29T13:43:29.018395Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:162499dd00fd0314be1ed2b35910de7a616bd2abbb67220172ecf55f8942f853","observation_id":"3db0dc68-3a88-4d5a-b518-32cb56fcfb3b","resolution":{"observed_at":"2026-07-02T17:37:14.037520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:ceba99d5e9f78f2b356d2d33d4e45a7f9d5a207fdac23673f6271859307d7bbb","observation_id":"f137f6d5-c43a-4677-9922-2d3efa2a795b","resolution":{"observed_at":"2026-07-01T23:06:21.347654Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2606.27330","last_updated":"2026-06-25T17:44:48Z","snapshot_observed_at":"2026-08-03T00:40:31.745653Z","submitted_at":"2026-06-25T17:44:48Z","title":"Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-26T03:51:51.827622Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2606.27330"},"observation_digest":"sha256:2a8835b53814169cff21bf71af23bc8dcc5c56130687a1926c2307bdbd98e904","observation_id":"815cbf74-c26e-40c7-9108-d33440545e1c","resolution":{"observed_at":"2026-07-04T14:29:53.387832Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:599c821f124b87bb90e0f13ad530335ff1f4738b00987bf534877de10a1b3569","observation_id":"9729d942-8013-4e75-8fe9-66e95fc67465","resolution":{"observed_at":"2026-07-08T02:44:28.050948Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-14T09:13:07.507164Z","title":"arXiv preprint arXiv:2505.04921 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10796","last_updated":"2026-07-12T15:09:03Z","snapshot_observed_at":"2026-08-03T12:20:45.242159Z","submitted_at":"2026-07-12T15:09:03Z","title":"Mixture of Cognitive Experts in Large Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T09:13:07.507164Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2607.10796"},"observation_digest":"sha256:c7f1c1cbc413d0d83750d2e590a3890df25f581422c3d44973b3fb753d095f80","observation_id":"39982139-c36d-4678-a8ab-a2e0f5789ddd","resolution":{"observed_at":"2026-07-14T09:13:07.507164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-01T21:08:19.564996Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16193","last_updated":"2026-07-17T17:59:56Z","snapshot_observed_at":"2026-08-06T02:03:23.672538Z","submitted_at":"2026-07-17T17:59:56Z","title":"Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:19.564996Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2607.16193"},"observation_digest":"sha256:b296f5973f13bba69f7770881a1c57a89d38843917f9e67c9f99dda535457418","observation_id":"d79251d8-84ac-45b3-bd19-4b1fb35c38a3","resolution":{"observed_at":"2026-08-01T21:08:19.564996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-02T13:42:25.191504Z","title":"Eagle: Specula- tive sampling requires rethinking feature uncertainty","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20467","last_updated":"2026-05-19T06:27:58Z","snapshot_observed_at":"2026-08-04T19:16:48.398719Z","submitted_at":"2026-05-19T06:27:58Z","title":"DC-Leap: Training-Free Acceleration of dLLMs via Draft-Guided Contiguous Leaping Decoding","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T13:42:25.191504Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2607.20467"},"observation_digest":"sha256:72f90c367becfdd3d641964c3b43783128e2552dbf1af0a8e12bb7fa1b3e207d","observation_id":"6f897abd-8868-4151-b05f-2845cbbfeee4","resolution":{"observed_at":"2026-08-02T13:42:25.191504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.04921/citation-record","integrity":"/paper/2505.04921/integrity","json":"/paper/2505.04921/citation-record.json","paper":"/paper/2505.04921"},"outbound":[],"paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2505.04921."}