{"as_of":"2026-08-12T22:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f820054c811c516b3a4bccd82e766d055e272e9106a02f3c4609e2f9d2bd130c","coverage":[{"denominator":211,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T22:00:13.891720Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:43:51.464398Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T08:39:42.500110Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"cited_work":{"arxiv_id":"2602.18600","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.18600","snapshot_observed_at":"2026-07-04T08:39:42.500110Z","title":"MapTab: Are MLLMs Ready for Multi-Criteria Route Planning in Heterogeneous Graphs?","venue":"cs.LG","work_id":"632e7926-cd54-48e8-b3b9-186ed68f6d2c","year":2026},"citing_paper":{"arxiv_id":"2604.09712","last_updated":"2026-04-08T06:28:03Z","snapshot_observed_at":"2026-08-10T23:47:03.569219Z","submitted_at":"2026-04-08T06:28:03Z","title":"LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T19:26:23.660206Z"},"links":{"cited_paper":"/paper/2602.18600","citing_paper":"/paper/2604.09712"},"observation_digest":"sha256:32ac68b54bb640d77bc4d3129f6ef7e00c0db05cff1c3f76ffd24927078417bc","observation_id":"59bb7911-6bb9-4cbc-a51f-48a6c4e5425e","resolution":{"observed_at":"2026-05-10T23:00:47.620002Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"cited_work":{"arxiv_id":"2602.18600","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.18600","snapshot_observed_at":"2026-07-04T08:39:42.500110Z","title":"MapTab: Are MLLMs Ready for Multi-Criteria Route Planning in Heterogeneous Graphs?","venue":"cs.LG","work_id":"632e7926-cd54-48e8-b3b9-186ed68f6d2c","year":2026},"citing_paper":{"arxiv_id":"2606.22597","last_updated":"2026-06-23T04:17:28Z","snapshot_observed_at":"2026-07-06T23:57:28.172988Z","submitted_at":"2026-06-21T17:13:35Z","title":"MapReason-OSM: Can Vision-Language Models Make Graph-Verifiable Mobility Decisions from Street Maps ?","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T11:07:50.534593Z"},"links":{"cited_paper":"/paper/2602.18600","citing_paper":"/paper/2606.22597"},"observation_digest":"sha256:dce7dfb23d79e1148f1431c0e879b71e03f819fa46fe557c83539deb79cbf0b8","observation_id":"570a44d3-e969-4c5b-ad08-00d117a45101","resolution":{"observed_at":"2026-07-04T08:39:42.501661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.18600","snapshot_observed_at":"2026-08-12T20:43:51.464398Z","title":"arXiv:2602.18600 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-12T21:21:13.879544Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.464398Z"},"links":{"cited_paper":"/paper/2602.18600","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:eb25dba223cc9dc491d1140e02d2c5b21205d24bdc767abc8d46a8b0567efaf0","observation_id":"b7641b32-c2c3-4da9-b257-69e33e6c7157","resolution":{"observed_at":"2026-08-12T20:43:51.464398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.18600/citation-record","integrity":"/paper/2602.18600/integrity","json":"/paper/2602.18600/citation-record.json","paper":"/paper/2602.18600"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:04.190848Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:04.190848Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:3d599091bd843f20fcc67314d936fc2b4994e66341b03efd64313ec16000c2dd","observation_id":"f96caba8-a266-4b59-9da8-368ae9f967ba","resolution":{"observed_at":"2026-08-02T22:00:04.190848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-05T04:04:21.846023Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-02T22:00:04.222885Z","title":"Phi-4 technical report.arXiv preprint arXiv:2412.08905, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:04.222885Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:4118d2c206194f1756c4758258ce00665f6c3ff383f69b5d0426c4d7d3c556f7","observation_id":"4857e590-b2a9-42d3-a46b-a64dd93f25ba","resolution":{"observed_at":"2026-08-02T22:00:04.222885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-02T22:00:04.280751Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:04.280751Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:e8d9b2b53b841cbcb96b69fc86b7b6dfcc04297906c2911fd28e10ff8903029b","observation_id":"a4a8babf-d6a4-49ff-9cf2-5dd25e9bed45","resolution":{"observed_at":"2026-08-02T22:00:04.280751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06566","last_updated":"2026-06-24T16:20:47Z","snapshot_observed_at":"2026-08-08T15:29:04.112831Z","submitted_at":"2026-02-06T10:05:25Z","title":"SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06566","snapshot_observed_at":"2026-08-02T22:00:04.360002Z","title":"Sparc: Separating perception and reasoning circuits for test-time scaling of vlms.arXiv preprint arXiv:2602.06566, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:04.360002Z"},"links":{"cited_paper":"/paper/2602.06566","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:5b98a38a539f2c3b5a7f827e5a98be97265a6ee4f3478279a42b2d717c4bdadc","observation_id":"28ed8397-ec8c-4f76-8c4f-24bd69adb2fd","resolution":{"observed_at":"2026-08-02T22:00:04.360002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:04.413822Z","title":"Qwen3-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:04.413822Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:45dc6a6dd2f7987af6862fcc35a135b7f8d87701abc6f8eace3817304de3a231","observation_id":"f11210c6-8ca6-4179-86fa-6d258a846708","resolution":{"observed_at":"2026-08-02T22:00:04.413822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-02T22:00:04.484203Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:04.484203Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:26c7ab289966f33840673cf3cbe03bcc8d008b58859b0de400cd437921061672","observation_id":"b4df9b2e-197a-4254-9a0d-e1d52f4cef5d","resolution":{"observed_at":"2026-08-02T22:00:04.484203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:04.542531Z","title":"doubao-seed-1.6-thinking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:04.542531Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:e3a2510db1b62c1f47cb317a1141a86e44cd825f51a8cf9102791b4a3654de9d","observation_id":"423f9fbc-6828-4a80-bb50-486fbf2d98ec","resolution":{"observed_at":"2026-08-02T22:00:04.542531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:04.590992Z","title":"Seed1.6: Tech introduction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:04.590992Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:cf7b213a86feb7badea3a43185af7aa953c2c2df46668c635c9b6a50e9c49fd0","observation_id":"ce3a3000-8cfd-4d0e-bf08-89687e7a8f2e","resolution":{"observed_at":"2026-08-02T22:00:04.590992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:04.646592Z","title":"Holistic evaluation of multimodal llms on spatial intelligence.arXiv preprint arXiv:2508.13142, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:04.646592Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:668ac9c4b4a1a10edf17c760975ceeef772cab655d66b245678d36b317a8782b","observation_id":"c9bf13b2-24b4-4249-90a5-a1dc3721fe67","resolution":{"observed_at":"2026-08-02T22:00:04.646592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:04.699968Z","title":"Representation granularity enables time-efficient autonomous exploration in large, complex worlds.Science Robotics, 8(80):eadf0970, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:04.699968Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:5ed47e837f5732deecc396332c54bbe2a0d1f79bf683bc7db6c43af6234c6e6e","observation_id":"38078396-3c83-4ee6-930c-88f918724693","resolution":{"observed_at":"2026-08-02T22:00:04.699968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:04.767809Z","title":"Maplm: A real-world large-scale vision-language benchmark for map and traffic scene understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:04.767809Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:5f53623fce7dcd0744f584fa2f210af84fd9e078ec7c70a635ede7fef0645fde","observation_id":"e3ae5e61-e8ec-4d0b-b475-25ec7a88f9ac","resolution":{"observed_at":"2026-08-02T22:00:04.767809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06948","last_updated":"2026-05-30T09:01:09Z","snapshot_observed_at":"2026-08-04T22:56:01.963927Z","submitted_at":"2025-09-08T17:58:02Z","title":"Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06948","snapshot_observed_at":"2026-08-02T22:00:04.802440Z","title":"Beyond two-stage training: Cooperative sft and rl for llm reasoning.arXiv preprint arXiv:2509.06948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:04.802440Z"},"links":{"cited_paper":"/paper/2509.06948","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:8764cef166ee17c32255d9574eae29e9235d823ec427e3b1ee8158532cc61efd","observation_id":"c22d3a84-0d13-407c-9227-f01688ae2970","resolution":{"observed_at":"2026-08-02T22:00:04.802440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:04.855197Z","title":"Path planning algorithm for logistics autonomous vehicles at cainiao stations based on multi-sensor data fusion.PLoS One, 20(5):e0321257, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:04.855197Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:075ad5df63a0c413c2cff611d9e2867784ad71e7d17dff83314ce2fff7a2d1b0","observation_id":"96415ad7-9185-43d4-8372-13ccfbfc628e","resolution":{"observed_at":"2026-08-02T22:00:04.855197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:04.896744Z","title":"Glyph: Scaling context windows via visual-text compres- sion.arXiv preprint arXiv:2510.17800, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:04.896744Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:3f7af1203e669fed5d938d8ee898ddc8785268df6b6bf5de9378d03d698ab336","observation_id":"f20ce482-ab49-4ded-b20c-8d034682f0af","resolution":{"observed_at":"2026-08-02T22:00:04.896744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:04.958561Z","title":"Sensenova-mars: Empowering multimodal agentic reasoning and search via reinforcement learning.arXiv preprint arXiv:2512.24330, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:04.958561Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:d7a30924f41cd0f7086e69d5a197eb957dd5dc269e3972f3838d25f349a025e7","observation_id":"d7ba1a1e-1ed8-469c-a0d5-390d01f8685b","resolution":{"observed_at":"2026-08-02T22:00:04.958561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11831","last_updated":"2026-01-15T23:30:35Z","snapshot_observed_at":"2026-07-06T21:25:27.942187Z","submitted_at":"2025-05-17T04:34:48Z","title":"ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11831","snapshot_observed_at":"2026-08-02T22:00:05.001098Z","title":"Arc- agi-2: A new challenge for frontier ai reasoning systems.arXiv preprint arXiv:2505.11831, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:05.001098Z"},"links":{"cited_paper":"/paper/2505.11831","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:36225a7a332ff8682472c78da82a3f8d83eac4195eb99d976f63afa421c2a35e","observation_id":"757bba5c-de09-4349-a019-d2855fe37466","resolution":{"observed_at":"2026-08-02T22:00:05.001098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:05.058831Z","title":"A survey on multimodal large language models for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:05.058831Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:50662d0cfc8c4e6682d9883fadd24bd55b766c974a1a678077a75403504d1381","observation_id":"6c096d5f-deff-4a21-ab24-c91ca08a5db3","resolution":{"observed_at":"2026-08-02T22:00:05.058831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00316","last_updated":"2025-06-06T08:14:05Z","snapshot_observed_at":"2026-08-12T08:17:19.611807Z","submitted_at":"2024-12-31T07:20:32Z","title":"MapEval: A Map-Based Evaluation of Geo-Spatial Reasoning in Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00316","snapshot_observed_at":"2026-08-02T22:00:05.110597Z","title":"Mape- val: A map-based evaluation of geo-spatial reasoning in foundation models.arXiv preprint arXiv:2501.00316, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:05.110597Z"},"links":{"cited_paper":"/paper/2501.00316","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:de4d0ef777f6b0831999559fed10aa93b61d9749f0d6356231f524838e482cad","observation_id":"9df3ad2f-1f12-4762-b45b-5fd336ace813","resolution":{"observed_at":"2026-08-02T22:00:05.110597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:05.166547Z","title":"Travellm: Could you plan my new public transit route in face of a network disruption?arXiv preprint arXiv:2407.14926, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:05.166547Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:ffbfbd54484746918b6e50b321cdb201d1f3ce3e821cbdd5fab94e1151210c68","observation_id":"92fda95d-1e71-4a29-883c-6185697f0567","resolution":{"observed_at":"2026-08-02T22:00:05.166547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:05.230169Z","title":"Citybench: Evaluating the capabilities of large language models for urban tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:05.230169Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:9c127817ee9bbd5fcac367492037596bccaf2b70f14892bbb9f1a4c518df989d","observation_id":"e5d0724c-80c3-43fe-8695-1699261e20a6","resolution":{"observed_at":"2026-08-02T22:00:05.230169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:05.278866Z","title":"Citybench: Evaluating the capabilities of large language model as world model.arXiv e-prints, pages arXiv–2406, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:05.278866Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:4718ca514ec86f253e63ae3188893b17efc6d24ab86401e83acb9b456aa40028","observation_id":"097bb677-7ecb-4507-a58a-cf7ab48db391","resolution":{"observed_at":"2026-08-02T22:00:05.278866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:05.332906Z","title":"Efficient reasoning models: A survey.arXiv preprint arXiv:2504.10903, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:05.332906Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:4ecc8a22d67dc3f3830eae64d993b2774503a84655242ef07cde40fd651827bd","observation_id":"8883f9b3-e316-4c2e-bdc2-d3160cf92f2a","resolution":{"observed_at":"2026-08-02T22:00:05.332906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:05.398591Z","title":"Rewardmap: Tackling sparse rewards in fine-grained visual reasoning via multi-stage rein- forcement learning.arXiv preprint arXiv:2510.02240, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:05.398591Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:dfd19221e9fdc5fa052a63fa5f21ac6859826ec9501c67661f7699f6bcaeb092","observation_id":"0dc2a785-4f83-4275-9322-2cb9da1459a4","resolution":{"observed_at":"2026-08-02T22:00:05.398591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:05.460533Z","title":"Can mllms guide me home? a benchmark study on fine-grained visual reasoning from transit maps.arXiv preprint arXiv:2505.18675, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:05.460533Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:a460fd0f99d8bc3d57ede2019e8f7428df34f190bbef05444de0994b560874af","observation_id":"c1862407-6f52-49ac-b6a0-a9d7780e2e1c","resolution":{"observed_at":"2026-08-02T22:00:05.460533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:05.532876Z","title":"Drive like a human: Rethinking autonomous driving with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:05.532876Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:d69b2e748cca8b04aadfb5d672917e0fe6bf0c922b189b6432e5806b42113864","observation_id":"54513a32-4dd7-471a-aeee-983f686979c9","resolution":{"observed_at":"2026-08-02T22:00:05.532876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:05.573634Z","title":"Gemini 3 flash: Frontier intelligence built for speed","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:05.573634Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:774e280995d5f588567acc6cd1cea9999ce349282fe5a9d405220bd4fe53c331","observation_id":"63d38ca9-b478-4211-b8a6-f42c59864505","resolution":{"observed_at":"2026-08-02T22:00:05.573634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:05.740933Z","title":"Reasoning-aligned perception decoupling for scalable multi-modal reasoning.arXiv preprint arXiv:2506.04559, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:05.740933Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:a1a2e45192d416c891406f83a8bb4189302ef30ed2f6faaa4c766c38033aff76","observation_id":"48a0cfd9-2ac6-4022-827c-ec8aa6ff5455","resolution":{"observed_at":"2026-08-02T22:00:05.740933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-02T22:00:05.820515Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:05.820515Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:99be25917fb83e95a0184df5e9e25aa40874946df418798cddfcff40d38ce1a8","observation_id":"7f237cfd-9bb1-40c4-8dac-e41cdfa04ca3","resolution":{"observed_at":"2026-08-02T22:00:05.820515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:05.905891Z","title":"Enhanced natural language annotation and query for semantic mapping in visual slam using large language models.Journal of Sustainability, Policy, and Practice, 1(3):131–143, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:05.905891Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:8b6924acd8179c6ce872d9d65f4eaf09a9700c605381eaba3ae9a3240f05ffa2","observation_id":"7d348143-b569-40f7-a0c3-e353909eff4a","resolution":{"observed_at":"2026-08-02T22:00:05.905891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-08-02T22:00:05.988418Z","title":"R-bench: Graduate-level multi-disciplinary benchmarks for llm & mllm complex reasoning evaluation.arXiv preprint arXiv:2505.02018, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:05.988418Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:6fcc4f63957eba7ff7f61d82be56cd63824371e4e3ef2dc41dd3cfe8780a9e03","observation_id":"7e63eb40-1a4e-4c5d-901b-a879d875aed6","resolution":{"observed_at":"2026-08-02T22:00:05.988418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15677","last_updated":"2025-07-29T22:40:49Z","snapshot_observed_at":"2026-08-06T23:49:24.463717Z","submitted_at":"2025-06-18T17:58:17Z","title":"Embodied Web Agents: Bridging Physical-Digital Realms for Integrated Agent Intelligence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15677","snapshot_observed_at":"2026-08-02T22:00:06.045958Z","title":"Embodied web agents: Bridging physical-digital realms for integrated agent intelligence.arXiv preprint arXiv:2506.15677, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:06.045958Z"},"links":{"cited_paper":"/paper/2506.15677","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:e3f9b12df8893463f934ca7e3281f7bdb1db8e90534f6f6e0069d924317deb83","observation_id":"d8a01f90-674b-4c50-83c2-179dead6ff1c","resolution":{"observed_at":"2026-08-02T22:00:06.045958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:06.127839Z","title":"Vision-language-action models for autonomous driving: Past, present, and future.arXiv preprint arXiv:2512.16760, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:06.127839Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:bd243a95f3039f02616cef5cf046bc3c9db8f2e43bfba64ef02e138b34bd6ea8","observation_id":"45498371-63d1-448d-8e8e-2cc419fe0ae6","resolution":{"observed_at":"2026-08-02T22:00:06.127839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:06.183096Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models.Advances in Neural Information Processing Systems, 37:139348–139379, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:06.183096Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:e120f1771bcfd4ae030791f76ced98a7e937167ba76039dad5d097824ea901c6","observation_id":"0c8949ed-4d73-4aa9-8498-8b1d18f9d4a8","resolution":{"observed_at":"2026-08-02T22:00:06.183096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:06.291848Z","title":"Mllm-for3d: Adapting multimodal large language model for 3d reasoning segmentation.arXiv preprint arXiv:2503.18135, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:06.291848Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:1f43f632d83a6270951e018a188a52f3aae9aaa8ec59d3c230361d777fbc0af1","observation_id":"55c7ca74-60f9-4a68-b872-7ce402b8ab7c","resolution":{"observed_at":"2026-08-02T22:00:06.291848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-02T22:00:06.358912Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:06.358912Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:94c0469e11c522591bd64d19b27d6402c5c301551924df63ade9acd7482e7675","observation_id":"8f09c9d4-b4b3-4248-8fe2-a15307309153","resolution":{"observed_at":"2026-08-02T22:00:06.358912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:06.432499Z","title":"Geobenchx: Benchmarking llms in agent solving multistep geospatial tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:06.432499Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:4f9972af83edc9326f872d8b1c017ef7494cad8be8ed79a285122409a9645628","observation_id":"352c02da-8821-42d0-80a8-3558b13df6f2","resolution":{"observed_at":"2026-08-02T22:00:06.432499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09486","last_updated":"2024-09-26T09:31:48Z","snapshot_observed_at":"2026-08-09T03:04:44.111837Z","submitted_at":"2024-04-15T06:15:46Z","title":"MMCode: Benchmarking Multimodal Large Language Models for Code Generation with Visually Rich Programming Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09486","snapshot_observed_at":"2026-08-02T22:00:06.512766Z","title":"Mmcode: Benchmarking multimodal large language models for code generation with visually rich programming problems.arXiv preprint arXiv:2404.09486, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:06.512766Z"},"links":{"cited_paper":"/paper/2404.09486","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:40ac12bbb3635ebc1c91450b5521d4394537480dd68ab5349914fab7a37c9cd5","observation_id":"d477d8c0-a048-43cf-9752-c1307870ddc2","resolution":{"observed_at":"2026-08-02T22:00:06.512766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:06.594107Z","title":"Eee-bench: A comprehensive multimodal electrical and electronics engineering benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:06.594107Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:4b9ee97425e933b48b54dc9247d65a1bc0d444b618e0e012da6be87dccc65766","observation_id":"0b89fce9-6d2b-4769-a573-665ce850cb80","resolution":{"observed_at":"2026-08-02T22:00:06.594107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07871","last_updated":"2025-03-10T21:37:22Z","snapshot_observed_at":"2026-08-07T17:14:56.057416Z","submitted_at":"2025-03-10T21:37:22Z","title":"MapQA: Open-domain Geospatial Question Answering on Map Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07871","snapshot_observed_at":"2026-08-02T22:00:06.674087Z","title":"Mapqa: Open-domain geospatial question answering on map data.arXiv preprint arXiv:2503.07871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:06.674087Z"},"links":{"cited_paper":"/paper/2503.07871","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:6457a9dd8a817baaf2843d2fd2f1b0a4626e5265146204493bd6325d3c5826ae","observation_id":"140f6a16-e8d8-42f4-9429-cb22bec91de2","resolution":{"observed_at":"2026-08-02T22:00:06.674087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:06.721453Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:06.721453Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:c318a9167ec230eb8273634d52d845f02d89513847a09fcb31dfb854a263d5b7","observation_id":"77845e4a-2fc1-4621-a842-c2d12150f598","resolution":{"observed_at":"2026-08-02T22:00:06.721453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13284","last_updated":"2025-06-16T09:27:48Z","snapshot_observed_at":"2026-08-09T20:09:37.590476Z","submitted_at":"2025-06-16T09:27:48Z","title":"AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13284","snapshot_observed_at":"2026-08-02T22:00:06.791321Z","title":"Acereason-nemotron 1.1: Advancing math and code reasoning through sft and rl synergy.arXiv preprint arXiv:2506.13284, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:06.791321Z"},"links":{"cited_paper":"/paper/2506.13284","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:b016317dab6038e49ffb344b2f4520761fc62115ce0750e63f862b65e303960c","observation_id":"6dabc6dd-63a6-434f-ab24-e836b93fdf50","resolution":{"observed_at":"2026-08-02T22:00:06.791321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:06.863224Z","title":"Uniugp: Unifying understanding, generation, and planing for end-to-end autonomous driving.arXiv preprint arXiv:2512.09864, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:06.863224Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:7ad3f3eb16743764c6e09a9bb97edc2f991c3cbede0d4b41697035f2164ee4cf","observation_id":"561dd6c1-2514-4dc9-acac-9f48c28a3d4c","resolution":{"observed_at":"2026-08-02T22:00:06.863224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-02T22:00:06.951391Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:06.951391Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:dc6185b04f4c2fb983323a757798d24c5ab0ed368fd2552b5c47d54c6b37e7c6","observation_id":"09d9ed37-a6a6-44b0-81fc-68960bd9c2ae","resolution":{"observed_at":"2026-08-02T22:00:06.951391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04165","last_updated":"2021-07-20T23:22:27Z","snapshot_observed_at":"2026-08-06T13:29:31.050456Z","submitted_at":"2021-05-10T07:46:55Z","title":"Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04165","snapshot_observed_at":"2026-08-02T22:00:06.971790Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning.arXiv preprint arXiv:2105.04165, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:06.971790Z"},"links":{"cited_paper":"/paper/2105.04165","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:6c086d99bb68464d68b6d30122924637858eeb8e26743c19b975d1e3217b029e","observation_id":"fbb0382c-0bd2-476f-99ce-953d3579fe7d","resolution":{"observed_at":"2026-08-02T22:00:06.971790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11737","last_updated":"2025-08-15T17:01:08Z","snapshot_observed_at":"2026-07-06T22:13:37.150049Z","submitted_at":"2025-08-15T17:01:08Z","title":"Ovis2.5 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11737","snapshot_observed_at":"2026-08-02T22:00:07.080552Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:07.080552Z"},"links":{"cited_paper":"/paper/2508.11737","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:1afe2721791d6f0baa0ea81240d9aaefe0b4cde42f812021d8018bc5eca9f718","observation_id":"8c57d4dc-35b2-44c2-93aa-e22c930bf6b3","resolution":{"observed_at":"2026-08-02T22:00:07.080552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04277","snapshot_observed_at":"2026-08-02T22:00:07.204123Z","title":"Rsvp: Reasoning segmentation via visual prompting and multi-modal chain-of-thought.arXiv preprint arXiv:2506.04277, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:07.204123Z"},"links":{"cited_paper":"/paper/2506.04277","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:c2fe88c9e51fdc3e54033c7b8128413d8f67594f034a1d676d2f75594adee6d6","observation_id":"f5f8ffce-3e0a-4b13-a6cb-a408093d7064","resolution":{"observed_at":"2026-08-02T22:00:07.204123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:07.313907Z","title":"Mc-search: Evaluating and enhancing multimodal agentic search with structured long reasoning chains.arXiv preprint arXiv:2603.00873, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:07.313907Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:fc22f2f3aa0b7823ed08b7328d57f792e13c20aff060db327967e4946b6ce117","observation_id":"a16e3937-089a-41e4-8dfd-3b9e8afcd7fd","resolution":{"observed_at":"2026-08-02T22:00:07.313907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:07.434606Z","title":"OpenAI o1.https://openai.com/o1/, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:07.434606Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:fc21809a5792b81ec658014fcbc240277584b877005063225ffe11fc48325a70","observation_id":"34669a3f-a63f-467e-a0e9-b7a77e90a910","resolution":{"observed_at":"2026-08-02T22:00:07.434606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:07.511714Z","title":"Gpt-4.1 model card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:07.511714Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:a741e8647afbed54f47676dfcefeda79af798ad0b16cbae9f2cf62ad96d36263","observation_id":"80ad7055-cc56-4efa-bab0-3f616b8dd603","resolution":{"observed_at":"2026-08-02T22:00:07.511714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:07.604304Z","title":"OpenAI o3 and o4-mini System Card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:07.604304Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:a78aeeda9a4683e31c2895c591a19d28f9052efe7a7e077797a6eda44ae5298b","observation_id":"e2935462-bcb1-4c41-833d-c5ad38c0e86c","resolution":{"observed_at":"2026-08-02T22:00:07.604304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-02T22:00:07.716563Z","title":"Kosmos-2: Grounding multimodal large language models to the world.arXiv preprint arXiv:2306.14824, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:07.716563Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:ef1fbd359601b0524b9eac591e86389960eb78b8d72e01cd40715a94301e815a","observation_id":"d4192d26-e2d5-4d7c-a621-06027986651b","resolution":{"observed_at":"2026-08-02T22:00:07.716563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:07.839105Z","title":"Frieda: Benchmarking multi-step cartographic reasoning in vision-language models.arXiv preprint arXiv:2512.08016, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:07.839105Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:cc0f0174c6d9d3206f4b886e21e7d08343eaa1bf8b9f264f9c00a3c631f94ec5","observation_id":"9ee2d850-ddef-4416-b9fd-722eeec1b4b2","resolution":{"observed_at":"2026-08-02T22:00:07.839105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:07.960870Z","title":"Bear: Benchmarking and enhancing multimodal language models for atomic embodied capabilities.arXiv preprint arXiv:2510.08759, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:07.960870Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:c9be3d9a6aae92d713e16c93d136f9a8094008dd97b85b950c535fc99fd31028","observation_id":"762ae906-cfe1-4646-9c74-f618c3b2a733","resolution":{"observed_at":"2026-08-02T22:00:07.960870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:08.085794Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:08.085794Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:7f7cf4132789582db3b1dd862ff13b97b1128a304467333e13f9fde798a0f291","observation_id":"b825bd79-bdb6-450a-956a-a797a50eaa78","resolution":{"observed_at":"2026-08-02T22:00:08.085794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01031","last_updated":"2025-06-01T14:21:02Z","snapshot_observed_at":"2026-08-10T01:11:03.912616Z","submitted_at":"2025-06-01T14:21:02Z","title":"NavBench: Probing Multimodal Large Language Models for Embodied Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01031","snapshot_observed_at":"2026-08-02T22:00:08.208686Z","title":"Navbench: Probing multimodal large language models for embodied navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:08.208686Z"},"links":{"cited_paper":"/paper/2506.01031","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:f613994079f9709bcf4c1031f3474c9ef18a9c2703ba40c6217ea8631cae5958","observation_id":"9e96874f-a3bc-4662-ac17-b6d6368fe404","resolution":{"observed_at":"2026-08-02T22:00:08.208686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:08.296019Z","title":"Urbandrivepathway: A decision-making framework for navigating urban autonomous vehicles in complex traffic systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:08.296019Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:068d20b0774efee9a3265a3e20f277e6cee99cdd2f9990e3f971a9aa9f038d33","observation_id":"61dcc186-c6f3-47be-a25f-c51523771045","resolution":{"observed_at":"2026-08-02T22:00:08.296019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23064","last_updated":"2025-04-02T07:10:05Z","snapshot_observed_at":"2026-08-08T13:40:25.733363Z","submitted_at":"2025-03-29T12:50:38Z","title":"VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23064","snapshot_observed_at":"2026-08-02T22:00:08.370312Z","title":"Vgrp-bench: Visual grid reasoning puzzle benchmark for large vision-language models.arXiv preprint arXiv:2503.23064, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:08.370312Z"},"links":{"cited_paper":"/paper/2503.23064","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:ef4f9b964f1770e06e7a8e62146a1d878a79b063714ecdafb5f2d990167f18cc","observation_id":"7235af6b-ec94-4326-80c7-96d88d53c2e4","resolution":{"observed_at":"2026-08-02T22:00:08.370312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14195","last_updated":"2025-03-07T12:30:18Z","snapshot_observed_at":"2026-08-11T09:12:45.378052Z","submitted_at":"2025-02-20T02:00:02Z","title":"Bridging Text and Vision: A Multi-View Text-Vision Registration Approach for Cross-Modal Place Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14195","snapshot_observed_at":"2026-08-02T22:00:08.443131Z","title":"Bridging text and vision: A multi-view text-vision registration approach for cross-modal place recognition.arXiv preprint arXiv:2502.14195, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:08.443131Z"},"links":{"cited_paper":"/paper/2502.14195","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:8feab0f74fbe6e7f8bbcab95617e303b4892da277df1ded1257e8660b1d53469","observation_id":"d7845d23-02f4-4a7d-a8cd-988d9a7b39f5","resolution":{"observed_at":"2026-08-02T22:00:08.443131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T22:00:08.546863Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:08.546863Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:fa638306b29dd5f9ff8bb1fc2864350404b427e0d066112b5d7f36bc14c4118c","observation_id":"c506fbf7-a31f-4311-afb1-5275865f18fa","resolution":{"observed_at":"2026-08-02T22:00:08.546863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:08.645001Z","title":"A survey on the applications of frontier ai, foundation models, and large language models to intelligent transportation systems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:08.645001Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:f09061946c5946b996c14024c23c3e78144d5aa69b0d03305500921a8fba6ead","observation_id":"4a414d1c-39a0-4d94-b7b5-80a25c6ad6c3","resolution":{"observed_at":"2026-08-02T22:00:08.645001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-08-08T17:40:47.037804Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-02T22:00:08.728546Z","title":"Alfworld: Aligning text and embodied environments for interactive learning.arXiv preprint arXiv:2010.03768, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:08.728546Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:2a64ccbf7bb8cdc0d4fcda9699415541164269dd03631f240601706d92812745","observation_id":"2581d5de-67cc-4449-a7b8-f89873a4c55a","resolution":{"observed_at":"2026-08-02T22:00:08.728546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:08.813881Z","title":"Drivelm: Driving with graph visual question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:08.813881Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:e3c48df6159c025970d694f8d1ac2b3ce07f3eae20106aa2d45aca3c8d6c9176","observation_id":"41f07098-dda3-4401-8034-59dff4d847b6","resolution":{"observed_at":"2026-08-02T22:00:08.813881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:08.905820Z","title":"Codedance: A dynamic tool-integrated mllm for executable visual reasoning.arXiv preprint arXiv:2512.17312, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:08.905820Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:265d4a4eb18f0de632a94eaec0938e7e2c9a81d8719f039d3d6e84195218f28c","observation_id":"c33ff88e-6a0d-4925-a272-ceeff71401fe","resolution":{"observed_at":"2026-08-02T22:00:08.905820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10342","last_updated":"2025-04-30T14:45:01Z","snapshot_observed_at":"2026-08-07T16:05:50.340309Z","submitted_at":"2025-04-14T15:50:39Z","title":"VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10342","snapshot_observed_at":"2026-08-02T22:00:09.028700Z","title":"Visualpuz- zles: Decoupling multimodal reasoning evaluation from domain knowledge.arXiv preprint arXiv:2504.10342, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:09.028700Z"},"links":{"cited_paper":"/paper/2504.10342","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:f6161a359371e9f8a44b0e33bba0bd3841fedd6fd14d0306f9e1f5be1248d919","observation_id":"36dc0cea-f4ce-4c15-8b78-2988d4cbaf90","resolution":{"observed_at":"2026-08-02T22:00:09.028700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:09.113094Z","title":"Mapiq: Evaluating multimodal large language models for map question answering.arXiv preprint arXiv:2507.11625, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:09.113094Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:e3cd0926f2a5a220f8a434e15215bd46afaf3f455e275f378a6d379c550e7586","observation_id":"9832f600-de36-4fb3-95a5-57e903336dfe","resolution":{"observed_at":"2026-08-02T22:00:09.113094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:09.230606Z","title":"Reason-rft: Reinforcement fine-tuning for visual reasoning.arXiv preprint arXiv:2503.20752, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:09.230606Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:05c95d812c531a6cf9c047d5a954e587e1236c3c489a172c6f44fc4eab13a9ac","observation_id":"58091742-7f94-4278-8ea3-8b59a9a6534a","resolution":{"observed_at":"2026-08-02T22:00:09.230606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07445","last_updated":"2026-06-28T16:34:15Z","snapshot_observed_at":"2026-08-09T11:23:03.691659Z","submitted_at":"2025-07-10T05:48:28Z","title":"StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07445","snapshot_observed_at":"2026-08-02T22:00:09.367189Z","title":"Stardojo: Benchmarking open-ended behaviors of agentic multimodal llms in production-living simulations with stardew valley.arXiv preprint arXiv:2507.07445, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:09.367189Z"},"links":{"cited_paper":"/paper/2507.07445","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:e9f89bcc22ef02199274c3f240bc89333021d5405e6f097b5388f83f99cbf78d","observation_id":"0d802c50-fad7-474d-9cd4-56d2b5cc4d55","resolution":{"observed_at":"2026-08-02T22:00:09.367189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:09.444665Z","title":"Lumine: An open recipe for building generalist agents in 3d open worlds.arXiv preprint arXiv:2511.08892, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:09.444665Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:124ee8afcd1addcef39009e1f60e671b9010af25d00cbb9a98f835fe50496187","observation_id":"b4975958-faaa-4ba6-8cec-fcc0477fcf8d","resolution":{"observed_at":"2026-08-02T22:00:09.444665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-02T22:00:09.518948Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:09.518948Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:c94b1bea0b67239d00020ee60a6d9fd96c018f33c700ccac635d198809ba5d84","observation_id":"a0487b0e-7c7b-4da3-bd64-cf3febce441c","resolution":{"observed_at":"2026-08-02T22:00:09.518948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-09T09:48:45.884814Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-02T22:00:09.601701Z","title":"Kimi-vl technical report.arXiv preprint arXiv:2504.07491, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:09.601701Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:e044810dd9ba51a93f11e065570c5f6a848001744373e921ca555eaa48fba214","observation_id":"3d042823-38ec-4a82-96de-2a6eeda89d5d","resolution":{"observed_at":"2026-08-02T22:00:09.601701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:09.714549Z","title":"Cartomapqa: A fundamental benchmark dataset evaluating vision-language models on cartographic map understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:09.714549Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:c5ff6e60f8cb9eacf73a20a2abd186fe5bcfb575fa911a3038c5faa01515c227","observation_id":"ea740d21-64b6-46fe-b3dd-426af8624823","resolution":{"observed_at":"2026-08-02T22:00:09.714549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:09.832561Z","title":"A comprehensive review of path planning algorithms for autonomous navigation.Results in Engineering, page 107750, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:09.832561Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:f7dff4255e560b2ed5e9511cee975afd093082e5a9e3299e29d83a13f4400528","observation_id":"33406bcb-2368-43aa-8241-54b92d751721","resolution":{"observed_at":"2026-08-02T22:00:09.832561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:09.944398Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:09.944398Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:4896d621a4181ec4f5ee1595aaae3f0f1f55dcaa353196f3596257e1f63645f2","observation_id":"1826de9c-0425-4fae-8d6a-d6c2f8aa555c","resolution":{"observed_at":"2026-08-02T22:00:09.944398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:10.073653Z","title":"Multi-level symmetric semantic alignment network for image–text matching.Neurocomputing, 599:128082, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:10.073653Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:3967bfa788c5038d13715bf438b3f518fe22f7b9c47b8f0bb051b7bce02f7995","observation_id":"035edf20-8dd3-41d9-9857-dbd78fffe30b","resolution":{"observed_at":"2026-08-02T22:00:10.073653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-08-11T06:04:53.078032Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-02T22:00:10.239223Z","title":"Perception-aware policy optimization for multimodal reasoning.arXiv preprint arXiv:2507.06448, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:10.239223Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:5708b9a9403ff9e27110b03ef87906cd7af7b81d940bc5a51f3774dc2706ec4a","observation_id":"8bf1fa6a-ae1d-4042-8c52-3df0ba6d862e","resolution":{"observed_at":"2026-08-02T22:00:10.239223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:10.406633Z","title":"Game-tars: Pretrained foundation models for scalable generalist multimodal game agents.arXiv preprint arXiv:2510.23691, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:10.406633Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:6d7ceb7132f41e9afdd5e3abc2e46356e84161701cc368ad2c757a59afd8a895","observation_id":"72c85b5d-f702-4d5b-8d40-e856e5f0b5be","resolution":{"observed_at":"2026-08-02T22:00:10.406633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16292","last_updated":"2024-02-22T03:24:26Z","snapshot_observed_at":"2026-08-10T13:32:50.178693Z","submitted_at":"2023-09-28T09:41:35Z","title":"DiLu: A Knowledge-Driven Approach to Autonomous Driving with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16292","snapshot_observed_at":"2026-08-02T22:00:10.532491Z","title":"Dilu: A knowledge-driven approach to autonomous driving with large language models.arXiv preprint arXiv:2309.16292, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:10.532491Z"},"links":{"cited_paper":"/paper/2309.16292","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:a5f596277c991604e7be79d2c053e4c99c725287629a4a31c4a2f209f6a0f740","observation_id":"b8c44219-c814-4963-8e7b-fff753666ea3","resolution":{"observed_at":"2026-08-02T22:00:10.532491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01458","last_updated":"2026-06-09T09:31:25Z","snapshot_observed_at":"2026-08-12T11:28:18.161072Z","submitted_at":"2025-05-01T09:22:23Z","title":"A Survey of Robotic Navigation and Manipulation with Physics Simulators in the Era of Embodied AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01458","snapshot_observed_at":"2026-08-02T22:00:10.678551Z","title":"A survey of robotic navigation and manipulation with physics simulators in the era of embodied ai.arXiv preprint arXiv:2505.01458, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:10.678551Z"},"links":{"cited_paper":"/paper/2505.01458","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:c04b7ac992354b3211c37a7f619ca82cbd17c9924fce39fd5e95d1df7017316f","observation_id":"a818eba7-179f-44a7-8497-899eeaccfe8f","resolution":{"observed_at":"2026-08-02T22:00:10.678551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17012","last_updated":"2026-04-13T12:33:41Z","snapshot_observed_at":"2026-07-06T21:28:43.610849Z","submitted_at":"2025-05-22T17:59:03Z","title":"SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17012","snapshot_observed_at":"2026-08-02T22:00:10.803404Z","title":"Spa- tialscore: Towards unified evaluation for multimodal spatial understanding.arXiv preprint arXiv:2505.17012, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:10.803404Z"},"links":{"cited_paper":"/paper/2505.17012","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:4036f5106e6aad1d87129a9cba535ca9e66cd4d94e18a3af7864e98e7e4d874c","observation_id":"0615f639-c8fa-451f-aa91-ff21b880f49e","resolution":{"observed_at":"2026-08-02T22:00:10.803404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:10.915336Z","title":"V*: Guided visual search as a core mechanism in multi- modal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:10.915336Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:1eb73aeb6ced8c9ec1615ef0403d9715af25450fdeff54d891de6e29c9d746b2","observation_id":"21e896e0-9140-4511-b558-7704a73b85c7","resolution":{"observed_at":"2026-08-02T22:00:10.915336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-02T22:00:11.051278Z","title":"Deepseek-vl2: Mixture-of-experts vision- language models for advanced multimodal understanding.arXiv preprint arXiv:2412.10302, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:11.051278Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:e72f53f1a7d4962ddba9ae276045e1679e318b25e363f5f2080bf658c3c1d2d4","observation_id":"c169f84f-97ab-44c8-892c-540897c2a763","resolution":{"observed_at":"2026-08-02T22:00:11.051278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-02T22:00:11.176578Z","title":"Logicvista: Multimodal llm logical reasoning benchmark in visual contexts.arXiv preprint arXiv:2407.04973, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:11.176578Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:fe925d1e0804f299d1929fe8105c8e01dbcf048c2058c272d57d0f4dde8eeb9e","observation_id":"e2ac3779-6808-4d7e-9752-796e5e3bd6b3","resolution":{"observed_at":"2026-08-02T22:00:11.176578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04003","last_updated":"2025-01-07T18:59:55Z","snapshot_observed_at":"2026-08-10T21:39:35.298437Z","submitted_at":"2025-01-07T18:59:55Z","title":"Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04003","snapshot_observed_at":"2026-08-02T22:00:11.292826Z","title":"Are vlms ready for autonomous driving? an empirical study from the reliability, data, and metric perspectives.arXiv preprint arXiv:2501.04003, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:11.292826Z"},"links":{"cited_paper":"/paper/2501.04003","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:1b1960baa4c25d597b95b5314d00741a403bc8fbac35db1e52defd6f6b491bae","observation_id":"1cad9375-d121-48b9-8ed3-a5f7ef3dd87d","resolution":{"observed_at":"2026-08-02T22:00:11.292826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14607","last_updated":"2025-03-18T18:05:38Z","snapshot_observed_at":"2026-08-07T16:54:03.217440Z","submitted_at":"2025-03-18T18:05:38Z","title":"Can Large Vision Language Models Read Maps Like a Human?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14607","snapshot_observed_at":"2026-08-02T22:00:11.432989Z","title":"Can large vision language models read maps like a human?arXiv preprint arXiv:2503.14607, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:11.432989Z"},"links":{"cited_paper":"/paper/2503.14607","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:fa6da9d63076418737c8363164a19ec498362712ea3524f0285c765312e7a7fa","observation_id":"c2d14b2a-e6c5-4596-9bcd-7dfccb1eff87","resolution":{"observed_at":"2026-08-02T22:00:11.432989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:11.575622Z","title":"Geonav: Empowering mllms with explicit geospatial reasoning abilities for language-goal aerial navigation.arXiv preprint arXiv:2504.09587, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:11.575622Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:06f96ffaa3a3fc2bbfe8bdf9cbb98cd6ef8f2b111d39af2e1b45642ba8a41800","observation_id":"2cf87a76-6b03-4093-8110-adb4e5a2f468","resolution":{"observed_at":"2026-08-02T22:00:11.575622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15279","last_updated":"2025-04-21T17:59:53Z","snapshot_observed_at":"2026-08-07T16:00:29.784743Z","submitted_at":"2025-04-21T17:59:53Z","title":"VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15279","snapshot_observed_at":"2026-08-02T22:00:11.584146Z","title":"Visulogic: A benchmark for evaluating visual reasoning in multi-modal large language models.arXiv preprint arXiv:2504.15279, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:11.584146Z"},"links":{"cited_paper":"/paper/2504.15279","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:11120b28d392b9b9d0e870db5f22f5a19a08a2b2147fbb9c5a53320ca466dd62","observation_id":"38e9c3f6-cde0-4fe3-bd2b-5fc5105dc20e","resolution":{"observed_at":"2026-08-02T22:00:11.584146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:11.645653Z","title":"Flame: Learning to navigate with multimodal llm in urban environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:11.645653Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:fce9ce0e1ff894473f93ccba31af96eeb9e6040b0985a30163094cb8bbdff433","observation_id":"2b6ad6f1-1988-42f0-867e-11a1b2cb2d8f","resolution":{"observed_at":"2026-08-02T22:00:11.645653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:11.752284Z","title":"A survey of sustainable development of intelligent transportation system based on urban travel demand.Development, 2(1):2399, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:11.752284Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:4fbf8fbfdc67169362da117e865f99ce735b5902566887278e2d06f5fcabfc86","observation_id":"276ca3fe-559f-4c33-89e5-a01dffb70474","resolution":{"observed_at":"2026-08-02T22:00:11.752284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:11.838420Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:11.838420Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:67f4acc93c64df817e3bc75eef9d5a1f95b7cbcafcef12770f7b29ca2f024831","observation_id":"3a4c1508-cbfe-4c6d-bdc7-f28ea50faec0","resolution":{"observed_at":"2026-08-02T22:00:11.838420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-02T22:00:12.003747Z","title":"Embodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents.arXiv preprint arXiv:2502.09560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:12.003747Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:c1fea51caa372684cfdbd3640b394caf08923c42b2aa8aa21112135b06ac46e9","observation_id":"e8579d2d-49ba-4eb7-b5a9-329f5edd818a","resolution":{"observed_at":"2026-08-02T22:00:12.003747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13729","last_updated":"2024-12-02T14:59:08Z","snapshot_observed_at":"2026-07-06T19:18:53.582890Z","submitted_at":"2024-09-10T01:20:22Z","title":"MathGLM-Vision: Solving Mathematical Problems with Multi-Modal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13729","snapshot_observed_at":"2026-08-02T22:00:12.193820Z","title":"Mathglm-vision: solving mathematical problems with multi- modal large language model.arXiv preprint arXiv:2409.13729, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:12.193820Z"},"links":{"cited_paper":"/paper/2409.13729","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:e1d6d884f11a01d83e6b8aafa323914cce514327d4a2c08cc5c5ecdac5cf5f82","observation_id":"543b561f-495d-4977-859b-b72bcfeaded6","resolution":{"observed_at":"2026-08-02T22:00:12.193820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:12.366069Z","title":"Understand- ing the repeat curse in large language models from a feature perspective.arXiv preprint arXiv:2504.14218, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:12.366069Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:ab7ee7d96c463b32018769a83fe52960609e38f6d97abd226d319cfcafd63de7","observation_id":"c216e41a-b8b9-4edf-82b9-fc812a1cafb9","resolution":{"observed_at":"2026-08-02T22:00:12.366069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:12.544586Z","title":"What you see is what you read? improving text-image alignment evaluation.Advances in Neural Information Processing Systems, 36:1601–1619, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:12.544586Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:0b0bd567753fc50b673a083244baf3d9a505b058473e8722a091d5ca499e4191","observation_id":"a4c568c9-e89a-41c1-a8cb-cf661c034227","resolution":{"observed_at":"2026-08-02T22:00:12.544586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17425","last_updated":"2025-02-24T18:56:12Z","snapshot_observed_at":"2026-08-07T17:52:18.653123Z","submitted_at":"2025-02-24T18:56:12Z","title":"Introducing Visual Perception Token into Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17425","snapshot_observed_at":"2026-08-02T22:00:12.709967Z","title":"Introducing visual perception token into multimodal large language model.arXiv preprint arXiv:2502.17425, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:12.709967Z"},"links":{"cited_paper":"/paper/2502.17425","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:b1ef88da35b201a2f4c21832035f026f8cf096e9c26051e995aa9e25f9554b05","observation_id":"f19d2e7b-d5e3-4403-a4dc-f0baa4491e32","resolution":{"observed_at":"2026-08-02T22:00:12.709967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:12.918139Z","title":"Gsm8k-v: Can vision language models solve grade school math word problems in visual contexts.arXiv preprint arXiv:2509.25160, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:12.918139Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:80db8c96c6f881b4590eca65955e4faae8e841ecb243f3d9715836a14f905ff6","observation_id":"df1d12bf-0b7e-4f0f-b9b6-b36b9bd33e48","resolution":{"observed_at":"2026-08-02T22:00:12.918139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:13.159131Z","title":"Mmmu: A massive multi-discipline multi- modal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:13.159131Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:c008dab4a9f7e06adede521ff7318c129c0a9a0fbe7f7f88f9cfbaf3cd573c28","observation_id":"7c36f1bc-1a70-4b36-9e86-5f4b87a0857e","resolution":{"observed_at":"2026-08-02T22:00:13.159131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:13.408609Z","title":"Instruction-augmented multimodal alignment for image-text and element matching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:13.408609Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:3a7725a257137b75f85bffa1ef3518196acd0e3821df6deab29f41280047725e","observation_id":"fdb6dc83-d920-42a8-8bdc-bd457d35aca7","resolution":{"observed_at":"2026-08-02T22:00:13.408609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04168","last_updated":"2024-10-17T06:43:13Z","snapshot_observed_at":"2026-07-06T18:58:09.650413Z","submitted_at":"2024-08-08T02:28:43Z","title":"Perceive, Reflect, and Plan: Designing LLM Agent for Goal-Directed City Navigation without Instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04168","snapshot_observed_at":"2026-08-02T22:00:13.636042Z","title":"Perceive, reflect, and plan: Designing llm agent for goal-directed city navigation without instructions.arXiv preprint arXiv:2408.04168, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:13.636042Z"},"links":{"cited_paper":"/paper/2408.04168","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:3909c44ed0d97af66eca1db0a904546dfe04ae99966f73d62d4142eb61d06764","observation_id":"86820087-3c4b-4c81-b188-6b4e368fd2f6","resolution":{"observed_at":"2026-08-02T22:00:13.636042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04837","last_updated":"2025-06-05T09:57:43Z","snapshot_observed_at":"2026-08-12T21:44:43.803157Z","submitted_at":"2025-06-05T09:57:43Z","title":"OpenMaskDINO3D : Reasoning 3D Segmentation via Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04837","snapshot_observed_at":"2026-08-02T22:00:13.802598Z","title":"Openmaskdino3d: Reasoning 3d segmentation via large language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:13.802598Z"},"links":{"cited_paper":"/paper/2506.04837","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:198460e0d21fc7797bf3b81ac1538987d8ad14eee43e212a4ad606e1874385e8","observation_id":"6e32a0b0-e437-430c-b73f-cb9f38343f12","resolution":{"observed_at":"2026-08-02T22:00:13.802598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:00:13.891720Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? InEuropean Conference on Computer Vision, pages 169–186","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:13.891720Z"},"links":{"citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:48f11bd8365ad8f5385e4f20e07e94798ca55d21331a306e653a45e825844e65","observation_id":"19ceb54c-3958-4e88-af33-f3976542382c","resolution":{"observed_at":"2026-08-02T22:00:13.891720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","latest_version":5,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":211},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 211 outbound references and 3 inbound Pith citation observations for arXiv:2602.18600."}