{"as_of":"2026-08-14T02:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:28b6f8be38565c3e9096c8faa7791337ea2cfdb9b93712e7fbfa7851e0fda97a","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:36:22.245545Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07584/citation-record","integrity":"/paper/2608.07584/integrity","json":"/paper/2608.07584/citation-record.json","paper":"/paper/2608.07584"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:23.028660Z","title":"2022 , publisher =","venue":null,"work_id":"6b099321-3f71-4a99-8265-d615cad151da","year":2022},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.069655Z"},"links":{"citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:1379bce766e9e67e29178f9978870e6d295c1c1678b92f0017a104978e0baba9","observation_id":"4476f292-0ae6-45be-aa36-0a19615192ed","resolution":{"observed_at":"2026-08-11T00:36:23.035059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:22.078210Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.078210Z"},"links":{"citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:34f0d61021dcf5a34c93a548dff2a74de4e2215a8a18904fada121061a092b83","observation_id":"64d35d65-af2f-4476-9bc7-8600396687eb","resolution":{"observed_at":"2026-08-11T00:36:22.078210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:22.984845Z","title":"Lawrence and Girshick, Ross , booktitle =","venue":null,"work_id":"6134d8f4-9ab1-4833-8f0f-36a86a7121da","year":2017},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.088566Z"},"links":{"citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:a75b1bcdc67dddeb2a77b33fce548981e0d43cb02738164b910e0a93badc0bbc","observation_id":"cd3324ef-fff3-4469-8f7b-967e10675454","resolution":{"observed_at":"2026-08-11T00:36:22.990804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:22.962908Z","title":"2024 , doi =","venue":null,"work_id":"18ef343c-b0a9-410b-9ef8-ba3a18d8e5a9","year":2024},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.096685Z"},"links":{"citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:672bce401bca21788c8840dc81d83d0bebaf523cd9c5ac93b8baad20cb2f5cf1","observation_id":"51e95402-573c-4d2e-8e2a-c49209618063","resolution":{"observed_at":"2026-08-11T00:36:22.969167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:22.940372Z","title":"2025 , publisher =","venue":null,"work_id":"fd54afdd-fe11-462f-af39-30d483413849","year":2025},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.103389Z"},"links":{"citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:0456c59a638437cca505c82f8c66ab8b259128cc9a89d33a0770ab69852de5dc","observation_id":"c5f6c67b-10d0-45bf-a23a-ddc118cb8283","resolution":{"observed_at":"2026-08-11T00:36:22.946307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:22.921334Z","title":"Journal of Data-centric Machine Learning Research , volume =","venue":null,"work_id":"502af6ac-f56f-4559-8725-c813c8667a98","year":null},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.108889Z"},"links":{"citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:a74ea9037037cacd7ff171f95e0b0246daef1c4ce3a0e159e763e5912e697bfa","observation_id":"b4265b22-c5f0-4ae5-bf4f-0d0147d6d303","resolution":{"observed_at":"2026-08-11T00:36:22.928124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:22.114861Z","title":"2019 , eprint =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.114861Z"},"links":{"citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:228001ceb7ec9fae33014658d6743826e141fc87369a82753dc7ab5c748f211c","observation_id":"387f56a9-c392-48cb-9e1a-109170f7b229","resolution":{"observed_at":"2026-08-11T00:36:22.114861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-10T02:33:01.623850Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-08-11T00:36:22.121965Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.121965Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:e5ccf0a8802d07be98d03104288c1dca4b4253fad1df11b529a7cc7a5f99f160","observation_id":"16cf6ca3-e2f6-4e97-8a37-0cf641434036","resolution":{"observed_at":"2026-08-11T00:36:22.121965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00698","last_updated":"2025-06-04T16:20:49Z","snapshot_observed_at":"2026-08-13T22:22:39.554988Z","submitted_at":"2025-02-02T07:12:03Z","title":"MM-IQ: Benchmarking Human-Like Abstraction and Reasoning in Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00698","snapshot_observed_at":"2026-08-11T00:36:22.128677Z","title":"2502.00698 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.128677Z"},"links":{"cited_paper":"/paper/2502.00698","citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:e37a581f13325452835c176452eac0abcb90c9122b3317c8ee232b0199145b00","observation_id":"b6432445-2633-4b02-b7c0-d69144babb8c","resolution":{"observed_at":"2026-08-11T00:36:22.128677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:22.882398Z","title":"2024 , publisher =","venue":null,"work_id":"2bf9fff0-0d71-4c53-8f35-858d009f7e14","year":2024},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.134634Z"},"links":{"citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:8ce4d599988056ec07f936b5875423ee70e8c40c988a6f8b89b1098565b1039c","observation_id":"59df4741-b015-4241-ad15-04b1e257e67f","resolution":{"observed_at":"2026-08-11T00:36:22.889531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:22.855088Z","title":"2025 , eprint =","venue":null,"work_id":"75a4a847-cc26-449d-b2af-aeb75c7228de","year":2025},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.142290Z"},"links":{"citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:ecd0eee2b2e633ed497f9bab164d338e3a15d1b29dee5452719e11d2c5db6632","observation_id":"2ead2ad2-c935-42e2-a944-dc8ad8a058b9","resolution":{"observed_at":"2026-08-11T00:36:22.861618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10885","last_updated":"2025-04-15T05:29:31Z","snapshot_observed_at":"2026-08-07T16:05:40.179437Z","submitted_at":"2025-04-15T05:29:31Z","title":"PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10885","snapshot_observed_at":"2026-08-11T00:36:22.148366Z","title":"2504.10885 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.148366Z"},"links":{"cited_paper":"/paper/2504.10885","citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:83525a999fca59d5fb22474b89d80fb7f3a3d3fc2149107c67af8a691e2e6b9a","observation_id":"6964239f-fadf-4c63-bfa3-2830d73f31de","resolution":{"observed_at":"2026-08-11T00:36:22.148366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:22.836182Z","title":"2026 , eprint =","venue":null,"work_id":"c778a6c5-d21e-4057-808f-d566af2d53e8","year":2026},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.156416Z"},"links":{"citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:c86e21491965781df4b0772f8e3d3b663c6f98e0cb0bdd8e388b812a6b58b4bf","observation_id":"6fdbe709-ec3d-4eae-a840-88dabe50aeec","resolution":{"observed_at":"2026-08-11T00:36:22.842026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01777","last_updated":"2025-08-27T05:37:31Z","snapshot_observed_at":"2026-08-13T04:04:21.455040Z","submitted_at":"2024-03-04T07:10:31Z","title":"NPHardEval4V: Dynamic Evaluation of Large Vision-Language Models with Effects of Vision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01777","snapshot_observed_at":"2026-08-11T00:36:22.162543Z","title":"2403.01777 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.162543Z"},"links":{"cited_paper":"/paper/2403.01777","citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:63edd122a78a56e0bfb4c96a69ddd32542336bfbce14fb16f4f2476f9f462ffb","observation_id":"7c5160d0-5f51-4c7f-994d-825831750f7c","resolution":{"observed_at":"2026-08-11T00:36:22.162543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:22.814817Z","title":"2025 , publisher =","venue":null,"work_id":"8d54c5ba-7c27-4157-82c2-73f4f00f60b6","year":2025},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.170552Z"},"links":{"citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:bf76ecb77b8a075c095619e67096c79b7b77ff7a870c235778ba26a9537d44b3","observation_id":"0ae47376-8cfc-49ae-b668-44c7468c4ec9","resolution":{"observed_at":"2026-08-11T00:36:22.820733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23382","last_updated":"2025-07-31T09:59:17Z","snapshot_observed_at":"2026-08-07T11:02:57.710023Z","submitted_at":"2025-07-31T09:59:17Z","title":"MPCC: A Novel Benchmark for Multimodal Planning with Complex Constraints in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2507.23382","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.23382","snapshot_observed_at":"2026-08-11T00:36:22.504927Z","title":"MPCC: A Novel Benchmark for Multimodal Planning with Complex Constraints in Multimodal Large Language Models","venue":"cs.CL","work_id":"bff6ac70-e74f-4abe-8272-0a777e6de933","year":2025},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.176532Z"},"links":{"cited_paper":"/paper/2507.23382","citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:9a473b56c7846a1fc105eb199ef99fd1e5af2e309996b5796aa0d05be2e95fa8","observation_id":"801da51e-d348-486c-acc6-532317dd6cee","resolution":{"observed_at":"2026-08-11T00:36:22.517208Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:22.184820Z","title":"2602.08367 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.184820Z"},"links":{"citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:b45c8dcbf95bbf28f819b80fd512aadf6695c1995b6e098132d311ba27c4199e","observation_id":"eae8b963-b47e-41b7-a638-46c48763c3fb","resolution":{"observed_at":"2026-08-11T00:36:22.184820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:22.796003Z","title":"2026 , eprint =","venue":null,"work_id":"404bdf28-b5d6-4b58-a681-a2f9bbede538","year":2026},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.191335Z"},"links":{"citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:29fdf6cd31aae671c319d82d626eab6c894d669e5d874687fcf98dc231c3e041","observation_id":"bb30cc29-e875-43cd-ab43-ff33ec22c586","resolution":{"observed_at":"2026-08-11T00:36:22.801065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.19787","last_updated":"2026-06-18T04:43:23Z","snapshot_observed_at":"2026-08-07T10:39:28.966198Z","submitted_at":"2026-06-18T04:43:23Z","title":"ORAgentBench: Can LLM Agents Solve Challenging Operations Research Tasks End to End?","version":1},"cited_work":{"arxiv_id":"2606.19787","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.19787","snapshot_observed_at":"2026-08-11T00:36:22.337784Z","title":"ORAgentBench: Can LLM Agents Solve Challenging Operations Research Tasks End to End?","venue":"cs.AI","work_id":"02fc0e34-56ba-41d4-83fc-1ae500d845ff","year":2026},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.197364Z"},"links":{"cited_paper":"/paper/2606.19787","citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:e1308e7c973b98356034ba8d2e9e4010fe413fa1b813164bda48871fd09eec03","observation_id":"9f7642af-c173-4bb1-86d9-bf0125a3b057","resolution":{"observed_at":"2026-08-11T00:36:22.351158Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:22.773354Z","title":"2025 , eprint =","venue":null,"work_id":"24e27783-aa18-4cd8-97c3-a4fd4e88e0ed","year":2025},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.204494Z"},"links":{"citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:90707d9267e72694346f1cc4892cb385998b83567e487f8bf0e0cc7494b9a432","observation_id":"8cb0bcc6-4c1a-4a03-878e-d14bcfffb816","resolution":{"observed_at":"2026-08-11T00:36:22.781866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:22.211047Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.211047Z"},"links":{"citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:25bb45c74d50490be362ad628c5cd5ef87a77efa836854191bdf74ccd0b7f782","observation_id":"34c41c24-873b-457e-9a62-02262ed09492","resolution":{"observed_at":"2026-08-11T00:36:22.211047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-11T00:36:22.216429Z","title":"2303.11381 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.216429Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:70a0f8189c5c8f48b937cf825a99b889f7a752979a23762985c07f462261541f","observation_id":"d87097a0-a98e-4758-9d20-9779e2db31aa","resolution":{"observed_at":"2026-08-11T00:36:22.216429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:22.735225Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages =","venue":null,"work_id":"f741c502-67cc-4476-835a-ec114c5ed485","year":2023},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.222214Z"},"links":{"citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:2795bf7ac40998e0d823c98c1b3b5b2288832acc6cdb8ff76b7be724f3901750","observation_id":"2577fa03-b8e9-4dcb-83bf-5749fee3e8a5","resolution":{"observed_at":"2026-08-11T00:36:22.742909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:22.226802Z","title":"Advances in Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.226802Z"},"links":{"citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:60a5706ea9ef62d52004a474bdef2c1a94e934e6a38163d7b496222f9340e596","observation_id":"f19be4b3-7942-493d-84b7-0c85d85eb92d","resolution":{"observed_at":"2026-08-11T00:36:22.226802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:22.232109Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.232109Z"},"links":{"citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:b5ee0f7ecc419c1b609cb951b887e956f3cbc133b856f5fe8c0dd78a6970de23","observation_id":"9c4f1d09-8883-45f5-8ae2-e9bb2c002866","resolution":{"observed_at":"2026-08-11T00:36:22.232109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:22.678824Z","title":"Complexity of Computer Computations , editor =","venue":null,"work_id":"229d2aa9-baff-44dc-a2b5-c593cce64edd","year":1972},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.237385Z"},"links":{"citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:71a520324594ba90b3744dd31cd733c44e8dc17c01da42ecc92036355cbafd65","observation_id":"84ad65ce-7676-410b-8f3d-1f48132d4a42","resolution":{"observed_at":"2026-08-11T00:36:22.686421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:22.657537Z","title":"1979 , publisher =","venue":null,"work_id":"19d4d79a-52d8-43aa-b256-621da119dfe4","year":1979},"citing_paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:22.245545Z"},"links":{"citing_paper":"/paper/2608.07584"},"observation_digest":"sha256:f0b26aa73d3f058c9f7a3a0893723e1f43b38b3b9c5bacd09651ecfc79dd41af","observation_id":"d99f49fb-09d8-4954-bc74-e5ae756b4aba","resolution":{"observed_at":"2026-08-11T00:36:22.664591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.07584","last_updated":"2026-08-05T10:05:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T23:19:23.730286Z","submitted_at":"2026-08-05T10:05:41Z","title":"ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2608.07584."}