{"as_of":"2026-08-09T01:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:878bb4c3b1f5f1f571d3788c19ca9b305bd84c8869cfa925b9e31a9b4699f43b","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:45:30.735139Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:31:41.386191Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T13:43:28.625652Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"cited_work":{"arxiv_id":"2506.07235","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07235","snapshot_observed_at":"2026-06-29T13:43:28.625652Z","title":"Multi-step visual reasoning with visual tokens scaling and verification","venue":null,"work_id":"19cacd40-1252-4b37-8c9b-b7006ca05a21","year":2025},"citing_paper":{"arxiv_id":"2512.09299","last_updated":"2026-04-06T13:16:33Z","snapshot_observed_at":"2026-07-06T22:38:35.387503Z","submitted_at":"2025-12-10T03:57:29Z","title":"VABench: A Comprehensive Benchmark for Audio-Video Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T00:03:45.576961Z"},"links":{"cited_paper":"/paper/2506.07235","citing_paper":"/paper/2512.09299"},"observation_digest":"sha256:3a56e26dbd59dd58748c5a50ad989d445b5d76dc62821779ee594ccafffd4bd9","observation_id":"39b49e20-785e-4b2e-9bf3-6d436a00e7db","resolution":{"observed_at":"2026-05-17T00:08:43.833402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"cited_work":{"arxiv_id":"2506.07235","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07235","snapshot_observed_at":"2026-06-29T13:43:28.625652Z","title":"Multi-step visual reasoning with visual tokens scaling and verification","venue":null,"work_id":"19cacd40-1252-4b37-8c9b-b7006ca05a21","year":2025},"citing_paper":{"arxiv_id":"2604.04707","last_updated":"2026-05-25T06:28:44Z","snapshot_observed_at":"2026-07-13T09:42:22.607962Z","submitted_at":"2026-04-06T14:19:48Z","title":"OpenWorldLib: A Unified Codebase and Definition of Advanced World Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T19:36:42.100191Z"},"links":{"cited_paper":"/paper/2506.07235","citing_paper":"/paper/2604.04707"},"observation_digest":"sha256:697e9440cd4ff2d92606a54a54fc975068807eba4156577f087e09b576e7d509","observation_id":"12e287ce-b650-4ece-9a3a-d938f677967b","resolution":{"observed_at":"2026-05-10T22:45:49.164337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07235","snapshot_observed_at":"2026-07-13T09:42:23.808691Z","title":"Multi-step visual reasoning with visual tokens scaling and verification.arXiv preprint arXiv:2506.07235, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.04707","last_updated":"2026-05-25T06:28:44Z","snapshot_observed_at":"2026-07-13T09:42:22.607962Z","submitted_at":"2026-04-06T14:19:48Z","title":"OpenWorldLib: A Unified Codebase and Definition of Advanced World Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T09:42:23.808691Z"},"links":{"cited_paper":"/paper/2506.07235","citing_paper":"/paper/2604.04707"},"observation_digest":"sha256:c97c60777aeb3eede4b0406423f9e60d4c193c34f5d4aa151d532d73cf44ebdd","observation_id":"979eb267-7af1-4b5b-94d9-ca1c7e9f0ca1","resolution":{"observed_at":"2026-07-13T09:42:23.808691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"cited_work":{"arxiv_id":"2506.07235","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07235","snapshot_observed_at":"2026-06-29T13:43:28.625652Z","title":"Multi-step visual reasoning with visual tokens scaling and verification","venue":null,"work_id":"19cacd40-1252-4b37-8c9b-b7006ca05a21","year":2025},"citing_paper":{"arxiv_id":"2604.11025","last_updated":"2026-08-02T20:03:04Z","snapshot_observed_at":"2026-08-06T23:24:25.912298Z","submitted_at":"2026-04-13T05:49:04Z","title":"Test-time Scaling over Perception: Resolving the Grounding Paradox in Thinking with Images","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:11.785469Z"},"links":{"cited_paper":"/paper/2506.07235","citing_paper":"/paper/2604.11025"},"observation_digest":"sha256:cb2c0ea18b64403f4f640f8fa7aecf12d7764bea84fd617e915fca458cd22596","observation_id":"d546229b-d332-4831-9195-e3e3a43148fb","resolution":{"observed_at":"2026-05-11T08:26:01.651378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07235","snapshot_observed_at":"2026-08-04T05:31:41.386191Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11025","last_updated":"2026-08-02T20:03:04Z","snapshot_observed_at":"2026-08-06T23:24:25.912298Z","submitted_at":"2026-04-13T05:49:04Z","title":"Test-time Scaling over Perception: Resolving the Grounding Paradox in Thinking with Images","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T05:31:41.386191Z"},"links":{"cited_paper":"/paper/2506.07235","citing_paper":"/paper/2604.11025"},"observation_digest":"sha256:14938697c41adfa21848c30cc1ac46f772ebf8280fe87f40dd10d162754839c6","observation_id":"ab9dbc9c-ef0d-4135-bed8-94aa1b062247","resolution":{"observed_at":"2026-08-04T05:31:41.386191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"cited_work":{"arxiv_id":"2506.07235","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07235","snapshot_observed_at":"2026-06-29T13:43:28.625652Z","title":"Multi-step visual reasoning with visual tokens scaling and verification","venue":null,"work_id":"19cacd40-1252-4b37-8c9b-b7006ca05a21","year":2025},"citing_paper":{"arxiv_id":"2605.22177","last_updated":"2026-05-21T08:47:49Z","snapshot_observed_at":"2026-08-02T13:10:19.838403Z","submitted_at":"2026-05-21T08:47:49Z","title":"Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T07:51:13.362986Z"},"links":{"cited_paper":"/paper/2506.07235","citing_paper":"/paper/2605.22177"},"observation_digest":"sha256:c19b414c47df460f2f98350ebe9e44f57f9ea2b9af8b887d77e987e0857d7220","observation_id":"fee230e5-cb3d-4ff1-923f-61f1c48c44b0","resolution":{"observed_at":"2026-05-22T07:51:15.425338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"cited_work":{"arxiv_id":"2506.07235","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07235","snapshot_observed_at":"2026-06-29T13:43:28.625652Z","title":"Multi-step visual reasoning with visual tokens scaling and verification","venue":null,"work_id":"19cacd40-1252-4b37-8c9b-b7006ca05a21","year":2025},"citing_paper":{"arxiv_id":"2605.27959","last_updated":"2026-05-28T03:13:45Z","snapshot_observed_at":"2026-07-06T23:37:36.244456Z","submitted_at":"2026-05-27T04:52:42Z","title":"ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T13:41:44.049230Z"},"links":{"cited_paper":"/paper/2506.07235","citing_paper":"/paper/2605.27959"},"observation_digest":"sha256:67b24ab89581111f9377e5eaeaebc09da92b9c6df4cdf3c25687c4d639e0b6b4","observation_id":"37134517-1422-4099-86b4-023ea435cf36","resolution":{"observed_at":"2026-06-29T13:43:28.627224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07235","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2506.07235 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":164,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2506.07235","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:606e8caf813bf1c899313c9db1b59601fbe1c52b909289cd6188bfa706bc4d99","observation_id":"e1a2eaa2-1aba-4f20-8b48-d2dcdff3366a","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07235/citation-record","integrity":"/paper/2506.07235/integrity","json":"/paper/2506.07235/citation-record.json","paper":"/paper/2506.07235"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.197609Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":"cec44510-f12e-4609-bf04-fc70a8ca7a2c","year":2025},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.587797Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:19f5cacd2c046fe212a597f98eeb1f3c99035cf1be439c69352ab76e6eda1586","observation_id":"26949dd0-946c-4b20-8aae-73a130af3245","resolution":{"observed_at":"2026-08-07T05:45:31.201843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.184660Z","title":"V∗: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":"e1e5bb65-d334-459c-86e9-5be3bf94689c","year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.591770Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:8cc2a1894abb1e1b6e6be20af7dce50f15ec420982c2cf95186ded70c229e5e8","observation_id":"252017fe-5670-4cb6-b23d-e17e2c40e8b6","resolution":{"observed_at":"2026-08-07T05:45:31.188988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:30.595949Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.595949Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:d917d34f09cd6082034e627d948ac153628084401aa0ebdaff1210bf29deee0f","observation_id":"e674edb9-6e54-4a7f-aa85-33d81f32411a","resolution":{"observed_at":"2026-08-07T05:45:30.595949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-07T05:45:30.600959Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.600959Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:a3b0afe9619258b862d33734e2911fc269e3664c45b84a8c6061283b32666ab6","observation_id":"e5b51c26-c286-46df-9016-544557ae8b24","resolution":{"observed_at":"2026-08-07T05:45:30.600959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16999","last_updated":"2024-11-04T05:50:56Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:59:23Z","title":"Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16999","snapshot_observed_at":"2026-08-07T05:45:30.605338Z","title":"Visual cot: Unleashing chain-of-thought reasoning in multi-modal language models.arXiv preprint arXiv:2403.16999, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.605338Z"},"links":{"cited_paper":"/paper/2403.16999","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:9fcb3c144677c670f398b4e56818a95f63ba557da0e5223dddd9c6076e2220cd","observation_id":"bbb19b7a-cbac-4017-9c6e-430cd949d879","resolution":{"observed_at":"2026-08-07T05:45:30.605338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-07T05:45:30.610059Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic.arXiv preprint arXiv:2306.15195, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.610059Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:2ba9cf2f1dd91637fe1125232ae48336fae50b6fa20f7813c9cacaece4003d1a","observation_id":"52e12acf-5b2a-4255-8ca5-94afd5e420d3","resolution":{"observed_at":"2026-08-07T05:45:30.610059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.163933Z","title":"Visual program distillation: Distilling tools and programmatic reasoning into vision-language models","venue":null,"work_id":"275ec3cf-a1b6-4cc6-9e6a-d9b2df120f45","year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.615181Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:4c227ae25f4252a845e449c0d27763a472e5f0b2b5b6fabf24f2705bcbc5cbef","observation_id":"5d8a4253-37a2-4eec-abcf-5c91400e7576","resolution":{"observed_at":"2026-08-07T05:45:31.168232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:30.619311Z","title":"Visual programming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.619311Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:646c57afd439c4546f857da81f8d84b0a4f474290f09f8ae449f469992471801","observation_id":"cbcf874c-d05b-42ec-a1f6-e7368d67ad0b","resolution":{"observed_at":"2026-08-07T05:45:30.619311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.141669Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":"c18d65f7-a84e-4dd6-ac4d-9cd8dff8a607","year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.623036Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:d290619b188bbafd8887ae22d729acbd05f8dfdc87aca0b05eaac4a97e5329f9","observation_id":"9b9772bb-683c-4563-8847-1e8b248f6754","resolution":{"observed_at":"2026-08-07T05:45:31.146028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:30.627374Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.627374Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:c89efaba4be22a752e309476d2234ee69d0e7b03fd59291fbae497c4396990e5","observation_id":"92032de7-d6d7-48c5-9a3f-a5cf9317df0b","resolution":{"observed_at":"2026-08-07T05:45:30.627374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-07T05:45:30.631557Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v.arXiv preprint arXiv:2310.11441, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.631557Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:07df02b9d74c45f47c1ca4db7ed5c493b080e682f0b01447ce1f5b221ea9504a","observation_id":"b523a58f-2eef-46ee-b336-3950e403d8e8","resolution":{"observed_at":"2026-08-07T05:45:30.631557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12058","last_updated":"2024-02-19T11:23:53Z","snapshot_observed_at":"2026-07-06T17:32:10.828230Z","submitted_at":"2024-02-19T11:23:53Z","title":"Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12058","snapshot_observed_at":"2026-08-07T05:45:30.635922Z","title":"Scaffolding coordinates to promote vision-language coordination in large multi-modal models.arXiv preprint arXiv:2402.12058, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.635922Z"},"links":{"cited_paper":"/paper/2402.12058","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:5ab4823cfc694138aee26c3141c3f1f02063c785accad2b2d6922bc949f8657d","observation_id":"bf3df506-9ebc-4103-a789-956e840cebd0","resolution":{"observed_at":"2026-08-07T05:45:30.635922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-07T05:45:30.640388Z","title":"Mm-react: Prompting chatgpt for multimodal reasoning and action","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.640388Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:9b64edaf17141c3cde26f373e2e59678af633536ad693be2fdeb16d51fb30669","observation_id":"dcf6d6da-1844-4d90-a1f5-fa4898a2e6f5","resolution":{"observed_at":"2026-08-07T05:45:30.640388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:30.644103Z","title":"Making language models better reasoners with step-aware verifier","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.644103Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:d0b93178acfffaec96b31cc044151b761b16891745615fc1501f6abf99aeea8c","observation_id":"fc168fb3-3060-4879-b51d-a94c1a8661d8","resolution":{"observed_at":"2026-08-07T05:45:30.644103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:30.648369Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.648369Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:11f53cca8516d032d9f90030f5c8d832688e22d0db62453893e370966b869a3c","observation_id":"cb1f1667-6ae4-482e-a7ad-06dfc7a1262a","resolution":{"observed_at":"2026-08-07T05:45:30.648369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.105905Z","title":"Solving math word problems via cooperative reasoning induced language models","venue":null,"work_id":"a34c2020-e7d4-4f61-9314-57677845da7c","year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.652126Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:e093d47498baa3551f767e37614cdde923a1e9f5c8e80b6dfdb1a646475a6555","observation_id":"3e4fe20d-b57c-481a-b5cd-c493fd0e6d42","resolution":{"observed_at":"2026-08-07T05:45:31.109578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10080","last_updated":"2023-10-16T05:21:50Z","snapshot_observed_at":"2026-07-31T13:07:40.008796Z","submitted_at":"2023-10-16T05:21:50Z","title":"Let's reward step by step: Step-Level reward model as the Navigators for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10080","snapshot_observed_at":"2026-08-07T05:45:30.655336Z","title":"Let’s reward step by step: Step-level reward model as the navigators for reasoning.arXiv preprint arXiv:2310.10080, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.655336Z"},"links":{"cited_paper":"/paper/2310.10080","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:1ac7f3537cd89084b7a0d48bc10fc3941bbf236f82e3e9f05714731be8d6d1cb","observation_id":"fb622090-c761-4f60-8374-09194f456762","resolution":{"observed_at":"2026-08-07T05:45:30.655336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-07T05:45:30.658831Z","title":"Math-shepherd: A label-free step-by-step verifier for llms in mathematical reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.658831Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:e6b995a8413d5b0ba5a31093b120cb6cf8e5eb5111ad3c420c475a016230910f","observation_id":"2e143f65-c3c8-497e-892e-f6efc4614f71","resolution":{"observed_at":"2026-08-07T05:45:30.658831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T05:45:30.662617Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.662617Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:72be28fdd8bbdaaa1f4c06f46d8cbc6b2e5118957556b03270f2afdee8699737","observation_id":"68ac5975-e95e-4064-b93e-b95e536655c7","resolution":{"observed_at":"2026-08-07T05:45:30.662617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.093747Z","title":"Rlcd: Reinforcement learning from contrastive distillation for lm alignment","venue":null,"work_id":"d4036af0-db0d-49e1-86e2-2e20349f0e38","year":null},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.666869Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:68b606eeb0115e5e0b82c8d7c0a6cb67b1f1157c978aa784560445b202afb8a1","observation_id":"184ebd8e-b7e4-47db-80de-756321b7cf7b","resolution":{"observed_at":"2026-08-07T05:45:31.097704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.080991Z","title":"Pretraining language models with human preferences","venue":null,"work_id":"675dabf2-ac6e-47ba-9d01-1448454a6f9d","year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.671380Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:54f13681041462368dfb7ca3f4bf8f7d5129301d90df9d58112115a70b38d65d","observation_id":"3ba739d5-16d2-4232-bc94-8f028c22e319","resolution":{"observed_at":"2026-08-07T05:45:31.084696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10047","last_updated":"2023-10-16T04:11:19Z","snapshot_observed_at":"2026-07-06T16:33:30.170449Z","submitted_at":"2023-10-16T04:11:19Z","title":"Improving Large Language Model Fine-tuning for Solving Math Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10047","snapshot_observed_at":"2026-08-07T05:45:30.675404Z","title":"Improving large language model fine-tuning for solving math problems.arXiv preprint arXiv:2310.10047, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.675404Z"},"links":{"cited_paper":"/paper/2310.10047","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:6b51d3f8b9ac4399a62d0ddcfda97cba4c911e21e00da13d2aca4160fecb008c","observation_id":"cdee5b0e-b45c-4eef-b8b3-e02f34ede260","resolution":{"observed_at":"2026-08-07T05:45:30.675404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06457","last_updated":"2024-08-14T02:41:48Z","snapshot_observed_at":"2026-07-06T17:28:02.037844Z","submitted_at":"2024-02-09T15:02:56Z","title":"V-STaR: Training Verifiers for Self-Taught Reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06457","snapshot_observed_at":"2026-08-07T05:45:30.679605Z","title":"V-star: Training verifiers for self-taught reasoners.arXiv preprint arXiv:2402.06457, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.679605Z"},"links":{"cited_paper":"/paper/2402.06457","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:522eccfd1108fe582159ff05ca13e8f70f1cbed4d316b2af6d8844581940fbd0","observation_id":"b221ca03-9306-44e2-b182-2b87ba767138","resolution":{"observed_at":"2026-08-07T05:45:30.679605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02392","last_updated":"2025-02-27T22:10:16Z","snapshot_observed_at":"2026-08-02T09:51:41.216056Z","submitted_at":"2024-09-04T02:41:04Z","title":"Building Math Agents with Multi-Turn Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02392","snapshot_observed_at":"2026-08-07T05:45:30.683409Z","title":"Building math agents with multi-turn iterative preference learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.683409Z"},"links":{"cited_paper":"/paper/2409.02392","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:363da192103d2db80f1cf7dee4528c2ef882e1d8eb615fa80855c32ead94110b","observation_id":"0e2ad5c0-c823-4ec9-b278-869e749f1dc5","resolution":{"observed_at":"2026-08-07T05:45:30.683409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T05:45:30.687744Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.687744Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:3b74f6f3b3a0266a8e974e665180e3a1ec438339fb85a6731375748cb2aef9d1","observation_id":"4bde0720-d8c2-4b59-923e-cfb12b1e46bc","resolution":{"observed_at":"2026-08-07T05:45:30.687744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T05:45:30.691615Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.691615Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:0e912f05735e23f8768f5e70bfbfa0a3d08d25c8e60f320f7d72a69267c9c55d","observation_id":"7a1641a5-f9cd-41d4-b1f7-03d615ea423b","resolution":{"observed_at":"2026-08-07T05:45:30.691615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T05:45:30.694953Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.694953Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:b28d7bd782a1e7a434083f36a57584b357455a5d94edb87816510ac9fe8d6a0e","observation_id":"5afb27e4-9bc5-454f-a275-f37192943a9f","resolution":{"observed_at":"2026-08-07T05:45:30.694953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T05:45:30.698822Z","title":"Are we on the right way for evaluating large vision-language models?arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.698822Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:a6519fdde2bf80794192a4a9322ad7f388d37fcd8cc21e8d7129d3e56d58a86f","observation_id":"f957249a-e9a8-470d-837c-08b495156d34","resolution":{"observed_at":"2026-08-07T05:45:30.698822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T05:45:30.702326Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.702326Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:abcf499553b15faaa2119fb6ec2a8a30f0ec8846c4a4d5314a5b06673be87fcf","observation_id":"459c0db6-b89b-4b85-948e-7185cb7681f2","resolution":{"observed_at":"2026-08-07T05:45:30.702326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-08T00:55:20.148284Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18072","snapshot_observed_at":"2026-08-07T05:45:30.706182Z","title":"Mmfactory: A universal solution search engine for vision-language tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.706182Z"},"links":{"cited_paper":"/paper/2412.18072","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:3ae2c44ecb1f1b8bf137c9fe9b7ec946ade4a589b4dd5973d0b5e83c16abdfd3","observation_id":"65f1e13d-11f2-4578-9337-f6ffec9cf394","resolution":{"observed_at":"2026-08-07T05:45:30.706182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:30.709569Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.709569Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:fb6c06ce945232b700788541317cb8a04e1abde8cbc57923a3735b581cbf5515","observation_id":"0d54322b-c595-4edf-bbea-a1c08399fd84","resolution":{"observed_at":"2026-08-07T05:45:30.709569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:30.712751Z","title":"Mathematical analysis of machine learning algorithms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.712751Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:cf6c80f01de9445c7448aa5ea3aec9ca219833b01909a5459b02f1a0e9a9f9f8","observation_id":"2c26b258-5e7b-4a1b-8917-bd377116f215","resolution":{"observed_at":"2026-08-07T05:45:30.712751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.052500Z","title":"Probability: theory and examples, volume 49","venue":null,"work_id":"c7f4213e-0b8c-43e3-abdc-503c1aeafda3","year":2019},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.716671Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:32952258516940767c622465899ccc1e2796560343891150472e24697eb96940","observation_id":"1fbb9cad-42c1-4b29-9652-ca3470c1e0c0","resolution":{"observed_at":"2026-08-07T05:45:31.056031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.039370Z","title":null,"venue":null,"work_id":"b5ae90ab-1915-4174-b1ed-bd2c9828291d","year":null},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.720489Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:c7a77d575386a043ac7573575b0bb5bf0d99886d375f55e1d0c208f65575c6db","observation_id":"cd360758-56b3-4fd2-a23a-6f26d30c2e42","resolution":{"observed_at":"2026-08-07T05:45:31.043147Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.023548Z","title":"If in the last definition,= is replaced by ≤ or ≥, then Xn is said to be a supermartingale or submartingale, respectively","venue":null,"work_id":"cd2cf942-f1e5-49ea-b9e8-7f37da8a2fc3","year":null},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.723796Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:55fa93219b15e570943b4ea465feeb7531ad5051f2c03c7e807aa774e5fbb5b4","observation_id":"44af0ef1-f44d-4789-b130-ec622744a4b5","resolution":{"observed_at":"2026-08-07T05:45:31.028048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.012427Z","title":null,"venue":null,"work_id":"6c9a5635-7615-4e61-8dc2-266319901896","year":null},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.727319Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:bfba14c383561abc2439c214c621fe964532e662709444285efdad6610fd4fb9","observation_id":"5c9b9790-6d33-471b-99e3-7bde2da9912d","resolution":{"observed_at":"2026-08-07T05:45:31.015628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.000820Z","title":null,"venue":null,"work_id":"beccf2d4-1c26-4343-acbd-e1e830bcb8c6","year":null},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.731168Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:3fec97cd4a1222f4b6e3fffd2d98c0fc4433e568daa8773bb647a924da71e1ef","observation_id":"8af02ebc-195d-427a-b337-ca2f411af61f","resolution":{"observed_at":"2026-08-07T05:45:31.004160Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:30.986603Z","title":"log V ˆϕSDPO (th | sh) Vϕ0 (th | sh) +log V ˆϕSDPO (ah | th) Vϕ0 (ah | th) # . Observe that condition (ii) implies that Eth∼R ˆθSFT(·|sh)","venue":null,"work_id":"8e52bcdd-1ae3-4e34-b0d0-73d7eb1b3c01","year":null},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.735139Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:4ee466dd71c9ffdbeecafd537c2cdd2e015143a1739ceffcbddab56e1c2df158","observation_id":"5c19b0e8-7570-4206-92b9-a2fd8c9ccfca","resolution":{"observed_at":"2026-08-07T05:45:30.992308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:36:25.549695Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":27,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 8 inbound Pith citation observations for arXiv:2506.07235."}