{"as_of":"2026-08-07T18:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:311ad90133bb3a1c97b323f69cb61414a664b330c8471354be19baf0200af2b4","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:40:13.423620Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:24:39.864757Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T13:23:28.446166Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10128","snapshot_observed_at":"2026-08-05T13:24:39.864757Z","title":"Vicrit: A verifiable reinforcement learning proxy task for visual perception in vlms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-06T10:51:25.025627Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.864757Z"},"links":{"cited_paper":"/paper/2506.10128","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:3bdd6e7e3414665e8df9c762c846a862d4e967917e46b664e4765b84f9aa190f","observation_id":"9baea096-df66-4209-84a4-cc84c740d227","resolution":{"observed_at":"2026-08-05T13:24:39.864757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10128","snapshot_observed_at":"2026-08-04T16:07:42.673501Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":182,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:42.673501Z"},"links":{"cited_paper":"/paper/2506.10128","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:1a8d5961d6d61d6dcd40d18bc7f0469c9f0f2f9c1521e4cfa3ca996580118c45","observation_id":"c1007e17-2e9d-42c4-b6b4-27490a6c1045","resolution":{"observed_at":"2026-08-04T16:07:42.673501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"cited_work":{"arxiv_id":"2506.10128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10128","snapshot_observed_at":"2026-06-29T13:23:28.446166Z","title":"Vicrit: A verifiable reinforcement learning proxy task for visual perception in VLMs.ArXiv preprint, abs/2506.10128, 2025","venue":null,"work_id":"0114027b-29c6-4039-9821-cd99a3693e3a","year":2025},"citing_paper":{"arxiv_id":"2605.28023","last_updated":"2026-05-27T06:27:04Z","snapshot_observed_at":"2026-08-02T21:20:31.316522Z","submitted_at":"2026-05-27T06:27:04Z","title":"VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T13:13:57.599970Z"},"links":{"cited_paper":"/paper/2506.10128","citing_paper":"/paper/2605.28023"},"observation_digest":"sha256:4fc3ef012752991cee5220957a885bf18f7169229c657b8196d6c851bdff431e","observation_id":"3997fe41-a744-4773-a272-8bbe15188270","resolution":{"observed_at":"2026-06-29T13:23:28.447802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10128","snapshot_observed_at":"2026-07-12T11:31:14.532101Z","title":"Vicrit: A verifiable reinforcement learning proxy task for visual perception in vlms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02551","last_updated":"2026-06-26T16:05:57Z","snapshot_observed_at":"2026-08-06T08:59:01.715141Z","submitted_at":"2026-06-26T16:05:57Z","title":"DELTAVID: Enhancing Fine-Grained Spatiotemporal Perception with Cross-Video Differences","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T11:31:14.532101Z"},"links":{"cited_paper":"/paper/2506.10128","citing_paper":"/paper/2607.02551"},"observation_digest":"sha256:f6580cd3934ad376c0f2d455cf1fc5695430d246155ddcbb728b15e77784881e","observation_id":"f3d4dad6-963e-43b0-a461-ffe4a4862636","resolution":{"observed_at":"2026-07-12T11:31:14.532101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10128","snapshot_observed_at":"2026-08-01T11:47:27.425487Z","title":"ViCrit: A verifiable reinforcement learning proxy task for visual perception in VLMs.arXiv preprint arXiv:2506.10128, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-06T04:55:07.559078Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:27.425487Z"},"links":{"cited_paper":"/paper/2506.10128","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:9085b38501ec4422db9976ed29485caf1d1c47c819e51dc2c8b6c4c5fe7536de","observation_id":"5d28c6f6-f5b3-443a-99e4-67578dd105ef","resolution":{"observed_at":"2026-08-01T11:47:27.425487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.10128/citation-record","integrity":"/paper/2506.10128/integrity","json":"/paper/2506.10128/citation-record.json","paper":"/paper/2506.10128"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:17.966833Z","title":"Vqa: Visual question answering","venue":null,"work_id":"b05ab0e4-fae5-4b9d-bad5-111d93f8a84b","year":2015},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:06.644920Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:1ec386780a2bd7c0b8923340a41f0b5ce02dd90d6ceaa049f32265be62dea949","observation_id":"529e2bc9-2351-42ea-a4c2-476f671be824","resolution":{"observed_at":"2026-08-07T04:40:18.085418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07461","last_updated":"2024-11-12T00:52:52Z","snapshot_observed_at":"2026-07-06T19:48:49.553384Z","submitted_at":"2024-11-12T00:52:52Z","title":"BLIP3-KALE: Knowledge Augmented Large-Scale Dense Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07461","snapshot_observed_at":"2026-08-07T04:40:06.691389Z","title":"Blip3-kale: Knowledge augmented large-scale dense captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:06.691389Z"},"links":{"cited_paper":"/paper/2411.07461","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:441b142f3a2f12c526d7ea133d91b69efd86e4594222d8c8c8edfdcf1b5088f6","observation_id":"b187ba96-3bfb-41b1-907c-2d4870c92b3a","resolution":{"observed_at":"2026-08-07T04:40:06.691389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T04:40:06.769409Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:06.769409Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:fb84a82d9a49e1a5ec7dc70472a360a729ed881f9da16ba79bbe0dfae87dbb1b","observation_id":"295ab65c-4f3b-437d-a1cc-28902ee60831","resolution":{"observed_at":"2026-08-07T04:40:06.769409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:06.852093Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:06.852093Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:fc928931d6ab8c29854c1c03155d91b88724173deedc229ac55daeac47019c2f","observation_id":"0b6f18c6-6c7c-4c55-8a25-776297f6b43e","resolution":{"observed_at":"2026-08-07T04:40:06.852093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:06.950928Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:06.950928Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:271b1ab73d2be24fef899291aebfc29832fb899f86c48245b169b0b798848ace","observation_id":"61c4cd51-1079-4709-8a57-8f561729cab0","resolution":{"observed_at":"2026-08-07T04:40:06.950928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:17.612452Z","title":"R1-v: Reinforcing super generalization ability in vision language models with less than \\ 3","venue":null,"work_id":"6217b4bd-ca22-4103-ae13-b28f5c0b3405","year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.055773Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:fc51ca599e81d01b319b66dffebbc1e5e98151159490f1aadfbc5df627507748","observation_id":"e148fb5c-6010-4a9d-ac4b-2882ddc5bda8","resolution":{"observed_at":"2026-08-07T04:40:17.814290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:17.326066Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":"d119956b-16c6-4d46-916d-44ccd38ffc9a","year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.167181Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:cd2302c48d9d7db234bb63a4f3c62e26e69bcffb46566609830963dae6d697d2","observation_id":"b165f18e-9ec9-4319-b4ae-01800a07b4a2","resolution":{"observed_at":"2026-08-07T04:40:17.479967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T04:40:07.282039Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.282039Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:af6e6ca864001b672e01cfc815cb6105ba823e5902682bba60e9964856a9a6d5","observation_id":"16c87061-4b08-42b8-9650-ddbf4263dfbf","resolution":{"observed_at":"2026-08-07T04:40:07.282039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T04:40:07.352289Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.352289Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:92fb7cc6c91d103619125fded9759abb3346478d6dce3e9159a25d241d8c80fe","observation_id":"4278674d-e3d4-47ce-97c4-9aa33a023f0a","resolution":{"observed_at":"2026-08-07T04:40:07.352289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:07.423678Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.423678Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:69f0a6ac2145774b1aa2844c5f93f2c91d6bae6343e55b37ef9f80a67a2e61ec","observation_id":"0f547de1-4259-4664-ae43-04fc56b9f4fd","resolution":{"observed_at":"2026-08-07T04:40:07.423678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T04:40:07.530509Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.530509Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:718b37c6edbae25ff459a2bc6479e16f278c2183e9c4cceb8c0a8307b2da191a","observation_id":"ecfc56bd-d7c3-441d-89cc-0496c50d2888","resolution":{"observed_at":"2026-08-07T04:40:07.530509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-07T04:40:07.610397Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.610397Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:e41db62c7fff062723b22c8778d180818d740f402d7f8faeafc094a02dbf3fe1","observation_id":"dbfc9be6-f678-4ffe-b456-45023e87f0ef","resolution":{"observed_at":"2026-08-07T04:40:07.610397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:17.080227Z","title":"Enhancing large vision language models with self-training on image comprehension","venue":null,"work_id":"f6445dc4-3345-4d8c-8f56-e6439d467145","year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.695543Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:41eba342edf8d851cdbd397c2cfead13fd8602b7a9b0f3efbdaab02d99e0842c","observation_id":"6d3f5767-fb1f-4614-8730-bdcd5fdd560e","resolution":{"observed_at":"2026-08-07T04:40:17.196649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-07T04:40:07.764980Z","title":"Openvlthinker: An early exploration to complex vision-language reasoning via iterative self-improvement, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.764980Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:9ab6b19b1d5aaff85a731aa7c981209858231e08bb602a7ecda4b8ff184d8c7c","observation_id":"c9ae7c9d-2336-4ce8-a60a-05d82a6a63b4","resolution":{"observed_at":"2026-08-07T04:40:07.764980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:16.813832Z","title":"Virtex: Learning visual representations from textual annotations","venue":null,"work_id":"f90c6982-6ed9-45f4-853c-bf0b92718bdf","year":2021},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.899067Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:395e30755538b96b97e8357ee9b0b3ae2b3775f120fdde50efa5d6a424230e68","observation_id":"0af995ae-2b43-48e2-804f-57696d41c56e","resolution":{"observed_at":"2026-08-07T04:40:16.922173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-07-06T20:18:53.977126Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-08-07T04:40:07.980626Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.980626Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:324c6a46373e8c07d53497195b1b6bd3a3a98f65b29c46f961aecf5ecd0eb26d","observation_id":"22bcc49e-abe1-4239-a509-8b6c2363d5ac","resolution":{"observed_at":"2026-08-07T04:40:07.980626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T04:40:08.094721Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.094721Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:381b99af6cd7a77b70cca1b9a359604d4b307630161ce03704cbafc31822e01b","observation_id":"57b69c66-5c8e-451d-b509-23db3c4f7fb6","resolution":{"observed_at":"2026-08-07T04:40:08.094721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T04:40:08.211304Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.211304Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:4e0cdb828db7682d539a7fc974ca28e4b2920ecff1b60ce5b384bda14be7aff0","observation_id":"9024f7a6-09d5-44b8-a2c3-b8d1e33ac7af","resolution":{"observed_at":"2026-08-07T04:40:08.211304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:16.594654Z","title":"Measuring mathematical problem solving with the math dataset, 2021","venue":null,"work_id":"f0ff8684-797e-4b72-95b9-ef354da0575c","year":2021},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.309188Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:3032f5c2bd45602196ea9d225dfe1a4f2a0a4b0c51c61232efbf36b8d57a7758","observation_id":"4a3b41b7-8ec1-4758-af92-85adf205d4fd","resolution":{"observed_at":"2026-08-07T04:40:16.696254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-07-06T20:49:27.466064Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T04:40:08.388160Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.388160Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:0d7b9bda73b4dff09f643051c54feed7ff80c53d13dfcb5a21a937b74ac4b096","observation_id":"a280af47-a3c9-45c7-aff0-7c06e02d297f","resolution":{"observed_at":"2026-08-07T04:40:08.388160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:08.503288Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.503288Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:aa6aec712ad767fb903016dc40c730a6995f3386717e4039b34ff8833abc4df1","observation_id":"d93473b7-9c98-41ff-b8f5-0e2bc50c2d90","resolution":{"observed_at":"2026-08-07T04:40:08.503288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T04:40:08.599239Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.599239Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:3cd5618bd2f02579bf2892201e43423ab3ccc0869a96e6916f06eb061a43407e","observation_id":"ff924b2c-8786-46bf-8965-ee35e28c2680","resolution":{"observed_at":"2026-08-07T04:40:08.599239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T04:40:08.696397Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.696397Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:29de4685abdcdc0e190522beee399abe5c8c14cf122ce4f766fdd5a3b5930471","observation_id":"55ce0b4f-f7f3-49ef-b31a-191a7cb46f55","resolution":{"observed_at":"2026-08-07T04:40:08.696397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07103","last_updated":"2024-10-03T13:55:08Z","snapshot_observed_at":"2026-07-06T17:58:21.138881Z","submitted_at":"2024-04-10T15:41:53Z","title":"Graph Chain-of-Thought: Augmenting Large Language Models by Reasoning on Graphs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07103","snapshot_observed_at":"2026-08-07T04:40:08.808188Z","title":"Graph chain-of-thought: Augmenting large language models by reasoning on graphs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.808188Z"},"links":{"cited_paper":"/paper/2404.07103","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:0a163a501a8c00daabd20d55979fdf6af60e5537cd61caa1dfd32b54fd122a2a","observation_id":"01e4d8dd-532b-4c51-b697-43c1f4837be4","resolution":{"observed_at":"2026-08-07T04:40:08.808188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:08.912895Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.912895Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:14241288fcd8cd94fffc2eb48232e76a8ce9adad5f95953af31e0885aa98161b","observation_id":"4fcdadb3-48e7-4df2-a402-d1309441b60a","resolution":{"observed_at":"2026-08-07T04:40:08.912895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:08.994633Z","title":"Mawps: A math word problem repository","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.994633Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:c0e8a1150f344f7ae9989202f393bf343c24f725a8ce52dc2d5c0e004854ac6e","observation_id":"e728da3d-5c57-40c5-aa2b-ff39f97320fe","resolution":{"observed_at":"2026-08-07T04:40:08.994633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T04:40:09.073387Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:09.073387Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:356e1b753a7883f97c98708911db253146220873c6f6a34f292f59e52ff18eca","observation_id":"30fd708f-6fe5-4f35-a70a-d1d0c37805a5","resolution":{"observed_at":"2026-08-07T04:40:09.073387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:16.323144Z","title":"Multimodal foundation models: From specialists to general-purpose assistants","venue":null,"work_id":"b5e0d72b-c1dc-4db8-9cd7-ff31247be4ed","year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:09.168271Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:e63bd9567c79d2865565bd5a948c9586ca55da7737696f4f3e59295674ef606d","observation_id":"38288d0a-69ec-4b66-b564-7c40f6460735","resolution":{"observed_at":"2026-08-07T04:40:16.437363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16072","last_updated":"2025-04-22T17:51:41Z","snapshot_observed_at":"2026-08-07T16:00:09.944765Z","submitted_at":"2025-04-22T17:51:41Z","title":"Describe Anything: Detailed Localized Image and Video Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16072","snapshot_observed_at":"2026-08-07T04:40:09.244875Z","title":"Describe anything: Detailed localized image and video captioning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:09.244875Z"},"links":{"cited_paper":"/paper/2504.16072","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:ef6a7abd64dd0b8f123367c6ae175664986176b3ab30f4e90c688822540be374","observation_id":"9f99e18b-c7a3-42f5-8ecf-e7e4d906f080","resolution":{"observed_at":"2026-08-07T04:40:09.244875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T04:40:09.313417Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:09.313417Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:762b43c89dcdc0013d0d2c7a483b46643bfb3dd8ff2ef835651713890de0fff1","observation_id":"95ca5810-2016-4a10-94ba-bc9b988f8388","resolution":{"observed_at":"2026-08-07T04:40:09.313417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:09.436777Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:09.436777Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:b6f8592b4b77bdee5ec8ca6d8ab279919520873b5d4716fa032d671d6cbfa02b","observation_id":"41609576-8914-4c4a-8c88-98c69927a580","resolution":{"observed_at":"2026-08-07T04:40:09.436777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:16.052839Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"15c23f8a-516c-41a1-8021-cb51a0e8a26f","year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:09.523923Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:c62af38d9ee29b2b83e576a45eb36ab3fc093f0fc5cd8e2838d3e251a36dd63f","observation_id":"290e02e6-bfd3-4282-b57a-f67afa3e8367","resolution":{"observed_at":"2026-08-07T04:40:16.179830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:15.845720Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"80d5894f-f6a9-49ce-ad01-d18e6ab4569b","year":2022},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:09.582883Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:7a409e68942365ea3faf95facd117b9c3e38754eaf1e6c6dce91f73656131eb5","observation_id":"f4f3460a-ac9d-45af-b995-8b5b62531ca1","resolution":{"observed_at":"2026-08-07T04:40:15.949313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:09.661306Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:09.661306Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:8e499d7af8aa7318d6c3ac9993b1b6f2d63187ac95d67aeb2bb3faae8c44ade6","observation_id":"a16ab06f-44fb-40d8-819f-5b49a4350f77","resolution":{"observed_at":"2026-08-07T04:40:09.661306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00067","last_updated":"2019-09-04T10:43:20Z","snapshot_observed_at":"2026-08-07T00:54:00.522873Z","submitted_at":"2019-05-31T20:29:01Z","title":"OK-VQA: A Visual Question Answering Benchmark Requiring External Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00067","snapshot_observed_at":"2026-08-07T04:40:09.721963Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:09.721963Z"},"links":{"cited_paper":"/paper/1906.00067","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:678944d877bbab708e8e2ab8614217ef4d199dbe4c3b967ed31bfb34cbb91acb","observation_id":"f3d4d0d7-fb17-48da-bc52-bc06a535396e","resolution":{"observed_at":"2026-08-07T04:40:09.721963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-07-06T20:49:56.018809Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T04:40:09.920757Z","title":"Mm-eureka: Exploring visual aha moment with rule-based large-scale reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:09.920757Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:b862ec11cb13f7f977de5a270701d4e9a70ff341243178a008c365371c08210b","observation_id":"6bb0b974-fd24-4e7b-bed7-a382064bb313","resolution":{"observed_at":"2026-08-07T04:40:09.920757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12115","last_updated":"2025-05-29T23:07:34Z","snapshot_observed_at":"2026-08-07T18:11:26.038748Z","submitted_at":"2025-02-17T18:41:16Z","title":"SWE-Lancer: Can Frontier LLMs Earn $1 Million from Real-World Freelance Software Engineering?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12115","snapshot_observed_at":"2026-08-07T04:40:10.021002Z","title":"Swe-lancer: Can frontier llms earn \\ 1 million from real-world freelance software engineering? arXiv preprint arXiv:2502.12115, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.021002Z"},"links":{"cited_paper":"/paper/2502.12115","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:673b9942c5a85b44003c5648f5f7224d6a50ae15c47c7c812fe7927b174d451e","observation_id":"d39a454f-ee62-445b-b7b6-4257d893cb8e","resolution":{"observed_at":"2026-08-07T04:40:10.021002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T04:40:10.113399Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.113399Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:7e101613349479e8a043b83d02e6332ab641f76253c1e5d9a4ba548546dfc9e4","observation_id":"722d67f4-93c7-460a-a6be-ff80c6b107ed","resolution":{"observed_at":"2026-08-07T04:40:10.113399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19702","last_updated":"2025-05-26T08:54:14Z","snapshot_observed_at":"2026-08-07T14:05:35.534429Z","submitted_at":"2025-05-26T08:54:14Z","title":"Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19702","snapshot_observed_at":"2026-08-07T04:40:10.179618Z","title":"Point-rft: Improving multimodal reasoning with visually grounded reinforcement finetuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.179618Z"},"links":{"cited_paper":"/paper/2505.19702","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:8568382588b691a793946803a2c4ab68b73f6d1a5b0e1126bd121a8dd295f3c3","observation_id":"25071772-0c3a-415c-822f-7b225daad8ec","resolution":{"observed_at":"2026-08-07T04:40:10.179618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:15.602609Z","title":"American invitational mathematics examination (aime) 2024: Competition problems","venue":null,"work_id":"de4c9f79-5fcd-41d0-875b-eafda7c8d9b0","year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.250543Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:92ffaea92d84ec33c73da977a8840c99e6afb9cc206018be1d14462b8eafce4b","observation_id":"2adb2fad-fb06-4f7e-8be5-9b1f66733eff","resolution":{"observed_at":"2026-08-07T04:40:15.691239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:10.331609Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.331609Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:0b83188c79beed66208df41af610910800a35220417ff9065ff1ba721acc0eba","observation_id":"37a766c3-8881-48b5-811e-16d0fdcefe63","resolution":{"observed_at":"2026-08-07T04:40:10.331609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.07191","last_updated":"2021-04-15T06:11:12Z","snapshot_observed_at":"2026-08-07T13:11:17.300265Z","submitted_at":"2021-03-12T10:23:47Z","title":"Are NLP Models really able to Solve Simple Math Word Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.07191","snapshot_observed_at":"2026-08-07T04:40:10.409957Z","title":"Are nlp models really able to solve simple math word problems? arXiv preprint arXiv:2103.07191, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.409957Z"},"links":{"cited_paper":"/paper/2103.07191","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:7cd1c5a3d9cfa7c4cc7b43665736893de2af5f2e6de62dd249e5288985599938","observation_id":"1caae194-1900-484a-bbe1-021d5c4fa937","resolution":{"observed_at":"2026-08-07T04:40:10.409957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-07T04:40:10.484752Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.484752Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:2d691a1e88479abe6c7efec07f266ed644313bd68697a952ee24d82c14b1b2d9","observation_id":"daf7b12b-f92d-41f2-a761-5b29de60949c","resolution":{"observed_at":"2026-08-07T04:40:10.484752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:15.368246Z","title":"Connecting vision and language with localized narratives","venue":null,"work_id":"9ddec959-630c-45f6-90d8-32abe0abbaa9","year":2020},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.569209Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:4f8199973eba7d4b2e54e6415a96975548ccd20cf2237b8fb7053929994cf9ed","observation_id":"ff5c66e0-b5f7-4028-9bfd-dc9b592fb697","resolution":{"observed_at":"2026-08-07T04:40:15.460773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:10.655345Z","title":"Vision language models are blind","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.655345Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:5f9fe48974f75734c4a5adb4af4fce04a4dbff7412c6a9cfd46273eeadc74c8f","observation_id":"b8f3a763-69aa-4b6a-a1fc-332c2d1c65c5","resolution":{"observed_at":"2026-08-07T04:40:10.655345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-04T05:57:07.163978Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-08-07T04:40:10.721223Z","title":"Object hallucination in image captioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.721223Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:2786d3feaf5fb2d43a1e427dc6c1e6da6410a5aca60d50ec31e91cc6b88223b7","observation_id":"6e65327d-6dad-4ae9-a7e2-549795a65948","resolution":{"observed_at":"2026-08-07T04:40:10.721223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-07T04:40:10.790536Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.790536Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:38f3e61c7788ff06c919f2cc46dbb7c591a28b6aeb40e4b40e56ef431b2ce571","observation_id":"d6973e5d-3d08-4214-bbe4-a5764c3ead37","resolution":{"observed_at":"2026-08-07T04:40:10.790536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:15.170919Z","title":"Learning visual representations with caption annotations","venue":null,"work_id":"eb411523-a9fb-49d1-ad7d-7086a882f2a6","year":2020},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.860273Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:66f3eb0df2c50005d32e2c2f906354b04c089a2e481d152b61c2c2277784027a","observation_id":"5e318aa9-e996-4b3e-b39d-12ec4690f758","resolution":{"observed_at":"2026-08-07T04:40:15.227903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T04:40:10.915730Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.915730Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:7f2b241ce6da8f47d01820b8221fc6311ff97d0a526491d635502f77296b8d13","observation_id":"5d4ac2c6-bece-4c01-bdd7-b0b8913054f9","resolution":{"observed_at":"2026-08-07T04:40:10.915730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:11.020825Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.020825Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:364ddacdf9b9bde73594d5aebee322da5f6e8f3d493e3248f9aaca99bbbc692d","observation_id":"7de2822a-dbea-45c7-869b-77e795584691","resolution":{"observed_at":"2026-08-07T04:40:11.020825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-07T04:40:11.110047Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.110047Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:62007993c3e3fb61879cdba36b415df65c149605bd573d27a405f1889f55f71e","observation_id":"269f59d6-2c04-4850-a77f-cac1edfdf181","resolution":{"observed_at":"2026-08-07T04:40:11.110047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:11.186415Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.186415Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:9bdd578879cbe5a39ff5837d3cf3b7be9c62110d075ce801e2a33c782d48f1d9","observation_id":"60076ad4-8eca-49d0-9755-2c0751f93e70","resolution":{"observed_at":"2026-08-07T04:40:11.186415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:14.919347Z","title":"Image captioners are scalable vision learners too","venue":null,"work_id":"087e28b5-ff9d-40e3-b43b-eca9f76ed093","year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.255836Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:182de2ca9da175cce94d3632f291e541ec0251281dd282e5efe261b3b72e9a2b","observation_id":"4d1d6408-ca4f-4847-91fc-9ff115899846","resolution":{"observed_at":"2026-08-07T04:40:15.018460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-07T04:40:11.367240Z","title":"Solving math word problems with process-and outcome-based feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.367240Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:69bbc2b81763300152af797cd36657235cd8ff61c035276bf407d707f1ceb2d5","observation_id":"b64bb195-56a1-4555-9596-aaea9b217669","resolution":{"observed_at":"2026-08-07T04:40:11.367240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-07T04:40:11.443100Z","title":"Git: A generative image-to-text transformer for vision and language","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.443100Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:d20784b293f2c9cd84853b96fc46851a0bcdfe4958a7b7b49a428adf84bebfea","observation_id":"a3c4f7f1-599f-46c6-8676-c515b928c0cb","resolution":{"observed_at":"2026-08-07T04:40:11.443100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:11.511675Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.511675Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:6c8226dfa189dea05e9aa620ae264a5e1803588ff44d465186d2aa370ea18135","observation_id":"8964877a-7d06-4be7-a438-7545a15f4629","resolution":{"observed_at":"2026-08-07T04:40:11.511675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-07T04:40:11.584688Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.584688Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:bc377f002d25e97ca033adbf8e2fd503af3bd02749fe8350b12e6a065b662072","observation_id":"6b811447-8545-46ff-98c8-3544f21aa077","resolution":{"observed_at":"2026-08-07T04:40:11.584688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15973","last_updated":"2025-02-08T21:50:41Z","snapshot_observed_at":"2026-07-06T18:19:38.561528Z","submitted_at":"2024-05-24T23:09:27Z","title":"Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15973","snapshot_observed_at":"2026-08-07T04:40:11.660360Z","title":"Enhancing visual-language modality alignment in large vision language models via self-improvement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.660360Z"},"links":{"cited_paper":"/paper/2405.15973","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:4936f183da24fe395689194cd7e3fa762a826bb48369f58ff11ce2dd89630f35","observation_id":"677d734b-80d1-4bf2-b4ce-31d3dbac3d35","resolution":{"observed_at":"2026-08-07T04:40:11.660360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03704","last_updated":"2025-06-30T20:29:34Z","snapshot_observed_at":"2026-08-07T11:33:34.159217Z","submitted_at":"2024-12-04T20:35:07Z","title":"Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03704","snapshot_observed_at":"2026-08-07T04:40:11.741673Z","title":"Scaling inference-time search with vision value model for improved visual comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.741673Z"},"links":{"cited_paper":"/paper/2412.03704","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:9bf35c22838532a1d8fe461d9a1fd6bfa75861cf629f576d26ee8b661d9dd658","observation_id":"d0da67b2-01d5-4d05-a158-b71c70f17dfa","resolution":{"observed_at":"2026-08-07T04:40:11.741673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07934","last_updated":"2025-05-30T15:53:16Z","snapshot_observed_at":"2026-08-07T16:06:46.096701Z","submitted_at":"2025-04-10T17:49:05Z","title":"SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07934","snapshot_observed_at":"2026-08-07T04:40:11.821726Z","title":"Sota with less: Mcts-guided sample selection for data-efficient visual reasoning self-improvement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.821726Z"},"links":{"cited_paper":"/paper/2504.07934","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:d84603ac8df627bb3d6c7d8c3ae9bdb0dc9fe1880032c3887817c1fa77f73779","observation_id":"a9559091-c7ca-459c-8da7-146301ceae8d","resolution":{"observed_at":"2026-08-07T04:40:11.821726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T04:40:11.940289Z","title":"Le, Ed H","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.940289Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:cb1f7814447d4fc48cd4678e4801abc0284e775f190969f7988aac0f9d8cb8de","observation_id":"2110b634-0937-40a8-9cef-88c00df6502c","resolution":{"observed_at":"2026-08-07T04:40:11.940289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:14.673520Z","title":"Charxiv: Charting gaps in realistic chart understanding in multimodal llms","venue":null,"work_id":"6cacb6a2-e413-464e-80fc-c6e59334db35","year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.995421Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:3ef4660e9734cfd31480e01ef7207f029316074c2ebe4f2b84b96f956a323443","observation_id":"3b43b8ad-bc20-443f-a553-8b2bf2522a54","resolution":{"observed_at":"2026-08-07T04:40:14.800291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:12.078191Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.078191Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:7b33179439ba95dbaf5ca81e11365620412840121b26bfc18cbf87fa5285f223","observation_id":"3b1d654c-9cee-49bc-a702-9e6a175e7a8f","resolution":{"observed_at":"2026-08-07T04:40:12.078191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:14.406812Z","title":"Grit: A generative region-to-text transformer for object understanding","venue":null,"work_id":"3c4401e5-4f8c-4785-a669-abcfc7d05939","year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.170101Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:d6cd0f93cbe5d0361fc210393eea409bb62037462a1e45a982850273964e0704","observation_id":"54962dd3-54f6-4f1b-b9d8-8513fe06f20b","resolution":{"observed_at":"2026-08-07T04:40:14.545092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:14.190427Z","title":"Mind's eye of llms: Visualization-of-thought elicits spatial reasoning in large language models","venue":null,"work_id":"8b9a20f8-d69f-44d3-8070-bc905992e256","year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.229035Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:5d14c2ac67baac66a5d73bf81740bd2b38b7c9202c90c0c71212f1677085396b","observation_id":"ecbdf432-dae1-4225-80a3-8e3fafb23c0e","resolution":{"observed_at":"2026-08-07T04:40:14.273757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00451","last_updated":"2024-06-17T22:11:49Z","snapshot_observed_at":"2026-07-06T18:08:09.361079Z","submitted_at":"2024-05-01T11:10:24Z","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00451","snapshot_observed_at":"2026-08-07T04:40:12.319293Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.319293Z"},"links":{"cited_paper":"/paper/2405.00451","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:2a32dea8195a1575e24fdc4a903ff4249267ac6a05163bd67c6b064fa5f55600","observation_id":"52378c17-6432-4034-b1cb-652c1758abaf","resolution":{"observed_at":"2026-08-07T04:40:12.319293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02712","last_updated":"2025-03-04T00:49:07Z","snapshot_observed_at":"2026-08-06T04:32:16.849942Z","submitted_at":"2024-10-03T17:36:33Z","title":"LLaVA-Critic: Learning to Evaluate Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02712","snapshot_observed_at":"2026-08-07T04:40:12.386906Z","title":"Llava-critic: Learning to evaluate multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.386906Z"},"links":{"cited_paper":"/paper/2410.02712","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:a96b96d90477cfabb259d61167e00b0b1c0c4608e666cfcd598792d214d5585e","observation_id":"b15cf5c1-0f16-4079-9e14-187d98653191","resolution":{"observed_at":"2026-08-07T04:40:12.386906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-07T04:40:12.468494Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.468494Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:1bccc1be52bedb828c07095b53929d7458664ccf84c1f61afde47d26a34ff93d","observation_id":"8006c40d-0ba6-455c-9cb8-4c07c34460d3","resolution":{"observed_at":"2026-08-07T04:40:12.468494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08541","last_updated":"2024-08-14T17:43:25Z","snapshot_observed_at":"2026-08-04T18:22:59.333944Z","submitted_at":"2023-10-12T17:34:20Z","title":"Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08541","snapshot_observed_at":"2026-08-07T04:40:12.565375Z","title":"Idea2img: Iterative self-refinement with gpt-4v (ision) for automatic image design and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.565375Z"},"links":{"cited_paper":"/paper/2310.08541","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:3ba682b8a095fab48ccd5c45970a8c5ac420f1885091848eaa31d09c3bb677e6","observation_id":"e67b9949-c7f6-4feb-aa0c-0f818da0e6db","resolution":{"observed_at":"2026-08-07T04:40:12.565375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:12.641376Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.641376Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:80fa9ef9a6da0ee60405bec12d2ac5572c143a26901c97c6ed032b4fc7fa106d","observation_id":"8d3a5b4f-6365-49df-ad0d-e2fd06af8d16","resolution":{"observed_at":"2026-08-07T04:40:12.641376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-06T13:03:19.727877Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T04:40:12.722299Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.722299Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:6297f939cad37348b0ca57a1c6f6bfa2029680f796e93246075a57d67607647e","observation_id":"8e004ac8-a322-4de4-a87a-5b0d3bacc28b","resolution":{"observed_at":"2026-08-07T04:40:12.722299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00765","last_updated":"2024-12-01T06:08:00Z","snapshot_observed_at":"2026-08-06T07:47:35.642444Z","submitted_at":"2024-08-01T17:59:54Z","title":"MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00765","snapshot_observed_at":"2026-08-07T04:40:12.782437Z","title":"Mm-vet v2: A challenging benchmark to evaluate large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.782437Z"},"links":{"cited_paper":"/paper/2408.00765","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:1de9ba1f3e2657ba1ee7684b5b808d986703e7bb47a7e2c4224c7deb1b8f4ad9","observation_id":"1764ca9d-63de-47ee-a84e-1487f08812a7","resolution":{"observed_at":"2026-08-07T04:40:12.782437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:12.843716Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.843716Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:ed61e21eba4c6599d43e048870bf4a93e5cc61b56ce52ae466a7292bcea8966c","observation_id":"547fe278-652e-451d-879f-2af3e13b2ae0","resolution":{"observed_at":"2026-08-07T04:40:12.843716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-07T04:40:12.908645Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? arXiv preprint arXiv:2403.14624, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.908645Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:65c2c3150e8d09dc72e268042fd37c372d92cdf7c4aa75593bc5c253f25bbd56","observation_id":"0e7a1d09-8551-47e3-bb06-3a9c18d20f65","resolution":{"observed_at":"2026-08-07T04:40:12.908645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-07T04:40:12.982412Z","title":"Improve vision language model chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.982412Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:fb81d773150fb3b998c32ac0f7e3f07f952cac7392b20c15a2901661fd6c68f8","observation_id":"da366a1c-b9f7-4218-9d91-626a390921c3","resolution":{"observed_at":"2026-08-07T04:40:12.982412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:14.024794Z","title":"Multimodal chain-of-thought reasoning in language models","venue":null,"work_id":"f10c64ee-311d-44e4-b7db-c3a6868722f3","year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:13.071416Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:b1239a60b86c05d95b646dc71f7fef2f3a8cd1f3748c5b1b0062de7944712014","observation_id":"825be651-6293-4306-aa15-83976889b032","resolution":{"observed_at":"2026-08-07T04:40:14.087716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-07T04:40:13.125288Z","title":"Swe-bench: Can language models resolve real-world github issues? arXiv preprint arXiv:2310.06770, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:13.125288Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:ceb84d034d1ad35815f4d6d94955de661258c4d407f429d78bf775cddf984a0e","observation_id":"69ab859d-d281-4114-ba82-84a7bf3038d7","resolution":{"observed_at":"2026-08-07T04:40:13.125288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:13.207587Z","title":"Easyr1: An efficient, scalable, multi-modality rl training framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:13.207587Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:e378920ae6dc27f4b73ef3dba238a787c344a61867fe4fb1f3aab3790d886bdf","observation_id":"1c4c4e5f-7d75-452b-8a3a-e4fc03ffd881","resolution":{"observed_at":"2026-08-07T04:40:13.207587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-07T04:40:13.311339Z","title":"Aligning modalities in vision large language models via preference fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:13.311339Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:d6ea91aaa4ffc66574d6df9e0fbac90d371293c0f65c42d1f5e50ab4a3688ff6","observation_id":"addd42a4-9d0e-4b7d-883a-740d7ad3fc5d","resolution":{"observed_at":"2026-08-07T04:40:13.311339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14622","last_updated":"2024-11-02T02:51:51Z","snapshot_observed_at":"2026-07-30T21:22:18.339303Z","submitted_at":"2024-05-23T14:30:33Z","title":"Calibrated Self-Rewarding Vision Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14622","snapshot_observed_at":"2026-08-07T04:40:13.423620Z","title":"Calibrated self-rewarding vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:13.423620Z"},"links":{"cited_paper":"/paper/2405.14622","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:a3fb5f0fce4cf08b9b0a8c41467118a1be89bec60df13ea4a20b8a2a2f13ce8e","observation_id":"833b404f-7f94-40e2-aa27-34de5a8f59f4","resolution":{"observed_at":"2026-08-07T04:40:13.423620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 5 inbound Pith citation observations for arXiv:2506.10128."}