{"as_of":"2026-08-19T01:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:91a7feaad0788f4cd282fa7fddc65caca3e32762dc5a9607e486f8dc325cd03e","coverage":[{"denominator":113,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:24:08.529010Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T17:09:33.968186Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T19:06:10.238711Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"cited_work":{"arxiv_id":"2508.12680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12680","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision-g1: Towards general vision language reasoning with multi-domain data curation","venue":null,"work_id":"f445abf3-2db0-4473-9327-70197a41d3f1","year":2025},"citing_paper":{"arxiv_id":"2604.08539","last_updated":"2026-04-19T05:24:16Z","snapshot_observed_at":"2026-08-14T16:19:44.882122Z","submitted_at":"2026-04-09T17:59:39Z","title":"OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T17:09:33.968186Z"},"links":{"cited_paper":"/paper/2508.12680","citing_paper":"/paper/2604.08539"},"observation_digest":"sha256:dd1e122d5f341892b1fc1d910cb90d555d2efc13021be58153667361730dbdc1","observation_id":"6bf98c01-7ddf-4da9-888a-95077f7dad34","resolution":{"observed_at":"2026-05-11T07:30:58.744656Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"cited_work":{"arxiv_id":"2508.12680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12680","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision-g1: Towards general vision language reasoning with multi-domain data curation","venue":null,"work_id":"f445abf3-2db0-4473-9327-70197a41d3f1","year":2025},"citing_paper":{"arxiv_id":"2604.20806","last_updated":"2026-04-22T17:37:40Z","snapshot_observed_at":"2026-08-15T14:01:34.813286Z","submitted_at":"2026-04-22T17:37:40Z","title":"OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T00:40:47.562861Z"},"links":{"cited_paper":"/paper/2508.12680","citing_paper":"/paper/2604.20806"},"observation_digest":"sha256:60375e22d78963ce77ac1dfad17ddd25896ce0b2699a78232fd092c2434d41d4","observation_id":"27a7c529-19a8-4113-909d-20fb608e0500","resolution":{"observed_at":"2026-05-11T13:46:03.296681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"cited_work":{"arxiv_id":"2508.12680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12680","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision-g1: Towards general vision language reasoning with multi-domain data curation","venue":null,"work_id":"f445abf3-2db0-4473-9327-70197a41d3f1","year":2025},"citing_paper":{"arxiv_id":"2604.22192","last_updated":"2026-06-09T07:14:26Z","snapshot_observed_at":"2026-08-14T18:32:30.373064Z","submitted_at":"2026-04-24T03:39:51Z","title":"CharTide: Data-Centric Chart-to-Code Generation via Tri-Perspective Tuning and Inquiry-Driven Evolution","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-08T12:40:34.424341Z"},"links":{"cited_paper":"/paper/2508.12680","citing_paper":"/paper/2604.22192"},"observation_digest":"sha256:8171fba3318d1e8f02c40df6662ee270c47483aa7280821781eaa5e331676502","observation_id":"f3d80314-5b0f-4b0b-bdf7-8e8705610c62","resolution":{"observed_at":"2026-05-11T19:06:10.242064Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"cited_work":{"arxiv_id":"2508.12680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12680","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision-g1: Towards general vision language reasoning with multi-domain data curation","venue":null,"work_id":"f445abf3-2db0-4473-9327-70197a41d3f1","year":2025},"citing_paper":{"arxiv_id":"2605.06121","last_updated":"2026-05-07T12:30:02Z","snapshot_observed_at":"2026-08-18T18:24:56.100329Z","submitted_at":"2026-05-07T12:30:02Z","title":"Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T14:02:29.480442Z"},"links":{"cited_paper":"/paper/2508.12680","citing_paper":"/paper/2605.06121"},"observation_digest":"sha256:37136dd294943574cfdf0345aadee755503a4d851eb418cf2ec1c386593b69cb","observation_id":"f4626655-0973-4564-9de3-00cec701f71f","resolution":{"observed_at":"2026-05-11T18:46:09.398205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.12680/citation-record","integrity":"/paper/2508.12680/integrity","json":"/paper/2508.12680/citation-record.json","paper":"/paper/2508.12680"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T17:24:08.025253Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.025253Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:d48cb3f67334eda796087161f540b5341aeb628d1a3f467fdc1b4773f6930bb6","observation_id":"cfd5f7f5-cedb-4235-b24c-3b2b79e6a404","resolution":{"observed_at":"2026-08-15T17:24:08.025253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T17:24:08.031605Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.031605Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:a7fb64ee1741996f321b576da11bea38efcacd9411f4aaaadf95efc680507250","observation_id":"ce8eff9e-56fc-4499-ad9d-9ffb88505115","resolution":{"observed_at":"2026-08-15T17:24:08.031605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.037031Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.037031Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:2ba0af5587c07051c582801fcfe8508cf4e433e66e08d1cab5139659e11666d2","observation_id":"6aa7cf1a-2207-493e-b21f-e67f780a5272","resolution":{"observed_at":"2026-08-15T17:24:08.037031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.042129Z","title":"SWE-bench: Can language models resolve real-world github issues? In The Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.042129Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:5601838ca2435b3af3688c1510bc4ecf5a3741b36178f68890b06f54f41b9be0","observation_id":"4a2cf671-3e03-4208-86e5-e1bf28c41528","resolution":{"observed_at":"2026-08-15T17:24:08.042129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.047280Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.047280Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:5abab2f4cc988d56f7bc4433d96de8379e8edeba166efad136be9176cc9d3fc8","observation_id":"5aea5da8-1175-4b5c-a206-e8dae25642b7","resolution":{"observed_at":"2026-08-15T17:24:08.047280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-15T17:24:08.052248Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.052248Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:160691384128438af67b01e641fd34ad26d56f2102fb8687b35fd6d0264c0cb7","observation_id":"c00739b9-2aff-4843-bf97-9b9bc98461f3","resolution":{"observed_at":"2026-08-15T17:24:08.052248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-15T17:24:08.057500Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.057500Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:138a6a8ab03a65097d821b98a6d89b5ce82df931dbff4854abd3fb538b359839","observation_id":"464d6984-42b7-43e7-980b-ed5dd2d088d2","resolution":{"observed_at":"2026-08-15T17:24:08.057500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-18T21:07:15.893660Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14965","snapshot_observed_at":"2026-08-15T17:24:08.063540Z","title":"Revisiting reinforcement learning for llm reasoning from a cross-domain perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.063540Z"},"links":{"cited_paper":"/paper/2506.14965","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:3f077195738c43501a1b562c997ab85d2ca2e0c19022fd0f55beaa618e66183e","observation_id":"ade186c9-82a5-49a8-be9f-a10ccce1f593","resolution":{"observed_at":"2026-08-15T17:24:08.063540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T17:24:08.069223Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.069223Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:01162cad6f4a091aecf55e85a904f80be012dc547e90530a858e632db20a8789","observation_id":"fe4eab4d-e348-4dd7-85bd-740000ab12f2","resolution":{"observed_at":"2026-08-15T17:24:08.069223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.075537Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.075537Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:4f6c752d498258975ad123a1fd4cfeb99709c8e4c40c3ce7878ee6759657c449","observation_id":"ff11dbdd-89e4-4039-b08e-30fd1a15485f","resolution":{"observed_at":"2026-08-15T17:24:08.075537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.080483Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.080483Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:ee0825efd14674062837134f07d2d14c7e6d4d7771dd1c095f0a19d3257caf57","observation_id":"b335f2bc-d348-4448-9e50-7861a3efc2c7","resolution":{"observed_at":"2026-08-15T17:24:08.080483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-14T21:12:00.450049Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-15T17:24:08.085320Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.085320Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:90a5de122942f3e44c8b4fab3c1dcda6d2e5472abe5240fea8fa0800217f5983","observation_id":"58da3d48-c780-4ecd-ab43-50f69b2a6eb4","resolution":{"observed_at":"2026-08-15T17:24:08.085320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.090540Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.090540Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:bbed4be537fb37093288ecdf80c7fb0e1402d07ceb13c4a8584e95a81f62bb06","observation_id":"bbcb08f5-158d-40db-98bc-4747335ee78a","resolution":{"observed_at":"2026-08-15T17:24:08.090540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.095874Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.095874Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:f8ebf17dc3d82d3df8d87954ac8d4af6c0a8c50d98be2ba636363ba87913e210","observation_id":"3bde4210-ac89-43db-a1de-bf6ee3940371","resolution":{"observed_at":"2026-08-15T17:24:08.095874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01904","last_updated":"2025-02-05T09:17:01Z","snapshot_observed_at":"2026-08-16T12:59:45.562292Z","submitted_at":"2025-01-03T17:14:16Z","title":"Virgo: A Preliminary Exploration on Reproducing o1-like MLLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01904","snapshot_observed_at":"2026-08-15T17:24:08.105506Z","title":"Virgo: A preliminary exploration on reproducing o1-like mllm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.105506Z"},"links":{"cited_paper":"/paper/2501.01904","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:87304bea91dac18ba0d180db6d011f87e5e32e35387e8e1709cad5b83cbbe8c3","observation_id":"7622440a-edb0-41fd-b314-135e30cbaa0c","resolution":{"observed_at":"2026-08-15T17:24:08.105506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-15T09:44:57.157415Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-15T17:24:08.110787Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.110787Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:43244c83b59a9d34605d949ea4f9004731d6d82bc5c38fbeb245939ce8812d67","observation_id":"112b9614-e7a1-4a83-8c93-a72286806a15","resolution":{"observed_at":"2026-08-15T17:24:08.110787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-16T23:37:49.144529Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-15T17:24:08.116175Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.116175Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:3b94b0f45c43bef01dc6853f370cd13e255966ce80e735a24d8dc7451ffb3478","observation_id":"e23391ff-c8d4-463f-a79c-78f2522cadd0","resolution":{"observed_at":"2026-08-15T17:24:08.116175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-16T02:03:48.252223Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-15T17:24:08.121024Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.121024Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:f80878450e23f017a5ae6911d2d57e0f65b777963ff0eff4dc420844d190598c","observation_id":"6e8cb2c6-8893-4d19-ae6a-e7dba4b1234a","resolution":{"observed_at":"2026-08-15T17:24:08.121024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07934","last_updated":"2025-05-30T15:53:16Z","snapshot_observed_at":"2026-08-18T15:38:17.639385Z","submitted_at":"2025-04-10T17:49:05Z","title":"SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07934","snapshot_observed_at":"2026-08-15T17:24:08.125709Z","title":"Sota with less: Mcts-guided sample selection for data-efficient visual reasoning self-improvement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.125709Z"},"links":{"cited_paper":"/paper/2504.07934","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:daca5aabe4de817179cf6bcb8f8bad7f54f1ce96dc6c8b05c50f9a621b02d247","observation_id":"642c9b11-9ea2-4095-8624-faaa2e2aafde","resolution":{"observed_at":"2026-08-15T17:24:08.125709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-08-17T11:15:45.055944Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-15T17:24:08.130682Z","title":"Vl- rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.130682Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:52e794a8d1d78f8a6cc125e898af49d0c37469bbac069f842b0a89d1c3ec7844","observation_id":"90239c86-c51a-4bc9-a116-367c475a62c1","resolution":{"observed_at":"2026-08-15T17:24:08.130682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-17T03:46:28.942551Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-15T17:24:08.135546Z","title":"Kimi-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.135546Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:7c080e7fc47eb654bd805281333bdc4ffa045b55a01a64dcbad09d9d5352574b","observation_id":"0544f2a6-a603-43a8-804b-37d51e1ee67e","resolution":{"observed_at":"2026-08-15T17:24:08.135546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.140526Z","title":"Improve vision language model chain-of-thought reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.140526Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:5eaf1b35cba9a93bc0b3a8c263915f9071c20487c4da96cdc32bd003b5299edc","observation_id":"2af91df2-18d5-4b30-88f3-717e80af052b","resolution":{"observed_at":"2026-08-15T17:24:08.140526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.145289Z","title":"Llava-cot: Let vision language models reason step-by-step, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.145289Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:99f49f888259c302ca5dda1dc8c3261f3c6ef75668f8e40de47ad9e181ece9c4","observation_id":"643b81b0-db47-446e-84f0-a9d29287b31c","resolution":{"observed_at":"2026-08-15T17:24:08.145289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.150221Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.150221Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:10bc546b254b8730067e4edf851a3a0eb9c385cd0ae6a5fc278824453ed2c8af","observation_id":"d2394a16-e466-42f0-a81e-1ad9d082294d","resolution":{"observed_at":"2026-08-15T17:24:08.150221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24164","snapshot_observed_at":"2026-08-15T17:24:08.154904Z","title":"Mixed-r1: Unified reward perspective for reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.154904Z"},"links":{"cited_paper":"/paper/2505.24164","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:b0bd3afe6e06a410c49f4442d5ef7f7032746a690e2927c6539848f009b3e67d","observation_id":"d2cec0f4-2c7c-45ac-8c25-2662a84eb841","resolution":{"observed_at":"2026-08-15T17:24:08.154904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-18T17:13:47.373678Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24871","snapshot_observed_at":"2026-08-15T17:24:08.160749Z","title":"Modomodo: Multi-domain data mixtures for multimodal llm reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.160749Z"},"links":{"cited_paper":"/paper/2505.24871","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:a4520f720374d402f3a0e46b26bd8b69ecdf3c4e1d80c510821f919d442f20dd","observation_id":"da7e05ac-18da-4499-9480-2d1f810a8482","resolution":{"observed_at":"2026-08-15T17:24:08.160749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04333","last_updated":"2024-06-13T03:42:02Z","snapshot_observed_at":"2026-08-16T14:20:52.583862Z","submitted_at":"2024-02-06T19:18:04Z","title":"LESS: Selecting Influential Data for Targeted Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04333","snapshot_observed_at":"2026-08-15T17:24:08.165737Z","title":"Less: Selecting influential data for targeted instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.165737Z"},"links":{"cited_paper":"/paper/2402.04333","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:cf12d8088df5e83f113c9f9d37ba2066767212e383eafeef32ae8d5cc4c542e3","observation_id":"17e8a213-d68d-4a21-b5bd-71b06b1fe91a","resolution":{"observed_at":"2026-08-15T17:24:08.165737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08484","last_updated":"2020-11-14T18:47:35Z","snapshot_observed_at":"2026-08-17T13:05:26.793779Z","submitted_at":"2020-02-19T22:40:32Z","title":"Estimating Training Data Influence by Tracing Gradient Descent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08484","snapshot_observed_at":"2026-08-15T17:24:08.170718Z","title":"Estimating training data influence by tracking gradient descent","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.170718Z"},"links":{"cited_paper":"/paper/2002.08484","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:772b219e9e896d15280e9e0575c86c18f7cf15ec017351c07c4c1be61548a0e2","observation_id":"183598ef-8a3e-482c-8f50-d146f36bd236","resolution":{"observed_at":"2026-08-15T17:24:08.170718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.175673Z","title":"GPT-4o System Card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.175673Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:db6b8be356a73fe088c2a411f51b698dbc6a9192d7291b7c0ff7e41d9d1abae4","observation_id":"fb1a6e3f-3679-4b9f-a601-dedf248447a8","resolution":{"observed_at":"2026-08-15T17:24:08.175673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-15T17:00:20.282987Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-15T17:24:08.180238Z","title":"Llava-o1: Let vision language models reason step-by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.180238Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:02883e033e850bc74846f4238f850d45c2252069349cce2343752ebf220b7b3f","observation_id":"606f5ab8-6bd8-415b-aa7a-9850ede75773","resolution":{"observed_at":"2026-08-15T17:24:08.180238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-15T17:24:08.185246Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.185246Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:8490a01c55f050d0fe032f03d32ab379756325281b3b2d54d2aec36dba1870fd","observation_id":"6251beb0-6008-4404-8d7a-7d8c47d1a376","resolution":{"observed_at":"2026-08-15T17:24:08.185246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.190465Z","title":"Qvq: To see the world with wisdom, December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.190465Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:53de442d9bec4389931809c3aa6f502fdb8360e9a290407472e705b0dd867ac2","observation_id":"a7eb8a0b-c7b5-4ad2-950d-304f8a234132","resolution":{"observed_at":"2026-08-15T17:24:08.190465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-15T17:24:08.195348Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.195348Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:03a8f910fe6745fc84985128da8e770905d3d4ee8802c43018dbfd3a657995f8","observation_id":"68b71451-4a7a-4856-86ba-b191f7adc41a","resolution":{"observed_at":"2026-08-15T17:24:08.195348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T17:24:08.200230Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.200230Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:04ebb14484c5afaf3802c356c742867ce11f17921f95f8c22381ec02c262d135","observation_id":"f24ef1ec-9434-4f03-a185-96858763d27b","resolution":{"observed_at":"2026-08-15T17:24:08.200230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.205225Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.205225Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:62d5eee18e4706c8fcfe4886ec7b1be7dd2c4c8de6824464a0b582895c49ac01","observation_id":"88f412a1-b5a5-45f7-a2bf-78a6b741fa94","resolution":{"observed_at":"2026-08-15T17:24:08.205225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.210995Z","title":"R1-v: Reinforcing super gen- eralization ability in vision-language models with less than $3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.210995Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:33a492b30a01b81084fe9aa1db0154ddd731729fb8fb25fdea12720db5a8e93d","observation_id":"5d4b8d6e-260a-49aa-9a78-6e1471136246","resolution":{"observed_at":"2026-08-15T17:24:08.210995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-16T22:33:00.173650Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-15T17:24:08.215793Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision- language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.215793Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:5cd4f369a77002cc392608a7c909a45ecd8660200a5e2766cc4ef12ba6c437cd","observation_id":"a3c2899c-091c-4675-aa56-5eb2bec22a5b","resolution":{"observed_at":"2026-08-15T17:24:08.215793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.220934Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.220934Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:6a3b70ba6d533f74d0843cab4a81430a319cff0c9e847b75f98f81a3cd86df9b","observation_id":"fbd8b0af-21e1-4a8c-9841-09f1b4e70411","resolution":{"observed_at":"2026-08-15T17:24:08.220934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.225981Z","title":"Lima: Less is more for alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.225981Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:cc3ff2ea3c896a20c5bdfef64910f2cb147e5bc7383656dc774e61d3a5421bc9","observation_id":"cc2396e8-cd50-45ba-8cd9-3706eac66bb3","resolution":{"observed_at":"2026-08-15T17:24:08.225981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09246","last_updated":"2023-05-16T07:52:57Z","snapshot_observed_at":"2026-08-18T21:07:37.306544Z","submitted_at":"2023-05-16T07:52:57Z","title":"Maybe Only 0.5% Data is Needed: A Preliminary Exploration of Low Training Data Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09246","snapshot_observed_at":"2026-08-15T17:24:08.231109Z","title":"Maybe only 0.5% data is needed: A preliminary exploration of low training data instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.231109Z"},"links":{"cited_paper":"/paper/2305.09246","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:08ecb76d9fd5bd01f3e606569a6f61fe292fd6373d97d39bae18a21722637497","observation_id":"f35c73f3-39d1-45fb-807c-6ba3f365470f","resolution":{"observed_at":"2026-08-15T17:24:08.231109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14904","last_updated":"2023-11-25T02:45:50Z","snapshot_observed_at":"2026-08-18T21:07:36.588363Z","submitted_at":"2023-11-25T02:45:50Z","title":"LLM-Assisted Code Cleaning For Training Accurate Code Generators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14904","snapshot_observed_at":"2026-08-15T17:24:08.236832Z","title":"Llm-assisted code cleaning for training accurate code generators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.236832Z"},"links":{"cited_paper":"/paper/2311.14904","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:3c1487cc3811690bfb9c9a8b93e723301d91167c15c0c90baafecfa996cef540","observation_id":"12946d17-c9d3-47d6-b083-e47acee5baef","resolution":{"observed_at":"2026-08-15T17:24:08.236832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15685","last_updated":"2024-04-16T02:46:58Z","snapshot_observed_at":"2026-08-18T20:34:13.372074Z","submitted_at":"2023-12-25T10:29:28Z","title":"What Makes Good Data for Alignment? A Comprehensive Study of Automatic Data Selection in Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15685","snapshot_observed_at":"2026-08-15T17:24:08.242672Z","title":"What makes good data for alignment? a comprehensive study of automatic data selection in instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.242672Z"},"links":{"cited_paper":"/paper/2312.15685","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:a550e55b2e56d7bfd34a9b12638cba871bf676ffa475a18c3222e2c8a3794495","observation_id":"c6e8cc79-7e3c-4088-a071-b849fad1b69e","resolution":{"observed_at":"2026-08-15T17:24:08.242672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00788","last_updated":"2024-01-01T15:30:19Z","snapshot_observed_at":"2026-08-18T07:05:42.628973Z","submitted_at":"2024-01-01T15:30:19Z","title":"Astraios: Parameter-Efficient Instruction Tuning Code Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00788","snapshot_observed_at":"2026-08-15T17:24:08.247730Z","title":"Astraios: Parameter-efficient instruction tuning code large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.247730Z"},"links":{"cited_paper":"/paper/2401.00788","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:e9688652836668ba9a963cc0fd3569ca64be59973b1d8d1fc03bef28756dc147","observation_id":"c73c9da2-a9c0-46e3-a726-cbb2d4663d9a","resolution":{"observed_at":"2026-08-15T17:24:08.247730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07124","last_updated":"2024-02-18T09:46:06Z","snapshot_observed_at":"2026-08-16T15:08:39.154570Z","submitted_at":"2023-08-14T13:53:54Z","title":"OctoPack: Instruction Tuning Code Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07124","snapshot_observed_at":"2026-08-15T17:24:08.252677Z","title":"Octopack: Instruc- tion tuning code large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.252677Z"},"links":{"cited_paper":"/paper/2308.07124","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:b942545c8dcbc8afd5472ebea922d22d6440e8fe0d942dc0c34ff94258ab00c1","observation_id":"0cb1384e-8139-4298-8508-cca5bcef0348","resolution":{"observed_at":"2026-08-15T17:24:08.252677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.257664Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.257664Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:563bb4f45842b29f5721c911b9c901e83795085224c919440bdff4e8a106c595","observation_id":"30a91729-8420-44bf-8e9b-39f6759bcbb0","resolution":{"observed_at":"2026-08-15T17:24:08.257664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.262872Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.262872Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:8383e10862032ba7ef9ec4c7a2223dd750f55c4f784c28dc7545bcdd907ae6b6","observation_id":"acb0228c-59ed-4336-bbd5-7f6fc4c76ada","resolution":{"observed_at":"2026-08-15T17:24:08.262872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.267817Z","title":"Mmmu: A massive multi-discipline multi- modal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.267817Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:c2c7f81d5fd39cf217706455812694e20e16fc886c20d19c1bdb6c891524a391","observation_id":"d4d2e983-fcd9-4d5b-808c-e86268208079","resolution":{"observed_at":"2026-08-15T17:24:08.267817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-15T17:24:08.272810Z","title":"Mmmu-pro: A more robust multi-discipline multimodal understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.272810Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:b863c2ca6783363aa0547d7c0cc2df383c151deace05ede26d69c24025b2fbeb","observation_id":"46cf7362-e5d1-46a6-bb99-4f1ba45e377c","resolution":{"observed_at":"2026-08-15T17:24:08.272810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-15T17:24:08.277999Z","title":"Are we on the right way for evaluating large vision- language models? arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.277999Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:edf7b785a6183575e37ac2a1ad2ae486324af11360ad0c84008bde2c48f6cf03","observation_id":"c5f39aea-717f-4e37-9215-6e84e5962235","resolution":{"observed_at":"2026-08-15T17:24:08.277999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-15T17:24:08.283136Z","title":"Logicvista: Multimodal llm logical reasoning benchmark in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.283136Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:79350bb487268b154f3fa8688a5b506f86216e5394ce23563ba61ef548339ab1","observation_id":"75c08491-55e3-47da-af83-9fb8f069cbc3","resolution":{"observed_at":"2026-08-15T17:24:08.283136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.288087Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.288087Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:d9d0cc9e7073dcef731a4c076bb360c60f2ae099da36c87324380a2f7e434c5f","observation_id":"b9656623-4767-4186-94f5-b2ae1fea1b86","resolution":{"observed_at":"2026-08-15T17:24:08.288087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.292710Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.292710Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:19d88e2eb669f5d81c844eec6a33c49df3860f6f29657bd14fc09b7bd404dc62","observation_id":"697d2f21-c6f5-45bb-b7ca-7fd28bfbefa6","resolution":{"observed_at":"2026-08-15T17:24:08.292710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.297641Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.297641Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:6beb9d95fddf03fd697876d098b442397963d0c9771fcbddd432788f2d1def5c","observation_id":"065bef9b-408c-473e-ac24-3904ed4f939e","resolution":{"observed_at":"2026-08-15T17:24:08.297641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-15T17:24:08.302455Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.302455Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:5707d15b9ba942ee6b4205adb89cd4f07631c5db133d4d8b0ff3e748a2e72b15","observation_id":"16a605b8-022a-4945-9fd4-0bc8dbb33625","resolution":{"observed_at":"2026-08-15T17:24:08.302455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-08-12T06:11:26.786967Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-15T17:24:08.307694Z","title":"We-math: Does your large multi- modal model achieve human-like mathematical reasoning? arXiv preprint arXiv:2407.01284, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.307694Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:d35eda093a93f1506b038657ce8e395e7e6827691e448a56cba35609f1ff1d0b","observation_id":"659a2e93-4df8-4d7d-9d13-5bcad45354f1","resolution":{"observed_at":"2026-08-15T17:24:08.307694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00836","last_updated":"2025-02-24T06:55:22Z","snapshot_observed_at":"2026-08-18T21:08:40.240698Z","submitted_at":"2024-10-29T17:29:19Z","title":"DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00836","snapshot_observed_at":"2026-08-15T17:24:08.313024Z","title":"Dynamath: A dynamic visual benchmark for evaluating mathematical reasoning robustness of vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.313024Z"},"links":{"cited_paper":"/paper/2411.00836","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:bda5c2151b1f2cd19161c12f8831493619c24c6565d2631e6926d81106013864","observation_id":"ab350932-1d83-4672-a1b2-6435f145c084","resolution":{"observed_at":"2026-08-15T17:24:08.313024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.318268Z","title":"Charxiv: Charting gaps in realistic chart understanding in multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.318268Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:fab099d5862895a791a9256a79a99167e88d88968a494a364aff0a24272c238f","observation_id":"2a673b41-5ccf-4fb4-8a99-b9d678df3c72","resolution":{"observed_at":"2026-08-15T17:24:08.318268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05506","last_updated":"2025-04-10T14:10:05Z","snapshot_observed_at":"2026-08-18T21:08:39.769891Z","submitted_at":"2025-04-07T21:05:06Z","title":"ChartQAPro: A More Diverse and Challenging Benchmark for Chart Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05506","snapshot_observed_at":"2026-08-15T17:24:08.322949Z","title":"Chartqapro: A more diverse and challenging benchmark for chart question answering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.322949Z"},"links":{"cited_paper":"/paper/2504.05506","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:e0e9564d81cea74400781ebe0bce0186e97ce9d835d2db34c5e41271dfd5a73d","observation_id":"bd9394ee-27c1-4d83-ad73-20f2d6ae886d","resolution":{"observed_at":"2026-08-15T17:24:08.322949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.327988Z","title":"A dataset of clinically generated visual questions and answers about radiology images","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.327988Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:39ca662562af1294d5445fb9345f2db9a418501a907c579e1c7ca53c88369e79","observation_id":"72bfa829-d95b-4eb4-abd1-7d58dce836d3","resolution":{"observed_at":"2026-08-15T17:24:08.327988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.10286","last_updated":"2020-03-07T17:55:41Z","snapshot_observed_at":"2026-07-06T09:06:42.071993Z","submitted_at":"2020-03-07T17:55:41Z","title":"PathVQA: 30000+ Questions for Medical Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.10286","snapshot_observed_at":"2026-08-15T17:24:08.332746Z","title":"Pathvqa: 30000+ questions for medical visual question answering","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.332746Z"},"links":{"cited_paper":"/paper/2003.10286","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:397d357e04fbdb4dc676fdd2dd78b89e959c25bcaf3029fd1381f7d538bba981","observation_id":"f841676b-ba39-40c1-b25e-5ffa31b25379","resolution":{"observed_at":"2026-08-15T17:24:08.332746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.337699Z","title":"Slake: A semantically- labeled knowledge-enhanced dataset for medical visual question answering","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.337699Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:a55c968c0cb066a43e0e843fb348dbdc938bcce9d7561c2ced817ac3dfb818ca","observation_id":"4a3f783a-95aa-4417-97e9-298d15cbc6f2","resolution":{"observed_at":"2026-08-15T17:24:08.337699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-17T21:30:24.278971Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-08-15T17:24:08.342648Z","title":"Muirbench: A comprehensive benchmark for robust multi-image understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.342648Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:22d3c348c7a79726bf14cc18f7a6166b63b7efc85ca1635178a7cd927eefc2cb","observation_id":"ff7cb12c-657c-4e22-8879-62ac8b89aca1","resolution":{"observed_at":"2026-08-15T17:24:08.342648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-15T17:24:08.347677Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.347677Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:0b2c11a3499331d728913723d080458d75131b29c08c6300463afd88812fc008","observation_id":"72f64ce5-8e37-4f3a-b84e-f3d780d1ae00","resolution":{"observed_at":"2026-08-15T17:24:08.347677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-15T17:24:08.352870Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.352870Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:662b00b5aa8403cb40eee69f8d762a515686a4066d04702480e222c0a326eb51","observation_id":"da29709f-a27e-4bc2-b702-7e3df9903af3","resolution":{"observed_at":"2026-08-15T17:24:08.352870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-15T17:24:08.357697Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.357697Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:695917d9539f01b4b6b7e63a757d2b8215cef3ab9e264faa59cad1b42fd9238f","observation_id":"34ae2762-e1ed-41ae-8ea5-71819f1e94ae","resolution":{"observed_at":"2026-08-15T17:24:08.357697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.362835Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.362835Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:5f9b23823dafb8b04e11700f7212aa785ade0c6ad076c5436d37259dc39e753c","observation_id":"f10e8a88-ecf0-443e-9358-9d7289054b12","resolution":{"observed_at":"2026-08-15T17:24:08.362835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-13T20:16:31.803514Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-15T17:24:08.368349Z","title":"Mm-eureka: Exploring visual aha moment with rule-based large-scale reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.368349Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:7d89fecb9ab0783955f479330e42049f97a5970da208154ea23525b7620ccbbf","observation_id":"65c6103f-3e1b-40b1-8d0f-fd6070afde1c","resolution":{"observed_at":"2026-08-15T17:24:08.368349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-15T17:24:08.373195Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.373195Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:b38648aa267f748c5938ae9e5dee66d54cbcb0a7c773bb3048e346cef2bc84fb","observation_id":"0e724969-432f-4218-8cb3-d931bb78a8dd","resolution":{"observed_at":"2026-08-15T17:24:08.373195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T17:24:08.378185Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.378185Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:e2607e6d448e3095eaeec6f38c5238f4cc858d89b4172de3625bdb6caf03098c","observation_id":"c6bf0777-e8da-4546-96d7-41539bd2234a","resolution":{"observed_at":"2026-08-15T17:24:08.378185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.07300","last_updated":"2018-02-22T22:50:42Z","snapshot_observed_at":"2026-08-15T22:53:17.165603Z","submitted_at":"2017-10-19T18:01:38Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.07300","snapshot_observed_at":"2026-08-15T17:24:08.382930Z","title":"Figureqa: An annotated figure dataset for visual reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.382930Z"},"links":{"cited_paper":"/paper/1710.07300","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:10515f9e4493d18a95571b5a5d24f81cbff66cda73774f5c4e4cbd8a8c66a74b","observation_id":"376bacae-793c-42dd-9047-57ab352cf7a8","resolution":{"observed_at":"2026-08-15T17:24:08.382930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.387919Z","title":"Dvqa: Understanding data visualizations via question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.387919Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:46e99b275fb878595819a4ed19416b06394c0cb5505ecc43a5ac21fa5234d14a","observation_id":"63c1af2b-ad80-420f-97f4-2035f9b86daa","resolution":{"observed_at":"2026-08-15T17:24:08.387919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.392660Z","title":"Plotqa: Reasoning over scientific plots","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.392660Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:2838d230871a35e7ec91a058a75ccdd04ec58e31ed3fcaf03872ea4b63caf76d","observation_id":"4ed0157a-9167-4bc7-b5e0-d26bd703336f","resolution":{"observed_at":"2026-08-15T17:24:08.392660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-15T17:24:08.397621Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.397621Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:4e7ef94d13c8341a36c9158d1107489a29c3c042c5e3ffd4013d3bbc793a81f2","observation_id":"96109899-f9ff-431b-b58f-a0ed11b218ed","resolution":{"observed_at":"2026-08-15T17:24:08.397621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08545","last_updated":"2022-11-15T22:31:38Z","snapshot_observed_at":"2026-08-16T16:15:52.382364Z","submitted_at":"2022-11-15T22:31:38Z","title":"MapQA: A Dataset for Question Answering on Choropleth Maps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.08545","snapshot_observed_at":"2026-08-15T17:24:08.402852Z","title":"Mapqa: A dataset for question answering on choropleth maps","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.402852Z"},"links":{"cited_paper":"/paper/2211.08545","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:b7b9aa916337c82023a507ecce8e8e1df512bbf5b38d9dd7e96a39aa5880c1df","observation_id":"48732e57-7c6b-425b-8266-7a93b8ea40f1","resolution":{"observed_at":"2026-08-15T17:24:08.402852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15915","last_updated":"2024-06-19T03:58:32Z","snapshot_observed_at":"2026-08-18T21:07:23.948070Z","submitted_at":"2023-12-26T07:20:55Z","title":"ChartBench: A Benchmark for Complex Visual Reasoning in Charts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15915","snapshot_observed_at":"2026-08-15T17:24:08.407822Z","title":"Chartbench: A benchmark for complex visual reasoning in charts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.407822Z"},"links":{"cited_paper":"/paper/2312.15915","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:263d2c8683051237df513319999e1f23663a219a01a5b93b6cd36726a33c622a","observation_id":"2ae55cf7-6324-4e57-b2c2-2e1e7fa2bfe2","resolution":{"observed_at":"2026-08-15T17:24:08.407822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.412542Z","title":"Unichart: A universal vision-language pretrained model for chart comprehension and reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.412542Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:a6fcc8c3c5ec59476fe21106b0149509367131f4f01363dbd30efe9b2f8e4221","observation_id":"23c48653-37e2-4852-b360-82b30dbae3e2","resolution":{"observed_at":"2026-08-15T17:24:08.412542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.417054Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.417054Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:c74529e51c65084117a2ea008767f5eaa3440d97384a86d07af5061a4c793e84","observation_id":"6132d4de-611d-43a2-9dc3-0ffc6e463a72","resolution":{"observed_at":"2026-08-15T17:24:08.417054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13824","last_updated":"2024-11-06T08:29:22Z","snapshot_observed_at":"2026-08-17T23:12:16.766867Z","submitted_at":"2024-10-17T17:48:54Z","title":"Harnessing Webpage UIs for Text-Rich Visual Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13824","snapshot_observed_at":"2026-08-15T17:24:08.422038Z","title":"Harnessing webpage uis for text-rich visual understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.422038Z"},"links":{"cited_paper":"/paper/2410.13824","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:6faa5f747a8939eb227514aea39f5a3320bb82ca25afae647221c3c183a9b0d8","observation_id":"30ce4f23-7c12-45e3-b24e-577d02c4cd73","resolution":{"observed_at":"2026-08-15T17:24:08.422038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04165","last_updated":"2021-07-20T23:22:27Z","snapshot_observed_at":"2026-08-18T00:34:55.846518Z","submitted_at":"2021-05-10T07:46:55Z","title":"Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04165","snapshot_observed_at":"2026-08-15T17:24:08.427313Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.427313Z"},"links":{"cited_paper":"/paper/2105.04165","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:cf1ff053643f643b06f944a65229f18861ae4a8d5e8cc42edf78ee9c85fa2a09","observation_id":"9418bd85-c530-41be-aeeb-1d4b5681b22b","resolution":{"observed_at":"2026-08-15T17:24:08.427313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.432638Z","title":"An augmented benchmark dataset for geometric question answering through dual parallel text encoding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.432638Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:bd4203fb53e68c43a2b9c9529b1c5c4a096ec2d3ac3e865526231ca5e33834b1","observation_id":"769eb7e2-f057-4600-a319-7c77768b5187","resolution":{"observed_at":"2026-08-15T17:24:08.432638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.02746","last_updated":"2022-12-06T04:37:51Z","snapshot_observed_at":"2026-08-16T16:10:44.189376Z","submitted_at":"2022-12-06T04:37:51Z","title":"UniGeo: Unifying Geometry Logical Reasoning via Reformulating Mathematical Expression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.02746","snapshot_observed_at":"2026-08-15T17:24:08.437400Z","title":"Unigeo: Unifying geometry logical reasoning via reformulating mathematical expression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.437400Z"},"links":{"cited_paper":"/paper/2212.02746","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:04b028e9065a83ad922d0eb84e9e10cd2ff0a717d1efad31135602b9393b1b31","observation_id":"d08d20f2-47c6-4c1f-a5ad-588660b69e8b","resolution":{"observed_at":"2026-08-15T17:24:08.437400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14517","last_updated":"2022-01-11T03:50:31Z","snapshot_observed_at":"2026-08-17T03:33:20.954386Z","submitted_at":"2021-05-30T12:34:17Z","title":"GeoQA: A Geometric Question Answering Benchmark Towards Multimodal Numerical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14517","snapshot_observed_at":"2026-08-15T17:24:08.442245Z","title":"Geoqa: A geometric question answering benchmark towards multimodal numerical reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.442245Z"},"links":{"cited_paper":"/paper/2105.14517","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:e387a54ec5c9bd9a109b3db42bae6964504b95eb1ee6a5fd06280feaf0ed8457","observation_id":"3b5cebb5-9ff0-4f8d-88d3-4b0a296a8cf4","resolution":{"observed_at":"2026-08-15T17:24:08.442245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.447210Z","title":"Solving geometry problems: Combining text and diagram interpretation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.447210Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:12113c80e074a6759514b965d5bc158c559afa9ef45dc85b4a27afe1c9083675","observation_id":"84cebb8a-e84c-4ded-942a-a9e0dab82fb6","resolution":{"observed_at":"2026-08-15T17:24:08.447210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05358","last_updated":"2022-08-10T14:08:34Z","snapshot_observed_at":"2026-08-18T20:11:21.067738Z","submitted_at":"2022-08-10T14:08:34Z","title":"CLEVR-Math: A Dataset for Compositional Language, Visual and Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.05358","snapshot_observed_at":"2026-08-15T17:24:08.452090Z","title":"Clevr-math: A dataset for com- positional language, visual and mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.452090Z"},"links":{"cited_paper":"/paper/2208.05358","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:7c8aac6967e3971135a61f70ff3ab05abf9dc815e5d2a870310d9c9b9da62192","observation_id":"69d8adda-2460-48f0-be5b-5764e70775e3","resolution":{"observed_at":"2026-08-15T17:24:08.452090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13214","last_updated":"2022-07-25T04:05:29Z","snapshot_observed_at":"2026-08-18T20:12:50.297525Z","submitted_at":"2021-10-25T18:52:26Z","title":"IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13214","snapshot_observed_at":"2026-08-15T17:24:08.457298Z","title":"Iconqa: A new benchmark for abstract diagram understanding and visual language reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.457298Z"},"links":{"cited_paper":"/paper/2110.13214","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:7fc4c95234aab003b0eddcd8dd7fd7878e9b813d2dfd91d0feb958c277f3026e","observation_id":"1ae9e6f8-e958-4a16-bd67-35a411a8f7fa","resolution":{"observed_at":"2026-08-15T17:24:08.457298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00491","last_updated":"2019-07-21T05:26:36Z","snapshot_observed_at":"2026-08-14T18:05:37.795597Z","submitted_at":"2018-11-01T16:47:44Z","title":"A Corpus for Reasoning About Natural Language Grounded in Photographs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00491","snapshot_observed_at":"2026-08-15T17:24:08.462326Z","title":"A corpus for reasoning about natural language grounded in photographs","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.462326Z"},"links":{"cited_paper":"/paper/1811.00491","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:b00a30bfb5e971663761f7c173c919d745b741fc9607d538a9166525c0bfeab8","observation_id":"3229e0cd-4c93-42b0-a050-a02eba852c68","resolution":{"observed_at":"2026-08-15T17:24:08.462326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15867","last_updated":"2022-03-29T19:18:12Z","snapshot_observed_at":"2026-08-16T17:10:48.910235Z","submitted_at":"2022-03-29T19:18:12Z","title":"Image Retrieval from Contextual Descriptions","version":1},"cited_work":{"arxiv_id":"2203.15867","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.15867","snapshot_observed_at":"2026-08-15T17:24:08.763505Z","title":"Image Retrieval from Contextual Descriptions","venue":"cs.CV","work_id":"9e3e6eb7-37b2-480a-aab9-9bbf267fa480","year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.467219Z"},"links":{"cited_paper":"/paper/2203.15867","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:9f94d66e5bac08ad08665c747fa5c83bb05fd5af9490497d1201df8ea9662deb","observation_id":"4e6016ae-9dd9-47a4-b9a8-4917f9ef2ff6","resolution":{"observed_at":"2026-08-15T17:24:08.770841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.472416Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.472416Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:a764730db03b4eff4c18627392d348669d29404e9e0acbef8b58dd0c10a19bab","observation_id":"6a872cae-9d7c-4986-9b99-f5f33a6cec46","resolution":{"observed_at":"2026-08-15T17:24:08.472416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:10.019449Z","title":"Super-clevr: A virtual benchmark to diagnose domain robustness in visual reasoning","venue":null,"work_id":"05167e3a-f584-47a0-ad74-9133ce4e9ff5","year":2023},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.477274Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:e1e7f3ace1aa6f761669e7f4e0f99823d896f5a83c93aa35868d761862573bb4","observation_id":"eb282081-0b1c-42d3-8e7d-198b15c2a976","resolution":{"observed_at":"2026-08-15T17:24:10.024942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.481966Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.481966Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:22b825ade53f0331f0d3e5baf75ae16e63aab6f1c3ecfe3ec78b6ea611b9b2b3","observation_id":"de48a35c-7bd1-4689-8db8-a768aece6e2e","resolution":{"observed_at":"2026-08-15T17:24:08.481966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:09.989948Z","title":"Are you smarter than a sixth grader? textbook question answering for multimodal machine comprehension","venue":null,"work_id":"f6e30604-cc6e-49fb-b77f-2dacad0324b3","year":2017},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.486479Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:8124c24a58ba5bc66d00835197b8bf8d2b2d8ebec29929a9553dfc4a05e15d8e","observation_id":"d15722cf-d116-4081-a0d7-a43e7e8b4b34","resolution":{"observed_at":"2026-08-15T17:24:09.996101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.490975Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.490975Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:08853b0cd93a31710967dde2064cc12e7466fd416fc046314bf8c4b97031ca71","observation_id":"cd6f8cb2-0f48-4a38-a74d-5288742c67d2","resolution":{"observed_at":"2026-08-15T17:24:08.490975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.495486Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.495486Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:5c86b51c127697b72a9a3d7e2d5cd51b332946a4e3495f34d39381df9b2c9dde","observation_id":"ab713047-994d-4443-8b21-b87b0005d038","resolution":{"observed_at":"2026-08-15T17:24:08.495486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.500513Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.500513Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:fd3ddca9eb14531f5aaee795e9f4772d59a2910427bc2a47c46339fda2d2d8e3","observation_id":"bfe0133e-91c3-4c81-85a7-0729729d3aa8","resolution":{"observed_at":"2026-08-15T17:24:08.500513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.505250Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.505250Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:ded4187c1be34c46438345ec3d8a29198be3bffdffce1ebd23ea64bc06bb3596","observation_id":"b17bf1cf-2bfd-4532-bedf-bc28197e34dd","resolution":{"observed_at":"2026-08-15T17:24:08.505250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.510153Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.510153Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:f62b74c1a631371a39f63aae0ea97b6381b7b5056aad2a98bd459be64bdd0ce0","observation_id":"e24b1632-9004-4fb0-b05f-7da7199d71b8","resolution":{"observed_at":"2026-08-15T17:24:08.510153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10415","last_updated":"2024-09-08T01:04:35Z","snapshot_observed_at":"2026-08-15T13:17:09.334808Z","submitted_at":"2023-05-17T17:50:16Z","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10415","snapshot_observed_at":"2026-08-15T17:24:08.514831Z","title":"Pmc-vqa: Visual instruction tuning for medical visual question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.514831Z"},"links":{"cited_paper":"/paper/2305.10415","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:ebb57ee088fed53dec834d2432a4418a19df52b1071c530ca913f3ff96f30d6a","observation_id":"15866e9d-4e44-40d8-9ab7-a6b5d64790b7","resolution":{"observed_at":"2026-08-15T17:24:08.514831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T17:24:08.519580Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.519580Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:3491753dcc102e107eb8bfb55e159d621944a2da6553493222b71b5c67ef6d8e","observation_id":"0d26467e-9283-4c20-9eb0-d4c876cad2fb","resolution":{"observed_at":"2026-08-15T17:24:08.519580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.524451Z","title":"Chart-r1: Chain-of-thought supervision and reinforcement for advanced chart reasoner","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.524451Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:1b185193a9afdbd64034c389950c5d8e8c501c8f4c2e81426e9d16bcc58857ec","observation_id":"f701a439-9b26-42c4-9d6f-f0b003162a47","resolution":{"observed_at":"2026-08-15T17:24:08.524451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:09.917003Z","title":"You are a QUESTION-TYPE classifier (do **NOT** answer the question itself)","venue":null,"work_id":"f22eb4c3-3a8c-42a0-b6c0-aa452b1ce84c","year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.529010Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:ab4a615c3751e70e789c4214781af2f74844e05b8c41a103ce33bc27063e39be","observation_id":"76ea1cc2-7929-4419-bcf2-0c36ff67336e","resolution":{"observed_at":"2026-08-15T17:24:09.922336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":96,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":113},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 113 outbound references and 4 inbound Pith citation observations for arXiv:2508.12680."}