{"as_of":"2026-08-07T06:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:50e1a49598c93fc9df4d3470034ae2f5a0a988a4a30012759d4e81a8ad1d89a0","coverage":[{"denominator":125,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:27:05.282142Z","state":"measured"},{"denominator":108,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":108,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:57:07.475851Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:39:46.104997Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07905","snapshot_observed_at":"2026-08-06T13:57:07.475851Z","title":"WeThink: To- ward general-purpose vision-language reasoning via rein- forcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19891","last_updated":"2025-07-30T04:47:07Z","snapshot_observed_at":"2026-08-06T18:41:11.291505Z","submitted_at":"2025-07-26T09:43:09Z","title":"Interpretable Open-Vocabulary Referring Object Detection with Reverse Contrast Attention","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:07.475851Z"},"links":{"cited_paper":"/paper/2506.07905","citing_paper":"/paper/2507.19891"},"observation_digest":"sha256:261515cdf36aa4b5751623f2c4565aa33cac62c8ac52b3ddb64be31ebe7d36a6","observation_id":"db245629-0bcf-49c4-9b7c-5aa648952409","resolution":{"observed_at":"2026-08-06T13:57:07.475851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07905","snapshot_observed_at":"2026-08-05T23:03:10.158919Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06009","last_updated":"2025-08-08T04:39:16Z","snapshot_observed_at":"2026-08-06T16:03:13.511884Z","submitted_at":"2025-08-08T04:39:16Z","title":"MathReal: We Keep It Real! A Real Scene Benchmark for Evaluating Math Reasoning in Multimodal Large Language Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T23:03:10.158919Z"},"links":{"cited_paper":"/paper/2506.07905","citing_paper":"/paper/2508.06009"},"observation_digest":"sha256:0a927fc68c50c863b747d3706ad9c269015ed31ef7a52493826cc51ac34101b9","observation_id":"81f9e82d-4567-4976-9de0-b0ba9a4a3bb7","resolution":{"observed_at":"2026-08-05T23:03:10.158919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.07905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07905","snapshot_observed_at":"2026-07-04T10:39:46.104997Z","title":"Wethink: Toward general-purpose vision- language reasoning via reinforcement learning.arXiv preprint arXiv:2506.07905, 2025a","venue":null,"work_id":"0bdc8453-564e-45ce-8ac2-22be4b0bda04","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":238,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2506.07905","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:7f6066777184a0f12b7552987ca35bab856c93c88281bc7fa6db1c6c6d0cc288","observation_id":"48e25eed-7b27-47cf-834e-9b44876c6c93","resolution":{"observed_at":"2026-05-18T19:21:48.853224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07905","snapshot_observed_at":"2026-08-03T14:57:29.176406Z","title":"Wethink: To- ward general-purpose vision-language reasoning via rein- forcement learning.arXiv preprint arXiv:2506.07905, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.18735","last_updated":"2026-05-25T12:55:14Z","snapshot_observed_at":"2026-08-07T05:11:54.627363Z","submitted_at":"2025-12-21T13:50:26Z","title":"$M^3-Verse$: A \"Spot the Difference\" Challenge for Large Multimodal Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T14:57:29.176406Z"},"links":{"cited_paper":"/paper/2506.07905","citing_paper":"/paper/2512.18735"},"observation_digest":"sha256:18b78d968402bb3316602645aed828b8c3f5acdd2108d1e856a19726a4734bdd","observation_id":"0664b863-da57-4521-b0a4-9e6706ad160d","resolution":{"observed_at":"2026-08-03T14:57:29.176406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.07905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07905","snapshot_observed_at":"2026-07-04T10:39:46.104997Z","title":"Wethink: Toward general-purpose vision- language reasoning via reinforcement learning.arXiv preprint arXiv:2506.07905, 2025a","venue":null,"work_id":"0bdc8453-564e-45ce-8ac2-22be4b0bda04","year":2025},"citing_paper":{"arxiv_id":"2604.19264","last_updated":"2026-04-21T09:28:34Z","snapshot_observed_at":"2026-07-31T12:03:21.545054Z","submitted_at":"2026-04-21T09:28:34Z","title":"DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-10T03:21:30.732925Z"},"links":{"cited_paper":"/paper/2506.07905","citing_paper":"/paper/2604.19264"},"observation_digest":"sha256:4adec6b373b4a0715d7e7565319aca6abe5d72059a85b6eb409b57f91b9fbfcc","observation_id":"c6b81be2-5b5c-4e7c-a979-e9098ce6c857","resolution":{"observed_at":"2026-05-11T12:31:07.983014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.07905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07905","snapshot_observed_at":"2026-07-04T10:39:46.104997Z","title":"Wethink: Toward general-purpose vision- language reasoning via reinforcement learning.arXiv preprint arXiv:2506.07905, 2025a","venue":null,"work_id":"0bdc8453-564e-45ce-8ac2-22be4b0bda04","year":2025},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2506.07905","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:c612ac37cb7f583fdc0941d3699c5bddb199e0a97dd648d20c9dde6a95587d7a","observation_id":"6983eb48-fcc7-4ed4-9e77-1de6f3922bfd","resolution":{"observed_at":"2026-05-20T05:13:21.563530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.07905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07905","snapshot_observed_at":"2026-07-04T10:39:46.104997Z","title":"Wethink: Toward general-purpose vision- language reasoning via reinforcement learning.arXiv preprint arXiv:2506.07905, 2025a","venue":null,"work_id":"0bdc8453-564e-45ce-8ac2-22be4b0bda04","year":2025},"citing_paper":{"arxiv_id":"2606.23543","last_updated":"2026-06-22T16:17:30Z","snapshot_observed_at":"2026-07-06T23:58:16.163783Z","submitted_at":"2026-06-22T16:17:30Z","title":"VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T08:34:27.719022Z"},"links":{"cited_paper":"/paper/2506.07905","citing_paper":"/paper/2606.23543"},"observation_digest":"sha256:6160dec4be462d8df7ecb05ee044ad83e9cf87c554797388da7ea1f662e8eed3","observation_id":"09b8ffd8-cfb9-4af7-b9d0-3ed26b71c759","resolution":{"observed_at":"2026-07-04T10:39:46.106878Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07905","snapshot_observed_at":"2026-08-01T11:47:28.164827Z","title":"WeThink: Toward general-purpose vision-language reasoning via reinforcement learn- ing.arXiv preprint arXiv:2506.07905, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-06T04:55:07.559078Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:28.164827Z"},"links":{"cited_paper":"/paper/2506.07905","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:de820c71feb89363dce94b631f8f0efd197d1003ebdd0b55268075b9001d768a","observation_id":"a38f450c-7479-419e-a93a-2d14d92ed709","resolution":{"observed_at":"2026-08-01T11:47:28.164827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07905/citation-record","integrity":"/paper/2506.07905/integrity","json":"/paper/2506.07905/citation-record.json","paper":"/paper/2506.07905"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T05:27:04.910573Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.910573Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:a9a5c9f6d1a538f3d74d7c4f1be8617b14e1c0c94e8100194f2d6cdd22a13155","observation_id":"a2f85b3b-0818-41ce-9958-2cae1fc7f270","resolution":{"observed_at":"2026-08-07T05:27:04.910573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:04.914834Z","title":"Openai o3 and o4-mini system card, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.914834Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:618dc7c7d21217295acd7d77a9e7b659e18ab636d55e2934f0351d081b54f5c3","observation_id":"978c1cab-a1dd-4444-89c9-6ad7b5172600","resolution":{"observed_at":"2026-08-07T05:27:04.914834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T05:27:04.918664Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.918664Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:4d83955812363806c68a78e308517523482be6149eaddea1083a2c16cb55981d","observation_id":"4843fe97-3092-45f2-bf8c-925fce292f34","resolution":{"observed_at":"2026-08-07T05:27:04.918664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:27:04.922660Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.922660Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:b9774ae9d59eac5327f5ddc149b3842b9065ce2cb0a831ad71d7208077af0922","observation_id":"f9fbe446-e9d6-4e54-8d3b-2e4157656162","resolution":{"observed_at":"2026-08-07T05:27:04.922660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-07T05:27:04.926476Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training.arXiv preprint arXiv:2501.17161, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.926476Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:951ff59f4313204ce2330126090728333ed8ed06c7ed34a7f5ce450ab1ba8152","observation_id":"03394a63-8b2d-453b-831a-db6468728ed7","resolution":{"observed_at":"2026-08-07T05:27:04.926476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T05:27:04.930282Z","title":"s1: Simple test-time scaling.arXiv preprint arXiv:2501.19393, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.930282Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:17aedfae6eb3426ede78251d8ed148618e1d5fba6d2a7fce6e38ca75a67fdf18","observation_id":"3fb95a9b-1dc8-4365-8085-9f50c9b4469e","resolution":{"observed_at":"2026-08-07T05:27:04.930282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-07T05:27:04.934233Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models.arXiv preprint arXiv:2504.11468, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.934233Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:e2e7e5c0ff4f52c608c49b7a59bad85f9828d14190b17e6aedb98b768279ac26","observation_id":"822dc9e1-c613-4d34-ac15-2d56b77e2daa","resolution":{"observed_at":"2026-08-07T05:27:04.934233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-07T05:27:04.938064Z","title":"Open- vlthinker: An early exploration to complex vision-language reasoning via iterative self- improvement.arXiv preprint arXiv:2503.17352, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.938064Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:0b4574c6bf4e7318293d40a78e2bfa26bb3f9af5dcf91f152930c0b6855b5b15","observation_id":"495b0a75-d03b-463d-83cb-f010a3d40fbf","resolution":{"observed_at":"2026-08-07T05:27:04.938064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-07T05:27:04.941900Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization.arXiv preprint arXiv:2503.12937, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.941900Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:4d9a8ddec4bd639c36e57df200dbab3acccd9af3a3e02c16a83e1339bd58d922","observation_id":"5894646a-2c5d-4728-b863-800dbed0db4a","resolution":{"observed_at":"2026-08-07T05:27:04.941900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-07-06T20:52:09.743730Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-07T05:27:04.945637Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization.arXiv preprint arXiv:2503.10615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.945637Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:3b5add27f20ea594775668b06c8d0ebd5ee07f6d8bebae3aa67bb69900285429","observation_id":"b32720cc-9242-4df5-9434-3ef7c2fcbb91","resolution":{"observed_at":"2026-08-07T05:27:04.945637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10291","last_updated":"2025-03-13T12:03:37Z","snapshot_observed_at":"2026-07-06T20:51:59.624697Z","submitted_at":"2025-03-13T12:03:37Z","title":"VisualPRM: An Effective Process Reward Model for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10291","snapshot_observed_at":"2026-08-07T05:27:04.949338Z","title":"Visualprm: An effective process reward model for multimodal reasoning.arXiv preprint arXiv:2503.10291, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.949338Z"},"links":{"cited_paper":"/paper/2503.10291","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:c399c1a235c9deb583afd4e17c32f2a0be6dc2c3d0da147314ae8b1a20a1356e","observation_id":"b65f2783-cb81-4d0b-81c6-d4f0b5b9c89e","resolution":{"observed_at":"2026-08-07T05:27:04.949338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-07-06T20:49:27.466064Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T05:27:04.953540Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models.arXiv preprint arXiv:2503.06749, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.953540Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:1264af9afc5f2cf78f8837dab764d01e978cd2bd9fa1510c1c81f8bbd76d0768","observation_id":"52f93ccf-1a8f-4b7b-a910-5f065c564f82","resolution":{"observed_at":"2026-08-07T05:27:04.953540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-07T05:27:04.957024Z","title":"Vl- rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.957024Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:e21ee053a2d72803941fbe6ca7379e54363b52e874eb76326a6853487ffec187","observation_id":"853b1ea0-8045-4c13-85fe-1bc958a89ac2","resolution":{"observed_at":"2026-08-07T05:27:04.957024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16656","last_updated":"2025-06-06T07:27:18Z","snapshot_observed_at":"2026-08-04T14:10:02.519865Z","submitted_at":"2025-04-23T12:24:10Z","title":"Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16656","snapshot_observed_at":"2026-08-07T05:27:04.960499Z","title":"Skywork r1v2: Multimodal hybrid reinforcement learning for reasoning.arXiv preprint arXiv:2504.16656, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.960499Z"},"links":{"cited_paper":"/paper/2504.16656","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:7c704f4da831151dde2a9055793f240538e94949e7a07407a9722379728cb668","observation_id":"c9527092-abfe-40c2-90fc-066cb510a9a0","resolution":{"observed_at":"2026-08-07T05:27:04.960499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:04.964036Z","title":"Noisyrollout: Reinforcing visual reasoning with data augmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.964036Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:530fac80b523a10440534249591de2f1e775c1027396ee570d92c7ea72d0d605","observation_id":"2be5a1d3-a000-4c5f-9957-538d64e23047","resolution":{"observed_at":"2026-08-07T05:27:04.964036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:04.967572Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.967572Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:d1fc41315314c96e41718ecf75d2b470403cb5199ff27a07807cd70b0fbd251e","observation_id":"931c915c-c4eb-46fc-a16f-3c8a5d0e56df","resolution":{"observed_at":"2026-08-07T05:27:04.967572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-07-06T16:09:09.018523Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-07T05:27:04.971025Z","title":"Seamlessm4t: Massively multilingual & multimodal machine translation.arXiv preprint arXiv:2308.11596, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.971025Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:64ff1051490d140dda5db9c4664ffd0fa495134027419f370f958ce54a355a75","observation_id":"4360f939-c564-4e2d-b0db-dd4d8b278137","resolution":{"observed_at":"2026-08-07T05:27:04.971025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:04.974789Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing.IEEE Journal of Selected Topics in Signal Processing, 16(6):1505–1518, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.974789Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:d65833af6fa0b713e85565fb5dc2127289d8daf43dad545976f18afb6bf5b768","observation_id":"734dfa59-790b-4812-9760-d728fd635084","resolution":{"observed_at":"2026-08-07T05:27:04.974789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T05:27:04.979169Z","title":"Videochat: Chat-centric video understanding.arXiv preprint arXiv:2305.06355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.979169Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:11349bfc921aa987e82059f597a64ba756b738a7766187728f9f4d497e7796b5","observation_id":"43752052-9380-4f73-bef0-41ec3dc11c36","resolution":{"observed_at":"2026-08-07T05:27:04.979169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T05:27:04.982714Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding.arXiv preprint arXiv:2306.02858, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.982714Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:f70b0872e2b74d37c70d996936da8ee9f495423041f94e4763038084f0e8a9a4","observation_id":"ad8d57d7-e276-4a9d-acab-25b25134dd35","resolution":{"observed_at":"2026-08-07T05:27:04.982714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T05:27:04.986725Z","title":"Minigpt-4: En- hancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.986725Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:c8cc7899a5741a3bd83e2cfe2a78fd9844305a581a5179660e741b95ffc8d464","observation_id":"53b78e31-cdda-46c9-8643-9501c5f25b5c","resolution":{"observed_at":"2026-08-07T05:27:04.986725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T05:27:04.990004Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.990004Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:0c5c5977900f0bcc40e0aedd668b242520b5e605aad08a8123dec1d7d2cd3823","observation_id":"0bb33cbc-892d-4c18-906c-d4aadfe706ef","resolution":{"observed_at":"2026-08-07T05:27:04.990004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:04.993533Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.993533Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:e40a61644011860a658374408119198353858cf7a4038f96a6e4e79bd778301d","observation_id":"3691229f-741c-4818-8bb2-a29dd3b1b139","resolution":{"observed_at":"2026-08-07T05:27:04.993533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:04.997106Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.997106Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:7a7203fa94d02ee2467777f86c860984f45b1d22de21eed5d31c1389e2dd91ee","observation_id":"cca83f3e-479e-4246-af88-9e0ac8d0177e","resolution":{"observed_at":"2026-08-07T05:27:04.997106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T05:27:05.000341Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.000341Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:74606953cdf472ee60d46a3d2194138611931610dff90ca44bca1f15b14659a3","observation_id":"773ba099-657e-40ee-b8de-4024deea19f1","resolution":{"observed_at":"2026-08-07T05:27:05.000341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T05:27:05.004085Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.004085Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:5868f95fc3b9ae11c74d7fd7f5c1e0c2a79f9e66407e7b9ef47653f68cf426e4","observation_id":"f2523b7a-b2f7-45dc-9ef8-6112f043af83","resolution":{"observed_at":"2026-08-07T05:27:05.004085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.007607Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.007607Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:257e6eecbaa26c1d98674f03262b943c2b07d63b8b9b0be2abac00800ac945b8","observation_id":"ea755578-ed6e-48c1-a8fc-4b270399c075","resolution":{"observed_at":"2026-08-07T05:27:05.007607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T05:27:05.011264Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.011264Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:8bc7f1763a1b699352d1c3337ed8b82da1b0beb90dc044e6a624ed98bb0450be","observation_id":"c6e4bad6-63ba-4c71-bc04-1cd724b58701","resolution":{"observed_at":"2026-08-07T05:27:05.011264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.014866Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.014866Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:e2e051a41601760fa45844e866b6ac2f18a608707ab64f6e7572d38307ee9dbf","observation_id":"85856486-bfae-44a9-a157-c0638ef44a41","resolution":{"observed_at":"2026-08-07T05:27:05.014866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T05:27:05.018179Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.arXiv preprint arXiv:2404.16821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.018179Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:c3aee237e97fe32443097d894d2ce37a0419d9d6ccf0fa63d2428e2a1123b9bd","observation_id":"866e57e5-febe-4c62-a48f-569875f5fdc9","resolution":{"observed_at":"2026-08-07T05:27:05.018179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T05:27:05.021821Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.021821Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:8130537997b6431e132855b2516ccb32d10af6e42117a2db85fb832512bb646d","observation_id":"4d41cacd-b65d-4fad-ad0e-98d679aad327","resolution":{"observed_at":"2026-08-07T05:27:05.021821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T05:27:05.025413Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.025413Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:951d69cf88e310d5a639d4e45d7db7c073a012521fe1f7f7e5c2e30e7540e623","observation_id":"743ef82d-e42c-42e6-9bdd-0f9672ef23e6","resolution":{"observed_at":"2026-08-07T05:27:05.025413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T05:27:05.028712Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.028712Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:afc7828648ddc7fd241d65b65c39e2e04a90b9700fe51cc82ac3868569856bd3","observation_id":"c9f02f92-f888-404a-bb3a-02e0f1357460","resolution":{"observed_at":"2026-08-07T05:27:05.028712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T05:27:05.032184Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.032184Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:515eb336ba2030a24c9d7ae8ede4ae0f54f7a70e9ee665fe644a73786ddfb527","observation_id":"a55093e7-af8c-4648-80c8-294a51b3d510","resolution":{"observed_at":"2026-08-07T05:27:05.032184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.035668Z","title":"Claude.https://www.anthropic.com/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.035668Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:0bfac1a1d535438db83160bfec659c1f9ed3feb6f8f9850c694ce2c16e39cc79","observation_id":"c1f62a4c-2475-4afe-8820-7f6546cb2512","resolution":{"observed_at":"2026-08-07T05:27:05.035668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.039295Z","title":"Grok.https://x.ai/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.039295Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:f1c2f11e22815757f361de7f6724a8e9bfb238ca6e009273d447f8af1ab6d459","observation_id":"a1f81c7e-41dc-4c9f-a147-ca620750ba25","resolution":{"observed_at":"2026-08-07T05:27:05.039295Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.042756Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.042756Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:254b72a1c6a22424189b83ec83d4f39d8b745dbb5bb674b92cddb5d3b26b8163","observation_id":"580d4b2b-7a81-4cf8-a2d8-cf1b67f926ee","resolution":{"observed_at":"2026-08-07T05:27:05.042756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.046056Z","title":"Large language models are zero-shot reasoners.Advances in neural information processing systems, 35:22199–22213, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.046056Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:e917cc6287dd1e6fa45d7a68be19c3ff29d961ab454d39f1517ea2867bf8e091","observation_id":"217880b1-42c6-488a-b0f8-96e668dc1cee","resolution":{"observed_at":"2026-08-07T05:27:05.046056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T05:27:05.050109Z","title":"Mul- timodal chain-of-thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.050109Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:1eb3247a8558f70dc699b05c5f01e1af94276d53a9b55ad89dc8e41ee56f12a2","observation_id":"373b2e0a-d748-48a8-967e-69b399de2ec1","resolution":{"observed_at":"2026-08-07T05:27:05.050109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.053861Z","title":"Chameleon: Plug-and-play compositional reasoning with large language models.Advances in Neural Information Processing Systems, 36:43447–43478, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.053861Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:a190eb4dffdb70ca22349a54b764cc94341ed62274f99c7d903d23c32c0d03f1","observation_id":"f00f1f6c-04fc-4e3f-8008-a8d0088b3fbf","resolution":{"observed_at":"2026-08-07T05:27:05.053861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.057374Z","title":"Layoutllm: Layout instruction tuning with large language models for document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.057374Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:f6926e85da5015d43147afcdea6b593500c1ab2206c5bd7be81ef92fd843d006","observation_id":"eed55363-e79c-4b63-834e-d9e1eb30dab3","resolution":{"observed_at":"2026-08-07T05:27:05.057374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-07T05:27:05.060976Z","title":"Mm-react: Prompting chatgpt for multimodal reasoning and action.arXiv preprint arXiv:2303.11381, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.060976Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:4c62d7cad5e2926098cc37904f3a7d1a1c1484401e801621ca30a48343f72841","observation_id":"2b587f56-f0a4-4f1f-a570-c273cdc5878a","resolution":{"observed_at":"2026-08-07T05:27:05.060976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02582","last_updated":"2024-01-05T00:26:07Z","snapshot_observed_at":"2026-07-06T17:11:50.961895Z","submitted_at":"2024-01-05T00:26:07Z","title":"CoCoT: Contrastive Chain-of-Thought Prompting for Large Multimodal Models with Multiple Image Inputs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02582","snapshot_observed_at":"2026-08-07T05:27:05.064735Z","title":"Cocot: Contrastive chain-of-thought prompting for large multimodal models with multiple image inputs.arXiv preprint arXiv:2401.02582, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.064735Z"},"links":{"cited_paper":"/paper/2401.02582","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:807cb98b1aede5f566fedea7f7a8c2d6d406750aca07299b5a41396f180ba4b2","observation_id":"5793574b-1f18-435d-8eb9-a6f95939c91f","resolution":{"observed_at":"2026-08-07T05:27:05.064735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.068394Z","title":"Compositional chain-of- thought prompting for large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.068394Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:c1db72fde347410794132c6d455b43165c2ea70d7bc581a357f4b1c618fc102a","observation_id":"25e96661-8911-472f-b823-13befa0f4b47","resolution":{"observed_at":"2026-08-07T05:27:05.068394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.072062Z","title":"Ddcot: Duty-distinct chain-of-thought prompting for multimodal reasoning in language models.Advances in Neural Information Processing Systems, 36:5168–5191, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.072062Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:9f50ced6dc174236f88899834e088c605bc35d05790729983569ffb20ca19b8d","observation_id":"4093cbf7-d757-4e22-86d6-75ffac09711c","resolution":{"observed_at":"2026-08-07T05:27:05.072062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03321","last_updated":"2024-10-04T11:18:41Z","snapshot_observed_at":"2026-07-06T19:27:37.936219Z","submitted_at":"2024-10-04T11:18:41Z","title":"Visual-O1: Understanding Ambiguous Instructions via Multi-modal Multi-turn Chain-of-thoughts Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03321","snapshot_observed_at":"2026-08-07T05:27:05.075376Z","title":"Visual-o1: Understanding am- biguous instructions via multi-modal multi-turn chain-of-thoughts reasoning.arXiv preprint arXiv:2410.03321, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.075376Z"},"links":{"cited_paper":"/paper/2410.03321","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:e00f529a2cc54b48651a13662a39fa2963b17841eaa8b71d26ec75edec288167","observation_id":"c88c960c-7624-418f-870a-1bde9f3e909d","resolution":{"observed_at":"2026-08-07T05:27:05.075376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.078937Z","title":"Visual chain-of-thought prompting for knowledge-based visual reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.078937Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:c5e9ad62bc803acdaf46bb3609f197ef58ebe5a8f3cf0b739a37388f5f10c084","observation_id":"722c6d23-e56b-4f1e-8965-a73b0ea02771","resolution":{"observed_at":"2026-08-07T05:27:05.078937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-07-06T19:51:05.604758Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T05:27:05.083376Z","title":"Llava-o1: Let vision language models reason step-by-step.arXiv preprint arXiv:2411.10440, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.083376Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:b1fc6651d4689771074bdc01e3c835e02c0296aec5b16dab8e7e37af2959bef8","observation_id":"8b2136dc-12f3-45aa-8bda-ac0ed1d08a1c","resolution":{"observed_at":"2026-08-07T05:27:05.083376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14432","snapshot_observed_at":"2026-08-07T05:27:05.088125Z","title":"Insight-v: Exploring long-chain visual reasoning with multimodal large language models.arXiv preprint arXiv:2411.14432, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.088125Z"},"links":{"cited_paper":"/paper/2411.14432","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:68dbb468ad8a2e066892536c3c2c20cc8f42a4b34853df29a6ad73923b2de2ec","observation_id":"b21cc11a-7cb7-4090-b1d7-b43f9e8a02c6","resolution":{"observed_at":"2026-08-07T05:27:05.088125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-07T05:27:05.091700Z","title":"Llamav-o1: Rethinking step-by-step visual reasoning in llms.arXiv preprint arXiv:2501.06186, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.091700Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:c2c45d704e8ba4c22e0d77f6524f903a5cac37e9f90697c86897acde275bdc37","observation_id":"38fca845-86fc-4356-abf4-22a29e52629f","resolution":{"observed_at":"2026-08-07T05:27:05.091700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21277","last_updated":"2025-05-21T06:08:31Z","snapshot_observed_at":"2026-08-05T20:11:59.994752Z","submitted_at":"2025-04-30T03:14:28Z","title":"Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21277","snapshot_observed_at":"2026-08-07T05:27:05.095888Z","title":"Reinforced mllm: A survey on rl-based reasoning in multimodal large language models.arXiv preprint arXiv:2504.21277, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.095888Z"},"links":{"cited_paper":"/paper/2504.21277","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:cd7f782d93e67e39bc528d8c5988fe9f28c8268b00521002bddfa28ae06124f7","observation_id":"c4e8ca4e-e792-4925-8635-57e9b487c9aa","resolution":{"observed_at":"2026-08-07T05:27:05.095888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.099935Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.099935Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:aa3784bae98b954d5367a1ab52e60217f6d61e479bdb8ef46a8c9b458f745f40","observation_id":"d226f46e-6381-44ed-a5dd-84a08c35a2d9","resolution":{"observed_at":"2026-08-07T05:27:05.099935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.103227Z","title":"Relation-r1: Cognitive chain-of-thought guided reinforcement learning for unified relational comprehension.arXiv preprint arXiv:2504.14642, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.103227Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:2fe1147228fa644a5acd6ba5db4596f8fa34f7bda66c021a34ec9643d47596a9","observation_id":"f129975a-ae54-4a41-a608-82aca32d2b88","resolution":{"observed_at":"2026-08-07T05:27:05.103227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13617","last_updated":"2025-05-26T10:35:23Z","snapshot_observed_at":"2026-07-06T21:11:24.852957Z","submitted_at":"2025-04-18T10:46:22Z","title":"Compile Scene Graphs with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13617","snapshot_observed_at":"2026-08-07T05:27:05.106433Z","title":"Compile scene graphs with reinforcement learning.arXiv preprint arXiv:2504.13617, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.106433Z"},"links":{"cited_paper":"/paper/2504.13617","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:6d4b9183d77f4aff0d72a0535cd5474620bf022374f2f89f98849a24b57e5b4a","observation_id":"aa3c6233-1240-410d-b735-770dffa707f5","resolution":{"observed_at":"2026-08-07T05:27:05.106433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12680","last_updated":"2025-04-17T06:16:11Z","snapshot_observed_at":"2026-07-06T21:10:46.664436Z","submitted_at":"2025-04-17T06:16:11Z","title":"Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12680","snapshot_observed_at":"2026-08-07T05:27:05.110383Z","title":"Embodied-r: Collaborative framework for activating embodied spatial reasoning in foundation models via reinforcement learning.arXiv preprint arXiv:2504.12680, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.110383Z"},"links":{"cited_paper":"/paper/2504.12680","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:493cfe1be11cd1e0d128906477807f2b00681f67da1ce0a9563d2773baec47fc","observation_id":"fb0606e7-931c-4f6b-a038-f2783832d086","resolution":{"observed_at":"2026-08-07T05:27:05.110383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00883","last_updated":"2025-04-14T20:12:57Z","snapshot_observed_at":"2026-07-06T21:02:28.100677Z","submitted_at":"2025-04-01T15:11:11Z","title":"Improved Visual-Spatial Reasoning via R1-Zero-Like Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00883","snapshot_observed_at":"2026-08-07T05:27:05.114508Z","title":"Improved visual-spatial reasoning via r1-zero-like training.arXiv preprint arXiv:2504.00883, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.114508Z"},"links":{"cited_paper":"/paper/2504.00883","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:c2484c22c37e6edd6caf91cbac4fd237731cc6fd1f903bf9b81ab6972ee55300","observation_id":"900592f3-cb75-485e-8f6d-57cc9329113b","resolution":{"observed_at":"2026-08-07T05:27:05.114508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21696","last_updated":"2025-05-14T17:48:02Z","snapshot_observed_at":"2026-07-06T20:59:44.949088Z","submitted_at":"2025-03-27T17:00:51Z","title":"Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21696","snapshot_observed_at":"2026-08-07T05:27:05.118106Z","title":"Embodied-reasoner: Synergizing visual search, reasoning, and action for embodied interactive tasks.arXiv preprint arXiv:2503.21696, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.118106Z"},"links":{"cited_paper":"/paper/2503.21696","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:19915a3cd060e69a83bb4307b0665a79d31b994e02b28e06b507498b15f1b60f","observation_id":"d4216eaa-f78b-4267-8cf5-86dd6946c4ec","resolution":{"observed_at":"2026-08-07T05:27:05.118106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-07-06T20:48:18.268075Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-07T05:27:05.122122Z","title":"aha moment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.122122Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:6949a53c00ee34dcee6016b2f1d061483df0668b7d5ebeb37f2a5b2d9e251c85","observation_id":"103c64de-bd83-4be8-9b3f-cd361c7ee95f","resolution":{"observed_at":"2026-08-07T05:27:05.122122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07954","last_updated":"2025-04-10T17:58:27Z","snapshot_observed_at":"2026-08-04T01:05:26.679801Z","submitted_at":"2025-04-10T17:58:27Z","title":"Perception-R1: Pioneering Perception Policy with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07954","snapshot_observed_at":"2026-08-07T05:27:05.125750Z","title":"Perception-r1: Pioneering perception policy with reinforcement learning.arXiv preprint arXiv:2504.07954, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.125750Z"},"links":{"cited_paper":"/paper/2504.07954","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:fd8351cfdc396eb4da16b1fb2d62105d382228b8cae1f8eed7604d6258c014c3","observation_id":"d120e7ae-903b-489a-aa89-14f38d5d8a2f","resolution":{"observed_at":"2026-08-07T05:27:05.125750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T05:27:05.129486Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.129486Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:d327a0a2d03a411da583c19f4c4fbac14c85e3c2bc94d7f63750dd162b10c296","observation_id":"37fd741a-0b79-46df-9e00-a1c67bf22259","resolution":{"observed_at":"2026-08-07T05:27:05.129486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T05:27:05.133072Z","title":"Visual-rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.133072Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:4d9d43b7e662416c9f5a9841762845e91fdb1161f4263c55864ba6049b34798c","observation_id":"7679a474-d1ab-4409-abd9-9c4aaa7000b6","resolution":{"observed_at":"2026-08-07T05:27:05.133072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07065","last_updated":"2025-03-10T08:48:50Z","snapshot_observed_at":"2026-08-03T20:22:57.879457Z","submitted_at":"2025-03-10T08:48:50Z","title":"Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07065","snapshot_observed_at":"2026-08-07T05:27:05.136689Z","title":"Boosting the generalization and reasoning of vision language models with curriculum reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.136689Z"},"links":{"cited_paper":"/paper/2503.07065","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:78a673f6b38e65469c2858362665d1499e684a49c654a042415986ad0a726d3b","observation_id":"6348801c-8c22-4cb9-8943-fd8dbb1ab974","resolution":{"observed_at":"2026-08-07T05:27:05.136689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-05T01:42:30.194131Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-08-07T05:27:05.140729Z","title":"Seg- zero: Reasoning-chain guided segmentation via cognitive reinforcement.arXiv preprint arXiv:2503.06520, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.140729Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:803eda5d8562cb8c46422a7fb0be62366674c64e93c4de3604c3e22df682884e","observation_id":"22bc375c-4e64-45da-a171-f57595902bb2","resolution":{"observed_at":"2026-08-07T05:27:05.140729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.145217Z","title":"Crowdvlm-r1: Expanding r1 ability to vision language model for crowd counting using fuzzy group relative policy reward.arXiv preprint arXiv:2504.03724, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.145217Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:ce211e868565129c86cd2572174254dd3e2438cfc7e50781041b3e9f3ec5b349","observation_id":"d157d2d5-3671-4249-8e5b-5e86a6654f91","resolution":{"observed_at":"2026-08-07T05:27:05.145217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.148735Z","title":"Reason-rft: Reinforcement fine-tuning for visual reasoning.arXiv preprint arXiv:2503.20752, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.148735Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:066448e5bf77eee72d3bc0f8f04cf2b19ff18286551c7e871994e10aa046f910","observation_id":"4217f07e-78ef-41aa-84e8-8aa534724142","resolution":{"observed_at":"2026-08-07T05:27:05.148735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16081","last_updated":"2025-03-28T11:19:21Z","snapshot_observed_at":"2026-07-06T20:56:00.594770Z","submitted_at":"2025-03-20T12:22:18Z","title":"OThink-MR1: Stimulating multimodal generalized reasoning capabilities via dynamic reinforcement learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16081","snapshot_observed_at":"2026-08-07T05:27:05.152302Z","title":"Othink- mr1: Stimulating multimodal generalized reasoning capabilities via dynamic reinforcement learning.arXiv preprint arXiv:2503.16081, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.152302Z"},"links":{"cited_paper":"/paper/2503.16081","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:a219718d10096f93a99e5df445db5b7834483fd7d86711097332e39aa34af372","observation_id":"5fc15cf8-7aa9-4a9e-8c30-3b2432984ada","resolution":{"observed_at":"2026-08-07T05:27:05.152302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.156233Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.156233Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:070e1c17eda622b3fcfe3f1070babf7d9e752eec50e62e40db54ec47869010b4","observation_id":"c581d90e-8ee5-493f-9b53-e0e95a7b9f11","resolution":{"observed_at":"2026-08-07T05:27:05.156233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.160052Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.160052Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:6d65b753f3e05eb8a68fa1c2d242078c69a79efa8a75c9da039a70633dab61c2","observation_id":"2d04fc18-ed40-4c4a-a6e7-95235979c46f","resolution":{"observed_at":"2026-08-07T05:27:05.160052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.164402Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International journal of computer vision, 123:32–73, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.164402Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:998797b6ff0cd03c09bdd4f31f02b6d69774a267f4a9e34f14ccc4fea679f6f3","observation_id":"89861dc0-b9bf-4763-a63b-48c10926ab6c","resolution":{"observed_at":"2026-08-07T05:27:05.164402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.168039Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.168039Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:4b6ede09b2c4b85d39ec002b305147ee97f22347461a39144699877a0789e4ab","observation_id":"e381a6a3-9853-40d7-8bf7-9d101078f2ce","resolution":{"observed_at":"2026-08-07T05:27:05.168039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.171480Z","title":"Dual-glance model for deciphering social relationships","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.171480Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:5ce9ecd588bcf4c14e99365ec4dc062084d445dc6c74b86dc3547497a92542f7","observation_id":"8f3867a4-b03c-4462-b451-93b616482945","resolution":{"observed_at":"2026-08-07T05:27:05.171480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.175095Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.175095Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:5f6e8c70ff3fb7f07bce65d67ebe2ed1ba4b22fd75b171b2d091c19ae63800ba","observation_id":"ca7b2491-d32b-4813-98bb-6b7c5dc20abb","resolution":{"observed_at":"2026-08-07T05:27:05.175095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.178737Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.178737Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:fe4150ef605a6d9ba18a9dff8cf6dc7fd3fda0e48b45c92d1396f42bc28d6444","observation_id":"291d4e8a-b359-415c-b459-b6c1c0a85b02","resolution":{"observed_at":"2026-08-07T05:27:05.178737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.181987Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.181987Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:f9bc360e355fa3d7ba54772b5856a8b2cddbcdec6d0dfdd042995b1cdc08e0fc","observation_id":"a10dcfd0-96a0-4c4e-8c9c-f3242c3acade","resolution":{"observed_at":"2026-08-07T05:27:05.181987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T05:27:05.185608Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning.arXiv preprint arXiv:2203.10244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.185608Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:7aa5b30b09fd507791ef236a5d48984b1399f8d3c97dce4bbea68fbd2c580b89","observation_id":"068b58b0-13bb-4fbd-9d9e-84d6034677ae","resolution":{"observed_at":"2026-08-07T05:27:05.185608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.189776Z","title":"An augmented benchmark dataset for geometric question answering through dual parallel text encoding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.189776Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:e324cc6a5c6811f127a37acae55a1f90512894da20e9ff7813e598407098cf9f","observation_id":"b9aa5595-ee68-44df-bb08-01cfb3932d8d","resolution":{"observed_at":"2026-08-07T05:27:05.189776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.193367Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.193367Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:91ddb9dd96bec50458ee1a11bfb22bfeb037a732fae5d54e9c60b8e626a1f95e","observation_id":"7d62ce74-5137-4911-8044-048da7265ebd","resolution":{"observed_at":"2026-08-07T05:27:05.193367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.196950Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.196950Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:b19b013455b1e32ef6d8813c8caf36e8634a33a2f95d5708caf15b2729c6ba8f","observation_id":"b06efcd8-19f4-4144-843f-9821c78a36cc","resolution":{"observed_at":"2026-08-07T05:27:05.196950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05358","last_updated":"2022-08-10T14:08:34Z","snapshot_observed_at":"2026-07-06T13:40:38.776164Z","submitted_at":"2022-08-10T14:08:34Z","title":"CLEVR-Math: A Dataset for Compositional Language, Visual and Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.05358","snapshot_observed_at":"2026-08-07T05:27:05.200325Z","title":"Clevr-math: A dataset for compositional language, visual and mathematical reasoning.arXiv preprint arXiv:2208.05358, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.200325Z"},"links":{"cited_paper":"/paper/2208.05358","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:4ac7fa0be1b5c9499a9d0fb09ee256b204930dc688243872fec075a6573da296","observation_id":"eabeb259-7914-4223-8ee5-9a69dae88dbc","resolution":{"observed_at":"2026-08-07T05:27:05.200325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.00855","last_updated":"2015-05-05T01:25:26Z","snapshot_observed_at":"2026-07-06T04:16:54.272660Z","submitted_at":"2015-05-05T01:25:26Z","title":"Large-scale Classification of Fine-Art Paintings: Learning The Right Metric on The Right Feature","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.00855","snapshot_observed_at":"2026-08-07T05:27:05.204087Z","title":"Large-scale classification of fine-art paintings: Learning the right metric on the right feature.arXiv preprint arXiv:1505.00855, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.204087Z"},"links":{"cited_paper":"/paper/1505.00855","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:6810f9fd8bba00b8cd6c65a014864d9f7c78223ab320b1fd2dcd92ef2592bd79","observation_id":"6cca9462-d10f-4096-afbf-ed6e80f2ff0e","resolution":{"observed_at":"2026-08-07T05:27:05.204087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.207819Z","title":"Quality at a glance: An audit of web-crawled multilingual datasets.Transactions of the Association for Computational Linguistics, 10:50–72, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.207819Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:d338efddddfaf99e254a973b942e32304197b01b6cbd240f7c0a00351ee4da8b","observation_id":"de39bb08-53f5-4639-9513-e13008944536","resolution":{"observed_at":"2026-08-07T05:27:05.207819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-06T13:03:19.727877Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T05:27:05.211152Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.211152Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:3a735050f3cfc798418b79823ba27de9cbeb0f0807c0ef2bbbc94e039cc5ecc5","observation_id":"453ec9e4-fd2a-452c-b484-b24161f7711f","resolution":{"observed_at":"2026-08-07T05:27:05.211152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T05:27:05.214816Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.214816Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:e40c5279cccf49304f13d302080442053d5da288ffe33732bda7c5b69eb245d4","observation_id":"2217614f-6fb3-46a2-bb53-017653874857","resolution":{"observed_at":"2026-08-07T05:27:05.214816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.218695Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.218695Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:1e0eef4c3acfa6f51a9f84f52c39c2e78d15f1452a454b58a50e2e31df18b6c0","observation_id":"31eea80b-7b86-4b09-a24c-f21b2b5d36fa","resolution":{"observed_at":"2026-08-07T05:27:05.218695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.221981Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? InEuropean Conference on Computer Vision, pages 169–186","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.221981Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:47a7bbefb63c43a30978c1ca6b7aa85bcbb094bf658176b0f74a5c42ac55a7c4","observation_id":"dc998b26-193b-44a7-8a6f-d61669a8b7a9","resolution":{"observed_at":"2026-08-07T05:27:05.221981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00836","last_updated":"2025-02-24T06:55:22Z","snapshot_observed_at":"2026-07-06T19:43:46.557944Z","submitted_at":"2024-10-29T17:29:19Z","title":"DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00836","snapshot_observed_at":"2026-08-07T05:27:05.225253Z","title":"Dynamath: A dynamic visual benchmark for evaluating mathematical reasoning robustness of vision language models.arXiv preprint arXiv:2411.00836, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.225253Z"},"links":{"cited_paper":"/paper/2411.00836","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:f9b4a7f34265265d7c3a1b3353edaec6cb5e16c747b093ebdc006fba94aabe34","observation_id":"a5bc9403-a0d6-4efd-b92f-bc0e7a252ec1","resolution":{"observed_at":"2026-08-07T05:27:05.225253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-07T05:27:05.229610Z","title":"We-math: Does your large multimodal model achieve human-like mathematical reasoning?arXiv preprint arXiv:2407.01284, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.229610Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:b76cafcdfc09f8e36433b74aff24616ae5d078154bcd5d145212a0b77f7703c0","observation_id":"d11d3584-06d5-4374-867b-ff60a6a0b96f","resolution":{"observed_at":"2026-08-07T05:27:05.229610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-07T05:27:05.233360Z","title":"Logicvista: Multimodal llm logical reasoning benchmark in visual contexts.arXiv preprint arXiv:2407.04973, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.233360Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:81866be89ab5f592ee7862781c0d17e6a522c1fc4cf14f6aaf28ff8f054805dc","observation_id":"2583034b-a82f-497d-8e02-8cfb62091901","resolution":{"observed_at":"2026-08-07T05:27:05.233360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.237152Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.237152Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:cf39751f486ff40faa24621cc3ea7bf68c25f98bdb4303626e0bb44f29bf17df","observation_id":"7e6b901e-2631-4aa3-8984-2716b6426aa0","resolution":{"observed_at":"2026-08-07T05:27:05.237152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.240629Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.240629Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:36c13dcf02b01a02ba223734502d283e3d55f21958d465afd5c58d1ebd5459e8","observation_id":"6017241e-0ff7-461c-8c6f-b5ba0517dc04","resolution":{"observed_at":"2026-08-07T05:27:05.240629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-02T21:55:15.857183Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T05:27:05.244024Z","title":"Are we on the right way for evaluating large vision-language models?arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.244024Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:9c8eeb732ab60583cb479f1dd11dda03f49ad0dcdc123335f0cb9143a9e8d5f8","observation_id":"c3dbcfa2-99e2-44f3-b95c-5f8a0ae48840","resolution":{"observed_at":"2026-08-07T05:27:05.244024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.248472Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.248472Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:db14342afc068c0481620613c83061df6629352749a7466f9031c89e0aa02682","observation_id":"98464604-acdf-499c-acf3-4e38f8e7e286","resolution":{"observed_at":"2026-08-07T05:27:05.248472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.253190Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models.Science China Information Sciences, 67(12):220102, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.253190Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:0cdc616ee33bbed8afe7fe823409ea4011e22029bd5a49f1361cc3f33bd300ef","observation_id":"f24ffa82-7d1f-4a5a-818f-553dd3864afa","resolution":{"observed_at":"2026-08-07T05:27:05.253190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.256916Z","title":"Grok-1.5 vision preview: Connecting the digital and physical worlds with our first multimodal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.256916Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:9b1fd08928254f755eafd7d75f1017b9de4d625b69a60cd8a7db6fa58094cda1","observation_id":"00d2368b-9ee9-4596-bafa-2c10545d8f6f","resolution":{"observed_at":"2026-08-07T05:27:05.256916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.261384Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.261384Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:3cc014aa4fe37e64929492e91e3261d4bb5fc18b041b142655b435500e3a132a","observation_id":"fed61cc2-61ea-49e4-bd12-eddbad3687f9","resolution":{"observed_at":"2026-08-07T05:27:05.261384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T05:27:05.265419Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.265419Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:aeaa06c77acebc40cd4c4c8cdc0650b63ba9fe2430d56e52d34441714837a7cb","observation_id":"2c09f3aa-a7bc-4afb-93a0-874cd4d96168","resolution":{"observed_at":"2026-08-07T05:27:05.265419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T05:27:05.269421Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.269421Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:ce6ddc4beef8de955a821a44899d5da056c3900630749437ea0134153ceaf513","observation_id":"0738cffd-d5a9-412b-a106-c939684827a1","resolution":{"observed_at":"2026-08-07T05:27:05.269421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.273613Z","title":"Easyr1: An efficient, scalable, multi-modality rl training framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.273613Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:f5b59b02cf80c0c5f6b98e685ec6de2267fda774cfa7f3e2d257582d214ed235","observation_id":"dcc8fc6f-9d29-414e-90d5-719c3458ef99","resolution":{"observed_at":"2026-08-07T05:27:05.273613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T05:27:05.277827Z","title":"Vision Only","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.277827Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:79835be903585b41dbf721f3a041e7de8d67839035a7aba7436451207b0684af","observation_id":"40909008-8a02-4e26-98bd-9a1ed8bbe2eb","resolution":{"observed_at":"2026-08-07T05:27:05.277827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.282142Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.282142Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:02a736a156374e55e6386fb5be472c5894db63ff808fbe49337cac10b35822eb","observation_id":"522bca22-8ced-4f8f-b805-8fd38471bdb4","resolution":{"observed_at":"2026-08-07T05:27:05.282142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":99,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":125},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 125 outbound references and 8 inbound Pith citation observations for arXiv:2506.07905."}