{"as_of":"2026-08-09T03:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:37c51ffa30ac60eb794cc232f77d37a42bf2cdcce64f574d486b7de24bf58318","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:21:13.972406Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T06:45:27.857034Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T13:56:19.149879Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"cited_work":{"arxiv_id":"2602.08503","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.08503","snapshot_observed_at":"2026-07-09T13:56:19.149879Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","venue":"cs.CV","work_id":"64c350c2-fcd1-4b2e-94f8-11be748d3b0e","year":2026},"citing_paper":{"arxiv_id":"2607.07361","last_updated":"2026-07-10T08:24:37Z","snapshot_observed_at":"2026-08-08T11:59:10.159319Z","submitted_at":"2026-07-08T12:56:39Z","title":"BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning","version":1},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-07-09T13:51:49.149342Z"},"links":{"cited_paper":"/paper/2602.08503","citing_paper":"/paper/2607.07361"},"observation_digest":"sha256:4a6a232740ed05a07e096ffa8c8c86f5a8cb769abd3762aa5c1e7880d2d44951","observation_id":"787af9da-b4b9-412f-96b4-ce2c6b31134d","resolution":{"observed_at":"2026-07-09T13:56:19.151657Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.08503","snapshot_observed_at":"2026-07-13T06:45:27.857034Z","title":"arXiv preprint arXiv:2602.08503 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.07361","last_updated":"2026-07-10T08:24:37Z","snapshot_observed_at":"2026-08-08T11:59:10.159319Z","submitted_at":"2026-07-08T12:56:39Z","title":"BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning","version":2},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-07-13T06:45:27.857034Z"},"links":{"cited_paper":"/paper/2602.08503","citing_paper":"/paper/2607.07361"},"observation_digest":"sha256:8bc6fc00eeeb8b7b84e4dca92dc77426352b41a26ccd1531fbc0edcf45b61c5c","observation_id":"5090e2b1-e65a-45bb-94b1-ff5bb52dd9a7","resolution":{"observed_at":"2026-07-13T06:45:27.857034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.08503/citation-record","integrity":"/paper/2602.08503/integrity","json":"/paper/2602.08503/citation-record.json","paper":"/paper/2602.08503"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.828338Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.828338Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:1528f3b72565566277c5d7c052510b044d1d1a33bf32a3eeebfaefd9824ee5a5","observation_id":"70d0a3f6-bd21-4ac1-b7cd-7906b79348f9","resolution":{"observed_at":"2026-08-03T03:21:13.828338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.832568Z","title":"Claude 3.5 sonnet model card addendum, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.832568Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:ac71d2e0bc008cf80f817effead80b27e9d162904c52303a2d98c371fe47cbc8","observation_id":"205c4f7f-7bd0-4aec-85c4-f305160be02d","resolution":{"observed_at":"2026-08-03T03:21:13.832568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-03T03:21:13.836456Z","title":"V., R \\'e , C., and Mirhoseini, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.836456Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:936ecaed10a4afba84de8a3d902d5f446bd9a611ac8bb12056a480dab160b3fa","observation_id":"57b51591-3107-47f4-aa48-85ae14a2c6fa","resolution":{"observed_at":"2026-08-03T03:21:13.836456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.840209Z","title":"Are we on the right way for evaluating large vision-language models? Advances in Neural Information Processing Systems, 37: 0 27056--27087, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.840209Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:aa2cf741503578d0f1eb04cd94918ccd23a125a0e4c5a926adf6df5f18ffe1bd","observation_id":"f67dda4e-51dc-4deb-8b03-fe056126c410","resolution":{"observed_at":"2026-08-03T03:21:13.840209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-03T03:21:13.843641Z","title":"Towards reasoning era: A survey of long chain-of-thought for reasoning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.843641Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:abe3183245d78e82e0b44f115b681845db00c88a186998599e9d8530ea568071","observation_id":"4edfbaf5-67a7-4414-a103-f4cb6245babe","resolution":{"observed_at":"2026-08-03T03:21:13.843641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-03T03:21:13.847157Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.847157Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:eb6b3cb3b902c4e62953da490c4bee7b1c2342901cd8ad0870dc8c050a64039f","observation_id":"5600bfb2-b8fa-4f5f-94ec-feae0a016c92","resolution":{"observed_at":"2026-08-03T03:21:13.847157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.850757Z","title":"and Zhang, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.850757Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:0a6575daa2d2c68afbae031c34cb7f8c17faf2fc10cb89628bbacb22aa31e871","observation_id":"d32c93b9-8e3d-4f66-a9b7-221f9d1ef093","resolution":{"observed_at":"2026-08-03T03:21:13.850757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.854074Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.854074Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:b6c0f878ac77e47436f0c7b9269079dec8c8ca66d31aef514ac4cb6c4512d639","observation_id":"29de44e6-5691-4c03-9cd4-d874e2091a90","resolution":{"observed_at":"2026-08-03T03:21:13.854074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.857385Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.857385Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:48e22f452f4596fab355fd8ada0b445f2ab62afa9aecbdb59f2bbfa05f4160c0","observation_id":"7c2899e4-2dc5-4a85-9214-117d522bbe4c","resolution":{"observed_at":"2026-08-03T03:21:13.857385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T03:21:13.860519Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.860519Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:33c3765b5d1f79f89050c8b0759edebbaa1593aa647b212565ef1a76e1891a77","observation_id":"34583ee4-ee0c-444b-9d70-25bfed191d29","resolution":{"observed_at":"2026-08-03T03:21:13.860519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T03:21:13.864335Z","title":"P., Perelman, A., Ramesh, A., Clark, A., Ostrow, A., Welihinda, A., Hayes, A., Radford, A., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.864335Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:ed8506d4c33f74742a9a0405323b5d969a359351e988e8fc39211c5526873bea","observation_id":"02e915b1-c889-4e9b-9790-b3b84e4d5e7e","resolution":{"observed_at":"2026-08-03T03:21:13.864335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-03T03:21:13.867754Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.867754Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:e098596f9d720e3e1226ab33d7badbb2265872dbbe12ed53fefa12faae0bc9e9","observation_id":"ffcab89f-e46e-4187-b1c6-ef46b7c0af0a","resolution":{"observed_at":"2026-08-03T03:21:13.867754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.871940Z","title":"Look again, think slowly: Enhancing visual reflection in vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.871940Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:179f0aadfc766c64c9b9b9c5562deef49e68bddec863c281dd932079809faaf1","observation_id":"d022775d-2220-4123-95db-46bdbddfefa3","resolution":{"observed_at":"2026-08-03T03:21:13.871940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-03T03:21:13.875111Z","title":"D., Singh, A., Baumli, K., Iqbal, S., Bishop, C., Roelofs, R., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.875111Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:b0248f4308a32f1913e494e63d83571f8aad80f3bb5bb566fbf220f0a2f10dec","observation_id":"a315bf8b-9604-4635-b73d-915505ca5c78","resolution":{"observed_at":"2026-08-03T03:21:13.875111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.878279Z","title":"H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.878279Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:79a063a092e8e55244b247714f58f3d8b085913df614f34955516b2c9e43f24e","observation_id":"eac0620b-09e0-4fbf-aab3-ad8008beed43","resolution":{"observed_at":"2026-08-03T03:21:13.878279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-03T03:21:13.881298Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.881298Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:9ec7a053925eb0aaec1dc042e7a33268e24ecd0bed3d1ea04254801a091ac8f5","observation_id":"a9fdc6b7-6594-45f7-a494-178c7ef5778a","resolution":{"observed_at":"2026-08-03T03:21:13.881298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.884637Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.884637Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:44248c83e21c80f07216f5cb05f0c964e25b4e4bb02ed9879a963ba55d34cdcf","observation_id":"b8f5a1e8-506d-4662-aba7-03be9d80e269","resolution":{"observed_at":"2026-08-03T03:21:13.884637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04165","last_updated":"2021-07-20T23:22:27Z","snapshot_observed_at":"2026-08-06T13:29:31.050456Z","submitted_at":"2021-05-10T07:46:55Z","title":"Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04165","snapshot_observed_at":"2026-08-03T03:21:13.887624Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.887624Z"},"links":{"cited_paper":"/paper/2105.04165","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:224bfab0b1bb93811cdaede1b52b606c682128b4225152cd580b64b61472ef1d","observation_id":"42dead94-8c66-4fb5-b628-9b550f2e79cc","resolution":{"observed_at":"2026-08-03T03:21:13.887624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-03T03:21:13.891083Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.891083Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:735d02a7d33ef17d893fbdd845a3f93893e6c43725ab8398aee38851d4b74d30","observation_id":"059a77d4-f74b-4a8b-a71f-78d97344c433","resolution":{"observed_at":"2026-08-03T03:21:13.891083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.894328Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.894328Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:c2a637c1cce074c763f30d5754f58f701a9a4dc8293efcd46a527d48ea27f6f9","observation_id":"b43e7b87-370d-4494-844d-54a9bc84120c","resolution":{"observed_at":"2026-08-03T03:21:13.894328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.897277Z","title":"L., Tan, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.897277Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:1836cf80f08b04ec94953779a8620880477c6c8bce66b9ae2e3c49426bffde57","observation_id":"42d150b9-d757-4e55-b8d5-847ca62dff35","resolution":{"observed_at":"2026-08-03T03:21:13.897277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05599","last_updated":"2025-06-09T11:44:18Z","snapshot_observed_at":"2026-08-07T16:07:44.263463Z","submitted_at":"2025-04-08T01:19:20Z","title":"Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05599","snapshot_observed_at":"2026-08-03T03:21:13.900352Z","title":"Skywork r1v: Pioneering multimodal reasoning with chain-of-thought","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.900352Z"},"links":{"cited_paper":"/paper/2504.05599","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:7c28a8aea5d57468c6d41cc0c6624d6e751441a5ea71020e62dc2bfd640fd88d","observation_id":"c85aff74-3635-4b8a-bb67-dcca7a2768bb","resolution":{"observed_at":"2026-08-03T03:21:13.900352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.903784Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.903784Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:45450ddb339938135e5f1d624e19424fc4ff6ea9fb537a887a3996ba65b39e94","observation_id":"750a83f8-29ea-4732-b46c-a8bf25f968a5","resolution":{"observed_at":"2026-08-03T03:21:13.903784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T03:21:13.906826Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.906826Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:d7b8eb99624d47c319c068df7a96fea3bab5a8188177350034d3da768c730c68","observation_id":"0a0de85f-d0fb-4ac1-8123-c374e7e4026c","resolution":{"observed_at":"2026-08-03T03:21:13.906826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.909940Z","title":"Srpo: Enhancing multimodal llm reasoning via reflection-aware reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.909940Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:ca739e10912f7421e5a9bf095e6035988f987b1db08f321232203c6917b6b05d","observation_id":"3aff086c-97a1-4861-96b9-0f125780ac6a","resolution":{"observed_at":"2026-08-03T03:21:13.909940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-03T03:21:13.913033Z","title":"Vl-rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.913033Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:e7e57200315b50c43935efb82467a19eb153532fed9c1ad3df46e1a8340d45aa","observation_id":"def79938-6814-47ff-95bc-e777b88801a7","resolution":{"observed_at":"2026-08-03T03:21:13.913033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-03T03:21:13.917664Z","title":"Internvl3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.917664Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:827d6cd93a7801103d261717b4317d4806c80d5c172d42f6dbebd84bb56d6ab2","observation_id":"4fde56f7-fc30-47f7-a5b5-25c842b4b746","resolution":{"observed_at":"2026-08-03T03:21:13.917664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07934","last_updated":"2025-05-30T15:53:16Z","snapshot_observed_at":"2026-08-07T16:06:46.096701Z","submitted_at":"2025-04-10T17:49:05Z","title":"SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07934","snapshot_observed_at":"2026-08-03T03:21:13.921539Z","title":"Sota with less: Mcts-guided sample selection for data-efficient visual reasoning self-improvement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.921539Z"},"links":{"cited_paper":"/paper/2504.07934","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:b5dfdc6cd4f6ac7c853ece4432852472f8007052ca4edee17ed02eb93d4555cb","observation_id":"1478b99e-35d9-45ef-b481-a9237ec9ca09","resolution":{"observed_at":"2026-08-03T03:21:13.921539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.924847Z","title":"Charxiv: Charting gaps in realistic chart understanding in multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.924847Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:9f1c5eeabc234517f7fe3b36250b1543fac0e76afb8f7de445bc08b579f59d09","observation_id":"76033a86-4052-42d2-bb78-d5c307e40699","resolution":{"observed_at":"2026-08-03T03:21:13.924847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.927695Z","title":"V., Zhou, D., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.927695Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:0ab132da73d8bd579a87f68ddba57571eabb45c822aad312fec7a1050f3b33a3","observation_id":"c065b604-b9e3-4e69-84f2-dd8ab5341b75","resolution":{"observed_at":"2026-08-03T03:21:13.927695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-03T03:21:13.930637Z","title":"Mimo-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.930637Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:1ee720b8b8cc1900ba484e43863376da78dc7901c0e46a75f015999be30b48b5","observation_id":"9f537819-a78b-4e4e-8494-e6c407fc8e08","resolution":{"observed_at":"2026-08-03T03:21:13.930637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.933805Z","title":"Llava-cot: Let vision language models reason step-by-step","venue":null,"work_id":null,"year":2087},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.933805Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:f9a40395e881956368a671c49d4f8969ebc7bbd0bb31233e6191bc09dbed2db5","observation_id":"120a71e1-6f58-4d1e-822a-b6a170ba68d8","resolution":{"observed_at":"2026-08-03T03:21:13.933805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T03:21:13.936891Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.936891Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:0819934e2f303b4274786bbb5a473acc7606c3efe3482dd238a8d4c5a0444aa5","observation_id":"f3896ec2-27d8-4c99-918e-7b4aba42deeb","resolution":{"observed_at":"2026-08-03T03:21:13.936891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-03T03:21:13.939966Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.939966Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:8d271f166c7b6e9800eb327048922934af433c081ec9a6f6ec2426e52951791e","observation_id":"8f6e4d58-357f-4d24-a45c-e2b88533f0d7","resolution":{"observed_at":"2026-08-03T03:21:13.939966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.943200Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.943200Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:b48474e851e5ab70286808302c87743fbd69b0a216574d8979cdf93ddd2718bc","observation_id":"aaa2445b-b441-4f51-9e5b-f79ef4f19982","resolution":{"observed_at":"2026-08-03T03:21:13.943200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-03T03:21:13.946237Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model? arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.946237Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:1824ab7522bbf5a7862ec8f2d1daedba7824ad562b421070995e86eb625a870a","observation_id":"66bcf109-c5c6-4e75-b892-2d5608f460bb","resolution":{"observed_at":"2026-08-03T03:21:13.946237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.949689Z","title":"Evolving llms' self-refinement capability via iterative preference optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.949689Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:658259fc0985da241ce6cea6c2299e865202f931ab04874456d445e26d509f0d","observation_id":"cda9b2f5-09e6-4d90-b771-8bf4a4e68d19","resolution":{"observed_at":"2026-08-03T03:21:13.949689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-03T03:21:13.952698Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.952698Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:efff44380314bdc5c164324c44366b618ea5f8e51df2680071a8277d25008c86","observation_id":"775c1e07-9e2e-440e-aed9-28be4a1a3986","resolution":{"observed_at":"2026-08-03T03:21:13.952698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.955811Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pp.\\ 169--186","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.955811Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:e94b099a5f48396d0a9f6158ecbc710ce236f26f9b188c6351c20cc46a04013a","observation_id":"8f22f2d1-250d-4936-8c9a-e3f03266fc8b","resolution":{"observed_at":"2026-08-03T03:21:13.955811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.959015Z","title":"Small language models need strong verifiers to self-correct reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.959015Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:1612f5afacbbfd5a273a0e74e938fd9fb53fb6a81bd20f543e4c2eed934be943","observation_id":"ace3ceb4-62cd-442f-888e-6f48df7e1117","resolution":{"observed_at":"2026-08-03T03:21:13.959015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13257","snapshot_observed_at":"2026-08-03T03:21:13.961875Z","title":"Mme-realworld: Could your multimodal llm challenge high-resolution real-world scenarios that are difficult for humans? arXiv preprint arXiv:2408.13257, 2024 c","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.961875Z"},"links":{"cited_paper":"/paper/2408.13257","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:020440b5d385ebc471cf60de0e68d0a79cde1dc899f813cfbb3d8ce8767f9663","observation_id":"5600fd11-4511-4c33-8d85-fc507c4a1722","resolution":{"observed_at":"2026-08-03T03:21:13.961875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-03T03:21:13.965141Z","title":"Group sequence policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.965141Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:2bb5ef8a4ceb759b3fffe506db65397bca7ce5b3c3e2e476688a42ea455cf6c4","observation_id":"fe9308a1-b17b-4d04-9f31-13d65d4fd0f6","resolution":{"observed_at":"2026-08-03T03:21:13.965141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-03T03:21:13.968926Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.968926Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:d669cfa17a88dbb78176100c569295349cc0108b8ca80d9a989280ebfd9ab7bf","observation_id":"b05f92e3-598b-4804-9a38-39866bb2bc59","resolution":{"observed_at":"2026-08-03T03:21:13.968926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:21:13.972406Z","title":"Easyr1: An efficient, scalable, multi-modality rl training framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.972406Z"},"links":{"citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:2c11dd3fafb5549ef451c29fe082194685848b2406fea54fdb1c37bf9c6c0f37","observation_id":"c7f138cb-58e0-4824-a831-82b22c490c80","resolution":{"observed_at":"2026-08-03T03:21:13.972406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 2 inbound Pith citation observations for arXiv:2602.08503."}