{"as_of":"2026-08-09T20:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b4d8d22dc9a3fe339c76a2937e0a197a0ded77cb74db9f8828e9db4a125f68d4","coverage":[{"denominator":91,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":91,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:13:01.038049Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T01:47:07.116263Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:20:06.732932Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22334","snapshot_observed_at":"2026-08-04T00:15:16.101741Z","title":"Advancing multimodal reasoning via reinforcement learning with cold start","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02360","last_updated":"2026-05-26T12:26:50Z","snapshot_observed_at":"2026-08-04T00:15:08.705793Z","submitted_at":"2025-11-04T08:28:46Z","title":"LaRe: Latent Refocusing for Multimodal Reasoning","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T00:15:16.101741Z"},"links":{"cited_paper":"/paper/2505.22334","citing_paper":"/paper/2511.02360"},"observation_digest":"sha256:e15cc08347ca054e25fa957a5fdaabd70c42945f63d282123865617dcf68ecec","observation_id":"d4ad2234-a99e-4036-ad53-08bfec05eca6","resolution":{"observed_at":"2026-08-04T00:15:16.101741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"cited_work":{"arxiv_id":"2505.22334","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22334","snapshot_observed_at":"2026-07-04T19:20:06.732932Z","title":"Advancing multimodal reasoning via reinforcement learning with cold start","venue":null,"work_id":"d3d741cd-38dd-4d73-ad7c-d1523d720cc7","year":2025},"citing_paper":{"arxiv_id":"2604.16896","last_updated":"2026-04-18T08:09:10Z","snapshot_observed_at":"2026-08-01T00:38:12.379585Z","submitted_at":"2026-04-18T08:09:10Z","title":"ProtoCycle: Reflective Tool-Augmented Planning for Text-Guided Protein Design","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T07:00:46.618841Z"},"links":{"cited_paper":"/paper/2505.22334","citing_paper":"/paper/2604.16896"},"observation_digest":"sha256:775cff1beb22dce4a4386abba7350f65fa9a9c38e16fb4e17e08c8d420d81d96","observation_id":"25e3e49c-c7c5-4e80-a9bb-b7981a14a940","resolution":{"observed_at":"2026-05-10T07:01:49.070150Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"cited_work":{"arxiv_id":"2505.22334","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22334","snapshot_observed_at":"2026-07-04T19:20:06.732932Z","title":"Advancing multimodal reasoning via reinforcement learning with cold start","venue":null,"work_id":"d3d741cd-38dd-4d73-ad7c-d1523d720cc7","year":2025},"citing_paper":{"arxiv_id":"2605.12163","last_updated":"2026-05-13T02:23:44Z","snapshot_observed_at":"2026-08-02T15:57:40.981833Z","submitted_at":"2026-05-12T14:13:08Z","title":"Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T07:14:48.918959Z"},"links":{"cited_paper":"/paper/2505.22334","citing_paper":"/paper/2605.12163"},"observation_digest":"sha256:0e92631e7ab3c9c33755b02c5763471bad57c1add7ff48b96fe71846bddac801","observation_id":"87ffdd63-c27e-425b-ae71-19dfe4e4e665","resolution":{"observed_at":"2026-05-13T07:17:28.951658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"cited_work":{"arxiv_id":"2505.22334","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22334","snapshot_observed_at":"2026-07-04T19:20:06.732932Z","title":"Advancing multimodal reasoning via reinforcement learning with cold start","venue":null,"work_id":"d3d741cd-38dd-4d73-ad7c-d1523d720cc7","year":2025},"citing_paper":{"arxiv_id":"2605.12163","last_updated":"2026-05-13T02:23:44Z","snapshot_observed_at":"2026-08-02T15:57:40.981833Z","submitted_at":"2026-05-12T14:13:08Z","title":"Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-14T21:47:50.595481Z"},"links":{"cited_paper":"/paper/2505.22334","citing_paper":"/paper/2605.12163"},"observation_digest":"sha256:b3a4a14ab077534d820d60464b673c9f522c86cd8280d785b644a025be137c2b","observation_id":"2fce9b40-570a-449e-95f3-80cf80901a00","resolution":{"observed_at":"2026-05-14T21:48:00.492818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"cited_work":{"arxiv_id":"2505.22334","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22334","snapshot_observed_at":"2026-07-04T19:20:06.732932Z","title":"Advancing multimodal reasoning via reinforcement learning with cold start","venue":null,"work_id":"d3d741cd-38dd-4d73-ad7c-d1523d720cc7","year":2025},"citing_paper":{"arxiv_id":"2605.18740","last_updated":"2026-06-02T16:34:00Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:04Z","title":"Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T10:58:01.621488Z"},"links":{"cited_paper":"/paper/2505.22334","citing_paper":"/paper/2605.18740"},"observation_digest":"sha256:9a20d96a23f94f619b5c4d195825c1d6d5732d06f8ae5d27e6fb55bbbaa20888","observation_id":"2e502e2f-c1b0-4b06-9948-b3e3d3a3561b","resolution":{"observed_at":"2026-05-20T10:58:13.396480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"cited_work":{"arxiv_id":"2505.22334","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22334","snapshot_observed_at":"2026-07-04T19:20:06.732932Z","title":"Advancing multimodal reasoning via reinforcement learning with cold start","venue":null,"work_id":"d3d741cd-38dd-4d73-ad7c-d1523d720cc7","year":2025},"citing_paper":{"arxiv_id":"2605.18740","last_updated":"2026-06-02T16:34:00Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:04Z","title":"Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T18:28:21.605646Z"},"links":{"cited_paper":"/paper/2505.22334","citing_paper":"/paper/2605.18740"},"observation_digest":"sha256:477f15b40db3748f19c058ff898c754b0fcb6b073b2647cfaa8ce2c7d3864727","observation_id":"7c2c75b8-0e29-456b-95e2-f9441410b598","resolution":{"observed_at":"2026-06-30T18:35:00.698390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"cited_work":{"arxiv_id":"2505.22334","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22334","snapshot_observed_at":"2026-07-04T19:20:06.732932Z","title":"Advancing multimodal reasoning via reinforcement learning with cold start","venue":null,"work_id":"d3d741cd-38dd-4d73-ad7c-d1523d720cc7","year":2025},"citing_paper":{"arxiv_id":"2605.24375","last_updated":"2026-05-23T03:30:36Z","snapshot_observed_at":"2026-08-04T17:22:32.357745Z","submitted_at":"2026-05-23T03:30:36Z","title":"Distilling Game Code World Model Generation into Lightweight Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T13:58:37.956333Z"},"links":{"cited_paper":"/paper/2505.22334","citing_paper":"/paper/2605.24375"},"observation_digest":"sha256:f90a2f7228602d7ca4952e3e82fc20b7894ea03ab854edc8693563e7d489f6cd","observation_id":"d2cfd117-e6e7-4385-82b0-78f54c0c56b1","resolution":{"observed_at":"2026-06-30T14:04:44.686114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"cited_work":{"arxiv_id":"2505.22334","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22334","snapshot_observed_at":"2026-07-04T19:20:06.732932Z","title":"Advancing multimodal reasoning via reinforcement learning with cold start","venue":null,"work_id":"d3d741cd-38dd-4d73-ad7c-d1523d720cc7","year":2025},"citing_paper":{"arxiv_id":"2606.25319","last_updated":"2026-06-24T02:32:38Z","snapshot_observed_at":"2026-08-04T23:24:39.482468Z","submitted_at":"2026-06-24T02:32:38Z","title":"V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-25T21:23:10.051805Z"},"links":{"cited_paper":"/paper/2505.22334","citing_paper":"/paper/2606.25319"},"observation_digest":"sha256:2feff43c2b2e0eb970bc73f37b2d62cf44fd7a1616bce051308c015e10d6a5a5","observation_id":"d04b7a35-ab91-47a5-a8a3-3928e4eed17d","resolution":{"observed_at":"2026-07-04T19:20:06.734339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"cited_work":{"arxiv_id":"2505.22334","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22334","snapshot_observed_at":"2026-07-04T19:20:06.732932Z","title":"Advancing multimodal reasoning via reinforcement learning with cold start","venue":null,"work_id":"d3d741cd-38dd-4d73-ad7c-d1523d720cc7","year":2025},"citing_paper":{"arxiv_id":"2606.29984","last_updated":"2026-06-29T08:58:33Z","snapshot_observed_at":"2026-08-06T21:39:49.770771Z","submitted_at":"2026-06-29T08:58:33Z","title":"Be Faithful When Response: Returning Fluent and Grounded Answers for Vision-Language Models Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-30T06:12:49.839459Z"},"links":{"cited_paper":"/paper/2505.22334","citing_paper":"/paper/2606.29984"},"observation_digest":"sha256:540412b1c14d24088c244efc55457598d9e6b5953ba1630958e89d761710e70c","observation_id":"3d65458b-09dc-4312-b131-7cf8af863332","resolution":{"observed_at":"2026-06-30T06:14:18.868098Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22334","snapshot_observed_at":"2026-08-04T01:47:07.116263Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00030","last_updated":"2026-07-15T11:11:39Z","snapshot_observed_at":"2026-08-09T01:33:10.902039Z","submitted_at":"2026-07-15T11:11:39Z","title":"SLMs as Multi-Agent Routers: A Progressive SFT and Reinforcement Learning Approach","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T01:47:07.116263Z"},"links":{"cited_paper":"/paper/2505.22334","citing_paper":"/paper/2608.00030"},"observation_digest":"sha256:8b81cbfc773e1079fee027320ef86b9192a2c568214bfc0871f6a973adb1c4e9","observation_id":"c8eb2883-164b-4563-af06-d99077909789","resolution":{"observed_at":"2026-08-04T01:47:07.116263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22334/citation-record","integrity":"/paper/2505.22334/integrity","json":"/paper/2505.22334/citation-record.json","paper":"/paper/2505.22334"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:52.537010Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:52.537010Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:2fc5dcfa3f988dbda5781abe1f3f265d383f6469844c477eab6ae6b31c6cd366","observation_id":"cf2f7f32-6e97-49ea-aaa4-86384daa567f","resolution":{"observed_at":"2026-08-07T13:12:52.537010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:12:52.627521Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:52.627521Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:4f96f1894ac3d3c31265b0c31840c40102ba9ec150671b125406c464e8119201","observation_id":"7282e936-d0fc-4c87-98b4-c92ea2a75876","resolution":{"observed_at":"2026-08-07T13:12:52.627521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:52.685659Z","title":"An augmented benchmark dataset for geometric question answering through dual parallel text encoding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:52.685659Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:c8675d46e36561e6f13c28f21231b64381bb2740e300818cc5a8cb62283beca0","observation_id":"7aa782b2-efae-4fe7-a425-fab274a35187","resolution":{"observed_at":"2026-08-07T13:12:52.685659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:52.793186Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:52.793186Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:28035f2043d6b2de68d14d6725d5dcc53971f7f7a5d1617b02ad0bb9e3bfae36","observation_id":"8ea13821-0f53-4f4b-8ade-72e0f46458a1","resolution":{"observed_at":"2026-08-07T13:12:52.793186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:52.892662Z","title":"Geoqa: A geometric question answering benchmark towards multimodal numerical reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:52.892662Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:923039967ae3d4532425c71609ed1c083455325b9262b55204a631b8e9dd7f3f","observation_id":"c9b8d8f3-4bab-4c2e-8cf4-ba4ff0f32a3a","resolution":{"observed_at":"2026-08-07T13:12:52.892662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:52.971155Z","title":"R1-v: Reinforcing super generalization ability in vision-language models with less than $3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:52.971155Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:da26912346efaeccd08e1013a23e28849d3c4c7dd07a5e2741009ea0d2cfb443","observation_id":"a3ba1c2c-06f5-4181-8bac-377a0ebf08fd","resolution":{"observed_at":"2026-08-07T13:12:52.971155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:53.054692Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:53.054692Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:c2601245d6743ffd892fde256318f2b1049971b757861d017215342999e4fec5","observation_id":"ddd47ed3-9fdb-42bd-b6ce-cd2a04bbea3b","resolution":{"observed_at":"2026-08-07T13:12:53.054692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T13:12:53.142788Z","title":"M3cot: A novel benchmark for multi-domain multi-step multi-modal chain-of-thought","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:53.142788Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:97abb85be47bc51db821c6647a887b15e5501a4fcf2c5f28a2e09292f95ff2e8","observation_id":"d6e6e4a9-3d92-4866-95c0-a526d30c03aa","resolution":{"observed_at":"2026-08-07T13:12:53.142788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00855","last_updated":"2024-10-30T14:45:00Z","snapshot_observed_at":"2026-08-07T12:15:46.504578Z","submitted_at":"2024-10-30T14:45:00Z","title":"Vision-Language Models Can Self-Improve Reasoning via Reflection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00855","snapshot_observed_at":"2026-08-07T13:12:53.239198Z","title":"Vision-language models can self-improve reasoning via reflection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:53.239198Z"},"links":{"cited_paper":"/paper/2411.00855","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:2ac89b04f784baa161b5dd18f57ea99b8c92bc4158ef06d7ffc3112fb5ec7e28","observation_id":"0c35fc60-7847-4323-a846-5c23a3736f1b","resolution":{"observed_at":"2026-08-07T13:12:53.239198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-07T13:12:53.300884Z","title":"Openvlthinker: An early exploration to complex vision-language reasoning via iterative self-improvement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:53.300884Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:0888d623b3c0ede7c39b903ebf841a2923932f5ac0af9034073ff38325b18077","observation_id":"df2bc233-7654-44c7-8989-c034770064d6","resolution":{"observed_at":"2026-08-07T13:12:53.300884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14432","snapshot_observed_at":"2026-08-07T13:12:53.376458Z","title":"Insight-v: Exploring long-chain visual reasoning with multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:53.376458Z"},"links":{"cited_paper":"/paper/2411.14432","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:79e8b97d9f97a9dcdf589d4b04d791d561301cb7275a3b0d35beb368cf118449","observation_id":"33e31527-5aaa-426e-b768-4588cb091ccd","resolution":{"observed_at":"2026-08-07T13:12:53.376458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15363","last_updated":"2023-11-20T13:59:16Z","snapshot_observed_at":"2026-08-09T16:33:11.662686Z","submitted_at":"2023-08-29T14:59:54Z","title":"Text-to-SQL Empowered by Large Language Models: A Benchmark Evaluation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.15363","snapshot_observed_at":"2026-08-07T13:12:53.471122Z","title":"Text-to-sql empowered by large language models: A benchmark evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:53.471122Z"},"links":{"cited_paper":"/paper/2308.15363","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:6f82dc29d8340a117accf4d9f810f22656abe841957830eff8e3c65420d6e47e","observation_id":"3e83f93d-a0b6-4051-9d6d-f315e394bb53","resolution":{"observed_at":"2026-08-07T13:12:53.471122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:53.564403Z","title":"Introducing gemini 2.0: our new ai model for the agentic era, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:53.564403Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:f200a4eca9ba08427542286b43dc726a53a8145b21301b3d54f1651422e57836","observation_id":"4d36db9d-6f0f-4569-8293-21758f36f9e8","resolution":{"observed_at":"2026-08-07T13:12:53.564403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:12:53.642938Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:53.642938Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:d27c5c8040cb51e3c267e80eb6d121277a7911a1f6b2f7e06d1d9f61229d2956","observation_id":"42f47a43-0c55-4d9a-87f5-69e2caac04da","resolution":{"observed_at":"2026-08-07T13:12:53.642938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-07T13:12:53.708467Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:53.708467Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:5eb40cc45acce5c9f1e197d6ea53961df1b4d34acf0210aec33a61ef6c01acbc","observation_id":"f099e45b-584b-4429-90f8-7bfef4ee4b09","resolution":{"observed_at":"2026-08-07T13:12:53.708467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:53.764326Z","title":"Infimm-webmath-40b: Advancing multimodal pre-training for enhanced mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:53.764326Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:843d684a407aef9bb940f850dc5160bc51ded969483dcf7bfda06aa456b482b5","observation_id":"1e8e55a2-7f5b-4e2d-82c6-7bbe078069f3","resolution":{"observed_at":"2026-08-07T13:12:53.764326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-07T13:12:53.817955Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:53.817955Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:c0c67902ecd3a46f745020e239ba8b993f2a6251f1943d8e470a680dcc90e225","observation_id":"a7706e48-a2e3-4ff6-bf07-642cdc4169d1","resolution":{"observed_at":"2026-08-07T13:12:53.817955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T13:12:53.897667Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:53.897667Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:5271d1d2009b3c42fdf370c8b55cff4ba61a545790600842195067c2f430a42d","observation_id":"ffe533d3-e574-461b-a2d4-fdd83d57c5ac","resolution":{"observed_at":"2026-08-07T13:12:53.897667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T13:12:53.965180Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:53.965180Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:934b409090eb27e4d805a9ee1885fbfe5ad0037bd775c30093446621ca1fec71","observation_id":"f2d1fc8d-40b8-4614-9802-4c1dbbd23734","resolution":{"observed_at":"2026-08-07T13:12:53.965180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T13:12:54.061385Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:54.061385Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:7448ba2aa51a6b61186d8e9a70ec8527131fe7523f5d99fb67ccbb16e87bef03","observation_id":"35201955-b0e0-4f7c-8e2f-65c9598af8de","resolution":{"observed_at":"2026-08-07T13:12:54.061385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.07300","last_updated":"2018-02-22T22:50:42Z","snapshot_observed_at":"2026-08-04T06:17:25.388464Z","submitted_at":"2017-10-19T18:01:38Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.07300","snapshot_observed_at":"2026-08-07T13:12:54.135029Z","title":"Figureqa: An annotated figure dataset for visual reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:54.135029Z"},"links":{"cited_paper":"/paper/1710.07300","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:4fa1f5c0e481cbb72f06431d3923c3c0c425dedc0783aee4489d5f5876e412a5","observation_id":"3d7fd054-2c18-4304-8e71-800a895a9c70","resolution":{"observed_at":"2026-08-07T13:12:54.135029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:54.181520Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:54.181520Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:812e4d4e8e89bb51ea8b68f29cb9ded44cc04d046955c82a5fa66cae00b27ee3","observation_id":"2a89bc6b-2403-405c-b6d1-3e3b02064ecd","resolution":{"observed_at":"2026-08-07T13:12:54.181520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00232","last_updated":"2019-06-02T10:38:04Z","snapshot_observed_at":"2026-07-06T07:11:57.756712Z","submitted_at":"2018-11-01T05:10:44Z","title":"Textbook Question Answering with Multi-modal Context Graph Understanding and Self-supervised Open-set Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00232","snapshot_observed_at":"2026-08-07T13:12:54.261687Z","title":"Textbook question answering with multi-modal context graph understanding and self-supervised open-set comprehension","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:54.261687Z"},"links":{"cited_paper":"/paper/1811.00232","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:f9febaee3776f2c5ebcba2843815ef2a13dd857477e15842ca796cf5e336d739","observation_id":"b394d188-35fa-4666-a776-f1b32039608b","resolution":{"observed_at":"2026-08-07T13:12:54.261687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T13:12:54.353238Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:54.353238Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:a449ce6e4d42c1d028c69bbd304849d88a2cc85e2c5b0b21ac0857b4abbc023c","observation_id":"0d004864-0200-4949-85dc-6c912af1fa89","resolution":{"observed_at":"2026-08-07T13:12:54.353238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07374","last_updated":"2025-02-18T05:20:33Z","snapshot_observed_at":"2026-08-09T18:38:39.510086Z","submitted_at":"2025-02-11T08:48:48Z","title":"LLMs Can Easily Learn to Reason from Demonstrations Structure, not content, is what matters!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07374","snapshot_observed_at":"2026-08-07T13:12:54.424523Z","title":"Llms can easily learn to reason from demonstrations structure, not content, is what matters! arXiv preprint arXiv:2502.07374, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:54.424523Z"},"links":{"cited_paper":"/paper/2502.07374","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:8ca990e10b9ec9c6ddf4e57940e222a63e03aa858a8b03a60129f57974ee1f2b","observation_id":"037b8c57-1954-4814-a83f-344cccb655ee","resolution":{"observed_at":"2026-08-07T13:12:54.424523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:54.501039Z","title":"Small models struggle to learn from strong reasoners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:54.501039Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:dbfea73b8f1395b0e9b30a6fc98478150de85aacf65f1b1b2b5a9e243fce87d9","observation_id":"9a73e6a4-0672-489b-bf73-a3283f55e690","resolution":{"observed_at":"2026-08-07T13:12:54.501039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05358","last_updated":"2022-08-10T14:08:34Z","snapshot_observed_at":"2026-08-07T21:24:23.287695Z","submitted_at":"2022-08-10T14:08:34Z","title":"CLEVR-Math: A Dataset for Compositional Language, Visual and Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.05358","snapshot_observed_at":"2026-08-07T13:12:54.565717Z","title":"Clevr-math: A dataset for compositional language, visual and mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:54.565717Z"},"links":{"cited_paper":"/paper/2208.05358","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:bf00a6a9e9854518c60d12d0483b307f8183dfca679df2ec3472df078c202e3a","observation_id":"b417db3f-86af-4854-94a3-596d2ebdd857","resolution":{"observed_at":"2026-08-07T13:12:54.565717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04165","last_updated":"2021-07-20T23:22:27Z","snapshot_observed_at":"2026-08-06T13:29:31.050456Z","submitted_at":"2021-05-10T07:46:55Z","title":"Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04165","snapshot_observed_at":"2026-08-07T13:12:54.641119Z","title":"Inter- gps: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:54.641119Z"},"links":{"cited_paper":"/paper/2105.04165","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:059a84d8df2dcf0c75d0cf9e099c583a659f3bc096ce944ac0393f698bb12847","observation_id":"17c6a821-cd57-45ff-bd17-2baff1321b62","resolution":{"observed_at":"2026-08-07T13:12:54.641119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13214","last_updated":"2022-07-25T04:05:29Z","snapshot_observed_at":"2026-08-02T20:16:21.986025Z","submitted_at":"2021-10-25T18:52:26Z","title":"IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13214","snapshot_observed_at":"2026-08-07T13:12:54.713753Z","title":"Iconqa: A new benchmark for abstract diagram understanding and visual language reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:54.713753Z"},"links":{"cited_paper":"/paper/2110.13214","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:b14718fc718d3af1299c9966282c06977431f18ccbce63b1f486164ad4539ba8","observation_id":"97844a3d-0ffb-46b8-be1b-0f8825a089bd","resolution":{"observed_at":"2026-08-07T13:12:54.713753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:54.862278Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:54.862278Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:e20ce2f8ff27974818d670fef94ed62d9dfcc4cdb36c2b15ebc30d1bdc8a7dc0","observation_id":"a1f7142a-71bf-4066-af12-08221de474ae","resolution":{"observed_at":"2026-08-07T13:12:54.862278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-08T00:29:35.147198Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-07T13:12:54.957538Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:54.957538Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:45b82275443df1ecdebba3222c4b31ccac2dcaf7742388d718cb1f8427aca211","observation_id":"c06c8f85-6815-4e2f-a344-637fcd7bc9a1","resolution":{"observed_at":"2026-08-07T13:12:54.957538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T13:12:55.080042Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:55.080042Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:2ef195311142774a89c4bb84bb3a8714efda295f7b3406122e811ff16b097f8e","observation_id":"c734c683-f7fa-4713-8fb2-9c415a15fa6c","resolution":{"observed_at":"2026-08-07T13:12:55.080042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09583","last_updated":"2025-06-04T08:58:56Z","snapshot_observed_at":"2026-08-02T06:48:43.121988Z","submitted_at":"2023-08-18T14:23:21Z","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09583","snapshot_observed_at":"2026-08-07T13:12:55.233108Z","title":"Wizardmath: Empowering mathematical reasoning for large language models via reinforced evol-instruct","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:55.233108Z"},"links":{"cited_paper":"/paper/2308.09583","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:07c46b164e7e2c9ea0c5537d619e8f8df48e3e80a4f468c32b0713b31c630c31","observation_id":"03176429-43cd-44e5-8e28-4dc958ab35d6","resolution":{"observed_at":"2026-08-07T13:12:55.233108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T13:12:55.396310Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:55.396310Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:8b88678473469fcadb480b26919f2ce1984555e1e4b20663844500d6e6d7a045","observation_id":"c46935cb-7cb9-4e3f-b2a7-4f27b43ffc7b","resolution":{"observed_at":"2026-08-07T13:12:55.396310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:55.547632Z","title":"Mm-eureka: Exploring visual aha moment with rule-based large-scale reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:55.547632Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:3f4cdad9418db01a63a9afb3f9f1bee29f082887d25fa300ff531eb2ad5dfe58","observation_id":"d30813e0-15f8-424e-810c-c210ec23d1a0","resolution":{"observed_at":"2026-08-07T13:12:55.547632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00147","last_updated":"2024-08-30T07:37:38Z","snapshot_observed_at":"2026-08-09T14:33:03.506246Z","submitted_at":"2024-08-30T07:37:38Z","title":"MultiMath: Bridging Visual and Mathematical Reasoning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00147","snapshot_observed_at":"2026-08-07T13:12:55.652216Z","title":"Multimath: Bridging visual and mathematical reasoning for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:55.652216Z"},"links":{"cited_paper":"/paper/2409.00147","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:2568b7956b0cd2af245620901182b920103ee17a8b2eb514ac29012fca3a682c","observation_id":"31def1ef-43ec-4b2a-aa73-17b3d493d011","resolution":{"observed_at":"2026-08-07T13:12:55.652216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05599","last_updated":"2025-06-09T11:44:18Z","snapshot_observed_at":"2026-08-09T12:50:50.767642Z","submitted_at":"2025-04-08T01:19:20Z","title":"Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05599","snapshot_observed_at":"2026-08-07T13:12:55.775370Z","title":"Skywork r1v: Pioneering multimodal reasoning with chain-of-thought","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:55.775370Z"},"links":{"cited_paper":"/paper/2504.05599","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:1a1d076ebc7ba59afeb5250272a66238274f7c450c5482d0cf0a4f8f8d54f91e","observation_id":"90ef9e79-5272-441e-8a41-c03e13bc9072","resolution":{"observed_at":"2026-08-07T13:12:55.775370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-07T13:12:55.912190Z","title":"We-math: Does your large multimodal model achieve human-like mathematical reasoning? arXiv preprint arXiv:2407.01284, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:55.912190Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:a831ad29ea21d2cd30f4ed6c7fd80dc413cc0acfd33b34679801b5e1e3809db1","observation_id":"186b519e-bec1-4ba0-a171-e04fd64c632a","resolution":{"observed_at":"2026-08-07T13:12:55.912190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:56.022698Z","title":"Solving geometry problems: Combining text and diagram interpretation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:56.022698Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:1333246986ce789dc72a89d33e5dbbeea6eea6088c78d382d6be532f985a7907","observation_id":"88ea283a-40da-4d23-9579-e0f1ed81e090","resolution":{"observed_at":"2026-08-07T13:12:56.022698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04022","last_updated":"2025-04-05T02:24:07Z","snapshot_observed_at":"2026-08-07T21:53:41.208900Z","submitted_at":"2025-04-05T02:24:07Z","title":"Rethinking Reflection in Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04022","snapshot_observed_at":"2026-08-07T13:12:56.143869Z","title":"Rethinking reflection in pre-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:56.143869Z"},"links":{"cited_paper":"/paper/2504.04022","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:e3e9be764a1d8e45328eaea2c527d46f1b64c5fe028efacdf1ab2c58b326783c","observation_id":"fab60022-41ec-4e5d-863b-f1e9c041f5f7","resolution":{"observed_at":"2026-08-07T13:12:56.143869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T13:12:56.300104Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:56.300104Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:d39932e5b1572df3410a515347aef601efc3b25d7a25476448893ef67d37480f","observation_id":"a11a1ac3-a697-4387-97e5-d8d96be010c1","resolution":{"observed_at":"2026-08-07T13:12:56.300104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:07.342999Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":"70ad10a1-85d4-43f0-b305-9cc4e002edf8","year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:56.391949Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:c3f024966e8378504fab5de78cd5532021991cfe87e44eec381b44cfec57574b","observation_id":"343899cc-4aa0-4490-8d04-4ebe9f2a9052","resolution":{"observed_at":"2026-08-07T13:13:07.449948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17294","last_updated":"2024-10-08T06:58:27Z","snapshot_observed_at":"2026-08-08T00:41:26.316141Z","submitted_at":"2024-06-25T05:43:21Z","title":"Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17294","snapshot_observed_at":"2026-08-07T13:12:56.479241Z","title":"Math-llava: Bootstrapping mathematical reasoning for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:56.479241Z"},"links":{"cited_paper":"/paper/2406.17294","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:c7c7b3df9a90260dc1f92b96da6327583f1a1f9fe0b52b7d2403cd2b5e36a024","observation_id":"06a8e1bc-ed18-460e-ac83-75c63b3af582","resolution":{"observed_at":"2026-08-07T13:12:56.479241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:56.588932Z","title":"Qvq: To see the world with wisdom, December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:56.588932Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:cb2e8bb97afdec45083cd21d2c3f6d2808c0e5ea2f5e348f2bcb3edfe412dc6f","observation_id":"a10defa0-6cfe-4974-842b-2b1dadf18f59","resolution":{"observed_at":"2026-08-07T13:12:56.588932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:07.021006Z","title":"Qwq: Reflect deeply on the boundaries of the unknown, November 2024","venue":null,"work_id":"61063efd-8854-4c1f-baa4-b2a23eba0b17","year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:56.709212Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:cc858d81953b373e0fd34507b2fd7e14665c2f61f98b703dcd07ef7f580fa4c1","observation_id":"901117d6-9bc3-4d6e-a114-6f39238faa11","resolution":{"observed_at":"2026-08-07T13:13:07.178034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-07T13:12:56.792142Z","title":"Llamav-o1: Rethinking step-by-step visual reasoning in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:56.792142Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:4352ca482d66680cec9922bc25c12a50407843f0e49bf0743b4749704786b9c2","observation_id":"5af3b130-2555-4395-8ab3-95379f7f4141","resolution":{"observed_at":"2026-08-07T13:12:56.792142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:06.757776Z","title":"Dart-math: Difficulty-aware rejection tuning for mathematical problem-solving","venue":null,"work_id":"fd83c4b1-dae7-4137-82b3-53b3b5eb61ed","year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:56.884248Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:cd220eb0dda7fbf00377de5e7666c2d99dd6985e868bae60842ac5231f73aa21","observation_id":"a79d6d28-d27a-4143-bca6-a762b35c1019","resolution":{"observed_at":"2026-08-07T13:13:06.898278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T13:12:56.989615Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:56.989615Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:515fd86040d8fc68762e31d507b0c9de3ccbed6864c752e6d22cfb880a4e1994","observation_id":"9f4544bb-202d-4cd7-ac7b-b2e7a008a2d4","resolution":{"observed_at":"2026-08-07T13:12:56.989615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:06.577065Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":"05a419f5-ce0c-42f6-b657-fe9af3149ac5","year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:57.115706Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:4f123c3f036ee88634026e09c7ee9dea8808872fb188248624dde5b291b5c2c3","observation_id":"c19e7c57-99e1-493d-8590-78bd419dba88","resolution":{"observed_at":"2026-08-07T13:13:06.644661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:06.406450Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":"4db11d7d-44d8-4dac-b763-2ac0a533db7d","year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:57.257567Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:06691361c3c1dac0b3fc9ecc204829b838547c3d93dc57a6df25fed0646c6fba","observation_id":"2d3ccf7f-34ea-4d12-9641-731228058c6f","resolution":{"observed_at":"2026-08-07T13:13:06.485039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07934","last_updated":"2025-05-30T15:53:16Z","snapshot_observed_at":"2026-08-07T16:06:46.096701Z","submitted_at":"2025-04-10T17:49:05Z","title":"SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07934","snapshot_observed_at":"2026-08-07T13:12:57.363121Z","title":"Sota with less: Mcts-guided sample selection for data-efficient visual reasoning self-improvement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:57.363121Z"},"links":{"cited_paper":"/paper/2504.07934","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:83bbd7e6e87a4db1cc418c202c1ea8c4ac0ac4f8913a99d965bfbc0e50a892ee","observation_id":"39f7e458-7dd4-4b3b-9084-63c8f4085552","resolution":{"observed_at":"2026-08-07T13:12:57.363121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:57.504024Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:57.504024Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:7629635420ee507c9c5e70ccd286fdabfb0fff13f0cf12776780a43f0a5af5ad","observation_id":"28084151-8b5f-460c-a165-44b5b6085461","resolution":{"observed_at":"2026-08-07T13:12:57.504024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17139","last_updated":"2024-10-14T04:36:09Z","snapshot_observed_at":"2026-08-02T12:51:52.072797Z","submitted_at":"2024-01-30T16:19:55Z","title":"Diff-eRank: A Novel Rank-Based Metric for Evaluating Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17139","snapshot_observed_at":"2026-08-07T13:12:57.631505Z","title":"Large language model evaluation via matrix entropy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:57.631505Z"},"links":{"cited_paper":"/paper/2401.17139","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:94a3d737764b92fb3335e0e6520908f8500d58e15a9aea66cd442244f4deebff","observation_id":"f80afabf-0589-4ed3-a5eb-94ac1091de39","resolution":{"observed_at":"2026-08-07T13:12:57.631505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:57.789354Z","title":"Thinkpatterns-21k: A systematic study on the impact of thinking patterns in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:57.789354Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:cda099f428e076c39388bd7fd7a6242cff790cfba79f925a14e8073cf5f7fc56","observation_id":"87d06979-765a-4f4f-b19d-613fc9a935fb","resolution":{"observed_at":"2026-08-07T13:12:57.789354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T13:12:57.865700Z","title":"Llava-cot: Let vision language models reason step-by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:57.865700Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:c439cc2b3103b901aa682e59b17323a6580e39cd8fc4baacae76c826a1d5cf2c","observation_id":"170cf958-85f6-4120-a855-822dc9e166d9","resolution":{"observed_at":"2026-08-07T13:12:57.865700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:06.160517Z","title":"Tbac-vlr1-3b-preview, 2025","venue":null,"work_id":"b92fceb0-bcec-4bfe-b3f9-622983e34b3f","year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:57.964220Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:420a444664a1de23027b6f065f2e3be24f86d4fe3fe7618ddd618ff31f718f15","observation_id":"7f2d9f59-0262-4b0c-97d8-8aabdb75a8c0","resolution":{"observed_at":"2026-08-07T13:13:06.313434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:12:58.041766Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:58.041766Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:2ace6f045bb44a8d14cf24f110c5c028505d1e232de758baf11f8fc228298381","observation_id":"7b522abf-9414-480c-adb7-a27c2fc1873c","resolution":{"observed_at":"2026-08-07T13:12:58.041766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13729","last_updated":"2024-12-02T14:59:08Z","snapshot_observed_at":"2026-07-06T19:18:53.582890Z","submitted_at":"2024-09-10T01:20:22Z","title":"MathGLM-Vision: Solving Mathematical Problems with Multi-Modal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13729","snapshot_observed_at":"2026-08-07T13:12:58.101610Z","title":"Mathglm-vision: Solving mathematical problems with multi-modal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:58.101610Z"},"links":{"cited_paper":"/paper/2409.13729","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:5690a113b19be6d8b79610bb1fbec6f024f024076e3afeaf5ece14f5a146584d","observation_id":"31ac8f67-bd2b-4af2-967a-3513938cd04a","resolution":{"observed_at":"2026-08-07T13:12:58.101610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-08T00:04:35.299538Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-08-07T13:12:58.218444Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:58.218444Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:7c74272e28abd28e87623f79cf31afb273e53b37c8301e0615b88a0ffba6808d","observation_id":"c410146c-2b0d-4cf1-9aec-ba6358eaa55b","resolution":{"observed_at":"2026-08-07T13:12:58.218444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.977619Z","title":"Easyr1: An efficient, scalable, multi-modality rl training framework","venue":null,"work_id":"fb0a8dcd-7c2a-4361-85af-de51eef63102","year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:58.305710Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:4d0deb43b628bf9d643f5dad7a83dd05d2d6f61d367d68f70b45bafb9195a5a7","observation_id":"b5d7a13f-412f-4c12-ac67-fb5593a4cba9","resolution":{"observed_at":"2026-08-07T13:13:06.041294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:58.382458Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:58.382458Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:a826d3d629a0f03132cfdfbc4714d7ed07d9670e00fa2bcf6b6e3476cafe6c51","observation_id":"f0892b82-1770-4b4f-ac1f-d978e917377f","resolution":{"observed_at":"2026-08-07T13:12:58.382458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07954","last_updated":"2025-04-10T17:58:27Z","snapshot_observed_at":"2026-08-07T16:06:45.172290Z","submitted_at":"2025-04-10T17:58:27Z","title":"Perception-R1: Pioneering Perception Policy with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07954","snapshot_observed_at":"2026-08-07T13:12:58.487945Z","title":"Perception-r1: Pioneering perception policy with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:58.487945Z"},"links":{"cited_paper":"/paper/2504.07954","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:cb9ef5e3b81a0ee081bfd81a7f242a908be5995c117aa3de35ebe1fb0d487baf","observation_id":"d68c3269-b1d9-48f9-8ace-48cd4b1d7387","resolution":{"observed_at":"2026-08-07T13:12:58.487945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12284","last_updated":"2024-05-03T17:36:07Z","snapshot_observed_at":"2026-08-02T15:00:50.388422Z","submitted_at":"2023-09-21T17:45:42Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12284","snapshot_observed_at":"2026-08-07T13:12:58.601919Z","title":"Metamath: Bootstrap your own mathematical questions for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:58.601919Z"},"links":{"cited_paper":"/paper/2309.12284","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:c4ffe445cd2c8679528cc1be53c7b99d68f28f5ef07e44f61305888d751841fa","observation_id":"c040f369-7c8e-4b6f-866c-e0a3ce6ec44c","resolution":{"observed_at":"2026-08-07T13:12:58.601919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02884","last_updated":"2024-11-21T07:07:59Z","snapshot_observed_at":"2026-08-07T12:03:21.367108Z","submitted_at":"2024-10-03T18:12:29Z","title":"LLaMA-Berry: Pairwise Optimization for O1-like Olympiad-Level Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02884","snapshot_observed_at":"2026-08-07T13:12:58.712192Z","title":"Llama-berry: Pairwise optimization for o1-like olympiad-level mathematical reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:58.712192Z"},"links":{"cited_paper":"/paper/2410.02884","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:59c9906eb1c4144fece32cbc0df7626eb464b10415883e382a808082b3674c94","observation_id":"25b11409-beeb-43db-9ca3-f480f5916501","resolution":{"observed_at":"2026-08-07T13:12:58.712192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:58.778569Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:58.778569Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:01aac29f549c112e2ca58a69aa60b260e3eac8d6978f71ed024149aabc153493","observation_id":"b4a26876-c9af-4471-865b-b57c0d141a85","resolution":{"observed_at":"2026-08-07T13:12:58.778569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08739","last_updated":"2024-11-01T22:14:24Z","snapshot_observed_at":"2026-07-06T18:45:01.801741Z","submitted_at":"2024-07-11T17:59:47Z","title":"MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08739","snapshot_observed_at":"2026-08-07T13:12:58.908022Z","title":"Mavis: Mathematical visual instruction tuning with an automatic data engine","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:58.908022Z"},"links":{"cited_paper":"/paper/2407.08739","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:500e29526432ff1f747d173365b66157f6fe161b3e23708a8292b66c7b1ff119","observation_id":"9bbde23e-4ac3-482c-8e41-cabfad96a542","resolution":{"observed_at":"2026-08-07T13:12:58.908022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-08-08T03:30:51.616377Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-07T13:12:59.008711Z","title":"Improve vision language model chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:59.008711Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:ca2c9700696b601061966499082ab02fea6631d1f55f567cbd6fb41d1f404712","observation_id":"706c7d72-c48c-4673-9c71-8cb089abe8f8","resolution":{"observed_at":"2026-08-07T13:12:59.008711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:59.086822Z","title":"Question-guided knowledge graph re-scoring and injection for knowledge graph question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:59.086822Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:50858cd79e7f05a826ece3c9e0971569cf6b16f8d218ad15abffb25c1e83e634","observation_id":"637323d1-858a-4d0a-b7c6-8f7a7fdfc1f7","resolution":{"observed_at":"2026-08-07T13:12:59.086822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05517","last_updated":"2025-05-19T06:50:53Z","snapshot_observed_at":"2026-08-05T14:11:37.629456Z","submitted_at":"2024-08-10T11:00:13Z","title":"SWIFT:A Scalable lightWeight Infrastructure for Fine-Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05517","snapshot_observed_at":"2026-08-07T13:12:59.184860Z","title":"Swift:a scalable lightweight infrastructure for fine-tuning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:59.184860Z"},"links":{"cited_paper":"/paper/2408.05517","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:d7071732fadb3ea819cd23098954a0f1f5d976b246abff52b0448196f088e035","observation_id":"5bb1439e-498d-4173-a198-15e309bf668b","resolution":{"observed_at":"2026-08-07T13:12:59.184860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.827819Z","title":"aha moment","venue":null,"work_id":"2138e9e5-df10-42cc-8f21-b0efd1c98610","year":2025},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:59.280504Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:c1dc5f2b46fdc5646edfaff99190231ce8a2d80ff310c1739ad3d1d87ade83bf","observation_id":"482f2187-dfae-43a2-af35-2d15e290995e","resolution":{"observed_at":"2026-08-07T13:13:05.873071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08640","last_updated":"2024-09-25T09:53:13Z","snapshot_observed_at":"2026-08-05T13:30:19.839955Z","submitted_at":"2024-08-16T10:11:05Z","title":"Math-PUMA: Progressive Upward Multimodal Alignment to Enhance Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08640","snapshot_observed_at":"2026-08-07T13:12:59.356894Z","title":"Math-puma: Progressive upward multimodal alignment to enhance mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:59.356894Z"},"links":{"cited_paper":"/paper/2408.08640","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:61652424b5c893cab639a76d24c94ff5ab6dda63a8d80ee19fd790cb97973328","observation_id":"ba021b73-5370-4339-b57a-0d1596a8bdde","resolution":{"observed_at":"2026-08-07T13:12:59.356894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.704012Z","title":null,"venue":null,"work_id":"a83a67ce-76df-4379-85bf-3dd7f4bd33c9","year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:59.475898Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:95fdd978c8f65a086db8671c4c367dfb7620b645a2811a64ded5246ac63c1c7f","observation_id":"088994ec-cb3d-456d-b9ef-65374c8cbcf6","resolution":{"observed_at":"2026-08-07T13:13:05.755965Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.527675Z","title":"aha moment","venue":null,"work_id":"ec746029-9603-42a4-a963-c391a9ab3990","year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:59.555762Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:2c4e79d4e4bf6c64363dd95af868e0cd349f9f9a7b7eb6ccfe9f0b61caa2600e","observation_id":"90158bf8-053b-4ceb-a438-182219806833","resolution":{"observed_at":"2026-08-07T13:13:05.620532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.329850Z","title":null,"venue":null,"work_id":"4148a070-16d9-4bb7-84b9-2d97771030e0","year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:59.620141Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:cba4658d36b69dd9d869262e1cd1f72cb57a05d3856c67740b4bccb4a5fd7f63","observation_id":"676068da-e025-4977-bc9c-ab3d42fc9fcf","resolution":{"observed_at":"2026-08-07T13:13:05.428673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.144145Z","title":null,"venue":null,"work_id":"4a8cb18f-2385-4741-8d34-c0b53e592673","year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:59.674379Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:683b3e67c138b93f83b73f73ff938cadb7a30c97553df49f5987835ece103e16","observation_id":"cdf8577b-67cb-4aa8-834b-6dc6274b82dd","resolution":{"observed_at":"2026-08-07T13:13:05.234616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.885144Z","title":"Given: The sum of angle B and angle D is 100◦","venue":null,"work_id":"3b7664a5-49f3-4cd2-ba52-cf28837f9c7c","year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:59.740041Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:4c22b10c7ebd1b5467b5f4446fcbd8217bf94f465584069361374e1c7d3249ca","observation_id":"e1fe6f8b-77f7-46de-bf65-68670cf654c2","resolution":{"observed_at":"2026-08-07T13:13:05.011044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.696679Z","title":"• Diameter BE of circle O means that BE is a straight line passing through the center of the circle","venue":null,"work_id":"36c34fdf-2bfa-42e0-ae7c-034a7375468e","year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:59.818951Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:fc8325df84acb980fd7b6bf4df9d242fb87b14a2625d5c5db3f4ef5155563b3b","observation_id":"279d766e-1108-4a94-958d-2a37977303bb","resolution":{"observed_at":"2026-08-07T13:13:04.789384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.506952Z","title":"Therefore, ∠BAD + ∠BCD = 180◦","venue":null,"work_id":"54dd0c3c-f230-4d26-95f3-c6f18d351035","year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:59.913549Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:1b03ba3d21eea09e583f7abdf07c339f15874b4bc78beda900fa459c4fb2bd05","observation_id":"3247c9e2-139e-42f3-8d06-0588b65e10cf","resolution":{"observed_at":"2026-08-07T13:13:04.576955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.361019Z","title":null,"venue":null,"work_id":"64f2a4a1-e568-47a3-800b-5a4e54fcf40f","year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.015418Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:13e253ecd5b0c31334ad420fbaef2759ddf15b8b5fe9a73031dc09d102ce4bf3","observation_id":"d028d651-5586-4630-81be-5ad67db31a00","resolution":{"observed_at":"2026-08-07T13:13:04.430067Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.207986Z","title":null,"venue":null,"work_id":"38089669-57af-46c1-ae36-9b67b4372173","year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.095458Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:e67c72406ef13d52d7c77e3272361c2bf778f6c87d4bc7e274c5049da7e31002","observation_id":"5ce9f604-ede0-41a4-a26a-d53905b81d6b","resolution":{"observed_at":"2026-08-07T13:13:04.266127Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.049652Z","title":"The sum of the angles in triangle ADE is 180◦: ∠DAE + ∠ADE + ∠AED = 180◦, ∠DAE + 90◦ + ∠AED = 180◦, ∠DAE + ∠AED = 90◦","venue":null,"work_id":"bb3b49f9-b1a6-444d-baa0-0c9aaa7dec31","year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.163730Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:763da81e1d974f2fe7293033875c108b4fca63024b9d7f0cc06e8c965bd10ece","observation_id":"f6db60fc-8d5a-4431-b285-6d7689142a1a","resolution":{"observed_at":"2026-08-07T13:13:04.101635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:03.828883Z","title":null,"venue":null,"work_id":"9421026b-1c2c-40eb-a16d-734f2d363f0a","year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.225496Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:aa2ef1ff737431332d79fafb6e17d46e8757ed93ce6d4aa6197060fd10fc4372","observation_id":"90fa580d-205b-4209-bc91-e02ff1c20b66","resolution":{"observed_at":"2026-08-07T13:13:03.931966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:03.662971Z","title":"Since ∠DAE cannot be negative, we must re-evaluate the problem","venue":null,"work_id":"9bc880c6-d803-466f-a616-f67f5dc273cd","year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.313043Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:e320c04b9d7acd00644ddbdaac77437f87d2ca39f73442cb4cf1d084b5b3d6cf","observation_id":"59d518fe-a3c8-463d-9e44-addefcc87cbc","resolution":{"observed_at":"2026-08-07T13:13:03.744279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:03.511490Z","title":"• Given the perimeter is 30, we can find the length of one side by dividing the perimeter by 3: Side length = 30 3 = 10","venue":null,"work_id":"e74c5fbf-ec8a-4e1a-857a-11b3bab4bd0b","year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.416991Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:c1483365688b9de65fbece08edbe8421f0f53bee3f51fac6ae0acef40b0c3326","observation_id":"aa5d843b-6657-4ddb-8ba7-e222869a0b53","resolution":{"observed_at":"2026-08-07T13:13:03.577793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:03.343289Z","title":"• In a 30-60-90 triangle, the ratio of the sides opposite the 30◦, 60◦, and 90◦ angles is 1 : √ 3 : 2","venue":null,"work_id":"950e1778-9ffe-4ce8-acbe-f1d60f4375e8","year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.514135Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:964901295b630a9e19abb1e93cfd0b3bcc7d83dce2331c6098cc1040a57da312","observation_id":"1ecbf4e4-896e-4681-a351-d1a1eabead5d","resolution":{"observed_at":"2026-08-07T13:13:03.390783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:03.154917Z","title":"• The side opposite the 30◦ angle (which is half the base) is 5 (since the base is 10 and it is bisected)","venue":null,"work_id":"7ecf44a5-59b7-4ff5-8185-106a04c27e0c","year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.582130Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:5666aa05f9715374991643e0c6e717fcca978c2bb23ac3b5d0e9783041238546","observation_id":"e47c8db1-473f-4ff7-818d-48affed72784","resolution":{"observed_at":"2026-08-07T13:13:03.218991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:02.971227Z","title":"• We need to find the length of the altitude h of this triangle","venue":null,"work_id":"dab5b15a-3e99-499c-b531-198d8cda824f","year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.679380Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:31d01062cd1588d16c2913294361fbce8acbf8441249bd95eb8ca6fd59e01d5b","observation_id":"653666e5-8c29-49b0-a835-47748bb6a5a9","resolution":{"observed_at":"2026-08-07T13:13:03.060938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:02.776621Z","title":"• Let the side length of the triangle be s","venue":null,"work_id":"58a3f4bf-1fa9-4f80-a883-5fc90920c00c","year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.755861Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:027c898932b094d0c2c55935716a7ddf24646a376d7922202f600a83fea11429","observation_id":"2d11caa4-2547-4f9a-ac3b-84425752d182","resolution":{"observed_at":"2026-08-07T13:13:02.880717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:02.515602Z","title":null,"venue":null,"work_id":"e20be90d-6ef5-4059-ae66-2ff652801f23","year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.845200Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:98303ef4f7f76edd56c4cdf3880831a8383832068cf5b0a27bb978a6f368e8bb","observation_id":"08494f91-4ab0-4f7c-844e-1574d2307636","resolution":{"observed_at":"2026-08-07T13:13:02.641387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:02.328134Z","title":"• In an equilateral triangle, the altitude bisects the base, creating two 30-60-90 right triangles","venue":null,"work_id":"878840f0-0b82-4cf7-b5e4-36cf7d936303","year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.932690Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:37c649c8aaa2f3bad984adfd9d774b2ef1b89aad407d3fbf87e0067730d0b834","observation_id":"ab35689a-28df-41bb-9c68-51d862c34f5b","resolution":{"observed_at":"2026-08-07T13:13:02.413427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:02.173220Z","title":"5 √ 3 19","venue":null,"work_id":"eb23a4fe-0bc2-48b0-aa99-91deb2f2fd40","year":null},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:01.038049Z"},"links":{"citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:cdeeddf9d05499a0e993f2a0ee426c472543bb69e86eaf6d97f1403ada3c1c18","observation_id":"7e1946b5-9ce7-45de-9b66-762df84831bd","resolution":{"observed_at":"2026-08-07T13:13:02.225475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start"},"reference_resolution":{"displayed":91,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":70,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":91},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 91 of 91 outbound references and 10 inbound Pith citation observations for arXiv:2505.22334."}