{"as_of":"2026-08-08T07:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f2d6d1f51df31e1959c1cc0286e9145328519203cf203d4de14a0d14c5566d2a","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:24:42.605024Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:00:49.780513Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T10:15:45.170778Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19213","snapshot_observed_at":"2026-08-06T11:00:49.780513Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03733","last_updated":"2025-07-31T05:07:18Z","snapshot_observed_at":"2026-08-06T21:11:56.499497Z","submitted_at":"2025-07-31T05:07:18Z","title":"CX-Mind: A Pioneering Multimodal Large Language Model for Interleaved Reasoning in Chest X-ray via Curriculum-Guided Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:00:49.780513Z"},"links":{"cited_paper":"/paper/2505.19213","citing_paper":"/paper/2508.03733"},"observation_digest":"sha256:123392d00952d353aeacd11c3de8b012ceefc7776f94fec904fffd3115686f34","observation_id":"67b2389a-d06d-445b-a313-a7fe8f0411be","resolution":{"observed_at":"2026-08-06T11:00:49.780513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19213","snapshot_observed_at":"2026-08-04T13:51:51.711834Z","title":"Improving medical reasoning with curriculum-aware reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24560","last_updated":"2026-08-02T06:52:09Z","snapshot_observed_at":"2026-08-07T16:20:24.562487Z","submitted_at":"2025-09-29T10:13:55Z","title":"AdaThink-Med: Optimizing Inference-Time Compute for Medical Reasoning via Uncertainty Quantification","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:51.711834Z"},"links":{"cited_paper":"/paper/2505.19213","citing_paper":"/paper/2509.24560"},"observation_digest":"sha256:0c503e01ca4ff1da37c55bf853d5782215dd03a79a9d25b73c9fcfb999e4996d","observation_id":"0bd09e0e-b0e5-45bf-b46e-894236e74223","resolution":{"observed_at":"2026-08-04T13:51:51.711834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19213","snapshot_observed_at":"2026-08-04T11:34:14.723040Z","title":"doi:10.48550/arXiv.2505.19213","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04033","last_updated":"2026-06-22T22:02:33Z","snapshot_observed_at":"2026-08-08T07:19:32.785815Z","submitted_at":"2025-10-05T04:52:26Z","title":"A global log for medical AI","version":2},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-08-04T11:34:14.723040Z"},"links":{"cited_paper":"/paper/2505.19213","citing_paper":"/paper/2510.04033"},"observation_digest":"sha256:0db5986d3c828326aade4535334cb8d1758ee6d5467189f908e95654c84b2f03","observation_id":"b3beaf0a-ec85-472b-8a70-3919146c80c0","resolution":{"observed_at":"2026-08-04T11:34:14.723040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.19213","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19213","snapshot_observed_at":"2026-07-01T10:15:45.170778Z","title":"arXiv preprint arXiv:2505.19213 (2025)","venue":null,"work_id":"c3fe30b4-19d4-41c3-8f37-1644638b462a","year":2025},"citing_paper":{"arxiv_id":"2605.21652","last_updated":"2026-05-23T13:26:54Z","snapshot_observed_at":"2026-07-06T23:32:05.693503Z","submitted_at":"2026-05-20T19:06:34Z","title":"Look-Closer-Then-Diagnose: Confidence-Aware Ultrasound VQA via Active Zooming","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T09:13:45.830192Z"},"links":{"cited_paper":"/paper/2505.19213","citing_paper":"/paper/2605.21652"},"observation_digest":"sha256:603ad5bff1ae53d4a4ffb61eb62d0d8befe72b125af56c1e2a44cd79498f7a75","observation_id":"4f11b0e0-75db-4281-8571-257bbcc4e6bb","resolution":{"observed_at":"2026-05-22T09:14:45.427393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.19213","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19213","snapshot_observed_at":"2026-07-01T10:15:45.170778Z","title":"arXiv preprint arXiv:2505.19213 (2025)","venue":null,"work_id":"c3fe30b4-19d4-41c3-8f37-1644638b462a","year":2025},"citing_paper":{"arxiv_id":"2605.21652","last_updated":"2026-05-23T13:26:54Z","snapshot_observed_at":"2026-07-06T23:32:05.693503Z","submitted_at":"2026-05-20T19:06:34Z","title":"Look-Closer-Then-Diagnose: Confidence-Aware Ultrasound VQA via Active Zooming","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T16:48:55.898188Z"},"links":{"cited_paper":"/paper/2505.19213","citing_paper":"/paper/2605.21652"},"observation_digest":"sha256:a1af25e836dd30a72dfe7f1155d8394e782b518d8fa88c3c6e04552495dfe3e2","observation_id":"9c9da16b-edaf-4586-9088-323df898fe22","resolution":{"observed_at":"2026-06-30T16:54:58.753056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.19213","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19213","snapshot_observed_at":"2026-07-01T10:15:45.170778Z","title":"arXiv preprint arXiv:2505.19213 (2025)","venue":null,"work_id":"c3fe30b4-19d4-41c3-8f37-1644638b462a","year":2025},"citing_paper":{"arxiv_id":"2606.31599","last_updated":"2026-06-30T12:47:30Z","snapshot_observed_at":"2026-07-07T00:05:17.259491Z","submitted_at":"2026-06-30T12:47:30Z","title":"Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-01T05:36:43.609602Z"},"links":{"cited_paper":"/paper/2505.19213","citing_paper":"/paper/2606.31599"},"observation_digest":"sha256:f02b526814ca91b0f699801b19cf8941d77cbbeb87308f0e62a86a9c3107badb","observation_id":"0f4a817e-1ce2-40c8-a068-9739e97f1dd7","resolution":{"observed_at":"2026-07-01T10:15:45.172460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19213/citation-record","integrity":"/paper/2505.19213/integrity","json":"/paper/2505.19213/citation-record.json","paper":"/paper/2505.19213"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:24:42.347787Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.347787Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:85a0164efa77eadb59d6b89886239fdc4f289b9ea02f9d9e3b6cff8cfb036f07","observation_id":"083e3c0e-d94f-4e1d-9da8-01239ac2f2e8","resolution":{"observed_at":"2026-08-07T14:24:42.347787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:42.355061Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.355061Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:ceabbf157286765c1d8103c7b0630c9e145fec8c3761104221934ed8275f79bf","observation_id":"485406a0-4f21-4692-9d72-13746cd7c810","resolution":{"observed_at":"2026-08-07T14:24:42.355061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-06T18:57:51.817317Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-07T14:24:42.360661Z","title":"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale.arXiv preprint arXiv:2406.19280, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.360661Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:a064544e57f6a413a357b70f64c58a85a1e2e37dba30e37db55719d5d826c228","observation_id":"4984e00a-9b04-4f94-9a48-9fc79a1f61ca","resolution":{"observed_at":"2026-08-07T14:24:42.360661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:24:42.366000Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.366000Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:b04bf250212c7d58dd6347714a600af84cca884255f262ba8aa4e1d335144e78","observation_id":"f4f7ae01-793e-4ea3-90f5-516f7ba1e176","resolution":{"observed_at":"2026-08-07T14:24:42.366000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:42.371834Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.371834Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:9ae9ca4ce8c19d8d5c001ba6c9d36d90be913a7797593d94e0e2d2a488b0afd7","observation_id":"414891cd-b1a4-4552-9e48-849577895210","resolution":{"observed_at":"2026-08-07T14:24:42.371834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01904","last_updated":"2025-02-05T09:17:01Z","snapshot_observed_at":"2026-08-08T00:29:08.656523Z","submitted_at":"2025-01-03T17:14:16Z","title":"Virgo: A Preliminary Exploration on Reproducing o1-like MLLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01904","snapshot_observed_at":"2026-08-07T14:24:42.378226Z","title":"Virgo: A preliminary exploration on reproducing o1-like mllm.arXiv preprint arXiv:2501.01904, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.378226Z"},"links":{"cited_paper":"/paper/2501.01904","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:bd0e373100746523cdb1f87a095bc8c3a972434b80d8a4843b1cd50d85c52d5d","observation_id":"3d957eeb-e9f8-477f-8c4b-6e156613f329","resolution":{"observed_at":"2026-08-07T14:24:42.378226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.10286","last_updated":"2020-03-07T17:55:41Z","snapshot_observed_at":"2026-07-06T09:06:42.071993Z","submitted_at":"2020-03-07T17:55:41Z","title":"PathVQA: 30000+ Questions for Medical Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.10286","snapshot_observed_at":"2026-08-07T14:24:42.384653Z","title":"Pathvqa: 30000+ questions for medical visual question answering.arXiv preprint arXiv:2003.10286, 2020","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.384653Z"},"links":{"cited_paper":"/paper/2003.10286","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:0008ffe3d1086c0fb826349c041f078a1eb6d92309f85db69e590d93c6b80865","observation_id":"194b85c6-e245-417c-be55-fc959ed2dcad","resolution":{"observed_at":"2026-08-07T14:24:42.384653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:42.390120Z","title":"Omnimed- vqa: A new large-scale comprehensive evaluation benchmark for medical lvlm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.390120Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:8acad8e52ae08f5a88f3ba9344fd6cdac5c263e16431d7e736d5e9a292469b4f","observation_id":"dc7f90b0-980f-4fb5-8fb5-3d6f445c2311","resolution":{"observed_at":"2026-08-07T14:24:42.390120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T14:24:42.395324Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models.arXiv preprint arXiv:2503.06749, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.395324Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:daab54684f58cf8fc14e472db82f6aca4f5d814c09363632535ff258b889c087","observation_id":"7294fd7b-2b50-4a7d-8e47-73c13e29ea10","resolution":{"observed_at":"2026-08-07T14:24:42.395324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:42.400311Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.400311Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:ea5b8dc8694e7fa469cc628839b23ba97a23391540b03cb8bc8ef67dc16178c2","observation_id":"71f572d3-4d46-4a38-97da-8872d8fef298","resolution":{"observed_at":"2026-08-07T14:24:42.400311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:42.405019Z","title":"Med-r1: Reinforce- ment learning for generalizable medical reasoning in vision-language models.arXiv preprint arXiv:2503.13939, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.405019Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:b391860673c4d1ce9058375ab4328d5de926364f91bbdf6d7305742fc1223b98","observation_id":"16a6aac7-759d-4c74-9caf-8ada360f6976","resolution":{"observed_at":"2026-08-07T14:24:42.405019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:42.409995Z","title":"A dataset of clinically generated visual questions and answers about radiology images.Scientific data, 5(1):1–10, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.409995Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:e0f1a1c210f0b63103721da765ad3de95eb8b8fca9d40a621d84f7956c0b8682","observation_id":"47f3ec62-c8eb-49c3-b21a-2d205f4ca00f","resolution":{"observed_at":"2026-08-07T14:24:42.409995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:42.415633Z","title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day.Advances in Neural Information Processing Systems, 36:28541–28564, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.415633Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:053be29e49bb4a902489d8885e45689f22253ac50c49f927c60e551203181bb2","observation_id":"924a7d54-5ccd-42f7-a856-9053fd5aeba6","resolution":{"observed_at":"2026-08-07T14:24:42.415633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:43.880774Z","title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day.Advances in Neural Information Processing Systems, 36:28541–28564, 2023","venue":null,"work_id":"f120c6c6-04ca-4c85-ad1f-ad7dbae9b135","year":2023},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.421492Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:a4744fe5dd04d4d203752e57141b414f66e8b79c0e3c6d16c60ec2fd68c7417e","observation_id":"64b2524f-111e-48c3-88b4-45eb68fc228b","resolution":{"observed_at":"2026-08-07T14:24:43.889177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:42.426638Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.426638Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:14a6b6acf4957e13ce55a34c1be3199b26ab4897b62dbd4e2b133ef30357a14e","observation_id":"7cb2d57b-458f-46c5-a3f0-de02b9b13686","resolution":{"observed_at":"2026-08-07T14:24:42.426638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:42.431160Z","title":"Slake: A semantically- labeled knowledge-enhanced dataset for medical visual question answering","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.431160Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:137686a0d0a66045878f826e9312c71144a2745ef6d5477e34dde905f96bbaa9","observation_id":"11c2e270-d74b-4a94-9f9d-1f2ff245b5f5","resolution":{"observed_at":"2026-08-07T14:24:42.431160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:42.435904Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.435904Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:c3e88062188431b4c220ea0d17f77d7c4b7ee1e4dab5f3ac3cc583946131b2aa","observation_id":"743d4455-6f6c-46ed-9c84-51601b7f11b7","resolution":{"observed_at":"2026-08-07T14:24:42.435904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:42.441501Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.441501Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:3199738c9e0fa7f70ac10fd6ca4cada5cde8c65dedd51e6d2ce3901b9507278f","observation_id":"e165dee1-00b5-4151-89af-8d772649130d","resolution":{"observed_at":"2026-08-07T14:24:42.441501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-07T17:19:13.101842Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-08-07T14:24:42.447522Z","title":"Seg- zero: Reasoning-chain guided segmentation via cognitive reinforcement.arXiv preprint arXiv:2503.06520, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.447522Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:47c4d6663e9967237ae8520ed873b0ec9f57a03560969bc368972d230f1ad3ca","observation_id":"30310768-6994-47ff-8bc7-445dbc9c98a9","resolution":{"observed_at":"2026-08-07T14:24:42.447522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:42.452658Z","title":"Med-flamingo: a multimodal medical few-shot learner","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.452658Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:83d8861bc8a93ce732772f0ef0e8da46a4d0dda084a2fe5328fd8fc46ccb5aae","observation_id":"04e546ed-1663-4d8a-a641-f624cd64382b","resolution":{"observed_at":"2026-08-07T14:24:42.452658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19634","last_updated":"2025-03-19T13:55:33Z","snapshot_observed_at":"2026-08-07T20:37:56.716831Z","submitted_at":"2025-02-26T23:57:34Z","title":"MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19634","snapshot_observed_at":"2026-08-07T14:24:42.458642Z","title":"Medvlm-r1: Incentivizing medical reasoning capability of vision-language models (vlms) via reinforcement learning.arXiv preprint arXiv:2502.19634, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.458642Z"},"links":{"cited_paper":"/paper/2502.19634","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:36217d6a37a54157b866b3b0ad50205931a934a4a2807ef0f94dafca601073ab","observation_id":"16f03c70-230e-4852-847a-cf1b281a323c","resolution":{"observed_at":"2026-08-07T14:24:42.458642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:42.463525Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.463525Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:caa72e486f619eb62127559591732b224605ff8f237edbe22d66ee9cd1448f2c","observation_id":"c757ce95-577b-468f-a5aa-a7f73106c3ed","resolution":{"observed_at":"2026-08-07T14:24:42.463525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:24:42.468200Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.468200Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:1e8d5f406105e2621f47834482d468cae9089301a083d0a915c334f475c34870","observation_id":"3229f476-5b6a-4b7f-9d02-e3d08ae3bcaf","resolution":{"observed_at":"2026-08-07T14:24:42.468200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:42.473462Z","title":"Quilt-llava: Visual instruction tuning by extracting localized narratives from open- source histopathology videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.473462Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:56ff0dd6e96bca0ab41aadf834cd82fe2467d5dbefc02b47c2d6db3ae6325aa9","observation_id":"9de819ef-1b09-46d3-95c6-3a74402fe734","resolution":{"observed_at":"2026-08-07T14:24:42.473462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:24:42.478426Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.478426Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:bd2a4fdf25a1922be05cb8d1ae418d0c94433415953edcf75979117a1e44bec0","observation_id":"5a9508b1-cedb-452b-9d13-dbb420cc2cdf","resolution":{"observed_at":"2026-08-07T14:24:42.478426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T14:24:42.483506Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.483506Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:dc98c5c329489d151ba70f05e02de03bfb5c7ef110b5a143e3390a8374a35760","observation_id":"38209900-4f7e-46df-a766-5a5b326affb1","resolution":{"observed_at":"2026-08-07T14:24:42.483506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T14:24:42.489700Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.489700Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:9be37d9900a89693d8ed4b30cf97db0ee5dbeb42e0fa122c70b2149a62502045","observation_id":"8dfb0a38-c2b7-4582-9303-d6f0c64ab1d6","resolution":{"observed_at":"2026-08-07T14:24:42.489700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-07T14:24:42.496078Z","title":"Aligning large multimodal models with factually augmented rlhf.arXiv preprint arXiv:2309.14525, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.496078Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:82034ed16e011babd95303f9e0ec741be4e635820758e690b81d627079af8604","observation_id":"01b412b5-8ee6-4f45-b4e9-76c18a49d7c9","resolution":{"observed_at":"2026-08-07T14:24:42.496078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:42.501264Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.501264Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:231ffc083f53acc99de16f0a65141140d72a6c11d7971fced88f1980d537809c","observation_id":"f66319b4-9117-472e-9c0e-83cf91026761","resolution":{"observed_at":"2026-08-07T14:24:42.501264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10291","last_updated":"2025-03-13T12:03:37Z","snapshot_observed_at":"2026-08-07T21:25:47.268391Z","submitted_at":"2025-03-13T12:03:37Z","title":"VisualPRM: An Effective Process Reward Model for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10291","snapshot_observed_at":"2026-08-07T14:24:42.507040Z","title":"Visualprm: An effective process reward model for multimodal reasoning.arXiv preprint arXiv:2503.10291, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.507040Z"},"links":{"cited_paper":"/paper/2503.10291","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:054444ce7bff6f42d4ea72be63bb1c820300e9eac4c920822a8f733667611bda","observation_id":"1c994559-1c4f-4a4e-a084-4f9d5dee187f","resolution":{"observed_at":"2026-08-07T14:24:42.507040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:42.512932Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.512932Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:9abddaee99b7ca9798432a4a100ecab12d1d442f24c7963452b3cf0ea6e67700","observation_id":"19f87a5b-8251-4fa6-865c-5da7a6681925","resolution":{"observed_at":"2026-08-07T14:24:42.512932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02463","last_updated":"2023-11-16T12:38:46Z","snapshot_observed_at":"2026-08-08T04:57:05.131540Z","submitted_at":"2023-08-04T17:00:38Z","title":"Towards Generalist Foundation Model for Radiology by Leveraging Web-scale 2D&3D Medical Data","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02463","snapshot_observed_at":"2026-08-07T14:24:42.518960Z","title":"Towards generalist foundation model for radiology by leveraging web-scale 2d&3d medical data.arXiv preprint arXiv:2308.02463, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.518960Z"},"links":{"cited_paper":"/paper/2308.02463","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:f65ed214fe8a596624a05b2b793dde66377c8b5fffb373f4367f8b076aa0010c","observation_id":"2f426e4a-38af-491c-85cf-cda98f68442e","resolution":{"observed_at":"2026-08-07T14:24:42.518960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00993","last_updated":"2025-04-04T18:29:18Z","snapshot_observed_at":"2026-08-07T16:16:51.008728Z","submitted_at":"2025-04-01T17:31:44Z","title":"MedReason: Eliciting Factual Medical Reasoning Steps in LLMs via Knowledge Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00993","snapshot_observed_at":"2026-08-07T14:24:42.524211Z","title":"Medreason: Eliciting factual medical reasoning steps in llms via knowledge graphs.arXiv preprint arXiv:2504.00993, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.524211Z"},"links":{"cited_paper":"/paper/2504.00993","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:0b8b2fa4d1a0074dad5169b7073b95b61d5617622ce89fc96dfe4eb828df76eb","observation_id":"a465c906-8a80-426f-be98-5d5d5a5b2b6a","resolution":{"observed_at":"2026-08-07T14:24:42.524211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-07T14:24:42.530817Z","title":"Yi: Open foundation models by 01","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.530817Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:b7ceb9f7530ed65bcc0a3c9c71bfde8346c6cfb5161aa37d55fea6788475b64b","observation_id":"63a3a088-1330-4acf-87fb-41c8a6bf9bc7","resolution":{"observed_at":"2026-08-07T14:24:42.530817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09213","last_updated":"2025-07-30T08:05:40Z","snapshot_observed_at":"2026-07-06T20:21:42.341172Z","submitted_at":"2025-01-16T00:19:19Z","title":"FineMedLM-o1: Enhancing Medical Knowledge Reasoning Ability of LLM from Supervised Fine-Tuning to Test-Time Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09213","snapshot_observed_at":"2026-08-07T14:24:42.536609Z","title":"Finemedlm-o1: Enhancing the medical reasoning ability of llm from supervised fine-tuning to test-time training.arXiv preprint arXiv:2501.09213, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.536609Z"},"links":{"cited_paper":"/paper/2501.09213","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:bd635a9c44562913e866f4116daa0b16501ee03756c0e4d41e3bfcacc55e99c4","observation_id":"8aa50367-b97b-4643-ab22-b3351f0a2e56","resolution":{"observed_at":"2026-08-07T14:24:42.536609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:42.542366Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.542366Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:246b9760b479b96c7f35f061cbc05fd9f39920bb6dc6249f5c67cc5175e150a6","observation_id":"2c688696-33d5-4283-99ed-7a871a8cb5f4","resolution":{"observed_at":"2026-08-07T14:24:42.542366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:42.550786Z","title":"Rlaif-v: Aligning mllms through open-source ai feedback for super gpt-4v trustworthiness.arXiv preprint arXiv:2405.17220, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.550786Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:83f24014cb777f56b06649292b1355ed62d54abd6608b08f363778e03a3eeb6d","observation_id":"62d3e441-4423-4389-b657-bff9f78b355e","resolution":{"observed_at":"2026-08-07T14:24:42.550786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:42.557957Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.557957Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:0f940f005c4771c9edcc7cc4d9aebd66386c17cbf9f55e69e192178f52934df7","observation_id":"5cf5abd0-9e3c-46ce-a134-fd05dc177399","resolution":{"observed_at":"2026-08-07T14:24:42.557957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-07T14:24:42.564168Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization.arXiv preprint arXiv:2503.12937, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.564168Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:c837fc9f899a56d5a846e13969fba20318e1efb1a6906f298b22f00ba689a9ab","observation_id":"59ac7428-3669-4f1a-8ee1-344b0f87e5e7","resolution":{"observed_at":"2026-08-07T14:24:42.564168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10415","last_updated":"2024-09-08T01:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:50:16Z","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10415","snapshot_observed_at":"2026-08-07T14:24:42.578202Z","title":"Pmc-vqa: Visual instruction tuning for medical visual question answering.arXiv preprint arXiv:2305.10415, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.578202Z"},"links":{"cited_paper":"/paper/2305.10415","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:f879d8d7abcbf0612f480417511539bebb5e5225a2ce5ac7ba8c31f6b547ca33","observation_id":"18c884f0-3a42-4aea-af1e-14ff3c327dce","resolution":{"observed_at":"2026-08-07T14:24:42.578202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-08-08T04:17:23.797697Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-07T14:24:42.584939Z","title":"Beyond hallucinations: Enhancing lvlms through hallucination-aware direct preference optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.584939Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:f8ea414ef1057fa569154822f2d02af05eaf6c4fcc3286ea1b81cc233ee6db69","observation_id":"4fa16a12-2e15-4336-8e07-ae54486d285e","resolution":{"observed_at":"2026-08-07T14:24:42.584939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:42.590126Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.590126Z"},"links":{"citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:a7ed8044c7ed281868dd074216006f73dfa969cc90d32db665fbed1b2199f052","observation_id":"dc64ed3d-8be0-4113-b7ad-b4f368c8077b","resolution":{"observed_at":"2026-08-07T14:24:42.590126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-07-06T20:48:18.268075Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-07T14:24:42.595164Z","title":"R1-zero’s” aha moment” in visual reasoning on a 2b non-sft model, 2025.URL https://arxiv","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.595164Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:fa2921b3e724ad4e4438dc6cb2050ceff499fc48280377b6509f4d67584aac80","observation_id":"07d79c18-f00e-4afb-b695-829c38aed203","resolution":{"observed_at":"2026-08-07T14:24:42.595164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-07T14:24:42.600093Z","title":"Aligning modali- ties in vision large language models via preference fine-tuning.arXiv preprint arXiv:2402.11411, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.600093Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:e3d698aa3d1c7c78ed9da4f62a89c2dafdbf93e0632fc452c4fbbd4f9d7f7bb2","observation_id":"dd59a4c8-da6f-43b8-9998-f4168e7382ee","resolution":{"observed_at":"2026-08-07T14:24:42.600093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18362","last_updated":"2025-06-06T13:00:07Z","snapshot_observed_at":"2026-07-06T20:28:24.203633Z","submitted_at":"2025-01-30T14:07:56Z","title":"MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18362","snapshot_observed_at":"2026-08-07T14:24:42.605024Z","title":"Identify","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.605024Z"},"links":{"cited_paper":"/paper/2501.18362","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:78324b73e4ddbe650f1777b5d5bdd69f91b87fba8d126f833df332b97ab4ef62","observation_id":"247bc90c-215b-453a-ad87-185f4f606d53","resolution":{"observed_at":"2026-08-07T14:24:42.605024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 6 inbound Pith citation observations for arXiv:2505.19213."}