{"as_of":"2026-08-07T23:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0eb2c6eda9df0ff3109bd9055e0b6078d58c04a303e4d97df56ccf44fb6382f5","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:59:15.598200Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T18:50:22.827472Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T18:57:31.625203Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.12307","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12307","snapshot_observed_at":"2026-07-10T18:57:31.625203Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","venue":"cs.CL","work_id":"e3d6ba37-426a-4948-a4be-dafcc062f71a","year":2025},"citing_paper":{"arxiv_id":"2512.19691","last_updated":"2026-04-13T08:00:46Z","snapshot_observed_at":"2026-07-31T18:31:36.321575Z","submitted_at":"2025-12-22T18:59:34Z","title":"Scalable Stewardship of an LLM-Assisted Clinical Benchmark with Physician Oversight","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T20:21:40.867354Z"},"links":{"cited_paper":"/paper/2506.12307","citing_paper":"/paper/2512.19691"},"observation_digest":"sha256:d2eef2979ee7e9334120c40cf39a111f7770591203c8a2ba2599687a0798cddb","observation_id":"7d7bdbbb-83c5-4a6f-9d9d-56823e545fba","resolution":{"observed_at":"2026-05-16T20:23:23.811816Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.12307","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12307","snapshot_observed_at":"2026-07-10T18:57:31.625203Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","venue":"cs.CL","work_id":"e3d6ba37-426a-4948-a4be-dafcc062f71a","year":2025},"citing_paper":{"arxiv_id":"2607.07761","last_updated":"2026-07-08T15:19:37Z","snapshot_observed_at":"2026-08-06T23:41:57.869470Z","submitted_at":"2026-07-08T15:19:37Z","title":"Aligning Clinical Needs and AI Capabilities: A Survey on LLMs for Medical Reasoning","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-07-10T18:50:22.827472Z"},"links":{"cited_paper":"/paper/2506.12307","citing_paper":"/paper/2607.07761"},"observation_digest":"sha256:213b9581a254bed413061fb85d3058293f79125d4fdbdfacbeaf22eb8b676ed2","observation_id":"cfa7d1cf-2e59-4fb1-8a59-84a31d1fb65d","resolution":{"observed_at":"2026-07-10T18:57:31.626465Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12307/citation-record","integrity":"/paper/2506.12307/integrity","json":"/paper/2506.12307/citation-record.json","paper":"/paper/2506.12307"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.21318","last_updated":"2025-04-30T05:05:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-30T05:05:09Z","title":"Phi-4-reasoning Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21318","snapshot_observed_at":"2026-08-07T00:59:09.833831Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:09.833831Z"},"links":{"cited_paper":"/paper/2504.21318","citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:756703a3b2472e7506fc567677ab304a2751b81565454e1db43b03be424628a4","observation_id":"8401f3de-baca-447b-856d-a4ace2fbfc4b","resolution":{"observed_at":"2026-08-07T00:59:09.833831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-07T00:59:10.081098Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:10.081098Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:abab8506bbd0cca6937f63013b3df46621a2462696b572188306f69527dc38a4","observation_id":"056a1ff2-d7cc-4709-ac9a-4ec2702727da","resolution":{"observed_at":"2026-08-07T00:59:10.081098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:17.761769Z","title":null,"venue":null,"work_id":"5d450415-406a-48e7-abad-6150c3104eef","year":2025},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:10.276299Z"},"links":{"citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:b9c76f5333792e43096b28695bb7d82ef1d1790dc1ffed4ce437d3d24d270ab5","observation_id":"04de581b-a237-43cd-9123-0c3a50d17f75","resolution":{"observed_at":"2026-08-07T00:59:17.921380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18925","last_updated":"2024-12-25T15:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-25T15:12:34Z","title":"HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18925","snapshot_observed_at":"2026-08-07T00:59:10.422171Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:10.422171Z"},"links":{"cited_paper":"/paper/2412.18925","citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:b67a8b52320f23dafbe148be9c2e7591d648a353e7c795077541ad4b2132836f","observation_id":"31c6dc5b-2677-45d6-9443-ebba305728e6","resolution":{"observed_at":"2026-08-07T00:59:10.422171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:17.449439Z","title":null,"venue":null,"work_id":"0141bc62-443b-491a-a41e-3be6d1171294","year":2025},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:10.549901Z"},"links":{"citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:d4ad71c3eb67b04cb86296640dbe4d737ff763ea827d4c0cfee552f5b02878ed","observation_id":"99af1e2b-ddad-407c-9840-1d3933616316","resolution":{"observed_at":"2026-08-07T00:59:17.579025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T00:59:10.772605Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:10.772605Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:e7f106348e4e7e174bdd6012d6544b7d4c26da5266554159a18ad075d1eec2d7","observation_id":"1e43fd60-59c2-4faf-b2ea-d4f8eb9dcba4","resolution":{"observed_at":"2026-08-07T00:59:10.772605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T00:59:10.949543Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:10.949543Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:b2062673af20f8fd1c03eb68e2a4e8fd019eff5193394bcf0d6477a4c83265b6","observation_id":"bb78a099-e268-46bb-9a19-9a1792162fef","resolution":{"observed_at":"2026-08-07T00:59:10.949543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:11.183268Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:11.183268Z"},"links":{"citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:1e1ec2e680bcb06fba42c49a6b48d91991d1239f11743b6fe1a370b9db33290f","observation_id":"46322889-addc-4d97-9840-264a60c2d1f8","resolution":{"observed_at":"2026-08-07T00:59:11.183268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06458","last_updated":"2025-01-11T07:10:23Z","snapshot_observed_at":"2026-08-07T08:07:31.851127Z","submitted_at":"2025-01-11T07:10:23Z","title":"O1 Replication Journey -- Part 3: Inference-time Scaling for Medical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06458","snapshot_observed_at":"2026-08-07T00:59:11.360197Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:11.360197Z"},"links":{"cited_paper":"/paper/2501.06458","citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:dd0e16f09e581e663e1cc78128317e321639093e31831bab77ed9ca0efa5e256","observation_id":"84c77575-cc46-4928-8c8f-384b66d037ee","resolution":{"observed_at":"2026-08-07T00:59:11.360197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T00:59:11.506088Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:11.506088Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:4f1ea0b1e03a8ce5863f0f516e6c4e52a604479b6c85bb8add57bdec5bcec0c3","observation_id":"6f783802-b219-495c-8450-3daf0ed02b0e","resolution":{"observed_at":"2026-08-07T00:59:11.506088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10237","last_updated":"2024-09-01T16:39:31Z","snapshot_observed_at":"2026-08-07T06:50:58.775402Z","submitted_at":"2024-04-16T02:35:17Z","title":"Med-MoE: Mixture of Domain-Specific Experts for Lightweight Medical Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10237","snapshot_observed_at":"2026-08-07T00:59:11.712948Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:11.712948Z"},"links":{"cited_paper":"/paper/2404.10237","citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:9304337614e09db2d58b249bebc2f714bfaa9f1c3075bbf1227da3242622a947","observation_id":"4e8a4fb8-8f3b-430a-9ee1-a147d52dc6c2","resolution":{"observed_at":"2026-08-07T00:59:11.712948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:17.184404Z","title":null,"venue":null,"work_id":"eaaca21d-35b3-4429-aa11-0fa2a95b2dfc","year":2024},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:11.947481Z"},"links":{"citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:af2153b38d565613395dd23e49d22f2def1637ae5186cd0b9d31255025a4987b","observation_id":"f7a337e5-a406-4d6d-9a74-1117d2153a68","resolution":{"observed_at":"2026-08-07T00:59:17.299351Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:12.084690Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:12.084690Z"},"links":{"citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:efa3901bc7b04eefb39a90302e5847529d1bb61cabf2f3a8492139c9bc68b8e4","observation_id":"f2db5fb0-5f05-4ff8-89c2-03d53c708fd5","resolution":{"observed_at":"2026-08-07T00:59:12.084690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:16.911821Z","title":null,"venue":null,"work_id":"2146ec1c-c708-4363-b501-ebfec2323659","year":2024},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:12.212532Z"},"links":{"citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:b224524af6f581d519223c0b662787195528710e1724930cb68a19e94934fbdd","observation_id":"1f49c605-4ba8-4fb4-a4b2-360e9411bd1d","resolution":{"observed_at":"2026-08-07T00:59:17.023940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:12.353500Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:12.353500Z"},"links":{"citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:edf290f2fb76a988462750715db1696bb71d46c9fa1118b1b70b43f4ed996a7e","observation_id":"fc937c5d-b53c-43e1-a2de-5cce7ee5bb53","resolution":{"observed_at":"2026-08-07T00:59:12.353500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:12.490526Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:12.490526Z"},"links":{"citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:155dfcc61a373800ea704502689270175adc0ce0bc8deed18ec3cf93a02807c1","observation_id":"cb20ba7a-af7f-4a4d-a0b5-5d4b83a6c639","resolution":{"observed_at":"2026-08-07T00:59:12.490526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13736","last_updated":"2024-12-18T11:14:02Z","snapshot_observed_at":"2026-07-06T20:09:10.465980Z","submitted_at":"2024-12-18T11:14:02Z","title":"MedCoT: Medical Chain of Thought via Hierarchical Expert","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13736","snapshot_observed_at":"2026-08-07T00:59:12.703977Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:12.703977Z"},"links":{"cited_paper":"/paper/2412.13736","citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:ff766af7c1e46ee972322fb7b56034385bbf7d4d7e107aa106ca02e48189e6e8","observation_id":"ac93fe8b-42b7-47d1-9945-99ab4958ccc8","resolution":{"observed_at":"2026-08-07T00:59:12.703977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T00:59:12.896460Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:12.896460Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:f28cb20dad7e91141eeff77f0aa199e147a10b7503bae54ebee5df2c96cc1ad8","observation_id":"fe447467-8de9-422f-aeff-768cf53608a1","resolution":{"observed_at":"2026-08-07T00:59:12.896460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:13.028033Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:13.028033Z"},"links":{"citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:0b612356b401bd3ff179671122a3d5864db335f4c32225830503764cefc55f87","observation_id":"3687db58-cecc-43ed-9611-cae57eb00cdf","resolution":{"observed_at":"2026-08-07T00:59:13.028033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T00:59:13.211229Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:13.211229Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:00bf81b119d2add863dd351b32d5e8abf31cb7e8545e3ea05a73c7b79054ba76","observation_id":"51bedf58-c688-4b4a-bf4c-49668a85f01e","resolution":{"observed_at":"2026-08-07T00:59:13.211229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T00:59:13.346100Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:13.346100Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:56721bc0ed7e44557fc5355b89fb0046963ae8c4cd491eeb90a756d481de43f6","observation_id":"5688dbab-e7b8-4dbe-9205-a259ecfb5437","resolution":{"observed_at":"2026-08-07T00:59:13.346100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-03T14:09:43.107865Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-08-07T00:59:13.509910Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:13.509910Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:710087598e1e411f829fbc8af8e47233481a0d7c36d2bf3bd1daa6e4e4850dc6","observation_id":"5b442089-496d-4b5a-98ed-c8938c82a44c","resolution":{"observed_at":"2026-08-07T00:59:13.509910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T00:59:13.702592Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:13.702592Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:036fbcfa15e708b7dfce4a898d0ff8d93ba02d4905024ba225cbc8a880bdc14e","observation_id":"2bd87863-1112-4f2b-bd04-c846b5b0315b","resolution":{"observed_at":"2026-08-07T00:59:13.702592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:16.609778Z","title":null,"venue":null,"work_id":"b347c27c-c170-44d2-b538-02c2a1fc0735","year":2025},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:13.886171Z"},"links":{"citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:1afa1774ac6d2c8f524531f8373fde198616410855be9ed95cec4f5130d2ea3b","observation_id":"9d0c47de-a844-4976-bfd7-516e04eb9b0e","resolution":{"observed_at":"2026-08-07T00:59:16.734469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:14.069904Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:14.069904Z"},"links":{"citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:aff3716b124eb8c4364f211e8a91d0237c6631a1421c037640d599eca2c39a28","observation_id":"7cdb5a5a-7032-4b64-a3a9-134e3745bd11","resolution":{"observed_at":"2026-08-07T00:59:14.069904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T00:59:14.261785Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:14.261785Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:e548ebe6c5830ed9f423bd769381864a6784dcdd416a52acf3b515c31a7a7f89","observation_id":"f3313ee2-93db-4c35-9ba7-ea55de94f989","resolution":{"observed_at":"2026-08-07T00:59:14.261785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09213","last_updated":"2025-07-30T08:05:40Z","snapshot_observed_at":"2026-07-06T20:21:42.341172Z","submitted_at":"2025-01-16T00:19:19Z","title":"FineMedLM-o1: Enhancing Medical Knowledge Reasoning Ability of LLM from Supervised Fine-Tuning to Test-Time Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09213","snapshot_observed_at":"2026-08-07T00:59:14.414021Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:14.414021Z"},"links":{"cited_paper":"/paper/2501.09213","citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:5ecb4676d42f4b6c1d98d6c25151a5264debff5486b620b76c2a997c33e004a1","observation_id":"41080bab-eecf-4ffd-a170-102d4a00c6d1","resolution":{"observed_at":"2026-08-07T00:59:14.414021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17744","last_updated":"2024-06-25T17:29:52Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:29:52Z","title":"Following Length Constraints in Instructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17744","snapshot_observed_at":"2026-08-07T00:59:14.613450Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:14.613450Z"},"links":{"cited_paper":"/paper/2406.17744","citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:b29e4d4eb81d6b81ee27d1e8a39875ac5a8b5b86b180e095aaa0bca2bb135978","observation_id":"ae500814-b1e4-4faa-bb52-f6f79ade8617","resolution":{"observed_at":"2026-08-07T00:59:14.613450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:16.287010Z","title":null,"venue":null,"work_id":"9a0adff4-f628-4e39-986f-8e501e22aad6","year":2024},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:14.755403Z"},"links":{"citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:5fd599a813004ab74522cfc100c5e31491f4c347a1c15487db9ed11b6ed564c6","observation_id":"f95b5e92-aa72-4268-aa69-ba3242d98517","resolution":{"observed_at":"2026-08-07T00:59:16.451830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19655","last_updated":"2025-02-27T00:54:38Z","snapshot_observed_at":"2026-08-07T21:58:54.817701Z","submitted_at":"2025-02-27T00:54:38Z","title":"Med-RLVR: Emerging Medical Reasoning from a 3B base model via reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19655","snapshot_observed_at":"2026-08-07T00:59:14.911209Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:14.911209Z"},"links":{"cited_paper":"/paper/2502.19655","citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:52dcc031a9b53b38d076f2d60a5d0529f8b12cf32fa824a39b987a3a5fdd90bb","observation_id":"6e31e4cb-653f-425f-867c-c7a1b88411bb","resolution":{"observed_at":"2026-08-07T00:59:14.911209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T00:59:15.080266Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:15.080266Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:84fbc14f7e88d57d851a0b664f0b76cc68ef4fe4cc35dc55339fdbe908dde6d6","observation_id":"85f4c374-610f-4f6c-b165-40700cb6eb05","resolution":{"observed_at":"2026-08-07T00:59:15.080266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18362","last_updated":"2025-06-06T13:00:07Z","snapshot_observed_at":"2026-07-06T20:28:24.203633Z","submitted_at":"2025-01-30T14:07:56Z","title":"MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18362","snapshot_observed_at":"2026-08-07T00:59:15.260193Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:15.260193Z"},"links":{"cited_paper":"/paper/2501.18362","citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:46aadd9e71659c048e3d58c5f4c5aa94109aa0710a6430f989571f653e26ffc4","observation_id":"b21cae6e-9d43-4d4a-81f2-714733e39145","resolution":{"observed_at":"2026-08-07T00:59:15.260193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:15.435680Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:15.435680Z"},"links":{"citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:4f80eeffd3edfbb75a8853e4103b682a790b84e36c660a42c2e341621b2c5ef5","observation_id":"7ce861ae-a985-4971-9f30-cdaa5fb58be6","resolution":{"observed_at":"2026-08-07T00:59:15.435680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:15.598200Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:15.598200Z"},"links":{"citing_paper":"/paper/2506.12307"},"observation_digest":"sha256:028dd8abc50d6bdafe215c321e68e030c1df69adbc842b8af9ec881cce5912e1","observation_id":"092f3c12-39f9-4ef5-9958-81a71dc70da8","resolution":{"observed_at":"2026-08-07T00:59:15.598200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12307","last_updated":"2025-06-20T01:43:46Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T20:54:59.398635Z","submitted_at":"2025-06-14T02:00:36Z","title":"Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 2 inbound Pith citation observations for arXiv:2506.12307."}