{"as_of":"2026-08-19T17:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f26b2f719eb2886990d0904227a893b4127bed733041376b0fbbbf8c5e4db66e","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:28:11.158639Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T04:32:16.930291Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T06:11:23.712115Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"cited_work":{"arxiv_id":"2504.18080","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.18080","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2504.18080 , year=","venue":null,"work_id":"3aad0ed5-c0eb-41db-a66f-67ae44cd8503","year":null},"citing_paper":{"arxiv_id":"2605.09584","last_updated":"2026-05-10T14:51:31Z","snapshot_observed_at":"2026-07-06T23:21:39.966502Z","submitted_at":"2026-05-10T14:51:31Z","title":"CLR-voyance: Reinforcing Open-Ended Reasoning for Inpatient Clinical Decision Support with Outcome-Aware Rubrics","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-12T04:32:16.930291Z"},"links":{"cited_paper":"/paper/2504.18080","citing_paper":"/paper/2605.09584"},"observation_digest":"sha256:6737f5346d2e843a045aa6d937196f094b8bb0ce2dae6ab67bbaf9f4290decdc","observation_id":"6a795170-6248-4603-bd60-8e1386c46c69","resolution":{"observed_at":"2026-05-12T06:11:23.714985Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.18080/citation-record","integrity":"/paper/2504.18080/integrity","json":"/paper/2504.18080/citation-record.json","paper":"/paper/2504.18080"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.10849","last_updated":"2025-06-02T20:29:39Z","snapshot_observed_at":"2026-08-19T05:53:09.599135Z","submitted_at":"2024-12-14T14:46:18Z","title":"Superhuman performance of a large language model on the reasoning tasks of a physician","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10849","snapshot_observed_at":"2026-08-16T10:28:11.006071Z","title":"Brodeur, Thomas A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.006071Z"},"links":{"cited_paper":"/paper/2412.10849","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:c94c2b337b57ed9d2fa1572381c78e3a2cbb8e81c278b73b04130a4b01128aea","observation_id":"73b2b576-4d87-421c-b95f-bf107ef1ed77","resolution":{"observed_at":"2026-08-16T10:28:11.006071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18925","last_updated":"2024-12-25T15:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-25T15:12:34Z","title":"HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18925","snapshot_observed_at":"2026-08-16T10:28:11.010868Z","title":"Huatuogpt-o1, towards medical complex reasoning with llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.010868Z"},"links":{"cited_paper":"/paper/2412.18925","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:8e82443d9a017d77afa4b4ecde2b1030fde95463810c946f49031be8b65bf4ae","observation_id":"98110f26-a7fc-47bf-a384-64c93f1bf09c","resolution":{"observed_at":"2026-08-16T10:28:11.010868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16079","last_updated":"2023-11-27T18:49:43Z","snapshot_observed_at":"2026-07-06T16:53:18.275859Z","submitted_at":"2023-11-27T18:49:43Z","title":"MEDITRON-70B: Scaling Medical Pretraining for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16079","snapshot_observed_at":"2026-08-16T10:28:11.015505Z","title":"Meditron-70b: Scaling medical pretraining for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.015505Z"},"links":{"cited_paper":"/paper/2311.16079","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:28a69db2c5c4ded6e726632a100d7e55f368f130ea676aaebd1a6b6d868d2fa2","observation_id":"73d05cbc-4d28-44e1-a33b-8e24486b64ac","resolution":{"observed_at":"2026-08-16T10:28:11.015505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-emnlp.618","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:11.443184Z","title":"Beyond fine-tuning: Unleashing the potential of continuous pretraining for clinical LLM s","venue":null,"work_id":"eafc197a-4c97-4d28-9f70-9c7c5492ec3c","year":2024},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.019658Z"},"links":{"citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:aeae3fb1928f01f8a905bf7efcd6ab85ebc67353f344d365904221a4204cce23","observation_id":"10d34416-f6c7-421b-b9d6-3a57d230530a","resolution":{"observed_at":"2026-08-16T10:28:11.447147Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06474","last_updated":"2024-06-10T17:16:49Z","snapshot_observed_at":"2026-08-16T13:44:27.891447Z","submitted_at":"2024-06-10T17:16:49Z","title":"Towards a Personal Health Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06474","snapshot_observed_at":"2026-08-16T10:28:11.023518Z","title":"Furlotte , Zhun Yang , Chace Lee , Erik Schenck , Yojan Patel , Jian Cui , Logan Douglas Schneider , Robby Bryant , Ryan G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.023518Z"},"links":{"cited_paper":"/paper/2406.06474","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:df9b3330d5125630bfb64beafb2ed9080cea0a1021cc53d7a92395a21620f8f4","observation_id":"24ed6c3b-ce00-4dd1-99df-09b563b1a13d","resolution":{"observed_at":"2026-08-16T10:28:11.023518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T10:28:11.027707Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.027707Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:3cfffa6bd449bef5b0447d40b93a4302a38131b698176f356387b863deeea395","observation_id":"6092b268-ad98-440c-9cee-d7759edc8355","resolution":{"observed_at":"2026-08-16T10:28:11.027707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09720","last_updated":"2023-02-28T00:12:34Z","snapshot_observed_at":"2026-08-16T16:07:34.564651Z","submitted_at":"2022-12-19T18:48:33Z","title":"The case for 4-bit precision: k-bit Inference Scaling Laws","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09720","snapshot_observed_at":"2026-08-16T10:28:11.032102Z","title":"The case for 4-bit precision: k-bit Inference Scaling Laws","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.032102Z"},"links":{"cited_paper":"/paper/2212.09720","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:968c58aef6701c57672182b3717fd703cbd176b5339d46fedd0fef501a234f08","observation_id":"457ee354-005e-4c35-a054-5570fb6d34c9","resolution":{"observed_at":"2026-08-16T10:28:11.032102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:11.035791Z","title":"Qlora: Efficient finetuning of quantized llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.035791Z"},"links":{"citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:93d6c29ba831d2b588718dbe402ec1e018da97e41ceefd28ab8a1595f5ed4e09","observation_id":"0c58a6b2-b601-4b17-87fb-29f5ff648528","resolution":{"observed_at":"2026-08-16T10:28:11.035791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05904","last_updated":"2024-10-01T12:08:23Z","snapshot_observed_at":"2026-08-16T13:53:58.560866Z","submitted_at":"2024-05-09T17:00:22Z","title":"Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05904","snapshot_observed_at":"2026-08-16T10:28:11.039320Z","title":"Does fine-tuning llms on new knowledge encourage hallucinations? arXiv preprint arXiv:2405.05904, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.039320Z"},"links":{"cited_paper":"/paper/2405.05904","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:721ac52d5d9569de70f20f9fce619845c5dcbca02c479adf02f3790870ffd78c","observation_id":"917fb95d-8361-484a-a09e-1918df96bef9","resolution":{"observed_at":"2026-08-16T10:28:11.039320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T10:28:11.043167Z","title":"The Llama 3 Herd of Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.043167Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:cdd9f8a7fa20d6a2700be727814f42ba62702da098751665cc2c27f691f8aecf","observation_id":"19c99389-363b-4da0-ad6c-b4fc0e67369e","resolution":{"observed_at":"2026-08-16T10:28:11.043167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:11.047103Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.047103Z"},"links":{"citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:bf607707ece5e56db98af6b3dc7d978b6261348faf71c61e829b2ab826ef4d7e","observation_id":"81d060c2-dbc1-4d9e-8c77-a889a1d130e7","resolution":{"observed_at":"2026-08-16T10:28:11.047103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-16T10:28:11.050549Z","title":"Measuring Massive Multitask Language Understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.050549Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:906b79d702b51cb02b95ddfd3951a542fd1931976b840fea68e1d49c4cca0fe9","observation_id":"3060ebd3-1cd8-4034-b2f2-352701584d4b","resolution":{"observed_at":"2026-08-16T10:28:11.050549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-16T10:28:11.054338Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.054338Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:1b425aa8f93964e0ef3204a2e127eb005bead59ed84e0c9995c8907cb8c833ce","observation_id":"5c921b51-133c-41f9-a97d-a26f3cec6eab","resolution":{"observed_at":"2026-08-16T10:28:11.054338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13317","last_updated":"2024-09-20T08:25:16Z","snapshot_observed_at":"2026-08-16T13:16:56.835928Z","submitted_at":"2024-09-20T08:25:16Z","title":"JMedBench: A Benchmark for Evaluating Japanese Biomedical Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13317","snapshot_observed_at":"2026-08-16T10:28:11.057854Z","title":"JMedBench: A Benchmark for Evaluating Japanese Biomedical Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.057854Z"},"links":{"cited_paper":"/paper/2409.13317","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:0c8e8d87f105709cb8aab98e5260d94be12bf7f3d76de4f574ccdf2582d6cd7f","observation_id":"5c261eda-d21e-4720-adf2-46af41367546","resolution":{"observed_at":"2026-08-16T10:28:11.057854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13081","last_updated":"2020-09-28T05:07:51Z","snapshot_observed_at":"2026-08-19T11:12:45.951488Z","submitted_at":"2020-09-28T05:07:51Z","title":"What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.13081","snapshot_observed_at":"2026-08-16T10:28:11.061879Z","title":"What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.061879Z"},"links":{"cited_paper":"/paper/2009.13081","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:fabd3e4a370010f50e58ed29f6eeb82bbf219b9b58ec6d9b88e52e0ffb9c8a41","observation_id":"4eaf16e5-6cce-4550-b987-572c5adf0e95","resolution":{"observed_at":"2026-08-16T10:28:11.061879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:11.065840Z","title":"P ub M ed QA : A dataset for biomedical research question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.065840Z"},"links":{"citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:e7d02a56cd72dd0713e013eb794aed94f7f1d39b3880ad64b6d7c9b5f3cac5af","observation_id":"ca91b0bb-b531-42d0-bbad-1c23b7753a27","resolution":{"observed_at":"2026-08-16T10:28:11.065840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:11.623909Z","title":"An evaluation framework for clinical use of large language models in patient interaction tasks","venue":null,"work_id":"748c1f96-5669-4d21-95a2-9854f5228253","year":2025},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.069902Z"},"links":{"citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:99ab4c03d9fa091da926be0d88fc5d7d92e5c423eccaed910617ba427eca8425","observation_id":"cb7c69c1-495e-4a23-b7b0-3af71d1f3876","resolution":{"observed_at":"2026-08-16T10:28:11.627980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07314","last_updated":"2026-07-28T17:58:21Z","snapshot_observed_at":"2026-08-16T13:19:25.736790Z","submitted_at":"2024-09-11T14:44:51Z","title":"MEDIC: Comprehensive Evaluation of Leading Indicators for LLM Safety and Utility in Clinical Applications","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07314","snapshot_observed_at":"2026-08-16T10:28:11.073411Z","title":"MEDIC: Towards a Comprehensive Framework for Evaluating LLMs in Clinical Applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.073411Z"},"links":{"cited_paper":"/paper/2409.07314","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:206b5f6131e6f2e8a0c73be87622ef944d5942ea7c836237e68da2641387dfe6","observation_id":"48b23760-3ce1-4fc0-8875-80697cb08a23","resolution":{"observed_at":"2026-08-16T10:28:11.073411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18027","last_updated":"2023-04-05T07:53:37Z","snapshot_observed_at":"2026-08-16T15:43:46.612932Z","submitted_at":"2023-03-31T13:04:47Z","title":"Evaluating GPT-4 and ChatGPT on Japanese Medical Licensing Examinations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18027","snapshot_observed_at":"2026-08-16T10:28:11.077396Z","title":"Evaluating gpt-4 and chatgpt on japanese medical licensing examinations, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.077396Z"},"links":{"cited_paper":"/paper/2303.18027","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:b6da432e35f5c89fe37fb6770f4d5c7ca2d88722ec876bc88ac8da367bf2b95d","observation_id":"6b748f13-a5e6-4a0c-ba0e-904bb31ace17","resolution":{"observed_at":"2026-08-16T10:28:11.077396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:11.081154Z","title":"Medical Hallucinations in Foundation Models and Their Impact on Healthcare","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.081154Z"},"links":{"citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:734aabc9e14b3db02e15c2c2ab8e49bc164c486eb1b2d8aa99353b9f434a4500","observation_id":"73cb7e17-8456-4916-863a-c19e0428d06a","resolution":{"observed_at":"2026-08-16T10:28:11.081154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-16T14:26:54.639216Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-16T10:28:11.084518Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.084518Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:b148b03031c53ea95c75f2e36ffefe57e2d3aefaaa652517fbb31bfc1501f9a5","observation_id":"f15475b9-a3b8-44c3-a75f-052992fea374","resolution":{"observed_at":"2026-08-16T10:28:11.084518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:11.613393Z","title":"Radlink: Linking clinical entities from radiology reports","venue":null,"work_id":"814f801c-3a19-45fd-b6dd-c902646fc0bd","year":2024},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.088357Z"},"links":{"citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:0a229531a4b07801e4fa213bb2f0bb0679c8f18bb82ca0bd4fc354bea20eb19d","observation_id":"98a9ab13-58b5-4882-b961-1ad3d3c2f96c","resolution":{"observed_at":"2026-08-16T10:28:11.616832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-16T14:39:48.082697Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-16T10:28:11.091968Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.091968Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:373e594cec67bae08e904c02ad3161cc11f95692367c601b7cfbcfa1fdf87aea","observation_id":"b1b65886-20a3-42e7-9f14-eed8dcb70513","resolution":{"observed_at":"2026-08-16T10:28:11.091968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-16T14:39:48.082697Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-16T10:28:11.095769Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.095769Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:6e7224ec7d67538cd2a096bbc879856bb3309e3a0dc522c8059a008bcdfadf7b","observation_id":"5f8dc36a-7d12-4725-9937-29c4223836e0","resolution":{"observed_at":"2026-08-16T10:28:11.095769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03590","last_updated":"2024-11-06T01:09:17Z","snapshot_observed_at":"2026-08-17T18:13:42.083292Z","submitted_at":"2024-11-06T01:09:17Z","title":"From Medprompt to o1: Exploration of Run-Time Strategies for Medical Challenge Problems and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03590","snapshot_observed_at":"2026-08-16T10:28:11.099070Z","title":"From medprompt to o1: Exploration of run-time strategies for medical challenge problems and beyond","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.099070Z"},"links":{"cited_paper":"/paper/2411.03590","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:c226511b1b8b553fd421860fbb15f80db285f3f2edc14a742a7dad8324bbaf50","observation_id":"31daaaa7-af17-491b-a9cb-9bf932f12744","resolution":{"observed_at":"2026-08-16T10:28:11.099070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:11.602869Z","title":"openai/MMMLU , 2024","venue":null,"work_id":"9522fff0-61b3-4cee-84ac-1fc3f536aa01","year":2024},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.102529Z"},"links":{"citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:37a7bdd6f9800affda0440b057c39c676cc374a6976309ec3529cbe21b7874c3","observation_id":"72b9065e-cbe2-47b3-a690-5043ba97eb17","resolution":{"observed_at":"2026-08-16T10:28:11.606432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-16T10:28:11.107627Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.107627Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:77a82d7e77583ac0058866b16c62ad12cb4a28f33d5de366d4ab2187ffafce9c","observation_id":"8105fb90-7260-4de8-bf8d-5d87853ef6f3","resolution":{"observed_at":"2026-08-16T10:28:11.107627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:11.111525Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.111525Z"},"links":{"citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:8f3f09195545bfc51778243d951403f643f08246548235bc28ff602b42d85ddc","observation_id":"8e88db10-a75a-416c-959b-26fb15c1070b","resolution":{"observed_at":"2026-08-16T10:28:11.111525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-16T10:28:11.115101Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.115101Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:be02b7069c2d26832e6879328f45d255ca14564563cf320f57942e0454a34403","observation_id":"90ebc75e-2d21-4aa1-ab54-f6d02fbe2b3f","resolution":{"observed_at":"2026-08-16T10:28:11.115101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19733","last_updated":"2024-06-26T01:28:35Z","snapshot_observed_at":"2026-08-16T13:56:31.553308Z","submitted_at":"2024-04-30T17:28:05Z","title":"Iterative Reasoning Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19733","snapshot_observed_at":"2026-08-16T10:28:11.118774Z","title":"Iterative Reasoning Preference Optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.118774Z"},"links":{"cited_paper":"/paper/2404.19733","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:f001588eb88fd22750e991ffb946d7be07bcf8debafad2e9e14158406658949b","observation_id":"a12ed395-812b-4182-b83d-ddb8330022a0","resolution":{"observed_at":"2026-08-16T10:28:11.118774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07563","last_updated":"2024-10-22T09:06:38Z","snapshot_observed_at":"2026-08-19T05:53:12.548184Z","submitted_at":"2024-10-10T02:59:36Z","title":"PLaMo-100B: A Ground-Up Language Model Designed for Japanese Proficiency","version":2},"cited_work":{"arxiv_id":"2410.07563","doi":"10.48550/arxiv.2410.07563","metadata_source":"pith","pith_arxiv_id":"2410.07563","snapshot_observed_at":"2026-08-16T12:16:17.039197Z","title":"PLaMo-100B: A Ground-Up Language Model Designed for Japanese Proficiency","venue":"cs.CL","work_id":"802c9d50-8397-4f78-bb19-c3da9454d3ba","year":2024},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.122594Z"},"links":{"cited_paper":"/paper/2410.07563","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:529befedd7112d8ebb13d52a3d451c04597c059e36720ed45d09658e02673439","observation_id":"b1e73f53-7ab7-4ef8-9e3a-f2f32623bc35","resolution":{"observed_at":"2026-08-16T10:28:11.225598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-16T10:28:11.126407Z","title":"Qwen2.5 Technical Report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.126407Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:63c91721a76436ff8a36555749508dcdbcf85ac25b05afd150ffd795fb5b63a6","observation_id":"76b0664a-0ccf-48f5-9665-455016c42998","resolution":{"observed_at":"2026-08-16T10:28:11.126407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-16T10:28:11.129935Z","title":"Manning , and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.129935Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:c9e1a46df2185721edc05debbecd7553377c57d2e45e1b2985850ccadc1570eb","observation_id":"77f88661-dd29-4745-9d94-a600beb808dc","resolution":{"observed_at":"2026-08-16T10:28:11.129935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18416","last_updated":"2024-05-01T17:12:10Z","snapshot_observed_at":"2026-07-06T18:06:49.190172Z","submitted_at":"2024-04-29T04:11:28Z","title":"Capabilities of Gemini Models in Medicine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18416","snapshot_observed_at":"2026-08-16T10:28:11.133508Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.133508Z"},"links":{"cited_paper":"/paper/2404.18416","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:2d72bd24cd020ef380bdd98e0de708b8ad9a7c2782c9aca279ae8c1c8db4ea8f","observation_id":"1bd2fa28-c7df-427d-84d2-3e52dcf5aabf","resolution":{"observed_at":"2026-08-16T10:28:11.133508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:11.137385Z","title":"Toward expert-level medical question answering with large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.137385Z"},"links":{"citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:a201ca734a779fc9f3564be1f2cc257ee2a47a28c707b45f697e4620dff3797e","observation_id":"523c3ae4-07c3-431e-84ca-17c0ca95756d","resolution":{"observed_at":"2026-08-16T10:28:11.137385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11783","last_updated":"2024-09-20T04:13:33Z","snapshot_observed_at":"2026-08-16T13:17:35.299551Z","submitted_at":"2024-09-18T08:07:37Z","title":"Development and bilingual evaluation of Japanese medical large language model within reasonably low computational resources","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11783","snapshot_observed_at":"2026-08-16T10:28:11.140703Z","title":"Development and bilingual evaluation of japanese medical large language model within reasonably low computational resources","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.140703Z"},"links":{"cited_paper":"/paper/2409.11783","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:96460347dd0f52cfa35f5810aaf23c1469d804b2f63f43e3a3a70bc8c69bc8a1","observation_id":"2a38297a-6470-4172-8e5f-cea04e9e3511","resolution":{"observed_at":"2026-08-16T10:28:11.140703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14882","last_updated":"2024-06-21T06:04:10Z","snapshot_observed_at":"2026-08-16T13:40:51.626947Z","submitted_at":"2024-06-21T06:04:10Z","title":"70B-parameter large language models in Japanese medical question-answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14882","snapshot_observed_at":"2026-08-16T10:28:11.144236Z","title":"70B-parameter large language models in Japanese medical question-answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.144236Z"},"links":{"cited_paper":"/paper/2406.14882","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:2766884ec6d17456b5cf21bf2a5bc019cb3a1b6e31d026a6ec0ce9ff4b4eaf37","observation_id":"8f7c7534-552b-4cc9-b1e7-63a1b779ac28","resolution":{"observed_at":"2026-08-16T10:28:11.144236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:11.578509Z","title":"Towards conversational diagnostic artificial intelligence","venue":null,"work_id":"cb879803-b3a6-4d8f-b06b-eaa6ab70b1c9","year":2025},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.148130Z"},"links":{"citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:a1e18f3749117939cb917d1a53dd9409a063b9ff5600d55e975ac10e045b58c7","observation_id":"eb5034e7-d180-48f5-88a7-8867bba2d594","resolution":{"observed_at":"2026-08-16T10:28:11.582356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:11.151512Z","title":"Adapted large language models can outperform medical experts in clinical text summarization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.151512Z"},"links":{"citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:ac08335edf2f385071cf6e848f8c39afdb4b88bd870b65c4e9773913e8fce710","observation_id":"7becc1bc-dc26-40de-92e7-45a1ff2c6117","resolution":{"observed_at":"2026-08-16T10:28:11.151512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15277","last_updated":"2024-09-23T17:59:43Z","snapshot_observed_at":"2026-08-16T13:16:09.171829Z","submitted_at":"2024-09-23T17:59:43Z","title":"A Preliminary Study of o1 in Medicine: Are We Closer to an AI Doctor?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15277","snapshot_observed_at":"2026-08-16T10:28:11.154915Z","title":"A preliminary study of o1 in medicine: Are we closer to an ai doctor? arXiv preprint arXiv:2409.15277, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.154915Z"},"links":{"cited_paper":"/paper/2409.15277","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:9868232b2b3cd80e531e7fa711dc0252dc57cf1b1c81502cf0ae17c47670522b","observation_id":"c348976a-fe2c-4d1f-9b59-55dc43f7fabc","resolution":{"observed_at":"2026-08-16T10:28:11.154915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15075","last_updated":"2023-05-24T11:56:01Z","snapshot_observed_at":"2026-08-18T08:23:21.051891Z","submitted_at":"2023-05-24T11:56:01Z","title":"HuatuoGPT, towards Taming Language Model to Be a Doctor","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15075","snapshot_observed_at":"2026-08-16T10:28:11.158639Z","title":"Huatuogpt, towards taming language model to be a doctor","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.158639Z"},"links":{"cited_paper":"/paper/2305.15075","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:fc9f09ecb5b95751753a6d1f932c4d900116f71bbf07c40ad3c6a92218131844","observation_id":"5da5b1f8-702f-43bc-a4f8-3ac543734e9a","resolution":{"observed_at":"2026-08-16T10:28:11.158639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":4},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2504.18080."}