{"as_of":"2026-08-13T18:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f7a276293461c33507d997048882ba3cb16a9aab2ce1d342bdb0dbf4da64b3b9","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:31:03.576676Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:11:20.481528Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T10:38:36.176606Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07988","snapshot_observed_at":"2026-08-11T11:11:20.481528Z","title":"Automating expert-level medical reasoning evaluation of large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.481528Z"},"links":{"cited_paper":"/paper/2507.07988","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:9c0aeb703dffd4fb99065b995fab6959c30e26dc114ea6911b6afb77d0321b0d","observation_id":"89338951-d8e3-47ff-a305-7f5e7bfd8d5d","resolution":{"observed_at":"2026-08-11T11:11:20.481528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"cited_work":{"arxiv_id":"2507.07988","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.07988","snapshot_observed_at":"2026-08-05T10:38:36.176606Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","venue":"cs.CL","work_id":"be4387ab-dd83-42ba-9e24-82b19adf0db5","year":2025},"citing_paper":{"arxiv_id":"2509.04534","last_updated":"2025-09-04T04:18:45Z","snapshot_observed_at":"2026-08-06T05:31:52.923420Z","submitted_at":"2025-09-04T04:18:45Z","title":"Quantized Large Language Models in Biomedical Natural Language Processing: Evaluation and Recommendation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:31.601683Z"},"links":{"cited_paper":"/paper/2507.07988","citing_paper":"/paper/2509.04534"},"observation_digest":"sha256:8162066d1cb9d80b1e1f7c1d0c8f1cb9851ce2bb3ae2c0ad9f59f3215d455e90","observation_id":"3cfe754e-cd08-4ea8-9c04-f57d9a221b4f","resolution":{"observed_at":"2026-08-05T10:38:36.213313Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07988","snapshot_observed_at":"2026-08-01T12:04:28.955923Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19678","last_updated":"2026-07-22T02:27:51Z","snapshot_observed_at":"2026-08-09T16:17:16.844011Z","submitted_at":"2026-07-22T02:27:51Z","title":"Reference-Free Evaluation of Reasoning in Open-Ended Question Answering","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-01T12:04:28.955923Z"},"links":{"cited_paper":"/paper/2507.07988","citing_paper":"/paper/2607.19678"},"observation_digest":"sha256:44e9f7185c23b9721a0764bc59f5fffee7904a262d9346d20095d476d3e35763","observation_id":"e3612936-29d2-4b45-b3ec-42657fc5a18b","resolution":{"observed_at":"2026-08-01T12:04:28.955923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07988/citation-record","integrity":"/paper/2507.07988/integrity","json":"/paper/2507.07988/citation-record.json","paper":"/paper/2507.07988"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.597459Z","title":null,"venue":null,"work_id":"d15c242a-417b-496f-934c-3f5af2f1eb7b","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:57.538335Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:1713a859a3a3af4633992479e58cb2f699771df963a4dc6476198d6607c6ef0d","observation_id":"fea62828-9d94-41fa-8edb-b65d3f7ba34e","resolution":{"observed_at":"2026-08-06T18:31:09.602141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.580657Z","title":null,"venue":null,"work_id":"ac342635-3ebb-4776-a2da-2c67937bb666","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:57.605075Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:4163aa10bc3f3d6495fc540d3b598fbe880b065d5414bb07be43ac90b1eeeb84","observation_id":"82c86c53-cff5-4b11-9e22-becdd6e7bb11","resolution":{"observed_at":"2026-08-06T18:31:09.584943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.563798Z","title":null,"venue":null,"work_id":"78a64f9e-6512-43e9-879c-7441fc878d77","year":2023},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:57.699546Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:98ec601ef69f8c93b04fd6b99abc45e88ad224fa8f094d251f6a832cfcbf315c","observation_id":"d024cad4-2a9f-4d7e-8650-c479bdefc270","resolution":{"observed_at":"2026-08-06T18:31:09.569216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.545141Z","title":null,"venue":null,"work_id":"36a286e9-c858-4e6d-ad1b-640bf51e7b10","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:57.775519Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:06ebf4d55407800ad8c96d05d8eff7312e35f5570914f7306fed569e9518227c","observation_id":"b1fa0974-30b9-4dc5-8a72-2a64f4e7e327","resolution":{"observed_at":"2026-08-06T18:31:09.550385Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.524796Z","title":null,"venue":null,"work_id":"26f327d8-b28e-4cc2-a5d6-89a966339695","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:57.849681Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:84a55eec35b53c5c63d191f43bc1689e5e144cb2e8a150ff08e1fb549e634107","observation_id":"9938ec45-ea59-4fd7-9f6a-7656b396dd7d","resolution":{"observed_at":"2026-08-06T18:31:09.532446Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.505219Z","title":null,"venue":null,"work_id":"65f269c8-7051-43ca-af0d-aae709d7d05b","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:57.926277Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:7253d5769057be8bd0a06587cb91bc838af1be5ae375b737f5df2af8f57f2da5","observation_id":"2a1ea739-43f7-4404-acc5-266adaefde6a","resolution":{"observed_at":"2026-08-06T18:31:09.510289Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.485344Z","title":null,"venue":null,"work_id":"97685f06-1f66-42fe-9142-b92814b02a58","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.030842Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:09eaf4b45fe35f291633c9f3b987b75446e0fd8169f2907e2dcf3bce66737832","observation_id":"cf93f74a-3642-4262-a184-22013c439aa7","resolution":{"observed_at":"2026-08-06T18:31:09.490531Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.464525Z","title":null,"venue":null,"work_id":"98134130-3826-4690-8bc0-ca9d359b5e31","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.126704Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:8b50eb3d44d7024869e803ada64d938db5c6c37ad46648d532c6145c5790b2e4","observation_id":"b8ea57cd-4e6e-42c7-a217-dee22dfa13c9","resolution":{"observed_at":"2026-08-06T18:31:09.469292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.449084Z","title":null,"venue":null,"work_id":"e1c53b63-55c3-4776-905e-24e8b7a25476","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.206001Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:a281b0d6c5e32f87552a2825b8542d7abd190bc66795ee374bb1fafe1696449e","observation_id":"33371637-d575-458a-aaa0-b0ad6ed691c1","resolution":{"observed_at":"2026-08-06T18:31:09.454065Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.431149Z","title":null,"venue":null,"work_id":"0a3b5fc3-af98-4ac1-871d-2f14a9653634","year":2023},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.279514Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:de0011eca9f54be606a5145ea49811d2ab2cbcaaa22fef673a2cfb857c4f0e10","observation_id":"78f6a361-d8f3-4917-b1aa-a90e6b6535bb","resolution":{"observed_at":"2026-08-06T18:31:09.435785Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.403031Z","title":null,"venue":null,"work_id":"a4bd0202-7f22-43b2-94bc-6d4fd3b20abf","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.351768Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:ec487325a10441a211e149844980bd511d1f1e8cb85fa15c05e10d61a96cc71d","observation_id":"8201bc19-11ec-40d2-987a-27f7010a8402","resolution":{"observed_at":"2026-08-06T18:31:09.410700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15852","last_updated":"2024-03-15T21:04:34Z","snapshot_observed_at":"2026-08-13T11:33:41.872629Z","submitted_at":"2023-05-25T08:43:46Z","title":"Self-contradictory Hallucinations of Large Language Models: Evaluation, Detection and Mitigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15852","snapshot_observed_at":"2026-08-06T18:30:58.427520Z","title":"& Vechev, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.427520Z"},"links":{"cited_paper":"/paper/2305.15852","citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:ea122592d94cda20b322857d0662adad1306835145550dae8fc432342da6e511","observation_id":"94d06134-d812-4eea-8618-3082cdef62c0","resolution":{"observed_at":"2026-08-06T18:30:58.427520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.381552Z","title":"& Ranisch, R","venue":null,"work_id":"fcc8a08f-f9b0-47d6-bca3-c2714e99abae","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.512040Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:5ea514e65d8f26c290dd26a0a2a94c7d26dad14697e727a2364533cbfc3d7076","observation_id":"68a926b1-31da-48cb-ae54-ad162f7f71c5","resolution":{"observed_at":"2026-08-06T18:31:09.387708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.355347Z","title":"& Chen, J","venue":null,"work_id":"1a8ffb0b-1215-4a4e-84ea-33d710f18a8f","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.585270Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:7737938cee3063c99149a7c164d99cd60dd4b640e1c4824af37c6fb9e3a27e5e","observation_id":"0ee57d6b-f59d-4a04-ae2f-9d27b508b54c","resolution":{"observed_at":"2026-08-06T18:31:09.360873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.337226Z","title":null,"venue":null,"work_id":"bd9c0130-9cc7-400e-b284-870d08a0527b","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.645309Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:f0e96e4ac295c58ef42d2487eab29a33fc05c535b839999c93766e59208cdbf1","observation_id":"c410b272-f65c-4388-928f-d10e1bfbef9c","resolution":{"observed_at":"2026-08-06T18:31:09.343527Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.309985Z","title":null,"venue":null,"work_id":"eb219b1b-c3ca-43d4-b6cb-d78ce791ef0d","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.703906Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:f98bead15e793511548ac749d461db95c5d9de54faa84b758818f33123305eec","observation_id":"df2e0a39-cbd9-401b-9a47-813ca40e9eb5","resolution":{"observed_at":"2026-08-06T18:31:09.315728Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.288684Z","title":null,"venue":null,"work_id":"7d9f2c43-1e65-4bea-9a25-b64daefd9db3","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.787928Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:6bfab82f5dd0973af9e0affdb4731454c15decdd41b21c3564d29a06529ac48e","observation_id":"2b2ebbac-7dc1-4ffb-989e-a8cd2c496ec7","resolution":{"observed_at":"2026-08-06T18:31:09.296147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.270044Z","title":null,"venue":null,"work_id":"657fd37e-e1cf-4058-bff9-6909d95d0197","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.867942Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:1f4ed7680e05c049bb4a6769ed42ca40f3daecf8f9c47f24ac75197faaf98d04","observation_id":"b6563a44-3ff1-455f-99b7-d1138c6e2e84","resolution":{"observed_at":"2026-08-06T18:31:09.275469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2196/preprints.70080","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"2485a4ec-226a-4b17-bd0f-2eb3b02c2604","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.912490Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:4e6e00f99cd6e71ea1a43f4ef01f61d7ff959c774ebbf52210fb4d18be11d134","observation_id":"9780ca1c-fb59-4ce2-a6fd-3f9d7771df50","resolution":{"observed_at":"2026-08-06T18:31:03.894469Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:30:58.963784Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.963784Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:229b4b4fa4d7d3f0858d25fc93b2aa70e9457bc304f61b03f1512dfbae0e63fe","observation_id":"96bcb4f4-9993-4925-8232-c60a00c68819","resolution":{"observed_at":"2026-08-06T18:30:58.963784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.235221Z","title":null,"venue":null,"work_id":"749505a3-0389-4e4e-9431-e0d1770f0fd3","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.028935Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:a0e10ac2a632dcd2fa2847c46f427942796d21ce12548d604871e35157775171","observation_id":"0edfd9dc-f811-4d8b-b2cb-163399547ac4","resolution":{"observed_at":"2026-08-06T18:31:09.239650Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.218122Z","title":"E., Motzfeldt, A","venue":null,"work_id":"b1d23440-b6f8-4e1d-9e8e-952773f3e756","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.088944Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:5066125ed53f9fdda259bf08f6f1af0b72578bbff4c61ba5ccc3a26978398337","observation_id":"ce73f86f-a492-49a9-9699-29eccc6f86d7","resolution":{"observed_at":"2026-08-06T18:31:09.223653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.193950Z","title":null,"venue":null,"work_id":"4b9f1418-3519-486a-b995-1b4ee2021d80","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.135672Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:814d1adc7349f63a2644d44b1ec4e978b27ed74c2de3ea6949645304b70471a8","observation_id":"4badec55-5a92-445a-beef-5119c443f365","resolution":{"observed_at":"2026-08-06T18:31:09.199441Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.149021Z","title":null,"venue":null,"work_id":"1e0b5238-4c3a-4e43-bf62-bac4bd357453","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.176330Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:a7223537f5ff544a33191c80acaa2ce8e8bf832e3d95effe1e147a0c47af85d1","observation_id":"7920dcd3-97d4-46be-82ea-5322ae45aee7","resolution":{"observed_at":"2026-08-06T18:31:09.155223Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.121532Z","title":null,"venue":null,"work_id":"97ed8b11-2f9d-4084-9a5b-575622e5d45b","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.223086Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:9bd2274702261c87853a90a9cae48d0908628c63dde7b73d2407ccab60112598","observation_id":"9715e056-8792-4869-8056-d83e11810222","resolution":{"observed_at":"2026-08-06T18:31:09.135472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:30:59.270249Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.270249Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:85b60b21cba0c72e91caa5b1aa881b3ca01534ccaa8f7fb3abe99a05171abed2","observation_id":"15b7a50e-c4b9-4033-9ae9-2ee3170bf2e5","resolution":{"observed_at":"2026-08-06T18:30:59.270249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.089208Z","title":"& Zhang, M","venue":null,"work_id":"2cf7bdbf-6ba5-4f2c-a733-8d56b7b46362","year":2023},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.323111Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:eb30ab0547d22754bf3d5b6c3c773ea6b2570926d6abccaa9305d6e9c08dc1c4","observation_id":"654eef0e-e4ea-44f0-818e-9ab4b5b51d0a","resolution":{"observed_at":"2026-08-06T18:31:09.095502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.071263Z","title":null,"venue":null,"work_id":"e19ef5c4-1def-4ec0-a178-9a000a843bee","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.398355Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:d9634b9d645482affe320360d85a8a165d5c9eee9921b2ac2ecbab78775381e6","observation_id":"595d3d64-676c-47f4-a650-f243b5b26c23","resolution":{"observed_at":"2026-08-06T18:31:09.077073Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:30:59.448696Z","title":"& Zhu, W.-J","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.448696Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:f15050898df76a0f99fb3b02d54ec36cd7e3c0694a784e23c0271e7239f7094d","observation_id":"513cfb26-1ebe-446f-8783-d749c16559e5","resolution":{"observed_at":"2026-08-06T18:30:59.448696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.051453Z","title":"ROUGE: A package for automatic evaluation of summaries","venue":null,"work_id":"30f7e615-e720-4143-b46a-9e3934acb9c4","year":2004},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.526033Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:259bd5f5bda8fc05bef698592a512ec0982f53ab3bbcc4f4a6f82a5af6547234","observation_id":"32742a83-d522-476b-aada-9cafc088dc44","resolution":{"observed_at":"2026-08-06T18:31:09.056931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.024976Z","title":null,"venue":null,"work_id":"50ce9276-cca7-4434-b0da-12ceead83760","year":2019},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.591080Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:60784f293577416c78c08a53bc3baac62a29e43d5f3fa4b20658c3d0b2055a1a","observation_id":"cad86f9f-c74a-42b3-8a7d-996eca6af49e","resolution":{"observed_at":"2026-08-06T18:31:09.032771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.006776Z","title":null,"venue":null,"work_id":"bf335420-4c31-4568-b0f7-f945c552a5f8","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.647833Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:6c31c52941ff668460844775bdefb47946e50fa2cbb725c415ad1a4759fff931","observation_id":"f41df4a2-84cd-4fbf-9d46-856873202ddc","resolution":{"observed_at":"2026-08-06T18:31:09.011481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:08.987083Z","title":null,"venue":null,"work_id":"86e0f6e6-f966-419e-9205-2ceed2157f17","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.731276Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:e91a4f5273ca3bf5b252b4431e6fe46920d191462a38fb9ea114db445779daf9","observation_id":"5325ec03-3582-46f6-96ef-30aba848691c","resolution":{"observed_at":"2026-08-06T18:31:08.992397Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:08.963506Z","title":null,"venue":null,"work_id":"e91de9f1-7d8f-4ba3-8e01-3f479c8e3667","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.816765Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:a4515547cd862514fbf1ca25e4c71847569eecf65069e0d8a49bb789c02431e1","observation_id":"2b2bfa33-9464-4c8b-9c7e-74a7161d602b","resolution":{"observed_at":"2026-08-06T18:31:08.970046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:08.943312Z","title":null,"venue":null,"work_id":"143eac37-d7f7-4c5c-994a-2dc1f80008be","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.927540Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:a0a228374552a7811d66046d80adb82ec3a1ca70e6825071f23f0cc5d37ddec4","observation_id":"0924487e-7e62-4d87-bc51-a69a859c37ff","resolution":{"observed_at":"2026-08-06T18:31:08.948488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:08.928814Z","title":null,"venue":null,"work_id":"c00d9d60-266f-457a-bffa-7dc76c3b1de9","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.986127Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:69efa7fbfa65c3506951961b45fcb33ace9b190ad161982cbe39aa53ce562cd9","observation_id":"7d75a361-2d51-4ec0-b04e-42f68e294ab7","resolution":{"observed_at":"2026-08-06T18:31:08.933069Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:00.063157Z","title":"& Yuksel, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.063157Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:0dbcfe3df9fd784ad0c8530437d5ce049af43e095bcc6e85aa97d13d05e1d441","observation_id":"35697907-0a56-492d-9a62-502def21f83f","resolution":{"observed_at":"2026-08-06T18:31:00.063157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:08.862144Z","title":"& Dredze, M","venue":null,"work_id":"04617df5-5e1c-4f2d-a96d-0cb2b4401919","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.143843Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:1b47fcf7d784ffc390e753d043e864e371ff63a8e13620fea09c401e9b137747","observation_id":"5104ce6d-cde6-4ee8-8a4e-d50de8cbda29","resolution":{"observed_at":"2026-08-06T18:31:08.901236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:08.607561Z","title":null,"venue":null,"work_id":"1cc9f102-b548-4255-bfaf-b9be52d6acc9","year":2023},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.227387Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:10e150e6bc39635edb09885823a408a9718088a654942e2cd7339919acf6d6d8","observation_id":"9c211c11-1538-4043-be55-3e18d6957f65","resolution":{"observed_at":"2026-08-06T18:31:08.711102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-06T18:31:00.297754Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.297754Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:42e5a5a23618b84a1cfda9a17575ed2243305e07460889fa513ec645054a86b2","observation_id":"d77a8f62-3d2a-4da2-8746-98299c88fbc3","resolution":{"observed_at":"2026-08-06T18:31:00.297754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:08.363743Z","title":null,"venue":null,"work_id":"5dc39c05-09e6-4fc6-a254-944a3a731206","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.380994Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:d76d960750aa911b81cb4adc8b70af8f4b28d3357153f87d65d4a471b243893b","observation_id":"7a873045-b05b-4cae-b63d-989c30b9dfd5","resolution":{"observed_at":"2026-08-06T18:31:08.436810Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:08.159616Z","title":"F., Goel, R., Wen, Z., Martel, J","venue":null,"work_id":"f1b2259c-1bb7-4bbe-9b37-00a79b38a0d7","year":2022},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.463207Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:8dbe823910fb43eaeddac09fa81f8eb1f1d45b80d3c3c9f9700d5a802d24ceb8","observation_id":"fc03a2dc-81fd-4c6e-8802-3e8c43caeb5c","resolution":{"observed_at":"2026-08-06T18:31:08.300854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:07.860949Z","title":"& Dredze, M","venue":null,"work_id":"ec1217e2-65b9-4656-856a-0ef6e65c69ca","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.540262Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:bfc704c1061155dd59801ef8bd8e12f23981c7905fe6511b84701ed3f4fdc232","observation_id":"dba215f0-da18-488e-a5ef-b838c43c7cee","resolution":{"observed_at":"2026-08-06T18:31:07.990827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-06T18:31:00.630372Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.630372Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:b86af3c6b1c4196f754710ee08b793540aecef5d1096d4af2be6f64f3d140425","observation_id":"e012493f-0dd8-46c4-ba8b-5a9496c6af2f","resolution":{"observed_at":"2026-08-06T18:31:00.630372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:07.700670Z","title":null,"venue":null,"work_id":"6d73a221-3ffc-484b-a750-256b20ab61de","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.760960Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:543ca9e9b88ad6a3b1050743cc4e67ccd9bcd22b7c15d6bacbf9d027083f0857","observation_id":"62b7f041-cf32-42c2-aa67-16cd97084df2","resolution":{"observed_at":"2026-08-06T18:31:07.848943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:07.380906Z","title":null,"venue":null,"work_id":"15f0d633-693b-484e-bbb0-fea537c469b7","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.867715Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:cf9e38f6810a705ce90ba4131a46db88e8dc6c5da40a8350e7da6f9caa5ffdf8","observation_id":"7d9c4fd0-ba39-41b4-85de-4610ba30e2ff","resolution":{"observed_at":"2026-08-06T18:31:07.530259Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13081","last_updated":"2020-09-28T05:07:51Z","snapshot_observed_at":"2026-08-13T01:26:47.642290Z","submitted_at":"2020-09-28T05:07:51Z","title":"What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.13081","snapshot_observed_at":"2026-08-06T18:31:00.962024Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.962024Z"},"links":{"cited_paper":"/paper/2009.13081","citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:33334450e4c4e45cdc0bc82242205cd050f2493160f78596336480c065f3ac91","observation_id":"8c4aa8a8-8ab3-47c2-9ff8-51943695fa21","resolution":{"observed_at":"2026-08-06T18:31:00.962024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:07.066961Z","title":null,"venue":null,"work_id":"e58cc68e-b4c6-43ea-9f52-f0e81eb094cf","year":2019},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:01.052752Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:fde9dbb2cc393777d34ae4d57ca5a6037af97f759191a534e5521fd28b1a1a71","observation_id":"3e22655b-e182-4afb-b696-df244c612cce","resolution":{"observed_at":"2026-08-06T18:31:07.176482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:06.928709Z","title":null,"venue":null,"work_id":"4dcb77e5-ecdc-472c-a89d-a9ef1595cf73","year":2022},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:01.146944Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:e5d9dc994cdb2521b2fcb57041345d3671d4bc6161d78b6efab43c81fdccc779","observation_id":"a0da6c83-e3ed-4dec-bf93-7866be91e26f","resolution":{"observed_at":"2026-08-06T18:31:06.997332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T18:31:01.239886Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:01.239886Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:7b35d47ef39af2a4521f9e504e10d7c082e4e1d4f2da6285c4cc4847162a7eff","observation_id":"fc27fef7-a5bf-4b47-9e17-25612dec8a60","resolution":{"observed_at":"2026-08-06T18:31:01.239886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:06.758971Z","title":"& Gómez-Rodríguez, C","venue":null,"work_id":"e9095c67-efb0-4f73-867a-9f640a0b867e","year":2019},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:01.341500Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:76deb2f48de27526fe6bef2f4be96245e102d9fb89281476d77d163d0227ab37","observation_id":"d8abe900-b029-4332-ac3d-dda2921d18d6","resolution":{"observed_at":"2026-08-06T18:31:06.835297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:06.623339Z","title":"& Lavie, A","venue":null,"work_id":"02698457-8b3c-4fd8-bd2f-9eae63d21879","year":2005},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:01.473941Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:77098d3db918d2cf78b6bbc4d5e03c4bd4db4e9b941a9303fb46a93c8897c83b","observation_id":"1cbece59-209a-468e-95be-d351c0166c44","resolution":{"observed_at":"2026-08-06T18:31:06.693457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:06.426243Z","title":"& Parikh, A","venue":null,"work_id":"2290c4e6-bfba-42fd-ae1b-1c379344bc84","year":2020},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:01.622469Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:5113c2ce9431b3d73e89ee8b16e6400e33c4f7c01b5ffcd3695e48a1e1ae9402","observation_id":"bfef7063-a6f8-4e3f-9838-a6b87e8c2f54","resolution":{"observed_at":"2026-08-06T18:31:06.529950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:06.257481Z","title":null,"venue":null,"work_id":"431cdcee-e8a8-4538-aa90-03a4149c2161","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:01.723726Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:dac0b66fcf0e404f527689a275d7a196f9c4d02c6871635c58b162ec19756a41","observation_id":"cd95447a-adce-4700-a42b-c96546f6f4d2","resolution":{"observed_at":"2026-08-06T18:31:06.332867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:06.102463Z","title":"GPT-4 Technical Report","venue":null,"work_id":"f9e11404-1e87-44a7-8c2d-bacdca354205","year":2023},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:01.826623Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:23eaf9e177c1b36c35fa1e0ee47f91c568f966e6a1f523ae2c2dc7cd5d262218","observation_id":"e13e57a9-178d-4d8b-943d-20462a45e7a8","resolution":{"observed_at":"2026-08-06T18:31:06.153060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:05.933268Z","title":"GPT-4o System Card","venue":null,"work_id":"902b7f09-2fdb-4727-8477-e97bd876a329","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:01.969972Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:2938f8ce5add5754b9084821f90aa4aeda81442bc826c85bbc01d8d4a72ed32f","observation_id":"3b6e1b6c-72f4-4171-b9eb-9aaf9216b8d0","resolution":{"observed_at":"2026-08-06T18:31:06.021261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:05.802752Z","title":null,"venue":null,"work_id":"5dd0551f-5f2c-4f24-a722-c2bf4edaa5b1","year":null},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:02.061257Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:de6e7350d126bcf8a46c811b7de10e887532e80ab83c7a155fafed31c7add297","observation_id":"b93086a9-ac3b-448c-83d1-74cb23b0facc","resolution":{"observed_at":"2026-08-06T18:31:05.868662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:05.687665Z","title":"claude-3.5-sonnet","venue":null,"work_id":"6e7611c7-69ac-4e9b-bb99-85c7acd03ecf","year":null},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:02.213379Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:576e7429a00fdcf4d3f4a62e8ecb39dfaabba043c990b2901d694f7ed110f854","observation_id":"a0709f7d-6805-4dda-bd90-2cd96bbb9273","resolution":{"observed_at":"2026-08-06T18:31:05.736069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:05.534091Z","title":null,"venue":null,"work_id":"319ba447-5b77-4f18-bba2-d6d76a0f9308","year":null},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:02.376098Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:3a2df962a84e41bf017d6ab6836fbfd0cca0a2b6dbf73b338c145610c77dec4c","observation_id":"ea5f7796-2527-4459-be53-fdab36e7d703","resolution":{"observed_at":"2026-08-06T18:31:05.599003Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:05.386163Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":null,"work_id":"0cab026f-bd88-42f7-92b2-270bc0be3cfc","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:02.462287Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:8d5957bef6cc4c8029585f7c120bcb38410322f295cd02763b43645e401b6f64","observation_id":"ba711ad0-87ce-41e4-b5d4-656e21e35187","resolution":{"observed_at":"2026-08-06T18:31:05.461146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:05.233383Z","title":null,"venue":null,"work_id":"61397f19-9ace-4369-a52e-3ed211230f95","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:02.601521Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:e2a745199d04c27ae627e85123e9cc40465b37fb01941e9ef89fcaac20412dd5","observation_id":"d7d83259-76cc-46e2-9e34-e33de1a424d1","resolution":{"observed_at":"2026-08-06T18:31:05.317895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:05.124906Z","title":null,"venue":null,"work_id":"7941919c-e2be-4d32-9e9b-b2f04f82aeca","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:02.743876Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:fabf4f2f46c4ee1fa0c6e70c6198c0e73e8c3659c5e6e86e7a8af5eeeac6038e","observation_id":"35b2db4c-e65b-448d-8c84-ab6ea47ee2fd","resolution":{"observed_at":"2026-08-06T18:31:05.192439Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:04.956347Z","title":null,"venue":null,"work_id":"9ff7039f-bcec-40df-a465-2b7570f673f9","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:02.896069Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:6bb30b25c2736124f8442a34c2d3c8b06523dc38220cbcd48ca93df357a34ce0","observation_id":"78e6ae41-eea0-4b7d-87de-8c495109db28","resolution":{"observed_at":"2026-08-06T18:31:05.019319Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:04.705912Z","title":"K., Raha, T., Khan, S","venue":null,"work_id":"9531e76a-8b6d-40a7-ad94-4729bad6a317","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:03.071493Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:c8314a377c694da484eb16aa6cc927711c37372b8f5b0dac69f9a0acfb0ccc4d","observation_id":"9026ac5f-3925-46e5-ab3c-acc744688791","resolution":{"observed_at":"2026-08-06T18:31:04.840016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14779","last_updated":"2024-04-23T06:36:21Z","snapshot_observed_at":"2026-08-13T00:24:05.435627Z","submitted_at":"2024-04-23T06:36:21Z","title":"Med42 -- Evaluating Fine-Tuning Strategies for Medical LLMs: Full-Parameter vs. Parameter-Efficient Approaches","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14779","snapshot_observed_at":"2026-08-06T18:31:03.237211Z","title":"’ement et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:03.237211Z"},"links":{"cited_paper":"/paper/2404.14779","citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:24cf3843249e25aa1fd97618e8af2f1ab20328154f0a85866a40fe6d544e4e81","observation_id":"cb3674c9-db41-44de-9bfa-6e784ff8c288","resolution":{"observed_at":"2026-08-06T18:31:03.237211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:04.417003Z","title":null,"venue":null,"work_id":"d22295c3-e213-4d85-89ea-ae6f01e844e2","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:03.443895Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:a9950ba20169412efcdf8a9b113c99a70fb66d3e6ca111b8fd1a86bee2da8073","observation_id":"c02f3d50-24f3-44ac-9322-865f2fb5b65b","resolution":{"observed_at":"2026-08-06T18:31:04.545657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:04.239254Z","title":null,"venue":null,"work_id":"b8409914-2329-48d0-8c06-656bf18eef3a","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:03.576676Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:0c13fe60a447f6fdb71121533b0e04c4bbb4d56e9fa5ffead52a82cd719cea2e","observation_id":"8245cac9-65da-4272-af6c-45b915b618dd","resolution":{"observed_at":"2026-08-06T18:31:04.317615Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 3 inbound Pith citation observations for arXiv:2507.07988."}