{"as_of":"2026-08-14T02:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:291605e2af76b55e0a89bde00b72bccaf23ab0f6988640f0aa4e28a5039b73f9","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:18:05.098538Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07796/citation-record","integrity":"/paper/2608.07796/integrity","json":"/paper/2608.07796/citation-record.json","paper":"/paper/2608.07796"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:04.872899Z","title":"Sara Mahdavi, Jason Wei, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.872899Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:c5ad337ed2122b1f96732acb7bf9b142352160b5e95dcb63b0e13a2b218b2009","observation_id":"1e0a3630-579d-4c3c-8570-9287b20f47fd","resolution":{"observed_at":"2026-08-11T04:18:04.872899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13375","last_updated":"2023-04-12T16:48:39Z","snapshot_observed_at":"2026-08-13T08:33:17.178696Z","submitted_at":"2023-03-20T16:18:38Z","title":"Capabilities of GPT-4 on Medical Challenge Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13375","snapshot_observed_at":"2026-08-11T04:18:04.878937Z","title":"Ca- pabilities of gpt-4 on medical challenge problems.ArXiv, abs/2303.13375, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.878937Z"},"links":{"cited_paper":"/paper/2303.13375","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:58d5aa4d4ccb3f83e9f31c4898e295533669bad4a046a09a44193ef0781b30a0","observation_id":"aab619da-872e-4be0-98e0-0d27bc464a96","resolution":{"observed_at":"2026-08-11T04:18:04.878937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27470","last_updated":"2026-04-30T06:13:01Z","snapshot_observed_at":"2026-08-12T02:05:26.771562Z","submitted_at":"2026-04-30T06:13:01Z","title":"HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27470","snapshot_observed_at":"2026-08-11T04:18:04.885119Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.885119Z"},"links":{"cited_paper":"/paper/2604.27470","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:795472b6ab3753971382c4e7744712de7f955dec010485e8903d2c7e7fcd1743","observation_id":"f6492e97-6de6-4f42-94b9-e659bbb1d730","resolution":{"observed_at":"2026-08-11T04:18:04.885119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07960","last_updated":"2025-05-25T02:19:37Z","snapshot_observed_at":"2026-07-30T08:34:47.046912Z","submitted_at":"2024-05-13T17:38:53Z","title":"AgentClinic: a multimodal agent benchmark to evaluate AI in simulated clinical environments","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07960","snapshot_observed_at":"2026-08-11T04:18:04.890556Z","title":"Agentclinic: a multimodal agent benchmark to evaluate ai in simulated clinical environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.890556Z"},"links":{"cited_paper":"/paper/2405.07960","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:31db652cb1228f3d9c4f4d93c28f95e19c95d8a5c2584e24bb8cdb963eb16bd0","observation_id":"07b02a82-0118-4cf2-ac1b-cd63121a7d95","resolution":{"observed_at":"2026-08-11T04:18:04.890556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:04.896416Z","title":"Chen, Nigam H","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.896416Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:db37324ec97444e6ce65ca81b7fc3b06f4980792099eb1f693e7d0076b4a0721","observation_id":"df2d0518-e5a3-4c9c-8c85-e2176edae503","resolution":{"observed_at":"2026-08-11T04:18:04.896416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-11T04:18:04.903375Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.903375Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:ede4b3adb5ece36fdbc03ad7cf763e68e955d4fc99f4f95545a9d5a542fff830","observation_id":"9abbd290-9d57-47a7-b1ab-ed397e779b6f","resolution":{"observed_at":"2026-08-11T04:18:04.903375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:06.192668Z","title":"Fleming, Alejandro Lozano, William J","venue":null,"work_id":"19b8614e-c91c-4795-9333-793aa62ee2fc","year":null},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.909228Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:75d00e2e1ce27d2fd7f51ca756c9e4e20ee7d53496c85f902bc319f2ca766c27","observation_id":"c5bde9eb-c446-48e1-946e-b745809603d1","resolution":{"observed_at":"2026-08-11T04:18:06.198086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:06.176407Z","title":"EHRSHOT: An EHR benchmark for few-shot evaluation of foundation models","venue":null,"work_id":"f71fa218-d897-44cf-943f-b990079cf0ac","year":2023},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.918906Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:150ebe294dbcba1bc500e28249a44a6998c15b43ba960729bbbb1264ab723760","observation_id":"07bd9161-6fe1-43f7-af31-a2fb4f17a51a","resolution":{"observed_at":"2026-08-11T04:18:06.181502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:04.923496Z","title":"Goodell, Yeasul Kim, S","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.923496Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:5cc7208b6dd2b57ae66f4311d5400031e6fcb9bedf3ac60f1723a35cd2743614","observation_id":"9fc8edf0-8ac5-4637-8985-5c8ec1048307","resolution":{"observed_at":"2026-08-11T04:18:04.923496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:06.150501Z","title":"FactEHR: A dataset for evaluating factuality in clinical notes using LLMs","venue":null,"work_id":"de06fc1c-a1c8-4dfb-be15-5264d894105c","year":2025},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.928683Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:debb4b167a8232c4b3e8357832c59ae092fe732558f9164ff688190e7477d336","observation_id":"28be1f8b-b501-487b-bec8-33411c68ae4e","resolution":{"observed_at":"2026-08-11T04:18:06.155944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:04.933388Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.933388Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:0044641530472bb5af4b61afded6485163b26c0348ab2722ba28257787534928","observation_id":"44ac507f-0bc8-47db-b8ff-0c6ed09f91e7","resolution":{"observed_at":"2026-08-11T04:18:04.933388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.22771","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.876536Z","title":"Clindet-bench: Beyond abstention, evaluating judgment determinability of llms in clinical decision-making, 2026","venue":null,"work_id":"2bcd0d3b-c52b-469f-8ce8-89e54f7d0a59","year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.938574Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:7a206163bdfa66351eb3f549500177eb16c892fa2fd3a91ec4a54837dc25a361","observation_id":"48d680b0-10d3-4656-a690-5e0bd669d758","resolution":{"observed_at":"2026-08-11T04:18:05.884784Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:04.944313Z","title":"Knowing when to abstain: Medical llms under clinical uncertainty, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.944313Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:a0ce9124d37813b8b9c1403217562ea913395ca1d3493980e692c6dabc51c98f","observation_id":"b87c3d64-7ad3-4b52-be38-aebffb0afbfa","resolution":{"observed_at":"2026-08-11T04:18:04.944313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:04.948961Z","title":"MIMIC-IV.PhysioNet, October 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.948961Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:d9f0c1a66e878328aff4010650104913f2c381c444188d9968c1807718c5235f","observation_id":"43ebba98-c420-43b3-abce-26910a08dcb7","resolution":{"observed_at":"2026-08-11T04:18:04.948961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:06.134618Z","title":"KDIGO clinical practice guideline for acute kidney injury.Kidney International Supplements, 2012","venue":null,"work_id":"a132e6c9-20d0-4c24-ae9c-a4335f677303","year":2012},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.953657Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:6aea153915e64bcf91c81d0fdf2d3045f74bdb890d4b72ec0101b322aa364b9d","observation_id":"4f2122d6-4597-4aa2-8c45-a525dc7f9221","resolution":{"observed_at":"2026-08-11T04:18:06.139753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:06.119366Z","title":"Severe Sepsis and Septic Shock: Management Bundle Measure, 2020","venue":null,"work_id":"d9439498-fc37-4fd9-ae46-0759ed9dbc4f","year":2020},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.959306Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:f837bc88f0c3eb99d7db92713ff97f1cf25d6c61dc1243cf5a9fdd94125923ee","observation_id":"63e41441-645c-43ef-8576-de6f6b47927d","resolution":{"observed_at":"2026-08-11T04:18:06.124403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.12914","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.727110Z","title":"Carson, Simon J","venue":null,"work_id":"7d7423a0-24a9-4fe4-a8be-b6fec49e9d02","year":2023},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.964050Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:7783a73299becd4126908464171a06c15a78f67636535ae979e18cad60bdc19d","observation_id":"8ea8b5d6-34d4-46ce-8c3e-3417f3e87546","resolution":{"observed_at":"2026-08-11T04:18:05.734652Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:04.968627Z","title":"Heidenreich, Biykem Bozkurt, David Aguilar, Larry A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.968627Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:d9cb9906935e15019a63d8b6af5d3cee7e85d54f2629013bc00d6abe9cc3a8cb","observation_id":"43ea4972-1390-4d7f-953b-53c4afbdd40c","resolution":{"observed_at":"2026-08-11T04:18:04.968627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:04.973607Z","title":"Evaluation and mitigation of the limitations of large language models in clinical decision-making.Nature medicine, 30(9):2613–2622, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.973607Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:ca094ab8fcde27a7aa9ea8a4365f08d6f8f0d394e8a9cdeeb62dbbea8251c9fb","observation_id":"413471c8-e0e3-4a25-8e47-333050d2c868","resolution":{"observed_at":"2026-08-11T04:18:04.973607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:06.084523Z","title":"Fidelity of medical reasoning in large language models.JAMA Network Open, 8(8):e2526021, 2025","venue":null,"work_id":"0d6b3eb1-147a-4bf3-80c4-f05d5700d55e","year":2025},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.978555Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:eae45678f0af7ee27bb9775277867d076734c7c0d490b8c45e8944458ff45635","observation_id":"70c2a474-1a14-4750-826f-08c1dc62dfd3","resolution":{"observed_at":"2026-08-11T04:18:06.089696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:04.983880Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.983880Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:3971a3e46509f312056e1ee1fb5614a57f7448e2ac2f7ec81cf42f7222fea109","observation_id":"04dd78d5-80a0-4c71-8eac-22daac6fd771","resolution":{"observed_at":"2026-08-11T04:18:04.983880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-07-06T21:23:23.760393Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-08-11T04:18:04.988879Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.988879Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:1760be750a37f2e473af5f7591e45cfe18feac28bdf33062f37dee945b31e626","observation_id":"04999547-2dfa-44c5-b2c1-ec4e214fdd19","resolution":{"observed_at":"2026-08-11T04:18:04.988879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:06.058570Z","title":"Rethinking clinical trials for medical ai with dynamic deployments of adaptive systems.npj Digital Medicine, 8(1):252, 2025","venue":null,"work_id":"971316b4-cc0f-4b3f-848f-26ec5257a659","year":2025},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.993827Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:e88cf3f1df40418bcc1a0bedcbafcc6a65804277bf2e0c14157290cafad7caff","observation_id":"1c4cc808-7caa-4e87-bd11-7b4b10872e77","resolution":{"observed_at":"2026-08-11T04:18:06.063784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:06.041366Z","title":"Towards autonomous medical artificial intelligence agents.Nature, 2026","venue":null,"work_id":"7cab1e8f-79ab-4819-a282-c07fa32ca296","year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.998701Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:e2209f9c383af9a5a13f089e7f6e1289f0a9d290ab72c6f0d9bca4aa39165c79","observation_id":"64495769-61c8-48ea-bcaf-0da28849d1b8","resolution":{"observed_at":"2026-08-11T04:18:06.046887Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02568","last_updated":"2026-06-01T17:56:26Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:56:26Z","title":"ClinEnv: An Interactive Multi-Stage Long Horizon EHR Environment for Agents","version":1},"cited_work":{"arxiv_id":"2606.02568","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.02568","snapshot_observed_at":"2026-08-11T04:18:05.618155Z","title":"ClinEnv: An Interactive Multi-Stage Long Horizon EHR Environment for Agents","venue":"cs.AI","work_id":"5d71129c-b020-4718-acd7-bed3345beb1a","year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.004089Z"},"links":{"cited_paper":"/paper/2606.02568","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:753dd383bf1541d5defff1e2c265b9854671c9bc19c38b9f17263f5f1fc34095","observation_id":"16eb80e7-2185-4d13-acf7-9c796a78c584","resolution":{"observed_at":"2026-08-11T04:18:05.623460Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:06.024589Z","title":"Ehrsql: A practical text-to-sql benchmark for electronic health records.Advances in Neural Information Processing Systems, 35:15589–15601, 2022","venue":null,"work_id":"ee90530e-5a53-419a-be27-e8fe3bfeef48","year":2022},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.009350Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:739310eb0358841ee4a705841fb816cc8d84e58bfbb00581c47f8d80f12552f5","observation_id":"63f2cc37-0d82-413c-8ee8-6f3967f1a688","resolution":{"observed_at":"2026-08-11T04:18:06.029635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.014524Z","title":"Ho, Carl Yang, and May Dongmei Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.014524Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:42734c528a1e9341662c5ce8ac1ba37aafa503fe6a35cb73a6340253ee205d6a","observation_id":"2830aba6-c384-4e0d-b95e-c7d53dafa8eb","resolution":{"observed_at":"2026-08-11T04:18:05.014524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.993225Z","title":"Medagentbench: A virtual ehr environment to benchmark medical llm agents.NEJM AI, page AIdbp2500144, 2025","venue":null,"work_id":"bb1c2fc6-410c-4031-9142-7d8505d500f5","year":2025},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.025743Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:f498ea284763dadfcd7f6d2bc72c0a77da57c3242a27f31667da0beb9e8d0ef4","observation_id":"dab0d231-083f-4cdf-a0f6-f371171c61f7","resolution":{"observed_at":"2026-08-11T04:18:05.998772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.030913Z","title":"Pollard, Alistair Johnson, Edward Choi, Yugang Jia, and Jong Ha Lee","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.030913Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:c29f8714fd8a6f4e1ceb14159b05ea85cfcbe7659d61cd9e0e5f891a3faca487","observation_id":"6543a633-4088-4e13-9b1a-90de44551bc0","resolution":{"observed_at":"2026-08-11T04:18:05.030913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.23301","last_updated":"2026-06-22T13:14:21Z","snapshot_observed_at":"2026-08-14T01:02:15.436944Z","submitted_at":"2026-06-22T13:14:21Z","title":"EHR-Complex: Benchmarking Medical Agents for Complex Clinical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.23301","snapshot_observed_at":"2026-08-11T04:18:05.035371Z","title":"Ehr-complex: Benchmarking medical agents for complex clinical reasoning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.035371Z"},"links":{"cited_paper":"/paper/2606.23301","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:892eb0ebe174f00d30e7a6e983829a13db20c34d3afc79155a7447b020671056","observation_id":"7597a7bb-d11b-4fe2-9576-b8adb4ae01ea","resolution":{"observed_at":"2026-08-11T04:18:05.035371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02240","last_updated":"2026-05-04T05:32:25Z","snapshot_observed_at":"2026-08-11T12:30:29.467786Z","submitted_at":"2026-05-04T05:32:25Z","title":"PhysicianBench: Evaluating LLM Agents in Real-World EHR Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02240","snapshot_observed_at":"2026-08-11T04:18:05.040639Z","title":"Mohiuddin, Austin J","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.040639Z"},"links":{"cited_paper":"/paper/2605.02240","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:481edb4d3e71474cec6739a3ce3b51f5724a476a98e85fc12f2fb4982f929c65","observation_id":"224a539f-3ed6-4e74-aa62-ab36c6f20964","resolution":{"observed_at":"2026-08-11T04:18:05.040639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.09322","last_updated":"2026-07-10T12:04:31Z","snapshot_observed_at":"2026-08-12T23:45:41.156127Z","submitted_at":"2026-07-10T12:04:31Z","title":"LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making","version":1},"cited_work":{"arxiv_id":"2607.09322","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.09322","snapshot_observed_at":"2026-08-11T04:18:05.490656Z","title":"LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making","venue":"cs.AI","work_id":"c51bd84b-17ba-46d6-9723-ecfb96556bf7","year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.046139Z"},"links":{"cited_paper":"/paper/2607.09322","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:ce23ab3a1314ede7f194590d1760500606757733389252e2eab141802c3e27a6","observation_id":"6b953d02-81ef-47eb-b079-2255cc91aa7c","resolution":{"observed_at":"2026-08-11T04:18:05.497141Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41597-026-06639-z","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.172426Z","title":"A dataset for addressing patient’s information needs related to clinical course of hospitalization.Scientific Data, 13:523, 2026","venue":null,"work_id":"aa451062-c9a6-44e7-b180-a93291d14180","year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.051798Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:f2f16ca0736e298dd4cdbcdb58a3e6ebb33aaf35ee23ad6982eb22f0f14c3415","observation_id":"f3d495fd-766c-4781-be2e-9aef8dab3563","resolution":{"observed_at":"2026-08-11T04:18:05.177807Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.056931Z","title":"Clicare: Grounding large language models in clinical guidelines for decision support over longitudinal cancer electronic health records, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.056931Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:b36c938eba702af567e1c2b30b522eb6a4247a6a003981de5cdbd14114dcb493","observation_id":"97419ff7-0b50-48a1-994e-49e842533e43","resolution":{"observed_at":"2026-08-11T04:18:05.056931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.clinicalnlp-1.62","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.153028Z","title":"Overview of the EHRSQL 2024 shared task on reliable text-to-SQL modeling on electronic health records","venue":null,"work_id":"d1732ea2-6460-4342-8010-5b25110b640e","year":2024},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.062472Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:bb0818bfe9de5e5d4733d6179ec4f669789bf5e8befa9ace8fbb3f0b4783b36e","observation_id":"c9f1cc4a-fb8b-46c7-a679-da8517229624","resolution":{"observed_at":"2026-08-11T04:18:05.160643Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.067246Z","title":"Agents’ last exam.arXiv preprint arXiv:2606.05405, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.067246Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:edbc6427a03980e019dc7e006d64d4a52a31e331cd0d57082c776681a979ed71","observation_id":"f98dbefe-c8ee-4f47-9840-35396d12cd74","resolution":{"observed_at":"2026-08-11T04:18:05.067246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.977882Z","title":null,"venue":null,"work_id":"82d1bdd4-35d0-4afa-9ecc-cc604ad193cd","year":2025},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.072050Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:2352a13bc2aabdc695e1c217a0e69add94bbab6e48ceb80a05cf94dad271ee59","observation_id":"523c0aea-efeb-4c12-93b7-959dce59732f","resolution":{"observed_at":"2026-08-11T04:18:05.982709Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.961281Z","title":"A framework for formalizing LLM agent security, 2026","venue":null,"work_id":"5502dd92-f3a2-4c4a-a89e-35a2e3a656b4","year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.077041Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:38abefd5d4645a77ff9d16e83615408f99fbe0910b6aaff615086ed3a78508b3","observation_id":"aa71fc2c-dba8-4781-b4ed-742ae9b7e12e","resolution":{"observed_at":"2026-08-11T04:18:05.967333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.09937","last_updated":"2026-04-10T22:33:39Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-10T22:33:39Z","title":"HealthAdminBench: Evaluating Computer-Use Agents on Healthcare Administration Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.09937","snapshot_observed_at":"2026-08-11T04:18:05.082534Z","title":"Steinberg, Michael Wornow, Taeil Kim, Haroun Zakaria Ahmed, Peter V","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.082534Z"},"links":{"cited_paper":"/paper/2604.09937","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:f1a168fb379b2233177851041e805bf69088833843fd4e38282adff0b393c025","observation_id":"6575a0b8-3a97-420a-a90f-4e59ba85e904","resolution":{"observed_at":"2026-08-11T04:18:05.082534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.088248Z","title":"MIMIC-IV-Note: Deidentified free-text clinical notes.PhysioNet, January 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.088248Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:841c60138dd697db43ca621090eae4b1753e7ab6bb0eb78d18bc7ffa188fdf69","observation_id":"615a1e2e-7273-4776-9865-ac2b14d826e1","resolution":{"observed_at":"2026-08-11T04:18:05.088248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.093469Z","title":"MIMIC-IV-ED.PhysioNet, January 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.093469Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:8417da1cd3a3984a422092850f6fa993fd4248f39ae93bd5e8f057543ba79437","observation_id":"99436196-b298-47f4-9d8f-b72483c8c32c","resolution":{"observed_at":"2026-08-11T04:18:05.093469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7620.7160","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.316622Z","title":"first qualifying","venue":null,"work_id":"e90b2f22-1300-43f4-8b6f-187bfdd63aef","year":2020},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.098538Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:5d8830a0b0f6e39573e90c332fc9768ee1e24b93599e21a99cc031e30a230e8c","observation_id":"2eee86b0-6ca5-44c6-a42f-bafa41da513d","resolution":{"observed_at":"2026-08-11T04:18:05.326837Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:06.009145Z","title":null,"venue":null,"work_id":"7853303c-c65a-4752-88ec-2b211c9a4e70","year":2024},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":1245,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.020114Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:cb9e8b4e606c6f85a98cb0acc36ef3e3120e227487f4ec324cfc417e12cc2ac9","observation_id":"50c5bbdf-3c8e-417e-9b51-c07d6e7a63d9","resolution":{"observed_at":"2026-08-11T04:18:06.014145Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:04.913940Z","title":"URLhttps://doi.org/10.1609/aaai.v38i20.30205","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.913940Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:31eb6e722524a187816e25e196f5e7ae814f82e17887941653f2b3888e29331e","observation_id":"58681bb1-a230-4263-b6a9-a4499413e61c","resolution":{"observed_at":"2026-08-11T04:18:04.913940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T23:21:18.545160Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":26,"verified_exact":6,"verified_fuzzy":10},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2608.07796."}