{"as_of":"2026-08-19T15:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b46baadaff4d1a5f96af44c050513f1e0e3ca5731eeefd983c797f417a0611d3","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:04:40.479370Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.12538/citation-record","integrity":"/paper/2412.12538/integrity","json":"/paper/2412.12538/citation-record.json","paper":"/paper/2412.12538"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/bf03023077","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:08:50.044864Z","title":"The theory and practice of clinical decision-making","venue":"Canadian Journal of Anesthesia/Journal canadien d anesthésie","work_id":"004dc00e-2bef-4eda-96fe-9895eca38902","year":2005},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.234080Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:f241a107268d60387faf1cc3942998e15318f64d9f383f520c11353504d24b1c","observation_id":"24cb0844-4f0f-4f33-88ac-e376deb41b9b","resolution":{"observed_at":"2026-08-11T14:04:40.911904Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:42.062399Z","title":"Online health: untangling the web","venue":null,"work_id":"335d6459-876a-4c84-9daf-6f7c895a0652","year":2011},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.237801Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:a7819ad1728b013434aa8e774316811314b8f4a6b6fadb2dd00967d41dbc6757","observation_id":"9b243c56-81b2-4dc8-a0e7-73d3986089c1","resolution":{"observed_at":"2026-08-11T14:04:42.065881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1001/jama.289.21.2849","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:03:20.376878Z","title":"Changes in rates of autopsy-detected diagnostic errors over time: a system- atic review","venue":"JAMA","work_id":"b6c71af5-0000-43e7-bd0b-93680d05b7c3","year":2003},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.241317Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:22a56ed63a237b7ef849f2c26521a6b86fbce5d13844faaab95501147b3ec0f8","observation_id":"a7bcd447-bd82-4f8f-9852-7e57e2e830ef","resolution":{"observed_at":"2026-08-11T14:04:40.899336Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2013.2777","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:41.898508Z","title":"Types and origins of diagnostic errors in primary care set- tings","venue":null,"work_id":"10e89c58-08ca-43b8-b163-167767b29e1d","year":2013},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.244648Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:bf04f0f1d5e93ba2a90b3b3abccb52799675b34dde53af8a29213369f1f8f510","observation_id":"bf88207d-1150-402f-b218-998ba0348f1e","resolution":{"observed_at":"2026-08-11T14:04:41.904041Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:42.053286Z","title":"Diagnostic errors in hospital- ized adults who died or were transferred to intensive care","venue":null,"work_id":"768112ed-ac80-4f39-88e2-e8363bc0ba2d","year":2024},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.248400Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:230a33a0a830f8f560bcc7583ae9b625c73cc870a2e50a5439d8284847ce7161","observation_id":"89a52009-6a4e-4761-bb45-1d1ebaa1ca42","resolution":{"observed_at":"2026-08-11T14:04:42.056574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.254839Z","title":"National Academies Press; December 29, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.254839Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:a07f57652ff70a93a06ee85006164a624f3aa79935f8f987d515ef1fc983b38c","observation_id":"2fa6ba22-6256-42dd-a736-1182fd4d80a3","resolution":{"observed_at":"2026-08-11T14:04:40.254839Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:42.043333Z","title":"Diagnostic errors in the emergency depart- ment: a systematic review","venue":null,"work_id":"09d4afdb-3dd5-4488-961c-4934ebc89504","year":2022},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.258373Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:ebfbf88bc27ea57c2a2b4f91dd5340072fe25c05b6b01839aa2fda5b8097a630","observation_id":"2714d868-550c-46df-9ed5-1b115dbecc93","resolution":{"observed_at":"2026-08-11T14:04:42.047134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:42.033180Z","title":"The ef- fect of Dr Google on doctor-patient encounters in primary care: a quantitative, observational, cross-sectional study","venue":null,"work_id":"af01960a-9e68-4100-8df3-53eee72d6c62","year":2017},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.262086Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:d241e6c4aa960622f1ae0334bbce3f7f0c37e76152c4afadb2e4c8723d724ee2","observation_id":"a798061c-efb4-41c5-b1b9-e38f1f531a62","resolution":{"observed_at":"2026-08-11T14:04:42.036821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:42.022257Z","title":"Health Online 2013","venue":null,"work_id":"ee697925-0bfc-4505-9462-067f7a316707","year":2013},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.265468Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:33108e3e53d42aa4834f72012c84906217caf05e082a83a0d2e389f30f53a6e4","observation_id":"43e1fa64-fd2b-437c-b367-0f09511ced04","resolution":{"observed_at":"2026-08-11T14:04:42.025943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:42.012108Z","title":"Assessment of Diagnosis and Triage in Validated Case Vignettes Among Nonphysicians Before and After Internet Search","venue":null,"work_id":"f7de106e-4daa-4a9e-baf6-3116b30505bc","year":2021},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.269282Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:d218c1ec447301e2ba4c7a50b6bb0b95fc63affde1600c3137e74bf5ee2bff37","observation_id":"14663f59-1ba3-459d-a013-649761906c1a","resolution":{"observed_at":"2026-08-11T14:04:42.015974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:42.000915Z","title":"A random- ized controlled trial of online symptom search- ing to inform diagnosis","venue":null,"work_id":"d24a2fa4-42af-4308-a778-27f60e5e5688","year":null},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.272553Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:62444ab177e1c58697bd484211a1df8e7cb0d1c7d6e518a4e30e483af97e1940","observation_id":"0d93c454-2bf9-407e-bdb5-847be6ba886c","resolution":{"observed_at":"2026-08-11T14:04:42.005354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:41.990675Z","title":"Benchmarking triage capability of symptom checkers against that of medical laypersons: survey study","venue":null,"work_id":"a0563575-9685-4a58-82bb-638c9911dd7d","year":2021},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.276518Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:0ca6aacffed0f84549fa706c73ee968151fb799260be4b9e59241330e8b51690","observation_id":"b9e3638c-97d2-44cd-b082-ae470adc139f","resolution":{"observed_at":"2026-08-11T14:04:41.994475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:41.981787Z","title":"Should you search the Internet for information about your acute symptoms? Telemed J E Health","venue":null,"work_id":"69aca07a-b29d-4c58-9605-0127e4211b8d","year":2012},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.279831Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:111d596243154e096b9482b4654326c170fb783e96e00131981e9d5a7186de48","observation_id":"710f9f8e-26f1-4c74-8006-ae30a1754088","resolution":{"observed_at":"2026-08-11T14:04:41.985128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2196/jmir.5729","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.876258Z","title":"Internet health infor- mation seeking and the patient-physician re- lationship: A systematic review","venue":null,"work_id":"5ea2eabc-aaf9-403b-9e06-6e702ab3ea61","year":2017},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.283119Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:5cb8ba9a9cd0cfe16b7e35f175318d0bbb74e02864403b4fbdf0cff3d55e7b4d","observation_id":"26812fdd-1606-410f-940d-23c9b11de63f","resolution":{"observed_at":"2026-08-11T14:04:40.880693Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:41.972794Z","title":"KFF Health Mis- information Tracking Poll: Artificial In- telligence and Health Information","venue":null,"work_id":"8e26b3f6-bcb0-43a2-a53d-58b613d1f509","year":2024},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.286426Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:ad3481ddb0434131e98555fa69a7cac6588e7adce8f50b6c27ac4a0d20937d79","observation_id":"7ac2a869-aaa3-43c5-aed3-ff28b84368e7","resolution":{"observed_at":"2026-08-11T14:04:41.976104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1177/15347346241236811","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.864960Z","title":"Appropriateness of Arti- ficial Intelligence Chatbots in Diabetic Foot Ulcer Management","venue":null,"work_id":"064ee907-241e-49eb-8924-6c73147d25d5","year":2024},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.289872Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:b48e4c9caf36bd138dbde470999a0edfc41cea21d633dd7bd3d09ef6e5459e58","observation_id":"0677d6de-eb3c-4943-9776-f1e3b46c6b3e","resolution":{"observed_at":"2026-08-11T14:04:40.868776Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s12306-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.852967Z","title":"GPT-based chatbot tools are still unreliable in the man- agement of prosthetic joint infections","venue":null,"work_id":"67651768-2a87-4c14-b51e-235ed70c0960","year":2024},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.293313Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:af1ea795e532e57884955bfdd642426b7237da0181ae2b230bd0125b44508f1c","observation_id":"0e96b7a4-f0fd-493d-b75b-a94fe8370b62","resolution":{"observed_at":"2026-08-11T14:04:40.857043Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.297321Z","title":"Ethical concerns and re- sponsible use of ChatGPT in healthcare","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.297321Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:de515f7872303429a3d43b90756304ed5e5606bf0feba2676ae6f9db57e38b48","observation_id":"1adc0dd6-87fe-4126-a0d9-62910ac2e6b9","resolution":{"observed_at":"2026-08-11T14:04:40.297321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1101/2024.03.01.24303593","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.841657Z","title":"Protocol For Human Evaluation of Artificial Intelligence Chat- bots in Clinical Consultations","venue":null,"work_id":"f837c888-e726-49df-b6db-868ce4b35f6f","year":2024},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.300910Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:065b9ff1a28995b7bd401731d9ccedf0567fe1b1047c5c9fbe431102b7110854","observation_id":"a18cc880-c215-460b-82f1-b33e39f35207","resolution":{"observed_at":"2026-08-11T14:04:40.845454Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.hrthm.2024.04.010","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.829936Z","title":"Balancing Innovation and Professionalism: The Emerging Role of AI-Powered Chatbots in Medical Consultation","venue":null,"work_id":"6125146b-8917-4fed-8d53-084e4216fef0","year":2024},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.304827Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:6526b3a11acbb4993a1a618e2e955df026fd298698f31bd8075c249a4b8ae221","observation_id":"5fe373b5-0648-4903-be73-8bc2c84a6a27","resolution":{"observed_at":"2026-08-11T14:04:40.833996Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:41.962321Z","title":null,"venue":null,"work_id":"c5b5002a-3d8e-4fe0-b971-98912dec7b53","year":null},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.308271Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:34972c727009084cc3e4c42e7cd53fdc841e86b0d35bccb61c96f9b87329d506","observation_id":"bfcae6b5-20e5-4cca-ac0b-207424b6a651","resolution":{"observed_at":"2026-08-11T14:04:41.965709Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:41.952349Z","title":"Chatbots in Health Care: Connecting Patients to Information: Emerging Health Technologies","venue":null,"work_id":"515748f1-8317-411a-86b2-39a2327d877e","year":2024},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.312074Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:b47052a707cfd33fb6259b43971047bcb8aedb3e94927fbdd59723f3f0d7c0eb","observation_id":"4c95b133-7b86-4826-87a4-16a4eecafb8c","resolution":{"observed_at":"2026-08-11T14:04:41.956115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4018/979-8-3693-3860-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.817835Z","title":"Un- derstanding Large Language Models","venue":null,"work_id":"f535c4e8-cf8c-4bb2-b87d-64524fc71aba","year":2024},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.315437Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:ba08e19531a19db40a80308580e1c369fae27d2d334eab3379659da8a41a4248","observation_id":"75fb3de2-39d6-4569-aa40-f3a45bc4a82d","resolution":{"observed_at":"2026-08-11T14:04:40.821538Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:41.942179Z","title":"The Breakthrough of Large Language Models Re- lease for Medical Applications: 1-Year Timeline and Perspectives","venue":null,"work_id":"c265f99e-6cd5-47e7-9ac0-94eb51583572","year":null},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.318678Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:f16245afca17ad122b298e5c38c26d3877a66ee7b85fd620fa5d0898cce17223","observation_id":"d36c5f61-8a73-4dc2-aac2-f6438fa5b52f","resolution":{"observed_at":"2026-08-11T14:04:41.945759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.325033Z","title":"The future landscape of large language models in medicine","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.325033Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:ce1b9d92ce30b921b6741b0ec7c69af1661a6ab8a63ffbc639e32fb6e2bd21a1","observation_id":"63de21ca-d0de-4e47-802b-bb9672b184bd","resolution":{"observed_at":"2026-08-11T14:04:40.325033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2196/49324","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.785614Z","title":"Large Lan- guage Models for Therapy Recommendations Across 3 Clinical Specialties: Comparative Study","venue":null,"work_id":"38e11fb0-7831-471a-bb79-bf339b7ace37","year":2023},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.328126Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:7814936d7229ca506f02d7761067f6e89c348dfd77d9a579f58e7fc5af5abece","observation_id":"2c842f2c-9b41-4f4f-bd19-ddc5520b0456","resolution":{"observed_at":"2026-08-11T14:04:40.789666Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.331206Z","title":"Large lan- guage models for science and medicine","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.331206Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:bb56fb2a59227cc422c47b4b5484769b4e9e660a69fce1cb4e0f2140b68f8329","observation_id":"b2199485-1a10-40d2-b5be-8f795fdb9c57","resolution":{"observed_at":"2026-08-11T14:04:40.331206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1097/js9.0000000000001066","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.766541Z","title":"Evaluation of large language models in breast can- cer clinical scenarios: A comparative analy- sis based on ChatGPT-3.5, ChatGPT-4.0, and Claude2","venue":null,"work_id":"f6168738-59f7-4896-826f-22620ee2e4a7","year":2024},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.334235Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:e491f067ccbeeea2f2a0ca9783226380e133904224a39cfd579f1bbd23bfe8b8","observation_id":"973b0ca4-e401-49b1-a226-45118b571cd2","resolution":{"observed_at":"2026-08-11T14:04:40.770626Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.337343Z","title":"Towards A Deep Learning Question-Answering Specialized Chat- bot for Objective Structured Clinical Examina- tions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.337343Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:ec045c865b522b1fdfd53c21e4ed40e40e8901093f80f58f99c679f9c38424a2","observation_id":"45618d10-1025-4240-a8fc-3c5c91b533ce","resolution":{"observed_at":"2026-08-11T14:04:40.337343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2196/49239","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.755087Z","title":"Chatbots for Symptom Screening and Patient Education: A Pilot Study on Patient Acceptability in Autoim- mune Inflammatory Diseases","venue":null,"work_id":"6b0b2c98-7063-441d-802a-b84fead9abc4","year":2023},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.340659Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:af6f1a3abf9378ff768524d66c4e78246288c1824d396254d56d0601ccdc8d14","observation_id":"eee6763d-a9a7-4a96-b747-5f7b5860f6db","resolution":{"observed_at":"2026-08-11T14:04:40.759394Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1334.2013","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:41.607670Z","title":"Diagnostic reasoning: where we’ve been, where we’re going","venue":null,"work_id":"d639b2a9-146e-4678-a4b5-0f0a06f0e3b3","year":2013},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.344352Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:b8cce8fd37064ddbf38477e5d737ff41d32c5b5f59dcb7db8a8c673ccccfac7c","observation_id":"6009bf80-7b92-460e-befd-e642cef508d7","resolution":{"observed_at":"2026-08-11T14:04:41.613390Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/b978-0-323-05405-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.743923Z","title":"Clinical decision making","venue":null,"work_id":"4911a445-92f1-44a3-877d-01c8e9b1c22a","year":2011},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.348586Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:3109e4d3bcbaa234111b09e6a8415de7a1daf392fd548b504f914dcecad04987","observation_id":"f3dd1e13-c9d4-4190-acad-17172b358571","resolution":{"observed_at":"2026-08-11T14:04:40.747730Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1186/s12916-014-0265-4","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.732699Z","title":"what is likely to happen","venue":null,"work_id":"b37af904-f33a-4613-8b65-c9f9d5c00a4f","year":2015},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.352545Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:eca0ab30367e8a223bc5fb31d054d5fb122fd35b616a35685c4da92d3b4f3414","observation_id":"cd1a6d0a-f91f-4474-92c8-55948f26e1c3","resolution":{"observed_at":"2026-08-11T14:04:40.736412Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:41.932145Z","title":"Medicine information needs of patients: the relationships between informa- tion needs, diagnosis and disease","venue":null,"work_id":"c581681b-adfc-4ce4-9a98-4a7aa59faed3","year":2008},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.356509Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:0b85b17d825d8649cea1352b078514a332aae06750ba57ccf8aa717aa6345ece","observation_id":"4cdeaf97-e945-4485-ae67-293b005d7eaf","resolution":{"observed_at":"2026-08-11T14:04:41.935926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.361407Z","title":"Diagnostic rea- soning prompts reveal the potential for large language model interpretability in medicine","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.361407Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:dd84da3f9f2e51918e8d5cacaace062a78aa3a0992da5c685c984a8906eb612d","observation_id":"055c057a-a950-4b3b-b5c8-5157b28a3483","resolution":{"observed_at":"2026-08-11T14:04:40.361407Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.365026Z","title":"Evaluation of symptom checkers for self diagno- sis and triage: audit study","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.365026Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:d72d599b0e1b94bfa817323feffda5f37cdd30c5be010fdf05a452278f76b814","observation_id":"e591cbea-df03-4989-8349-28da97b2731e","resolution":{"observed_at":"2026-08-11T14:04:40.365026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1097/00001888-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.705496Z","title":"Patients don’t present with five choices: an alternative to multiple-choice tests in assessing physicians’ competence","venue":null,"work_id":"782558f7-93a8-49db-b123-1a9af391db7d","year":1999},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.368678Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:7d401c41b15dafaafb9167e5d202cc43631794ee8a72354371d2312544cb7776","observation_id":"cbb24dad-af2e-4e96-a01a-b098e2982ea6","resolution":{"observed_at":"2026-08-11T14:04:40.709901Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.372440Z","title":"Am- bient artificial intelligence scribes to alle- viate the burden of clinical documentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.372440Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:6f0fe5ea3c9e6cb1e40d6cf6498884b76b99d0245b5da5c7a1755cfbb370aaf1","observation_id":"427ff340-1fcf-4a46-ab3f-b30469d3df0e","resolution":{"observed_at":"2026-08-11T14:04:40.372440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1097/acm.0000000000002618","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.687925Z","title":"Clinical reasoning assessment meth- ods: a scoping review and practical guidance","venue":null,"work_id":"1c296065-d5c6-402f-b428-8f02827b42ac","year":2019},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.376138Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:0984675724891828fff5706e8e1973d93445bc7e419628e3206899d9d5d42da1","observation_id":"fc9f6a54-7638-4b6a-a7e7-5b6b451b365f","resolution":{"observed_at":"2026-08-11T14:04:40.691831Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.379522Z","title":"Accuracy of a gen- erative artificial intelligence model in a complex diagnostic challenge","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.379522Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:feb975b65993f5aca94ea357339b775e3bf23ffbd165d419ecc41671444c81f1","observation_id":"a4e38aec-a69a-40bd-a72f-405d2fb075e3","resolution":{"observed_at":"2026-08-11T14:04:40.379522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.382775Z","title":"How accurate are digital symptom assessment apps for suggesting conditions and urgency advice? A clinical vignettes comparison to GPs","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.382775Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:92509caf61dfe829de78f9b5b759f771e0d8dfe2b1a53b4b87c73a17e3a56901","observation_id":"ac571d2f-525a-4412-b11a-c5b6d97b8727","resolution":{"observed_at":"2026-08-11T14:04:40.382775Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1101/2023.11.24.23298844","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.669256Z","title":"Chat- GPT influence on medical decision-making, bias, and equity: a randomized study of clin- icians evaluating clinical vignettes","venue":null,"work_id":"686279c9-f3fb-4c67-be51-3888382c8df0","year":2023},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.385862Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:1d900444a229afc31b0af9df53635bb9f3bd8e40ec6184963c1651cd197f00be","observation_id":"8607e81f-2790-463a-b5f6-b2ac4f0f8a4e","resolution":{"observed_at":"2026-08-11T14:04:40.673233Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.389771Z","title":"Com- paring physician and artificial intelligence chatbot responses to patient questions posted to a public social media forum","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.389771Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:7d206aa6ae080b2fb6477d663cbbeac6bb12aa8f10cab156571deee3489dc180","observation_id":"dc1a7390-d69a-4a3c-84b2-52debc65709a","resolution":{"observed_at":"2026-08-11T14:04:40.389771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.7326/0003-4819-158-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.658487Z","title":"Patient- centered decision making and health care out- comes: an observational study","venue":null,"work_id":"7bf1f5b1-f019-4d01-97de-0f1c8ca34a68","year":2013},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.393050Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:9b730355653ead89e0996d55a09cc45c61e5f9458d69787c3fd9aae334932425","observation_id":"f9bc0552-4a5e-41fa-b6db-24522e539dee","resolution":{"observed_at":"2026-08-11T14:04:40.662396Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05654","last_updated":"2024-01-11T04:25:06Z","snapshot_observed_at":"2026-08-16T14:28:21.479244Z","submitted_at":"2024-01-11T04:25:06Z","title":"Towards Conversational Diagnostic AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05654","snapshot_observed_at":"2026-08-11T14:04:40.396592Z","title":"To- wards conversational diagnostic AI","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.396592Z"},"links":{"cited_paper":"/paper/2401.05654","citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:fc76c5a2d6a822297376643dc5b10628de47b89d8064e6b01c98f19f0c361da8","observation_id":"42ee19b5-4fd1-46fa-81bb-10b7ac0b4fe9","resolution":{"observed_at":"2026-08-11T14:04:40.396592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.400841Z","title":"Large language models in medicine: the poten- tials and pitfalls: a narrative review","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.400841Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:6188da878acfbeac8c17656fb6d9954f9798b18c55e8156ca70c22e63273e27d","observation_id":"eac585b0-1750-446c-99a0-17a18ac866ca","resolution":{"observed_at":"2026-08-11T14:04:40.400841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.404393Z","title":"Appropriateness of cardiovas- cular disease prevention recommendations ob- tained from a popular online chat-based ar- tificial intelligence model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.404393Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:29ecbe7b20fc76889c8ba14226dd3cf3aa3b8326e508a269ada505d6fe9a29f2","observation_id":"5f5da1e5-7172-45a3-a460-8c78d823dfb2","resolution":{"observed_at":"2026-08-11T14:04:40.404393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2196/22637","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.629484Z","title":"Young Adults’ Perspectives on the Use of Symptom Checkers for Self-Triage and Self-Diagnosis: Qualitative Study","venue":null,"work_id":"543a86a5-7908-46a3-86cf-2f396a4709cd","year":2021},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.408594Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:0adeebf429bb58d1da37267bd68b0cd8955f9d890a8db4451ec349f37c06018e","observation_id":"e28c47c0-df78-4ce2-adea-e928c9996aae","resolution":{"observed_at":"2026-08-11T14:04:40.634031Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.412457Z","title":"Ensuring Fairness in Machine Learning to Advance Health Equity","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.412457Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:64401bcd1e4d7de24ee70776123d25dfa0eecc78735581cb473d27b04054cdb0","observation_id":"1fd72fd9-a891-4ffc-8959-0e2569376031","resolution":{"observed_at":"2026-08-11T14:04:40.412457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.419512Z","title":"Search Engines vs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.419512Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:7cc9ce5cfb031ae572affb567079dcb5d7eddf0ff85bf966ebd8f2087bf538ed","observation_id":"71ffa10d-940d-47a3-bcfc-5518f65702ca","resolution":{"observed_at":"2026-08-11T14:04:40.419512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3399/bjgp20x707885","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.602673Z","title":"‘Next please!’ Psychological and practical consequences of an inconclusive diag- Deep Bhatt, Surya Ayyagari and Anuruddh Mishra December 18, 2024 18 nosis","venue":null,"work_id":"9c67c223-5ee2-484c-b1b7-09ee105230f5","year":2024},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.422649Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:c87ff1b373ad59d0bd29eeaf56251edccd90600c633dbbce4c72125a9f555594","observation_id":"3e65d136-2643-455b-b15d-dfe849169df7","resolution":{"observed_at":"2026-08-11T14:04:40.606289Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:41.921727Z","title":"The use of vignettes for conducting healthcare research","venue":null,"work_id":"044ed413-fa7b-4ede-9a9a-0b100d377707","year":null},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.425713Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:58179a9a3060fba12fde082066b2f50f38c32f43b0c1a50b3670b107940950f6","observation_id":"1f4e2446-a7b0-4ea2-ac82-21b2e2f987fc","resolution":{"observed_at":"2026-08-11T14:04:41.925678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1086/661914","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.592644Z","title":"Do case vignettes accurately reflect antibiotic prescription? Infection Control and Hospital Epidemiology","venue":null,"work_id":"ea2eea30-4557-4a7d-8569-6409f7ea4bfd","year":2011},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.429368Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:a4339b0117546d44df99249199e9a6c025240b7da4173d6af2213f2321c8eb86","observation_id":"8fc3ad12-8057-4c48-9584-d398be62be0f","resolution":{"observed_at":"2026-08-11T14:04:40.596104Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8068.2021","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:41.184623Z","title":"Vignettes as research tools in global health communication: a systematic review of the literature from 2000 to 2020","venue":null,"work_id":"f2b44d80-cecd-466d-a65e-161a64b60d05","year":2000},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.432765Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:a5cdf908293599b295fe829db92ad37b16bbd22ef5e978d0e1ee250d8ac6fd29","observation_id":"d1b77bf0-81f2-45be-ad9c-7b57ccee2e02","resolution":{"observed_at":"2026-08-11T14:04:41.191570Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.pcl.2019.03.006","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.581646Z","title":"Com- munication with Diverse Patients: Addressing Culture and Language.Pediatric Clinics of North America","venue":null,"work_id":"14966bec-ad15-4bff-a846-8db6a5c608d6","year":2019},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.435818Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:65a5fab9f9e6d6766623ccdea84d46de71a5b6f5954abd21c8d7f43eaad667b6","observation_id":"61ca9b53-730a-4e22-9894-649bab965f17","resolution":{"observed_at":"2026-08-11T14:04:40.585513Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6190.2014","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:41.110762Z","title":"Ex- ploring the role of communication barriers in healthcare","venue":null,"work_id":"4181c660-20b5-4fb4-a6e5-3809f496b35d","year":2016},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.438933Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:d3655c4566f8ced654bbc8c73b501fff159f347a9efa210246555d2b0624c33d","observation_id":"f10f704b-4dcb-4bd1-81c8-b80571cdb8be","resolution":{"observed_at":"2026-08-11T14:04:41.117432Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1186/s12875-016-0451-x","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.570740Z","title":"Recognition of patients with medically un- explained physical symptoms by family physi- cians: results of a focus group study.BMC Family Practice","venue":null,"work_id":"61ba2368-b9b7-4566-b096-cb3a68bb7f76","year":2016},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.442336Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:d4ebe326f242fae4d14a16a1afa268a5ae99c249a9a5c80c68a9ee0f28211c08","observation_id":"13fc7ccf-d03d-46ff-8dfe-d5bdce8742a1","resolution":{"observed_at":"2026-08-11T14:04:40.574462Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.7812/tpp/07-144","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.560102Z","title":"Do Patients Under- stand? The Permanente Journal","venue":null,"work_id":"ce7224ae-bd94-4726-8189-6ade5b78e341","year":2008},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.446313Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:b081f3fd3f7492812f60efe1cc33ef1cd71129cea0227b89312c81ba93c801e8","observation_id":"afa13638-9e6f-4261-a4a2-e3a7b152cbd3","resolution":{"observed_at":"2026-08-11T14:04:40.563979Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:41.910724Z","title":"The importance of the history and physical in diagnosis","venue":null,"work_id":"b6f86eb3-8fec-47a4-b033-503a2a46c70c","year":null},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.449640Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:4129baf247b046654b33b56f68c4692090289e09860d3c6b15319e4e9b9403a0","observation_id":"77e81c7a-4a07-4266-a6a0-d7c1f371348d","resolution":{"observed_at":"2026-08-11T14:04:41.915087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1136/bmjopen-2016-017902","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.549169Z","title":"In- ternational variations in primary care physi- cian consultation time: a systematic review of 67 countries","venue":null,"work_id":"67e8439d-da8a-4efb-81d4-0fe8731a82e6","year":2017},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.456829Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:fe99ac9707beae4507d55f6afbe7f60fbc54d4ece6187d746d02d425a6888976","observation_id":"cc12c55f-c654-457b-804b-74ee80c7d0d1","resolution":{"observed_at":"2026-08-11T14:04:40.553263Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4103/ijcm.ijcm7819","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.538771Z","title":"Preva- lence of Occupational Burnout among Resident Doctors Working in Public Sector Hospitals in Mumbai","venue":null,"work_id":"b833369b-6474-4ad2-bbb9-b0b71a010afa","year":2019},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.460408Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:e56bdac3bf464d29dbeca05cc9e9947eeea71759170bb7700bb37deaa38c7345","observation_id":"27b56a44-5d0b-4b90-b345-0f58e8bdf6e2","resolution":{"observed_at":"2026-08-11T14:04:40.542624Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2196/46875","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.612375Z","title":"Eval- uating the Diagnostic Performance of Symp- tom Checkers: Clinical Vignette Study","venue":null,"work_id":"d701c1bf-0ff3-4e18-9c00-1e025b4f86f2","year":2024},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.464042Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:1021ab35abfb7a7dd07f4e0a24bc620276b2a1d8c9f45ed9a78f9a5ca41db138","observation_id":"6bc82e7e-c92e-472d-9ea2-31cb2cd2aded","resolution":{"observed_at":"2026-08-11T14:04:40.615526Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.467589Z","title":"A systematic review of trustworthy and explainable artificial intelligence in healthcare: Assessment of quality, bias risk, and data fusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.467589Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:81377e5a7cd9d452cafa9b93e8b7074b7b7f22e1d970f413d0b6dcf2ed2160db","observation_id":"7e00d90b-862a-43e3-afe7-98cdfc837dd7","resolution":{"observed_at":"2026-08-11T14:04:40.467589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1136/bmjhci-2021-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.520366Z","title":"Evalu- ation framework to guide implementation of AI systems into healthcare settings","venue":null,"work_id":"1b89e54b-fcbb-4612-9ba1-0e88fbee4d43","year":2021},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.471160Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:9803e9cfeda907fdeedcfc5352c50f1c0acd317b8cc99bd6d6004a6bd1219717","observation_id":"01cb11b8-c896-47ec-bfe2-ebd55352aa07","resolution":{"observed_at":"2026-08-11T14:04:40.525790Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.475563Z","title":"What Disease Does This Patient Have? A Large-Scale Open Domain Question Answering Dataset from Med- ical Exams","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.475563Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:2eda5f799eda404893822c60fab1cbe8c3f1b55e8f8e4090cb65da284ad7f816","observation_id":"10395d0f-4615-4990-8440-e90080a8797c","resolution":{"observed_at":"2026-08-11T14:04:40.475563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:40.479370Z","title":"WHO and ITU establish benchmarking process for artificial intelligence in health","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.479370Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:83eb62b89b2cb4a22d33a9cf87f7e1639cd7a54aa12c321faa19379f45eaf9ff","observation_id":"c97ad694-867e-4b4f-ae24-c05849296bf7","resolution":{"observed_at":"2026-08-11T14:04:40.479370Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.7347","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:41.822867Z","title":null,"venue":null,"work_id":"212a6795-df0d-498d-98d8-5329e627dbde","year":2023},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":173,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.251591Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:df06656e7405cd3ba9dcd56182f7f7ae46547486a8bfac59cd0976468ec6ad1d","observation_id":"16e4ab7d-9c36-4f4c-8d5d-f2f9a29d2148","resolution":{"observed_at":"2026-08-11T14:04:41.828559Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4648.20444","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:04:41.038380Z","title":null,"venue":null,"work_id":"b2ceba16-74df-4f62-81bf-7d60aeea59bb","year":null},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.453296Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:8304f34b4007167cb096588aadcf8ff6e53d5688a2879c1fa2eb3566ed9c6d3a","observation_id":"7a725f8e-d38d-46c4-ab46-fdd111b6205d","resolution":{"observed_at":"2026-08-11T14:04:41.043691Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10916-024-02045-3","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-19T11:03:45.297681Z","title":null,"venue":"Journal of Medical Systems","work_id":"95393127-3bd4-45db-be53-22b4f2cc5a2d","year":null},"citing_paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T14:04:40.321795Z"},"links":{"citing_paper":"/paper/2412.12538"},"observation_digest":"sha256:f593633cbd981b21de56638346cd506d52cbba2a0920e0a3b3fefe1722c32884","observation_id":"e9b99c61-7c13-4c20-bc36-be9bf952e1a6","resolution":{"observed_at":"2026-08-11T14:04:40.810100Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.12538","last_updated":"2024-12-17T05:02:33Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-19T10:52:40.119576Z","submitted_at":"2024-12-17T05:02:33Z","title":"A Scalable Approach to Benchmarking the In-Conversation Differential Diagnostic Accuracy of a Health AI"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":14,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":24,"verified_fuzzy":15},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2412.12538."}