{"as_of":"2026-08-10T22:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf6f11843534141ec517483194fb50d580180b7c6707da6b711e88a5d24aed5c","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:46:10.522415Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T00:19:33.861692Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T11:08:02.948778Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"cited_work":{"arxiv_id":"2507.23486","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.23486","snapshot_observed_at":"2026-07-03T11:08:02.948778Z","title":"Bingbing Wen, Jihan Yao, Shangbin Feng, Chenjun Xu, Yulia Tsvetkov, Bill Howe, et al","venue":null,"work_id":"008b5644-5738-4320-b3be-8266d9781ac9","year":2025},"citing_paper":{"arxiv_id":"2604.07709","last_updated":"2026-06-03T21:15:24Z","snapshot_observed_at":"2026-07-13T00:19:28.134640Z","submitted_at":"2026-04-09T01:54:33Z","title":"IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-10T18:25:53.037936Z"},"links":{"cited_paper":"/paper/2507.23486","citing_paper":"/paper/2604.07709"},"observation_digest":"sha256:ea211e502bdba92757e9e996a854d60c3a567c5be2ee9d0648fba1d1f3ee75fa","observation_id":"65b203d6-9762-4c96-a5ff-584bbaaaac63","resolution":{"observed_at":"2026-05-11T00:35:52.677796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23486","snapshot_observed_at":"2026-07-13T00:19:33.861692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.07709","last_updated":"2026-06-03T21:15:24Z","snapshot_observed_at":"2026-07-13T00:19:28.134640Z","submitted_at":"2026-04-09T01:54:33Z","title":"IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-13T00:19:33.861692Z"},"links":{"cited_paper":"/paper/2507.23486","citing_paper":"/paper/2604.07709"},"observation_digest":"sha256:b58413b0cc303fee43bd08d15d508b4038b8b2424ebc2a383641f343dd7ad377","observation_id":"0444d725-a30e-4366-a6b4-685e8958ff48","resolution":{"observed_at":"2026-07-13T00:19:33.861692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"cited_work":{"arxiv_id":"2507.23486","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.23486","snapshot_observed_at":"2026-07-03T11:08:02.948778Z","title":"Bingbing Wen, Jihan Yao, Shangbin Feng, Chenjun Xu, Yulia Tsvetkov, Bill Howe, et al","venue":null,"work_id":"008b5644-5738-4320-b3be-8266d9781ac9","year":2025},"citing_paper":{"arxiv_id":"2605.07919","last_updated":"2026-05-22T17:54:54Z","snapshot_observed_at":"2026-08-10T21:30:45.317803Z","submitted_at":"2026-05-08T15:55:30Z","title":"MedVIGIL: Evaluating Trustworthy Medical VLMs Under Broken Visual Evidence","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T03:45:42.703353Z"},"links":{"cited_paper":"/paper/2507.23486","citing_paper":"/paper/2605.07919"},"observation_digest":"sha256:28265449eed7b313926a8fe3d73402bb73808914093c821377c62cde6c4c37e9","observation_id":"ad62a974-59d9-428c-b042-6fd8c90d11cd","resolution":{"observed_at":"2026-05-11T03:45:55.214681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"cited_work":{"arxiv_id":"2507.23486","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.23486","snapshot_observed_at":"2026-07-03T11:08:02.948778Z","title":"Bingbing Wen, Jihan Yao, Shangbin Feng, Chenjun Xu, Yulia Tsvetkov, Bill Howe, et al","venue":null,"work_id":"008b5644-5738-4320-b3be-8266d9781ac9","year":2025},"citing_paper":{"arxiv_id":"2605.07919","last_updated":"2026-05-22T17:54:54Z","snapshot_observed_at":"2026-08-10T21:30:45.317803Z","submitted_at":"2026-05-08T15:55:30Z","title":"MedVIGIL: Evaluating Trustworthy Medical VLMs Under Broken Visual Evidence","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T06:19:11.597882Z"},"links":{"cited_paper":"/paper/2507.23486","citing_paper":"/paper/2605.07919"},"observation_digest":"sha256:a5543241f2a45e9ba5ddeb450bb6820e8d2e34bedb2bd6b428e418303734cee1","observation_id":"88a75dbd-b112-4ed7-ab12-6276381603a5","resolution":{"observed_at":"2026-05-25T06:20:24.309424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"cited_work":{"arxiv_id":"2507.23486","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.23486","snapshot_observed_at":"2026-07-03T11:08:02.948778Z","title":"Bingbing Wen, Jihan Yao, Shangbin Feng, Chenjun Xu, Yulia Tsvetkov, Bill Howe, et al","venue":null,"work_id":"008b5644-5738-4320-b3be-8266d9781ac9","year":2025},"citing_paper":{"arxiv_id":"2606.12702","last_updated":"2026-06-10T21:44:20Z","snapshot_observed_at":"2026-07-31T15:03:20.136750Z","submitted_at":"2026-06-10T21:44:20Z","title":"Deployment-Centered Evaluation: Predicting Query-Level Rejection Risk in a Clinical LLM System","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T09:43:12.633039Z"},"links":{"cited_paper":"/paper/2507.23486","citing_paper":"/paper/2606.12702"},"observation_digest":"sha256:40b2c1d352b8d079c4b74059884f8f7e88a4ae112b8595fef06fd8775532664e","observation_id":"8018e963-9bd1-4870-a88d-8634dea74c4c","resolution":{"observed_at":"2026-07-03T11:08:02.950590Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.23486/citation-record","integrity":"/paper/2507.23486/integrity","json":"/paper/2507.23486/citation-record.json","paper":"/paper/2507.23486"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:46:10.406277Z","title":"A., Gui, H., Rezaei, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.406277Z"},"links":{"citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:1ebaae3dd781037a025bc9c7ab022de696fd4a86855d526a3007e5704f5a76fd","observation_id":"fc25d4d6-c059-44ad-8064-17e3be109249","resolution":{"observed_at":"2026-08-06T10:46:10.406277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:46:10.411592Z","title":"et al.Towards accurate differential diagnosis with large language models.Nature 642, 451-457, doi:10.1038/s41586-025-08869-4 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.411592Z"},"links":{"citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:9144e493bc554b8c121894655a0e9bacd61f60ec82e3744f29d67fc929970baf","observation_id":"0f85658d-f08c-4a65-8f52-e38b77919984","resolution":{"observed_at":"2026-08-06T10:46:10.411592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:46:10.416849Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.416849Z"},"links":{"citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:7c19be50b2d88db54c3218ebb83d325fe9f7b410a25e74beee84820b6a951166","observation_id":"f97b2fd1-0c6d-4f6f-b5c6-1a79d9b7e55e","resolution":{"observed_at":"2026-08-06T10:46:10.416849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:46:10.421342Z","title":"et al.Foundation models for generalist medical artificial intelligence","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.421342Z"},"links":{"citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:8d3edb86f28692cee4e3e3f02578903f6fbfbb0211cb8573c599c90495959c98","observation_id":"9e050803-03fe-43b4-989b-1259e5d3d3b4","resolution":{"observed_at":"2026-08-06T10:46:10.421342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:46:10.425603Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.425603Z"},"links":{"citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:6505abdaae51e3ee98f06f94c700ad9dee7c6a42112901713b91dfa6c40399f4","observation_id":"2fd6b8f4-60ef-4d98-8a7d-fa27cd9ffd22","resolution":{"observed_at":"2026-08-06T10:46:10.425603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03298","last_updated":"2025-02-05T15:56:37Z","snapshot_observed_at":"2026-08-09T05:10:36.971489Z","submitted_at":"2025-02-05T15:56:37Z","title":"MeDiSumQA: Patient-Oriented Question-Answer Generation from Discharge Letters","version":1},"cited_work":{"arxiv_id":"2502.03298","doi":"10.48550/arxiv.2502.03298","metadata_source":"pith","pith_arxiv_id":"2502.03298","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"MeDiSumQA: Patient-Oriented Question-Answer Generation from Discharge Letters","venue":"cs.CL","work_id":"8557a156-ffcb-4919-8a54-3443e7c2d211","year":2025},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.429615Z"},"links":{"cited_paper":"/paper/2502.03298","citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:9fb25054f3a8bd9d900ab7426d006d1631e7772f78a8cda2ee8c01875fbceb23","observation_id":"eb0e64ca-6258-4a4f-83af-9aa82c7683c7","resolution":{"observed_at":"2026-08-06T10:46:10.663501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:46:10.434980Z","title":"et al.Adapted large language models can outperform medical experts in clin- ical text summarization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.434980Z"},"links":{"citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:f0e20e4653bb0b6c2933d7636ea70b983179e0adb898c17c43aba298a4e18526","observation_id":"9d895fdc-55c7-4b1a-b9f9-c3a18ff14d97","resolution":{"observed_at":"2026-08-06T10:46:10.434980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20953","last_updated":"2025-05-06T17:34:29Z","snapshot_observed_at":"2026-08-07T16:34:30.589938Z","submitted_at":"2025-03-26T19:36:43Z","title":"Clean & Clear: Feasibility of Safe LLM Clinical Guidance","version":2},"cited_work":{"arxiv_id":"2503.20953","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.20953","snapshot_observed_at":"2026-08-06T10:46:10.998566Z","title":"Clean & Clear: Feasibility of Safe LLM Clinical Guidance","venue":"cs.CL","work_id":"7e63cff1-f7c3-4841-a522-584102732278","year":2025},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.438729Z"},"links":{"cited_paper":"/paper/2503.20953","citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:26d698c59f2f4e33f95ce6afc89cafbff738507795b710f064f2b3eeb00201d6","observation_id":"8e0589a2-b648-4e5a-a4d7-97debbe431f6","resolution":{"observed_at":"2026-08-06T10:46:11.003075Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:46:10.442312Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.442312Z"},"links":{"citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:45bfc60124a0f12e0e932c52e1962d9340d25fec290351f89d452362e12e2c99","observation_id":"76ec1c29-fd02-4c19-81e1-04043c52dca7","resolution":{"observed_at":"2026-08-06T10:46:10.442312Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:46:10.445844Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.445844Z"},"links":{"citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:9d7205532377a8339e36ef77d096f932a21405728dc9be5b23a20fb9dcb91057","observation_id":"f76e3116-4053-46a8-b86d-30f1c82a1d3d","resolution":{"observed_at":"2026-08-06T10:46:10.445844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1186/s12911-024-02709-7","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"& Cho, B","venue":"BMC Medical Informatics and Decision Making","work_id":"916a7b5a-6619-4aee-912a-e1587ee1d9af","year":2024},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.448927Z"},"links":{"citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:d50060a2cb4066fb9e811880d883665dbdb76784644b4fa6f89d864bb28e32e4","observation_id":"6de4fe4d-4f49-49b0-b41d-1f88f97020ae","resolution":{"observed_at":"2026-08-06T10:46:10.620912Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10990","last_updated":"2024-06-24T02:25:48Z","snapshot_observed_at":"2026-08-05T14:38:16.803841Z","submitted_at":"2024-06-24T02:25:48Z","title":"MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10990","snapshot_observed_at":"2026-08-06T10:46:10.452156Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.452156Z"},"links":{"cited_paper":"/paper/2407.10990","citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:afa26932ac9e27d6f9e9bbf7f5d2d3321a21988ad57beeeb229982aefe93bbcb","observation_id":"1c088b28-fcb0-4393-bba6-5d3efbb4fcf1","resolution":{"observed_at":"2026-08-06T10:46:10.452156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18927","last_updated":"2024-10-24T17:14:40Z","snapshot_observed_at":"2026-07-06T19:39:15.025945Z","submitted_at":"2024-10-24T17:14:40Z","title":"SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18927","snapshot_observed_at":"2026-08-06T10:46:10.455850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.455850Z"},"links":{"cited_paper":"/paper/2410.18927","citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:18cad15e2554a9f8dc37d97ebdc27fd5391992af8f61704fe7b6bdbfab458b99","observation_id":"f9460823-9764-4395-b2d8-e576d10e5b52","resolution":{"observed_at":"2026-08-06T10:46:10.455850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14470","last_updated":"2025-05-20T05:58:23Z","snapshot_observed_at":"2026-08-06T12:35:19.109481Z","submitted_at":"2024-12-19T02:35:15Z","title":"Agent-SafetyBench: Evaluating the Safety of LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14470","snapshot_observed_at":"2026-08-06T10:46:10.459472Z","title":"et al.Agent-SafetyBench: Evaluating the Safety of LLM Agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.459472Z"},"links":{"cited_paper":"/paper/2412.14470","citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:5a91cf020b65db36ea5d557d735cd9b30c430b567907404bb598f695f51b050b","observation_id":"793b6677-67f9-4e56-9a81-72f5750912d9","resolution":{"observed_at":"2026-08-06T10:46:10.459472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14985","last_updated":"2025-04-23T16:52:54Z","snapshot_observed_at":"2026-08-07T16:00:37.719752Z","submitted_at":"2025-04-21T09:26:05Z","title":"aiXamine: Simplified LLM Safety and Security","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14985","snapshot_observed_at":"2026-08-06T10:46:10.462713Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.462713Z"},"links":{"cited_paper":"/paper/2504.14985","citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:538aed61e26a93ffa823f5a1abf19428c52b3c282cc49c66a2d8662de8beaa8e","observation_id":"36310e5b-7a2c-431f-a77c-6aa87474a2d7","resolution":{"observed_at":"2026-08-06T10:46:10.462713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:46:10.466118Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.466118Z"},"links":{"citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:a85797273c7a307a47d5b101108f86ee7358328ee963b8fd45df65e66bc41977","observation_id":"18da0b2d-f55f-44f3-ae5d-7ce0dcc78126","resolution":{"observed_at":"2026-08-06T10:46:10.466118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-07-06T21:23:23.760393Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-08-06T10:46:10.469198Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.469198Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:3dfcd4e8bd09cde8fdadddef687275d47743e7f2c049adc3fe30892aef87f415","observation_id":"cca9673b-cc10-4286-8fbb-641821ba5438","resolution":{"observed_at":"2026-08-06T10:46:10.469198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16446","last_updated":"2024-03-25T06:17:54Z","snapshot_observed_at":"2026-07-06T17:49:56.713455Z","submitted_at":"2024-03-25T06:17:54Z","title":"Towards Automatic Evaluation for LLMs' Clinical Capabilities: Metric, Data, and Algorithm","version":1},"cited_work":{"arxiv_id":"2403.16446","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.16446","snapshot_observed_at":"2026-08-06T10:46:10.899688Z","title":"Towards Automatic Evaluation for LLMs' Clinical Capabilities: Metric, Data, and Algorithm","venue":"cs.CL","work_id":"9f7458ee-018a-426f-858f-e4b34c1d3530","year":2024},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.472579Z"},"links":{"cited_paper":"/paper/2403.16446","citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:5f8b99c4ab3485391bb5e56fd92757a9cebb5f95b048a40bfac5fae00ac878b8","observation_id":"c9cb5b69-05e3-4f79-9823-8e1d21eff0d0","resolution":{"observed_at":"2026-08-06T10:46:10.904582Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09617","last_updated":"2023-05-16T17:11:29Z","snapshot_observed_at":"2026-08-03T08:52:05.725675Z","submitted_at":"2023-05-16T17:11:29Z","title":"Towards Expert-Level Medical Question Answering with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09617","snapshot_observed_at":"2026-08-06T10:46:10.475973Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.475973Z"},"links":{"cited_paper":"/paper/2305.09617","citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:c7bef224441c70d952bcaf1d6a543cb2d29cbd73dbfb0039cd1dff24967c803d","observation_id":"c1e5acbb-284c-489b-bd4e-424c254d10a2","resolution":{"observed_at":"2026-08-06T10:46:10.475973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41591-024-03328-5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"et al.An evaluation framework for clinical use of large language models in patient interaction tasks","venue":"Nature Medicine","work_id":"f603c84a-0f56-47cf-bea3-eb4f40882889","year":2025},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.479077Z"},"links":{"citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:bfd9c36a768a09895d704f79c56a65877826e09bbaa3ef264e390f3a5cfca653","observation_id":"caf14afb-0b5e-4554-8baa-f677b1b8b321","resolution":{"observed_at":"2026-08-06T10:46:10.597414Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05654","last_updated":"2024-01-11T04:25:06Z","snapshot_observed_at":"2026-07-06T17:14:07.183954Z","submitted_at":"2024-01-11T04:25:06Z","title":"Towards Conversational Diagnostic AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05654","snapshot_observed_at":"2026-08-06T10:46:10.482561Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.482561Z"},"links":{"cited_paper":"/paper/2401.05654","citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:1369a9dac916fc8750c5c9123ec62f7c37adc8677f051a792b927f0c85801c2a","observation_id":"8465f969-37a8-4a75-8d95-49740f439ab8","resolution":{"observed_at":"2026-08-06T10:46:10.482561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07960","last_updated":"2025-05-25T02:19:37Z","snapshot_observed_at":"2026-07-30T08:34:47.046912Z","submitted_at":"2024-05-13T17:38:53Z","title":"AgentClinic: a multimodal agent benchmark to evaluate AI in simulated clinical environments","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07960","snapshot_observed_at":"2026-08-06T10:46:10.485794Z","title":"et al.AgentClinic: a multimodal agent benchmark to evaluate AI in simulated 27 clinical environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.485794Z"},"links":{"cited_paper":"/paper/2405.07960","citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:f61ee681811a9aa0d17922b217ca9d721e6a80d03e6274a9c694346e30b23807","observation_id":"d7748517-aa6a-46e7-9df6-e100b55de009","resolution":{"observed_at":"2026-08-06T10:46:10.485794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02077","last_updated":"2023-09-05T09:24:48Z","snapshot_observed_at":"2026-08-10T03:39:47.321832Z","submitted_at":"2023-09-05T09:24:48Z","title":"An Automatic Evaluation Framework for Multi-turn Medical Consultations Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02077","snapshot_observed_at":"2026-08-06T10:46:10.489111Z","title":"& Wang, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.489111Z"},"links":{"cited_paper":"/paper/2309.02077","citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:1cac30ace6d7b22e0d091d89d225bc7f16d5b44df55fb8305e60bc63a0592358","observation_id":"64a25829-9479-42dd-bc6f-17829ba377d9","resolution":{"observed_at":"2026-08-06T10:46:10.489111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07635","last_updated":"2023-08-15T08:32:20Z","snapshot_observed_at":"2026-07-06T16:06:18.758673Z","submitted_at":"2023-08-15T08:32:20Z","title":"LLM-Mini-CEX: Automatic Evaluation of Large Language Model for Diagnostic Conversation","version":1},"cited_work":{"arxiv_id":"2308.07635","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.07635","snapshot_observed_at":"2026-08-06T10:46:10.838495Z","title":"LLM-Mini-CEX: Automatic Evaluation of Large Language Model for Diagnostic Conversation","venue":"cs.CL","work_id":"cbca8902-ba55-4de0-b211-e08ba56c7385","year":2023},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.492712Z"},"links":{"cited_paper":"/paper/2308.07635","citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:f61ff58a2b7d97397d4ab994427e57da67bbd78007a9346d762e69cb21eb5fb4","observation_id":"2edab784-dfb4-414f-9e5b-c691a60f961d","resolution":{"observed_at":"2026-08-06T10:46:10.842469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:46:10.496554Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.496554Z"},"links":{"citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:32d8ed9b3fb3d6e90c961d28bd2fe3bd95b52a27f8e851ee9671d0648d5074f9","observation_id":"99cb9ef8-8cff-4929-a99b-cee4695c1741","resolution":{"observed_at":"2026-08-06T10:46:10.496554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-06T10:46:10.500484Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.500484Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:ddf99139d233a3988429fd50ac280546a13ca6f2a5be1cd4fcc6128d8cb983f2","observation_id":"844963ff-1f99-4258-9bc5-053685c07377","resolution":{"observed_at":"2026-08-06T10:46:10.500484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:46:10.504332Z","title":"et al.Automating Evaluation of AI Text Generation in Healthcare with a Large Language Model (LLM)-as-a-Judge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.504332Z"},"links":{"citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:22c25a4411a0cd6df9a68de9ce5c8c629d0fea12d5743fe9a4d8fdc584a2afe2","observation_id":"770d0a68-fd0e-4ec0-b153-d764739537eb","resolution":{"observed_at":"2026-08-06T10:46:10.504332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:46:10.508681Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.508681Z"},"links":{"citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:40416b0262d24027e2c6cb3e8abb915d3d4c0a8db7ca4873e9bc37b4dd35fa3f","observation_id":"6a955e62-4ee5-45fb-9a2a-0f821700a341","resolution":{"observed_at":"2026-08-06T10:46:10.508681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.10106","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:46:10.809811Z","title":null,"venue":null,"work_id":"0fab2e54-b199-4f6b-a3e4-8d47056dfd3c","year":2024},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.512605Z"},"links":{"citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:7d88ed6b262adb44ad7419d4ce5c3a1ec60f1c830efad7036fb2ce7e79b15e17","observation_id":"ce190359-ddaf-443c-aab8-c7334c01cedb","resolution":{"observed_at":"2026-08-06T10:46:10.815851Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-09T10:52:35.096607Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-06T10:46:10.515710Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.515710Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:0c2f05233661e8cc1681aaf987baa9da206eb6634b4ba922e0e9e8d1fd4a54b0","observation_id":"4cd591a4-3e82-4aee-904a-b4e9ae152850","resolution":{"observed_at":"2026-08-06T10:46:10.515710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s40265-024-02124-2","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"et al.Aligning Large Language Models with Humans: A Comprehensive Survey of ChatGPT's Aptitude in Pharmacology","venue":"Drugs","work_id":"4d0f110f-0696-4d44-8a76-de071fb31cdf","year":2025},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.519347Z"},"links":{"citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:815b53143e7ff808e18bf863fb30b4472abc8101010f843203ad708b5af93e64","observation_id":"314fc882-ee5b-4b39-a5d5-3b617bf6c05a","resolution":{"observed_at":"2026-08-06T10:46:10.562934Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:46:10.522415Z","title":"T., Bardak, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.522415Z"},"links":{"citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:3901cf7d61a54c942df624f09fcb6700f384b453fa3685b179f7569055daad23","observation_id":"8bef7af2-1cd9-43f7-b755-df775440a5c4","resolution":{"observed_at":"2026-08-06T10:46:10.522415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T04:06:54.161785Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":23,"verified_exact":7,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 5 inbound Pith citation observations for arXiv:2507.23486."}