{"as_of":"2026-08-09T11:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26d526c72d88cd5e0e4da0e492cf304ec34fde56b5599ddc93db4a2e4cb40151","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:46:29.739206Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:24:43.178158Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T05:59:38.023398Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06666","snapshot_observed_at":"2026-08-07T00:24:43.178158Z","title":"Automatic evaluation of healthcare llms beyond question-answering, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-07T00:16:03.841117Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:43.178158Z"},"links":{"cited_paper":"/paper/2502.06666","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:2bfd9bde2338446e414d0addc2b236658849cc8633cc0da2464cf3854176eb50","observation_id":"a7c90f96-cebf-48a7-badc-0e7119573cee","resolution":{"observed_at":"2026-08-07T00:24:43.178158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06666","snapshot_observed_at":"2026-08-06T20:25:46.816118Z","title":"A., Hinjos, D., Bernabeu-Perez, P., Ganzabal, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02822","last_updated":"2025-07-03T17:33:58Z","snapshot_observed_at":"2026-08-07T17:34:45.990556Z","submitted_at":"2025-07-03T17:33:58Z","title":"SynapseRoute: An Auto-Route Switching Framework on Dual-State Large Language Model","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:25:46.816118Z"},"links":{"cited_paper":"/paper/2502.06666","citing_paper":"/paper/2507.02822"},"observation_digest":"sha256:293ad8c18460e520fc1ca8d691ad376950f4f2155c0e489f6def85464f068eb9","observation_id":"1c069bbc-05f8-45c3-9434-ccb6027cc855","resolution":{"observed_at":"2026-08-06T20:25:46.816118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"cited_work":{"arxiv_id":"2502.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06666","snapshot_observed_at":"2026-07-04T05:59:38.023398Z","title":"Automatic evaluation of healthcare llms beyond question-answering","venue":null,"work_id":"80523b61-d697-4fcf-804d-95f49c7830df","year":2025},"citing_paper":{"arxiv_id":"2606.21023","last_updated":"2026-06-19T01:21:10Z","snapshot_observed_at":"2026-08-07T09:50:36.040243Z","submitted_at":"2026-06-19T01:21:10Z","title":"Demystifying Numerical Instability in LLM Inference: Achieving Reproducible Inference for Mission-Critical Tasks with HEAL","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T14:58:55.680525Z"},"links":{"cited_paper":"/paper/2502.06666","citing_paper":"/paper/2606.21023"},"observation_digest":"sha256:09db338a7dbdb463183c706157076368eebc322e05ee5bef91a5fe2df176cca5","observation_id":"aef5af40-d332-46b6-be89-6e4407f554e4","resolution":{"observed_at":"2026-07-04T05:59:38.025037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06666/citation-record","integrity":"/paper/2502.06666/integrity","json":"/paper/2502.06666/citation-record.json","paper":"/paper/2502.06666"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:29.518909Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.518909Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:e1ef3ed6158d82af5954de99938f90c1128ddf8d7a46a53655f71d97d14aca0a","observation_id":"3bbbf59a-aebb-4d4b-820c-079cd9576153","resolution":{"observed_at":"2026-08-08T14:46:29.518909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:29.524615Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.524615Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:dab3577461a5709bf96989fa403b4f9feb13d00c364a2629cf33fc6a00393d3e","observation_id":"850463a7-aaa6-48be-9aa6-1c67d836d434","resolution":{"observed_at":"2026-08-08T14:46:29.524615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01463","last_updated":"2023-09-26T20:52:46Z","snapshot_observed_at":"2026-08-07T23:09:45.569340Z","submitted_at":"2023-09-26T20:52:46Z","title":"Creating Trustworthy LLMs: Dealing with Hallucinations in Healthcare AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01463","snapshot_observed_at":"2026-08-08T14:46:29.530844Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.530844Z"},"links":{"cited_paper":"/paper/2311.01463","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:5fbfb6ee636dce02a481ad70dbe099c19cee57f1462036aa6969b5c03691e415","observation_id":"1283dea7-4db4-486d-b74a-b7deb8fde1f0","resolution":{"observed_at":"2026-08-08T14:46:29.530844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.796723Z","title":null,"venue":null,"work_id":"563870b9-d095-456d-84c2-f1d9d86276bd","year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.536495Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:95a847c89d7f958d20a615e82cb0173b06a6c275e85d486a18f02eeb385fddd1","observation_id":"5ccc4589-99dc-4076-aae0-cc38f0092862","resolution":{"observed_at":"2026-08-08T14:46:30.803045Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01781","last_updated":"2024-07-03T11:20:43Z","snapshot_observed_at":"2026-07-31T17:52:54.507082Z","submitted_at":"2024-02-01T19:12:25Z","title":"When Benchmarks are Targets: Revealing the Sensitivity of Large Language Model Leaderboards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01781","snapshot_observed_at":"2026-08-08T14:46:29.541762Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.541762Z"},"links":{"cited_paper":"/paper/2402.01781","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:166b8858a96a37e33803771a1a1dfdb2cc0a8cd1a9574d704bf4e8b7034f744c","observation_id":"6aabf32b-0f38-4f7f-9150-377d5b946014","resolution":{"observed_at":"2026-08-08T14:46:29.541762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.778928Z","title":null,"venue":null,"work_id":"bf6e6dc8-5724-44eb-8b65-657b97d194e5","year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.547732Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:05daf757e8227e9b4748e4fa0427b74703f71f29b594166eb31cc4daae01917c","observation_id":"1af37629-8959-4fb4-98c3-8911f50eb717","resolution":{"observed_at":"2026-08-08T14:46:30.784194Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.762741Z","title":null,"venue":null,"work_id":"3af6653a-a1f4-4887-a52a-836315963a63","year":2019},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.553071Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:1804830829d39d1d4bbb4d132e365152cbb4950836f09e6cfeed363b3361f871","observation_id":"3388325f-8e7c-445d-9dc7-db424159e0cb","resolution":{"observed_at":"2026-08-08T14:46:30.768023Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.745932Z","title":null,"venue":null,"work_id":"a20113ff-cc77-419a-8ec1-9ee47f5ef76e","year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.557764Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:14b97f1b3b6e7638a9ee00bc3cdd2458afd4a72b31ac5decf9b4f2f080fb5134","observation_id":"fd74d032-ca36-478f-a1cf-dca14b31099b","resolution":{"observed_at":"2026-08-08T14:46:30.750939Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16326","last_updated":"2025-04-25T22:22:45Z","snapshot_observed_at":"2026-07-06T15:33:31.386787Z","submitted_at":"2023-05-10T13:40:06Z","title":"Benchmarking large language models for biomedical natural language processing applications and recommendations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16326","snapshot_observed_at":"2026-08-08T14:46:29.562681Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.562681Z"},"links":{"cited_paper":"/paper/2305.16326","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:0df9617f16e45ee9cf3e8cbf1a612928f0d8698602dd4256b8ac153c0c0e05ca","observation_id":"28edeeb4-31ab-4c99-a644-4632cc037651","resolution":{"observed_at":"2026-08-08T14:46:29.562681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.727901Z","title":null,"venue":null,"work_id":"fafc3136-2ca6-4174-86eb-a3fe50891a02","year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.567264Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:58cb152f7e332a84f8242988683aee22b57f37caa585a7b568e2a08ffcb6d482","observation_id":"7a4a866f-3a30-487f-8de7-f4156a649dae","resolution":{"observed_at":"2026-08-08T14:46:30.733748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06142","last_updated":"2024-08-12T13:37:31Z","snapshot_observed_at":"2026-08-08T10:02:05.972661Z","submitted_at":"2024-08-12T13:37:31Z","title":"Med42-v2: A Suite of Clinical LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06142","snapshot_observed_at":"2026-08-08T14:46:29.571758Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.571758Z"},"links":{"cited_paper":"/paper/2408.06142","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:05898bc9dee451f33e47d99fc7c26f4fa5cf408d647ac388f89e3ea7098f6c04","observation_id":"9635c7ba-dacb-4501-b06f-eee813c20d76","resolution":{"observed_at":"2026-08-08T14:46:29.571758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:29.576417Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.576417Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:7c87bb650bff5e4faf3e14d6b543e302cefc05568c48d35b4fa1d560b53a03d2","observation_id":"5c711ba1-461b-444e-8ed5-dfe3a5eded22","resolution":{"observed_at":"2026-08-08T14:46:29.576417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.709586Z","title":null,"venue":null,"work_id":"52166d2b-a253-4ff5-8d45-b7874d842677","year":2022},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.580866Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:3eeb2092376fe3fe9b7ba04de4b8758d1c428821ef6514b093c382cc6b0351d3","observation_id":"01300569-716a-4cac-824b-8bd5f3a6a6e7","resolution":{"observed_at":"2026-08-08T14:46:30.714409Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.694096Z","title":null,"venue":null,"work_id":"3b8e2f28-868d-4591-8c4d-b0b30e374086","year":2020},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.585068Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:21a92eb2af7043f7a861f7b319f160611dc4e130f9c1d194146553b4d575e57e","observation_id":"440f50b2-e9ed-4cfc-b551-49af38c70ebf","resolution":{"observed_at":"2026-08-08T14:46:30.699053Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13081","last_updated":"2020-09-28T05:07:51Z","snapshot_observed_at":"2026-08-06T03:17:52.286711Z","submitted_at":"2020-09-28T05:07:51Z","title":"What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.13081","snapshot_observed_at":"2026-08-08T14:46:29.589392Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.589392Z"},"links":{"cited_paper":"/paper/2009.13081","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:1aaeac8b00f66a3bf8b8786cdd9719e81f70396ecb7099e35c444931baeb2643","observation_id":"8e935abc-8196-4705-a420-85dbca0cfb18","resolution":{"observed_at":"2026-08-08T14:46:29.589392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.678026Z","title":null,"venue":null,"work_id":"0e90c5f3-b3b6-420f-8afd-439ba5c196a2","year":2019},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.594081Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:9ffcd980b9af82293962198f3b7de7995ac750f0b5d84ddea966b557790aca3d","observation_id":"44131d9a-7334-4e33-8906-33b8c62b6ce9","resolution":{"observed_at":"2026-08-08T14:46:30.682768Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.662453Z","title":null,"venue":null,"work_id":"6abfd167-2194-423e-bcd0-9a8334424d61","year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.598397Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:eaec782dba37949bf188ea0bc1dee561948396d982c5217eab5673144704def6","observation_id":"20418767-79d8-435c-b263-446c64329612","resolution":{"observed_at":"2026-08-08T14:46:30.667239Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.647907Z","title":null,"venue":null,"work_id":"886f3f07-37d4-497d-937b-d514f6fa354e","year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.602500Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:ddace67dc784c4b26f5113e91c689a047ef7cd6cc558b03fd4082a12672d880c","observation_id":"07faaac9-8b9b-425d-b429-8a96bcfb4bf2","resolution":{"observed_at":"2026-08-08T14:46:30.652222Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:29.607256Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.607256Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:1883950e5da24495b34fd4a1227710349445cd5df175b67521dc3901836a9d4e","observation_id":"1cb332e2-6ba8-4ea8-a7fd-0ac708d83133","resolution":{"observed_at":"2026-08-08T14:46:29.607256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.622958Z","title":null,"venue":null,"work_id":"92012bae-9e50-4181-aaaf-65f108b21ec6","year":2025},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.612072Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:49103950eb857a57c5b8ee308b5cc5249ad9e41ef1539d233d345c11b78dd098","observation_id":"9bd9f22d-b078-43da-9ff9-f952e8c3dc0a","resolution":{"observed_at":"2026-08-08T14:46:30.627441Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10702","last_updated":"2023-11-20T02:01:33Z","snapshot_observed_at":"2026-08-09T03:30:59.643714Z","submitted_at":"2023-11-17T18:45:45Z","title":"Camels in a Changing Climate: Enhancing LM Adaptation with Tulu 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10702","snapshot_observed_at":"2026-08-08T14:46:29.617054Z","title":"Smith, Iz Beltagy, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.617054Z"},"links":{"cited_paper":"/paper/2311.10702","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:d6a218d853045c494c72d676610a62162c0214738f79ba19c8df3ff448a2994a","observation_id":"4423f7ba-ae5a-4110-b5eb-b549d5e66654","resolution":{"observed_at":"2026-08-08T14:46:29.617054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12701","last_updated":"2024-10-15T14:21:54Z","snapshot_observed_at":"2026-08-04T07:48:34.455699Z","submitted_at":"2024-05-21T11:50:16Z","title":"OLAPH: Improving Factuality in Biomedical Long-form Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12701","snapshot_observed_at":"2026-08-08T14:46:29.622140Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.622140Z"},"links":{"cited_paper":"/paper/2405.12701","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:5b0b1b87b5664c4e14e0a6f069bae32471af5fa333482f3d05b16cc8603a0dd5","observation_id":"392f9416-a4a5-4d90-8580-321bc43a5b50","resolution":{"observed_at":"2026-08-08T14:46:29.622140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:29.626947Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.626947Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:b633a3ae522626457004948175858d71e5db24c99ca37b8a57e65ae5dfc0448e","observation_id":"964883e9-d484-40f2-b3b1-59070b34ff6f","resolution":{"observed_at":"2026-08-08T14:46:29.626947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.598113Z","title":null,"venue":null,"work_id":"12e8a003-7b28-4854-bb2a-18b95e932e82","year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.631736Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:fb768ac9af22eda2b0b444ff5738645d580d51a2327eb1123247ce5a9d76f8ae","observation_id":"0d0431a9-aa5f-40de-ab3f-5a303d3d5f03","resolution":{"observed_at":"2026-08-08T14:46:30.602584Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07314","last_updated":"2026-07-28T17:58:21Z","snapshot_observed_at":"2026-08-05T16:41:56.624766Z","submitted_at":"2024-09-11T14:44:51Z","title":"MEDIC: Comprehensive Evaluation of Leading Indicators for LLM Safety and Utility in Clinical Applications","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07314","snapshot_observed_at":"2026-08-08T14:46:29.636932Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.636932Z"},"links":{"cited_paper":"/paper/2409.07314","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:b684bb2345ac007e47a421e9fbff31f2d2c16d04c6758cf8e4bddc3e2638c6dd","observation_id":"3d3cc3b0-46af-4e9a-9014-4905e879e5b6","resolution":{"observed_at":"2026-08-08T14:46:29.636932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-08-06T22:44:08.607902Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-08T14:46:29.642901Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.642901Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:e8321af504d8a7e6f4bb596d98c23671143721a4f9e56ac64bc2de9c2f707711","observation_id":"5904f9a0-4020-4755-8ee1-a246be78e0f0","resolution":{"observed_at":"2026-08-08T14:46:29.642901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:29.649246Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.649246Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:c6e1077d520012eec029b288a16e24f8e268f14c4184dadbb0c702a9798dcec2","observation_id":"4d478e3f-6162-4489-ac08-11f8185db780","resolution":{"observed_at":"2026-08-08T14:46:29.649246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-08T14:46:29.654391Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.654391Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:69b0af616cd030150a6c6434b75ca62fb659feaaf8b8b73f2e3a7af1c481e3ce","observation_id":"a1f7d08c-4030-4d6a-8592-d22be6238419","resolution":{"observed_at":"2026-08-08T14:46:29.654391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17752","last_updated":"2024-05-23T13:32:25Z","snapshot_observed_at":"2026-07-06T17:51:02.529047Z","submitted_at":"2024-03-26T14:43:48Z","title":"Can multiple-choice questions really be useful in detecting the abilities of LLMs?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17752","snapshot_observed_at":"2026-08-08T14:46:29.659804Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.659804Z"},"links":{"cited_paper":"/paper/2403.17752","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:605a4f6ac4f820c029ba57a5546383e71461f2c8559032941b2ca9392da11ff4","observation_id":"06638153-b732-4a2b-b7cd-4d6773385d08","resolution":{"observed_at":"2026-08-08T14:46:29.659804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:29.665017Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.665017Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:8a182ad2799ffa5cd83c80d7f86edf4b813c1df2b4445b15fa19033d8cce05d3","observation_id":"72b9fa63-f5b0-4111-b76f-2de3e5766a7c","resolution":{"observed_at":"2026-08-08T14:46:29.665017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.562293Z","title":null,"venue":null,"work_id":"cf047a76-0fdd-4446-87eb-41549147e246","year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.669943Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:2d92e7f237568ee086112dc7ea61944eb1f8dcfe9d7eb0c60e60aec9f9e4035f","observation_id":"33493c1d-cef7-4509-a595-612aed3e0b27","resolution":{"observed_at":"2026-08-08T14:46:30.567180Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11483","last_updated":"2023-08-22T14:54:59Z","snapshot_observed_at":"2026-08-07T01:33:49.598772Z","submitted_at":"2023-08-22T14:54:59Z","title":"Large Language Models Sensitivity to The Order of Options in Multiple-Choice Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11483","snapshot_observed_at":"2026-08-08T14:46:29.674840Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.674840Z"},"links":{"cited_paper":"/paper/2308.11483","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:1e0690244a392f34181cf3cd8af3b65185ea53554b3dd642b73ceee7d638774a","observation_id":"6d208892-cbb9-4c0b-9ffc-f8b009381b9f","resolution":{"observed_at":"2026-08-08T14:46:29.674840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.122628Z","title":null,"venue":null,"work_id":"c1d1ed9e-c53e-4ed8-9499-dfcd12339b94","year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.680052Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:8023d22214fa4fa1f45b15377a7e6b2b13d34d4aa1a2304dfa13b6205019964e","observation_id":"bb731652-7e56-4dad-9ed5-5907e3f4c78f","resolution":{"observed_at":"2026-08-08T14:46:30.129401Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07348","last_updated":"2024-05-14T16:44:02Z","snapshot_observed_at":"2026-08-02T13:58:02.691839Z","submitted_at":"2024-05-12T17:54:50Z","title":"MedConceptsQA: Open Source Medical Concepts QA Benchmark","version":2},"cited_work":{"arxiv_id":"2405.07348","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.07348","snapshot_observed_at":"2026-08-08T14:46:29.904520Z","title":"MedConceptsQA: Open Source Medical Concepts QA Benchmark","venue":"cs.CL","work_id":"903d91f4-b48e-4214-9079-9f177a97a1a2","year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.684247Z"},"links":{"cited_paper":"/paper/2405.07348","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:35e075350cf97d8623f55f7f03547c776b746f1fd0e9856a3e51dd213850f525","observation_id":"5acaf2af-1191-46c6-b54f-942db7a0b691","resolution":{"observed_at":"2026-08-08T14:46:29.912044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-08T14:46:29.688673Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.688673Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:0069ca7b39aaaa67262a0f3495d26f94bcbffd24cb868e385ed8f681e50dbed3","observation_id":"00f716b3-e7bf-4484-b15f-2057fbb985da","resolution":{"observed_at":"2026-08-08T14:46:29.688673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:29.693191Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.693191Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:63ff36560d5b325854d8c27bda9b1694a2d4cc7c81b00720872de4bbb3e55b03","observation_id":"46d4251d-b837-4d1d-b415-b098e7988428","resolution":{"observed_at":"2026-08-08T14:46:29.693191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15343","last_updated":"2023-10-14T17:04:12Z","snapshot_observed_at":"2026-08-07T02:36:54.737484Z","submitted_at":"2023-07-28T06:43:04Z","title":"Med-HALT: Medical Domain Hallucination Test for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15343","snapshot_observed_at":"2026-08-08T14:46:29.697697Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.697697Z"},"links":{"cited_paper":"/paper/2307.15343","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:d6a8a99fe7105a8391311e5a88371fe2c93920271497a87db1c468ca276f9902","observation_id":"dba1cb38-769e-414f-9922-53724a2b5405","resolution":{"observed_at":"2026-08-08T14:46:29.697697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02424","last_updated":"2018-10-22T13:48:32Z","snapshot_observed_at":"2026-07-06T05:13:49.420787Z","submitted_at":"2016-10-07T20:56:47Z","title":"Diverse Beam Search: Decoding Diverse Solutions from Neural Sequence Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02424","snapshot_observed_at":"2026-08-08T14:46:29.702216Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.702216Z"},"links":{"cited_paper":"/paper/1610.02424","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:28d463d6a32864e4a63d6cce0077803c16b99c34b19febef5d9fd6a5e51235be","observation_id":"e1bdcd6b-34f9-44d8-ab92-4e53efafbd26","resolution":{"observed_at":"2026-08-08T14:46:29.702216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.545083Z","title":null,"venue":null,"work_id":"6391f837-7b1d-45fe-8a6b-9e310207cfeb","year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.706924Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:49906a9f63d5838a0a1780d7013c8416168dc3ba60541b67046c39da5648ec1c","observation_id":"b8b97ea0-ae19-4636-9444-e8de7230ceea","resolution":{"observed_at":"2026-08-08T14:46:30.550064Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10200","last_updated":"2024-05-23T20:53:59Z","snapshot_observed_at":"2026-07-06T17:30:47.845775Z","submitted_at":"2024-02-15T18:55:41Z","title":"Chain-of-Thought Reasoning Without Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10200","snapshot_observed_at":"2026-08-08T14:46:29.711348Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.711348Z"},"links":{"cited_paper":"/paper/2402.10200","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:8720244c378f9c3fdecb9ef3313a3fcd37d5ae54167497cab57f4f565f3534ec","observation_id":"2dc0e316-f4cc-42ef-acf0-53d56e2330f3","resolution":{"observed_at":"2026-08-08T14:46:29.711348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-08T14:46:29.716103Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.716103Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:747c104c8c6833e83c61844320109e04f4609ceef3447d30f73a60b4edb5e152","observation_id":"47b87c55-fc5a-49fc-b430-c79d3cf665fb","resolution":{"observed_at":"2026-08-08T14:46:29.716103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.528783Z","title":null,"venue":null,"work_id":"f405296d-8b57-4cd0-9eda-31464786c7d9","year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.720920Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:8ed6e640678458fdfac7cbe236b22abe90293e05a062eec4b4f12743339094ca","observation_id":"b92ceb5f-1482-4682-ad61-0c2c8d846ab5","resolution":{"observed_at":"2026-08-08T14:46:30.533821Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-08T14:46:29.725457Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.725457Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:8d0f0b12d558d1965a8b27cdd75af910c66362edfb08bc9e6cf5fb42968da890","observation_id":"6d6a70cd-7650-4683-b5ac-fc082ea71c30","resolution":{"observed_at":"2026-08-08T14:46:29.725457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.511840Z","title":null,"venue":null,"work_id":"3db5f781-fd97-4f47-8dfc-11625f1ed46a","year":2020},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.730073Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:7821a56b495ad001575628f095ef60ce63c9ac813349a20ef31acb337b12c0bc","observation_id":"82c598b2-ef86-45c9-97a5-b2c12086f074","resolution":{"observed_at":"2026-08-08T14:46:30.517346Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:29.734491Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.734491Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:eedaa1650328c0755ba8bf272b9fbc05e62e709d35cd874cc460164baa8da187","observation_id":"158089a1-6082-4287-ab4b-1ad3f226d83f","resolution":{"observed_at":"2026-08-08T14:46:29.734491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05112","last_updated":"2024-07-22T12:16:30Z","snapshot_observed_at":"2026-07-06T16:45:03.211791Z","submitted_at":"2023-11-09T02:55:58Z","title":"A Survey of Large Language Models in Medicine: Progress, Application, and Challenge","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05112","snapshot_observed_at":"2026-08-08T14:46:29.739206Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.739206Z"},"links":{"cited_paper":"/paper/2311.05112","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:26963e4b85ebe6ace4ff3e2400a9ffd3667ecc8ae2d915e4481725107cfdae53","observation_id":"cd1c6953-d553-4d06-b0cc-25c632d18d78","resolution":{"observed_at":"2026-08-08T14:46:29.739206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T14:41:05.595018Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 3 inbound Pith citation observations for arXiv:2502.06666."}